AI Future Talks Insignt

自然言語処理(NLP)とは?生成AIの得意・不得意と評価|一橋大学・小町守教授

作成者: chai+広報部|Sep 27, 2026, 4:31:04 AM

自然言語処理(NLP:Natural Language Processing)とは、人間が日常的に使っている言語を、コンピュータで処理・分析・生成する技術です。

ChatGPTをはじめとする生成AIの登場で、自然言語処理は一気に身近な技術になりました。その一方で、生成AIが書いた文章をどこまで信頼し、どう評価すればよいのかという問いは、ますます重要になっています。一橋大学の小町守教授は、深層学習を用いた言語生成とその評価、そして言語と社会の関わりを研究しています。

本記事では、小町教授へのインタビュー(聞き手:デフィデ株式会社 代表 山本哲也)をもとに、自然言語処理の基本、生成AIの得意・不得意、用途によって変わる生成文章の評価の考え方、多言語モデルの課題、そして日本語の大規模言語モデル開発の現状を解説します。

この記事でわかること

・自然言語処理(NLP)とは何か、どんな研究・技術があるのか

・生成AIの得意なこと・苦手なことと、日本で利用が進まない理由

・翻訳・要約・大喜利で異なる「生成文章の評価尺度」

・多言語・多文化の知識と社会的バイアスという課題

・日本語の大規模言語モデル開発が必要な理由

自然言語処理(NLP)とは?

小町教授の専門は、自然言語処理や計算言語学(自然言語を計算可能な形で理解・処理する研究分野)と呼ばれる分野です。コンピュータを使って、人間が話したり書いたりする言語を理解したり、テキストを生成したりする研究を行っています。入力か出力にテキストが関わるものすべてが研究対象になります。

技術・研究テーマ 内容
機械翻訳 ある言語を別の言語に自動で翻訳する
文書要約 長い文書を入力すると、短い要約を示す
文法誤り訂正 文法的な誤りを見つけて訂正する
テキスト平易化 わかりにくい文章を、わかりやすい文章に言い換える
テキストの評価 人間が「良い文章だ」と感じるのはどんな文章か、その好みのバイアスはどこにあるかを探る(ここ5年ほどの研究の中心)
言語の意味変化 ここ10年、100年で単語の使われ方がどう変わってきたかを分析する

中でも小町教授が力を入れているのが、テキストの評価です。人間が「良い文章だ」と思っていても実は間違っている、それでも人間は悪い文章だと思わない――そんな文章が、今は大規模言語モデル(LLM)によって大量に生成され、世の中にあふれています。人間の好みのバイアスがどこにあるのかを解き明かすことが、研究の関心の一つです。

単語の意味の変化も興味深いテーマです。例えば英語の「gay」は、かつては「陽気な」という意味で使われていましたが、現在は主に同性愛者を指す言葉として使われています。こうした変化がどの単語でどのように起きているのかを、データから分析しています。

【キャプションを記入(不要な場合はfigcaptionごと削除)】

生成AIの得意・不得意――日本で利用が進まない理由

生成AIが得意になったこと

小町教授は、生成AIは生成する側に注目が集まりがちだが、実際には人間の指示をどう理解し、しっかり処理できるかが大きく進歩したと言います。5年前と比べて非常に長い文章を処理できるようになり、かつては別々に処理していた画像・音声・テキストも、まとめて扱えるようになりました。画像を入れて「この画風に変えて」と指示すれば、それらしく変換できるのも、深層学習による恩恵です。

生成AIがまだ苦手なこと

  • 細部の正確さ:画像全体は正しそうに見えても、細かく見ると箱の一辺が合っていない、指が6本あるといった不自然さが残る
  • ハルシネーション:翻訳や要約でも、入力されていない情報をもっともらしく出力してしまうことがある
  • 厳密さが求められる処理:厳密な論理、数字を一の位まで正確に扱うこと、文字数を指定どおりに制御することなど

「苦手をどこまで許容するか」の閾値が、国や世代で違う

総務省「令和7年版 情報通信白書」によると、生成AIを使ったことがある個人の割合は、日本では26.7%にとどまり、主要国と大きな差があります。

国 個人の生成AI利用経験(2024年度調査)
中国 81.2%
米国 68.8%
ドイツ 59.2%
日本 26.7%

出典:総務省「令和7年版 情報通信白書」

小町教授は、その背景に品質に対する日本人の厳しさがあると見ています。少しでもおかしなところがあると「これは使えない」と、すべての用途を否定してしまいがちです。しかし実際には、細かく見れば不正確でも、あまり気にしなくてよい用途は世の中にたくさんあります。そうした用途では、生成AIはもう十分に使えるレベルにあります。

「色々得意な点、苦手な点があって、そこの苦手な点をどこまで許容するのかというようなところの閾値が国により違うということです。」

――小町教授

世界には「問題があっても使えればよい」という実利主義的な文化もあり、そうした国では普通に使われています。世代によっても違い、若い世代はあまり気にせず使っている一方、世代が上がるにつれて「使えない」と考えて使わない傾向が目立つといいます。

【キャプションを記入(不要な場合はfigcaptionごと削除)】

完璧を待たず、「使える用途」から始める

生成AIは、細部の正確さが問題にならない業務では、すでに十分に役立ちます。DEFiDEの社内業務クラウド「SmartOps」は、AIエージェントやRAG、AI-OCRを活用し、社内手続きの確認や社内情報の検索、紙の書類のデータ化などの定型業務を効率化します。基本機能はずっと無料で、使える用途から小さく始められます。

▶ SmartOpsの機能を見る(基本機能はずっと無料)

生成文章の評価は「何をしたいか」で変わる

生成された文章の品質をどう評価するか。小町教授は、最終的に何をしたいのかによって、重視すべき観点が変わると説明します。

タスク 主な評価の観点 考え方
翻訳 流暢性・妥当性 流暢性は訳文がその言語として自然か(元の文とは無関係)。妥当性は元の文の意味をどれだけ表現できているか。流暢でも意味が違えば妥当性はゼロ
要約 意味の保持・流暢性 短くなる以上、全く同じ意味は表せない。その前提で、元の文章の意味をどれだけ保持しているかを見る
大喜利(創作) わかりやすさ・ウィット・共感など6つの観点 真面目すぎると面白くない。多少外れているほうが面白いこともある

翻訳や要約では面白さは必要ありませんが、クリエイティブな生成になるほど、「正確さ」とは別の物差しが必要になります。生成AIを業務で使うときも、その用途で何を重視するのかを決めてから評価することが大切です。

評価の重要性は、業界でもようやく理解されてきました。評価データを作らなければ、自分の手法が良いか悪いかも判断できません。しかし、自然言語処理の歴史では評価がおろそかにされることも多かったといいます。ここ3年ほどで、さまざまな言語・タスクのデータを用意してモデルを総合的に比較する流れが定着し、誰でも使えるベンチマークデータセット(モデルの性能を公正かつ再現可能に比較するための標準的なデータ)が公開されるようになったのは、とても良いことだと小町教授は評価しています。

【キャプションを記入(不要な場合はfigcaptionごと削除)】

多言語・多文化の知識と「社会的バイアス」

深層学習が登場する前は、言語ごとにシステムを作っていました。今の言語モデルはさまざまな言語を混ぜて学習するため、英語のデータが大半でも、日本語のデータを少し加えるだけで、日本語で指示すれば日本語で返してくれます。事前に学習していない言語の課題にも言語をまたいで対応する「多言語ゼロショット学習」は、今ではわざわざそう呼ばないほど当たり前になりました。

そのうえで、今注目されている課題は次の2つです。

  • 多文化の知識:日本語や日本文化の知識、英語圏の文化の知識がモデルの中にどう入っているのか。日本の知識を日本語で聞いても英語で聞いても引き出せるのか
  • 社会的バイアス:日本語で聞くと日本人を採用しやすい判断をしがちになる、英語で聞くと日本人が不利になるといった偏りがないか。一橋大学でも、こうしたバイアスを検証する研究を行っている

日本語の大規模言語モデル開発と「文化資源」の課題

日本語のデータは少なくないが、英語とは桁が違う

世界のデータは英語が中心です。ただし小町教授によれば、日本語も実はデータ量で少なくともトップテンに入る言語です。とはいえ英語と比べると1桁、2桁少ないのも事実で、日本語で質の高い処理をするには、日本独自の取り組みが必要になります。

国を挙げた開発と、安全保障の視点

国立情報学研究所の大規模言語モデル研究開発センターを中心に、得られた知見をすべてオープンにする前提で、企業も参加して日本全国で開発が進められています。中国や米国が生成AIに投じる金額は莫大で、日本は予算や人材の面で太刀打ちできないからこそ、国を挙げた取り組みが欠かせません。

海外のモデルをカスタマイズして使うことは、産業的には問題ありません。しかし小町教授は、安全保障の観点を見逃してはいけないと指摘します。国際関係の変化で海外のクローズドなモデルへのアクセスが遮断されれば、多くのビジネスが麻痺しかねません。同センターのモデルは最先端から2年ほどの遅れでついていけており、限られた資源の中で日本の取り組みは非常にうまく進んでいると、小町教授は評価しています。

文化の知識は「データの量」に左右される

英語は動画を含めてウェブ上のデータが圧倒的に多く、人間が経験から学ぶようなことも、人が一生かけても読み切れない量のデータから学習できます。一方、日本語や日本文化については、そうした経験的な知識のデータが少ないのが現状です。

また、多くの企業がモデルの重みを公開していますが、その裏側の学習データはほとんど公開されていません。データを作るノウハウこそが、他社に対するリードを保つ「虎の子」だからです。

データサイエンスは「調理器具」――ソーシャル・データサイエンスとは

一橋大学は2023年、社会科学とデータサイエンスを掛け合わせたソーシャル・データサイエンス学部・研究科を設立し、小町教授はそのタイミングで着任しました。

「データサイエンスは、要は調理器具、包丁みたいなもので、何を題材に料理するのかが大事になってきます。」

――小町教授

食材抜きに包丁だけを研いでも、その良さは生きません。そこで一橋大学は、強みである経済学・法学・社会学などの社会科学に、データサイエンスの手法を生かすことにしました。社会科学で扱うデータにはテキストが多く含まれるため、テキストを使ったデータサイエンスで社会科学に貢献するのが小町教授の役割です。自然言語処理は本来工学寄りの分野ですが、全員が工学寄りである必要はないと考え、社会科学への貢献を意識して研究しています。

よくある質問(FAQ)

Q. 自然言語処理(NLP)とは何ですか?

A. 自然言語処理(NLP:Natural Language Processing)とは、人間が日常的に使っている言語をコンピュータで処理・分析・生成する技術です。機械翻訳、文書要約、文法の誤り訂正、分かりにくい文章を分かりやすく言い換えるテキスト平易化など、入力か出力にテキストが関わる幅広いタスクが含まれます。

Q. 生成AIの得意なこと・苦手なことは何ですか?

A. 小町教授によると、生成AIは5年前と比べて非常に長い文章を処理できるようになり、画像・音声・テキストをまとめて扱えるようになりました。一方で、画像の細部の不自然さや、入力にない情報をもっともらしく出力するハルシネーション、厳密な論理や正確な文字数の制御などは苦手です。

Q. なぜ日本では生成AIの利用率が低いのですか?

A. 小町教授は、日本人は品質に厳しく、少しでもおかしいところがあると「使えない」とすべての用途を否定しがちなことを理由に挙げています。細部が不正確でも問題にならない用途は多く、苦手な点をどこまで許容するかの境目が、国や世代によって違うと指摘しています。

Q. 生成された文章はどのように評価すればよいですか?

A. 評価の観点は、最終的に何をしたいかによって変わります。翻訳では、訳文として自然かを見る「流暢性」と、元の意味を表現できているかを見る「妥当性」が典型的です。要約では元の意味をどれだけ保持しているかを、大喜利のような創作では、わかりやすさや共感などの観点を評価します。

Q. 多言語の大規模言語モデルにはどのような課題がありますか?

A. 最近の言語モデルは多くの言語を混ぜて学習しているため、少量の日本語データでも日本語で応答できます。一方で、日本の知識を日本語で聞いても英語で聞いても引き出せるかといった多文化の知識の扱いや、質問する言語によって特定の国の人に有利・不利な判断をしがちになる社会的バイアスが課題として研究されています。

Q. 日本独自の大規模言語モデルを開発する意味はありますか?

A. 小町教授は、海外のモデルをカスタマイズして使うことも産業的には問題ないとしつつ、安全保障の観点を見逃してはいけないと指摘しています。国際関係の変化で海外のクローズドなモデルへのアクセスが遮断されれば、多くのビジネスが麻痺しかねないため、日本独自の技術をある程度キャッチアップしておく必要があります。

まとめ:生成AIは「何に使うか」で評価が変わる

  • 自然言語処理とは、人間の言語をコンピュータで処理・分析・生成する技術。翻訳、要約、誤り訂正、平易化、評価などが含まれる
  • 生成AIは長文処理やマルチモーダル化が進んだ一方、細部の正確さや厳密な処理、ハルシネーションが課題
  • 日本の生成AI利用率が低い背景には品質への厳しさがある。苦手をどこまで許容するかの閾値は国や世代で違う
  • 生成文章の評価尺度は目的次第。翻訳は流暢性と妥当性、要約は意味の保持、創作は面白さなど別の物差しが要る
  • 日本語LLMの開発は、データ量の差と安全保障の観点から、国を挙げた取り組みが欠かせない

後編では、生成AIによる偽情報をなぜ防ぎにくいのか、LLMグルーミングの危険、日本がルール作りに参加する必要性、そしてAI時代に磨くべき数学・論理・判断力について伺います。

自社の用途に合った「評価の物差し」から設計する

生成AIの活用で成果を出すには、用途ごとに何を重視し、どこまでの誤りを許容するかを決めることが出発点です。DEFiDEでは、AI/DXコンサルティングを通じて、用途の整理から評価基準の設計、小さな実証まで伴走します。

▶ AI/DXコンサルティングの無料相談はこちら

▶ 後編:生成AIの偽情報はなぜ防げない?LLMグルーミングの危険と、AI時代に磨くべき力

▶ インタビュー全文:AIは道具。いかに使うかは人間に責任がある(前編)