AI Future Talks Insignt

ロボットの模倣学習とは?カメラ1台で人の動きを見まね|京都大学・長野匡隼助教

作成者: chai+広報部|Sep 27, 2026, 7:02:09 AM

ロボットの模倣学習とは、人の動作をお手本として、ロボットが同じような動きを学ぶ技術です。

人と共生するロボットを社会や家庭に広げるには、ロボットに動作を教えるコストが大きな壁になります。京都大学の長野匡隼助教は、特殊な装置を使わず、カメラ1台で人の動きを「見まね」するロボットの研究に取り組んでいます。目指すのは、子どもが育つように成長するAI・ロボットです。

本記事では、長野助教へのインタビュー(聞き手:デフィデ株式会社 代表 山本哲也)をもとに、ロボットの模倣学習の仕組み、教師なし学習で「見て覚える」考え方、五感と身体性の重要性、報酬モデルによる動作の洗練、そして工場への応用について解説します。

この記事でわかること

・ロボットの模倣学習とは何か、「見まね学習」の考え方

・教師なし学習で、ロボットが観察から動作を学ぶ仕組み

・テキストや画像だけでは足りない「五感」と「身体性」

・大規模基盤モデルと報酬モデルで、失敗から動作を洗練させる方法

・カメラ1台で始める見まね学習と、工場の作業解析への応用

ロボットの模倣学習とは?

長野助教が主に取り組んでいるのは、時系列情報の解析です。工場の作業動画のような時系列データは、収集・解析するだけでも大きな労力がかかります。そこで、正解ラベルを必要としない教師なし学習を使って、作業の区切りのラベル付けや、作業が上手な人とそうでない人の区別、上手な人のスキルの抽出を行い、それをロボットが模倣して作業を効率化する技術を開発しています。

用語 意味(一文定義)
模倣学習 人の動作をお手本として、ロボットが同じような動きを学ぶ技術
見まね学習 人の動きを見るだけで、ロボットがその動作をまねて学ぶ模倣学習の一種
教師なし学習 正解ラベルのないデータから、隠れたパターンや構造を学ぶ機械学習の手法
強化学習 システムが試行錯誤を繰り返し、報酬が最大になる行動を見つけ出す仕組み
報酬モデル 行動の良し悪しを評価し、望ましい行動に高い報酬を与えるモデル
記号創発 記号がどのように形成され、共有されていくのかを探る研究分野

原点は「人のように育つロボットを作りたい」

研究のモチベーションは、人のように育つAIやロボットを作りたいという想いです。今の技術とはまだ大きなギャップがありますが、少しずつ人のようなロボットを実現し、生活の質の向上に貢献したい。人間の機能を探求する基礎研究と、それを実社会の課題に生かす応用の両方に取り組んでいます。

「ロボットを使っていて思うのは、『やはり人間は優秀だ』ということです。」

――長野助教

話題の高性能ロボットを扱っていても、3〜5歳児のほうが優れていると感じることが多々あるといいます。人はどのように成長し、知能や運動能力を獲得しているのか――その問いが、研究の出発点です。

教師なし学習で「見て覚える」――子どもの成長をロボットで再現する

人は教えられて学ぶこともありますが、観察するだけでパターンを見つける能力も持っています。例えば走り高跳びを見れば、「走っている」「跳んでいる」という動作の区切りを、誰に教わるでもなく自然に捉えられます。音声から単語を、視覚情報から物体を捉えるのも同じです。

「こうした根源的な能力の獲得に関しては、教師なし学習が有効だと考えています。」

――長野助教

一方で、動作をさらに洗練させたり、特定のタスクに特化させたりするには、教える人からのフィードバックが必要です。長野助教は、学習の段階に応じて手法を使い分けています。

学習の段階 有効な手法 人の成長にたとえると
根源的な能力の獲得 教師なし学習 誰にも教わらずに、観察から動作の区切りやパターンを捉える
動作の洗練・特定タスクへの特化 強化学習・教師あり学習 親や指導者からフィードバックを受けて上達する

聞き手の山本は、祭りで初めて輪投げをした孫が、年上の子の投げ方をまねて10分ほどでできるようになった様子を紹介しました。長野助教は、人間はごく少量の知覚情報から行動を始め、短時間でタスクに最適化できると説明します。報酬の有無にかかわらず、他人の行動を見て「自分もやってみよう」と思う内発的なモチベーションも、見まね学習の重要な要素です。

テキストや画像だけでは足りない「五感」と「身体性」

最近の機械学習やAIでは、画像やテキストの情報が中心です。しかし、それだけでできることには限界があると長野助教は言います。人は視覚を重視しながらも、音声、触覚、嗅覚などの情報を使って生活しています。ロボットも多様なセンサーを備えているため、あらゆる知覚情報を使って、言葉の意味や動作を学ぶことに取り組んでいます。

輪投げや逆上がりには、言葉では説明しにくい身体的な「コツ」があります。「こうすればできる」と言われても、実際にやってみなければ始まりません。

「だからこそ、身体情報や五感に関わる情報まで統合しなければ、人と共生できるAIの実現には至らないのではないか、そう考えながら研究を進めています。」

――長野助教

失敗から学び、動作を洗練させる仕組み

ロボットがお手本から学んだ動作に失敗したとき、その失敗をどう学ぶのか。長野助教の見まね学習では、大規模基盤モデルと報酬モデルを活用しています。

例 仕組み
ボタンを押すタスク 「ライトが点灯している状態」を成功として自然言語で定義。大規模基盤モデルが画像を見て成功かどうかを判断し、成功に至る動作へ再調整する
ダンスをまねるタスク おおまかなポーズをまねるだけならシンプルな報酬設計で十分。「この瞬間でピタッと止める」「指先まで正確に」といった洗練の段階では、大規模基盤モデルによる報酬モデルで細かく評価する

大規模基盤モデルが言葉と画像を理解する力を使い、成功と判断した動作に高い報酬を与えることで、ロボットの行動が段階的に洗練されていく仕組みです。

カメラ1台で始める「見まね学習」

長野助教の研究室のデモでは、モーションキャプチャなどの特殊な装置は使いません。カメラ1台の前で手や腕を動かすと、離れた場所のロボットアームがその動きをリアルタイムにまね、散らばったお菓子をクレーンゲームのように拾い上げます。ふらっと訪れた人でも、カメラに手を映すだけで体験できます。

シンプルな装置にこだわる背景には、いくつかの経験があります。プロのスポーツ選手の動作をAIで解析するプロジェクトに関わった際、選手の多くは、わずかな違和感がプレーに影響しかねないため、体にセンサーを付けることに強い抵抗を示しました。また、ロボットに動作を教える一般的な方法にも課題がありました。

  リーダー・フォロワー制御(一般的な方法) 見まね学習(長野助教の研究)
教え方 人が操作装置で動作を行い、そのデータをロボットに教える 人の動きをカメラで見て、ロボットがまねる
必要な設備 専用の操作装置など。コストや運用の手間がかかる スマートフォンや市販のカメラなど一般的な機器
負荷 操作者の負担や、ロボットへの負荷による故障リスクがある 人は普段どおり動くだけでよい

「特殊なセンサーや高価な装置がなければ、動作の解析や模倣は本当にできないのか」――その疑問から、長野助教は研究の初期に自身のスマートフォンのカメラで実験を始めました。社会実装を見据え、誰もが手軽に使える技術であってほしいという想いがあります。潤沢な資金と計算資源で新たな知見を切り拓く大企業の研究にも敬意を持ちつつ、数年後に社会で役立ち、多くの人が参入しやすい研究も大切だと考えています。

将来的には、人の動きをまねたロボットを、別のロボットが見て覚える――それを連鎖させることで、人がロボットに教える手間を大幅に減らす仕組みも構想しています。

工場の作業解析への応用

長野助教は、大手電機メーカーと工場の作業解析をテーマに共同研究を行っています。製造現場では製品が年単位で変わるため、正解ラベルを毎回付け直す教師あり学習では大きなコストが発生します。そのため、ラベル付けが不要な教師なし学習や自己教師あり学習が好まれます。

長野助教のモデルは、正解ラベルが不要で計算コストも小さいのが特徴です。現場での実用性やリアルタイム性を高める改良を進めながら、「この作業者は上手か」「この手順はもっと効率化できないか」といった観点での改善も検討しています。

現場の作業や熟練の技を、データで見える化する

熟練者の作業のコツや、作業の上手・下手の違いは、データで捉えることで共有や改善につなげられます。DEFiDEでは、AI/DXコンサルティングを通じて、現場の課題の整理から、データ収集・解析の設計、小さな実証まで伴走します。

▶ AI/DXコンサルティングの無料相談はこちら

目指すのは「人のように育つ」AI――ASIとの関係

聞き手の山本は、五感を使って自ら学ぶ長野助教の研究は、AIを超える知能を持つとされるASI(人工超知能)の世界を目指しているのではないかと問いかけました。長野助教は、ASIが実現できれば理想的だとしつつ、人のように育つAI、ユーザーに寄り添う実用的なロボット、そしてASIのような高度な知能は「適材適所」だと考えています。

創造的な活動や複雑な業務の支援では、ASIのような高度な知能が意思決定や効率化に貢献できるでしょう。一方で、社会に根づき、人に近い存在であるためには、必ずしもASIである必要はない。人間味があり、「あれっ?」と思うような予測できなさを持つ知能にも価値があると長野助教は語ります。記号創発の研究の先には、人と共生できるASIの実現も見据えています。

よくある質問(FAQ)

Q. ロボットの模倣学習とは何ですか?

A. ロボットの模倣学習とは、人の動作をお手本(デモンストレーション)として、ロボットが同じような動きを学ぶ技術です。長野助教は、人の動きをカメラで見てまねる「見まね学習」に取り組み、特殊な装置を使わずにロボットが人の動作を学べる手法を研究しています。

Q. 教師なし学習とは何ですか?

A. 教師なし学習とは、正解ラベルのないデータから、隠れたパターンや構造を見つけ出す機械学習の手法です。長野助教は、人が「走っている」「跳んでいる」といった動作の区切りを誰にも教わらずに自然に捉えるように、ロボットが観察から動作を学ぶための根源的な能力の獲得に、教師なし学習が有効だと考えています。

Q. ロボットは失敗をどう学習するのですか?

A. 長野助教の研究では、大規模基盤モデルと報酬モデルを活用しています。例えば「ボタンを押してライトを点灯させる」タスクでは、成功した状態を自然言語で定義し、大規模基盤モデルが画像から成功かどうかを判断します。成功に近い動作に高い報酬を与えることで、ロボットの動作が段階的に洗練されていきます。

Q. 模倣学習には高価なセンサーが必要ですか?

A. 長野助教の見まね学習では、一般的な機器で十分に対応できます。研究の初期には、自身のスマートフォンのカメラで実験していたといいます。研究室のデモでは、カメラ1台の前で手や腕を動かすだけで、離れた場所のロボットアームがリアルタイムにその動きをまねします。

Q. 模倣学習は工場でどう役立ちますか?

A. 長野助教は大手電機メーカーと、工場の作業解析に関する共同研究を行っています。製品が頻繁に変わる製造現場では、正解ラベルを毎回付け直す教師あり学習はコストが大きくなります。ラベルが不要で計算コストも小さい教師なし学習により、作業の区切りの解析や、熟練者のスキルの抽出、作業の効率化の検討が可能になります。

まとめ:人を「見て覚える」ロボットが、教えるコストを下げる

  • ロボットの模倣学習とは、人の動作をお手本にロボットが動きを学ぶ技術。長野助教は「見まね学習」に取り組む
  • 根源的な能力は教師なし学習で観察から獲得し、洗練は強化学習や教師あり学習で行う
  • テキストや画像だけでなく、五感や身体性まで統合しなければ、人と共生できるAIには至らない
  • 大規模基盤モデルと報酬モデルで、失敗から学び、動作を段階的に洗練させる
  • カメラ1台で始められる見まね学習は、工場の作業解析など社会実装しやすい技術

後編では、ロボット同士が話し合って役割を分担する「自律分散型」の協調、日本の製造業への可能性、実用化への課題、そして若い世代へのメッセージについて伺います。

言葉にできるノウハウは、AIで継承する

動作のコツはロボットの模倣学習で、手順やノウハウなど言葉にできる知識は社内の文書で。DEFiDEの「chai+」は、社内の文書やマニュアルを参照して回答するRAG型のAIチャットボットです。熟練者の知識を誰もが引き出せるナレッジとして活用し、継承を支援します。

▶ chai+の資料をダウンロードする

▶ 後編:マルチエージェントとは?ロボット同士が話し合って役割分担する「自律分散型」の協調

▶ インタビュー全文:人と共生するロボットの開発に挑む(前編)