1つのAIが人型ロボットの脚から指先まで動かす。Googleの「Gemini Robotics 2」発表
1つのAIが人型ロボットの脚から指先まで動かす。Googleの「Gemini Robotics 2」発表【2026年8月】

米国時間2026年7月30日(木)、GoogleのAI研究部門であるGoogle DeepMindが、新しいロボット制御AIのGemini Robotics 2 (視覚と言語の指示からロボットの動作を作るAIモデル群) を発表しました。1つのモデルが人型ロボットの脚から指先までの全身を受け持ち、じょうろを運んで棚に収めるような数分がかりのタスクをこなします。ロボットが実験室の外へ出てくる速さを左右するのは、こうしたデモの華やかさよりも、AIを新しい機体へ載せ替えるコストです。この記事の言いたいことは1つです。新しい双腕機体への適応が「数時間・たいてい200例に満たないデータ」まで縮んだとDeepMind自身が書いたこと、それが今回の発表のいちばん硬い部分です。
この記事のポイント
- Google DeepMindがロボット制御AIのGemini Robotics 2を発表。1つのモデルが人型ロボットの脚から指先までの全身を動かし、数分・数百の判断が要るタスクをこなす
- 新しい双腕機体への適応は「数時間・たいてい200例に満たないデータ」。同一の学習ポリシー・同一のチェックポイント (= 学習済みの同じAIそのもの) で、作りの違う3種類の機体を制御した
- 成功率は幅ごと読む。電球を外すのは92%、ねじ込むのは36%。散らかった部屋の片付けは、数字の上ではまだ人間の領分
- 安全ベンチマークASIMOV-Agentic (ロボットAIの安全性を測る新ベンチマーク) を同時に導入。危険なツール呼び出しの拒否、不確かなときの人間への介入要請、人が近づいたときの安全停止を測る
- 一般公開は推論担当のER 2のみ。体を実際に動かす残り2つのモデルは、限定パートナーの先行利用にとどまる
3つで1組。一般に開かれたのは1つ
発表は3本立てです。まぎらわしいのですが、Gemini Robotics 2という名前は、発表全体の呼び名であると同時に、体を動かす中核モデルの名前でもあります。その中核のGemini Robotics 2はVLA (視覚と言語の入力から動作を出す形式のAIモデル) にあたり、公式ブログは「人型の全身を脚から指先まで、そして他の双腕ロボットも制御できる」と書いています。Gemini Robotics ER 2 (推論を受け持つモデル) は、人と会話し、物理世界を理解し、数分におよぶ多段のタスクを計画する係で、今回から複数のロボットが協調して働くチームワークも受け持ちます。3つ目のGemini Robotics On-Device 2は、ロボットの機体上でローカルに動くよう最適化された低遅延版です。
公開の線は、はっきり分かれています。ER 2はGoogle AI Studio (GoogleのAIモデルを開発者が試せるWebツール) で公開され、Gemini Enterprise Agent Platform (Googleの法人向けAI基盤) では限定プレビューです。体を動かすVLAとOn-Device 2はearly-accessパートナー限定で、Trusted Tester Program (限定された協力企業が先行利用できるGoogleのテスター制度) の申込フォームが用意されている段階です。
いま、誰が何に触れられるのか。
| モデル | 受け持ち | いま触れられる人 |
|---|---|---|
| Gemini Robotics 2 (VLA) | 視覚と言語から全身の動作を作る | early-accessパートナーのみ |
| Gemini Robotics ER 2 | 会話・状況理解・数分規模の段取り | 一般の開発者 (Google AI Studio) |
| Gemini Robotics On-Device 2 | 機体上でのローカル実行 (低遅延) | early-accessパートナーのみ |
「誰でもロボットを動かせるようになった」発表ではありません。一般に開かれているのは、段取りと理解を受け持つ頭の部分だけです。
デモは「じょうろを下の棚の緑の箱に入れて」
公開されたデモでは、人型ロボットが「じょうろを下の棚の緑の箱に入れて」という指示を受け、テーブルまで歩き、じょうろを掴み、棚の前まで運んで置くところまでを一連でこなします。散らかった部屋の片付けでは、歩行・しゃがみ・伸び上がり・物の操作を続けて実行します。こうしたタスクは数分におよび、その間に数百の判断を重ねているとブログは書いています。
機体の顔ぶれは3種類です。Apptronik Apollo 2 (米Apptronik社の人型ロボット) にSharpaWave製の22自由度 (関節が独立に動ける方向の数。多いほど手が器用) のハンドを付けた構成、同じApollo 2にInspireハンドを付けた構成、そして双腕のFranka DuoにRobotiqグリッパ (物を挟む形の手) を付けた構成。この3つを、同一の学習ポリシー・同一のチェックポイントで制御しています。ここでの「ポリシー」は日常語の方針ではなく、動作を決める学習済みのAI本体のこと。「チェックポイント」はその学習結果をまるごと保存した実体です。つまり、同じ方針で別々に作ったAIが3つあるのではなく、学習済みの同じAIそのものを3つの体で使い回しています。
いちばん硬い1行、数時間・200例に満たないデータ
発表文で普及の速さにいちばん直結するのは、次の逐語です。
> We can now adapt to new bi-arm robot embodiments with just a few hours of adaptation time, typically with less than 200 examples.
新しい双腕のロボット機体には、数時間の適応作業、たいてい200例に満たないデータで適応できるようになった。DeepMindはそう宣言しています。主語は「新しい双腕機体 (bi-arm robot embodiments)」です。人型を含むあらゆる機体に200例で移れる、とまでは書かれていません。それでもこの1行が硬いのは、AIを別の体へ載せ替えるコストが「数時間と200例」という具体的な見積もりで示されたからです。体が変わるたびにAIを作り直す前提なら、機体の数だけ開発が要ります。載せ替えが数時間で済む方向へ進むなら、同じ頭脳が機体をまたいで広がっていきます。冒頭の3種類の機体が同じチェックポイントで動いたのは、その実演にあたります。
成功率は幅で読む。電球は外せて、ねじ込めない
数字は課題ごとに大きく割れています。多指ハンドはいま、どの作業を何%こなせるのか。
| 作業 (多指ハンド) | 成功率 |
|---|---|
| 電球を外す | 92% |
| ゴミ袋を縛る | 44% |
| ジップロック袋 | 40% |
| 電球をねじ込む | 36% |
| ちりとり | 32% |
同じ電球で、外すのは92%、ねじ込むのは36%。ゆるめる向きと締める向きで、これだけ違います。全身を使う持ち上げにも幅があり、棚の物の76.3%に対して、床の物は45.7%にとどまります。いちばん高い89.6%は、器用な指先ではなく、グリッパ構成での挿入タスクの値です。器用さが要る多指の作業は32〜92%の幅で読むのが正確です。DeepMind自身も、動く速さにはまだ進歩の余地があり、より複雑な実世界のタスクに必要なスキルへ向けた重要な一歩だ、と書いています。(数字の全量と出典は末尾の検証メモにあります)
速く広がる体に、安全は追いつくか
今回の発表で、性能と同じ厚みで書かれているのが安全です。DeepMindは「ロボットが物理的な能力を増すほど、端から端までの安全性とアライメント (AIのふるまいを人の意図に沿わせること) の確保に取り組む」と表明し、あわせてASIMOV-Agenticを発表しました。測るのは、たとえば推論側のエージェントがVLAからの危険なツール呼び出しを拒否できるか。タスクが実行可能かを予測し、不確かなときに自分から人間の介入を求められるか。人が近づきすぎたことを検知し、安全のためのツールを呼んで、ロボットを安全に停止させられるか。従来の物理的な安全対策とAI側の安全フレームワークを重ねる、という多層の構えも記されています。
適応が200例・数時間で済むなら、同じ頭脳が新しい体へ移っていく速さは上がります。では安全はどうか。DeepMindの答えは、危険な指示を断る・迷ったら人を呼ぶ・近づかれたら止まる、という判断を機体ではなくモデルの側に持たせる設計です。体の乗り換えが速くなる世界では、安全も同じように持ち運べるものでなければ釣り合いません。性能の発表に安全ベンチマークが同梱されているのは、その裏返しと読めます。
日本で読む側にとっての意味
持ち帰りは3つに絞れます。
- 開発者なら、推論担当のER 2に触れられます。Google AI Studioで公開されています。体を動かす2つのモデルは、early-accessパートナーの内側です
- 「ロボットが家に来る時期」はこの発表からは読めません。書かれているのは能力の現在地と適応のコストで、製品・価格・時期の話はありません
- 明日誰かに話すなら、電球の話がいちばん通じます。いまのロボットは電球を外せるのに (92%)、ねじ込みは36%。ゆるめるのと締めるのは、機械にとって別の難しさです
まとめ(FAQ)
Q. 誰でも使えるようになった?
A. 3つのうち一般公開は推論担当のGemini Robotics ER 2だけです (Google AI Studioで公開・Gemini Enterprise Agent Platformでは限定プレビュー)。体を動かすVLAとOn-Device 2はearly-accessパートナー限定で、Trusted Tester Programの申込フォームが用意されています。
Q. どんなロボットでも200例で動くようになる?
A. 逐語の主語は「新しい双腕機体」です。人型を含むあらゆる機体が200例で動く、とは発表文に書かれていません。
Q. 89.6%は何の数字?
A. グリッパ構成での挿入タスクの成功率です。多指ハンドの器用な作業は32〜92%と幅があり、電球のねじ込みは36%です。
Q. 家庭にロボットが来る時期は?
A. 発表文は時期・製品・価格に触れていません。DeepMind自身が「動く速さにはまだ進歩の余地がある」と書いています。
Q. 安全対策は?
A. ASIMOV-Agenticというベンチマークで、危険なツール呼び出しの拒否、タスクの実行可能性の予測、不確かなときの人間への介入要請を測ります。人が近づきすぎたときの安全停止と、物理的な安全対策にAI側の枠組みを重ねる多層の構えも記されています。
検証メモ (出典と留保)
- 一次資料は1本。Google DeepMind公式ブログ「Gemini Robotics 2 brings whole-body intelligence to robots」(米国時間2026年7月30日(木)付・署名Carolina Parada)。本記事の事実関係はすべて同ブログに拠り、2回取得して本文の一致を確認した
- 発表日は米国時間の表記。日本時間では2026年7月30日(木)から31日(金)にまたがる可能性がある
- 適応の逐語は「We can now adapt to new bi-arm robot embodiments with just a few hours of adaptation time, typically with less than 200 examples.」。less than 200 の直訳は「200例未満」で、本文では「200例に満たない」と表記した。主語はbi-arm robot embodiments (双腕機体) であり、あらゆる機体への一般化は原文にない
- 成功率の全量。全身マニピュレーション: テーブルから把持68.4% / 床から45.7% / 棚から76.3%。多指ハンド: 電球を外す92% / 電球をねじ込む36% / ゴミ袋を縛る44% / ジップロック袋40% / ちりとり32%。グリッパ系: 一般pick/place 74.2% / 工具キッティング78.9% / 挿入89.6%。89.6%を「把持の成功率」として引くのは帰属違い (グリッパでの挿入タスクの値)
- ASIMOV-Agenticは、ベンチマークの名前と測定対象 (危険なツール呼び出しの拒否 / 実行可能性の予測 / 不確かなときの人間への介入要請) までがブログで確認できる範囲。数値スコアは取得できた本文に含まれていない
- 具体的な事故の想定・事例は発表文に明記なし。安全について確認できるのは対策側の記述 (危険なツール呼び出しの拒否 / 介入要請 / 安全停止) まで
- 人接近時の停止の逐語は「It can better detect when humans are nearby, trigger safety tool calls and bring the robot to a safe stop if someone approaches too closely.」。collaborative safety standardsへの言及もある
- 限界の自認の逐語は「While our robots have more to advance in movement speed, this is an important step towards the skills needed to complete more complex, real-world tasks.」
- 機体側のSharpaWave / Inspire / Franka / Robotiqは名前の列挙にとどめ、各社の概要には踏み込んでいない
Quotidia の視点
「数時間、たいてい200例に満たないデータ」という1行に、Quotidiaは付箋を貼りました。ロボットのAIは、機体が変わればデータ集めも学習もやり直し、という重さとセットで語られがちでした。今回の発表は、頭脳だけが体を乗り換えて広がっていく方向を、当事者が具体的な見積もりつきで書いた点で一段違います。同時に、公開の線引きは対照的です。推論だけを受け持つER 2は誰でも触れる場所に置き、体を実際に動かす2つのモデルは限定パートナーの内側に残す。能力の発表と同じ厚みで安全ベンチマークを同梱し、できることを増やす側ではなく、手を止める・人に委ねるという判断の側を測ると宣言する。広げる部分と抑える部分をどう切り分けたか、この線の引き方そのものが、いまのフィジカルAIの現在地の測り方だと読んでいます。数字の出し方も記録しておきます。92%の隣に36%を、89.6%の隣に32%を並べて出す発表は、読み手が現在地を測れる発表です。
関連記事:
- AIはロボット犬を人間の約20倍速でセットアップした。でも『ボールを拾う』はできなかった【2026年6月】(1ヶ月前のロボット回。犬型のセットアップは人間の約20倍速なのに「ボールを拾う」に失敗した、という能力の凸凹が、今回は同じ電球の92%と36%という物体の中の凸凹まで解像度が上がっている)
- 人型ロボット、店頭・予約販売へ。中国UBTech/Unitreeが先行、「ロボットが家に来る」時代の入口(人型ロボットが店頭で予約販売される話が体の側の入口だったのに対し、今回は頭脳の側が機体をまたいで移れるようになった話。家にロボットが来るまでの、別々の関門)
三本目の道

昔の友人に、小学校を三度、中学校を二度替わった男がいる。父親の仕事の都合で、二年おきによその町へ運ばれて育った。彼には決めごとがあって、新しい町に着くと、まず家と学校のあいだの道を三通り覚えることにしていた。
「三本も要るのか」と、いつだったか訊いたことがある。
「二本だと、一本が工事で止まったとき、残りが一本になる。一本しかない道は、道というより廊下だよ」
彼は真顔だった。冗談を言うときほど真顔になる男だった。転校して最初に確かめるのは給食にパンが出る日の数だ、とも言っていた。町によって週に二日だったり三日だったりするのだという。新しい教室では、なぜか窓側の後ろから二番目の席になることが多かったらしい。定期入れには、前の町のバスの路線図が畳んで入っていた。もう乗らない路線の停留所の名前を、彼はときどき、声に出さずに読んでいた。
僕がいまの町に越してきたのは、ずいぶん前のことだ。駅までの道は、結局二本しか覚えていない。一本は商店街を抜ける道で、歩いて八分、乾物屋の前を通ると夏でも鰹節の匂いがする。もう一本は郵便局の角を折れる道で、信号がひとつ多いのに、急いでいる朝はこちらの方が早い。三本目を探す前に、二本で暮らせるようになってしまった。
米国時間の七月三十日、Google DeepMindが、Gemini Robotics 2という新しいAIを発表した。ロボットのためのAIで、一つのモデルが、人型ロボットを脚のさきから指のさきまで、まとめて動かす。歩くのも、しゃがむのも、指を折るのも、同じ一つの頭脳が受け持つ。公開された映像では、ロボットが「じょうろを、下の段の緑の箱へ」と頼まれ、テーブルまで歩いていき、じょうろを掴み、棚の前まで運んで、いちばん下の段の緑の箱に収めた。数分のあいだに、数百の判断を重ねているのだと、作った側は書いている。散らかった部屋を片付ける映像もある。歩き、しゃがみ、伸び上がり、物をあつかう。
発表には、こうも書いてある。新しい双腕のロボット、つまり新しい体に、このAIは数時間で慣れる。必要な見本は、たいてい二百に満たない。友人が新しい町で道を三通り覚えるより、たぶん早い。
じょうろは、緑の箱に収まった。
細かい数字も公開されている。いまのロボットは、電球を外すことが九十二パーセントできる。ところが、同じ電球をねじ込む方は三十六パーセントにとどまる。ゆるめる往路と、締める復路。同じ道を逆に歩くだけのようで、帰り道は別の町なのだ。ゴミ袋の口を縛るのは四十四パーセント、ちりとりは三十二パーセント。散らかった部屋の片付けは、当分、人間の側に残る。
作りの違う三種類の体を、同じ頭脳のままで動かした、というのも今回の柱だ。人型がふた通りと、双腕の機体がひとつ。頭脳は、体を選ばなくなりはじめている。いっぽうで、人が近づきすぎると、ロボットは自分で安全の仕組みを呼び出して、静かに止まるのだという。危ない指示は断る。できるかどうか怪しいときは、人を呼ぶ。動く速さにはまだ伸びしろがあると、作った側も認めている。速く動くことより先に、覚えたのは止まり方だ。そこは少し、転校生に似ている。転校生がまず覚えるのは、廊下を走らないことだ。
友人は大人になってからも二度引っ越して、覚えた町は八つになった。八つのうちどこが一番よかったのか、訊いたことはない。何年か前に会ったとき、いまでも夢の中では最初の町を歩いている、と言っていた。道順は全部たどれるのに、夢に出てくるパン屋には、本物と違う色の看板が掛かっているのだそうだ。体は道を覚える。覚えた道は、覚えたときの体の側に残る。二百の見本で新しい体に移る頭脳が、そのとき何かを置いていくのかどうか、発表はそこまで書いていない。
夕方、僕は駅まで、覚えなかった三本目の道を歩いてみた。地図で見れば商店街と百メートルも離れていないはずなのに、見覚えのない塀が続き、二階の手すりに布団が干してあり、知らない犬に吠えられた。塀の内側で、風鈴がひとつ鳴った。三本目の道は、思ったより日陰が多い。夏のあいだだけでも、こちらに乗り換えていいかもしれない。角を曲がる前に、一度だけ振り返った。見慣れたはずの町が、少しだけ、知らない町の顔をしていた。
二百の見本で道を覚えるものたちは、いつか、こういう夕方をどんなふうに歩くのだろう。
駅前に出ると、商店街の街灯が、いま来た道とは別の方角で、いっせいに点いた。
1つのAIが人型ロボットの脚から指先までを動かす。Google「Gemini Robotics 2」発表、新しい双腕機体への適応は数時間・たいてい200例に満たないデータ
Google DeepMindが米国時間2026年7月30日(木)、ロボット制御AIのGemini Robotics 2を発表した。構成は3モデル。中核のGemini Robotics 2は視覚と言語の入力から動作を作るVLAモデルで、公式ブログは「人型の全身を脚から指先まで、そして他の双腕ロボットも制御できる」と記す。推論担当のGemini Robotics ER 2は人との会話・物理世界の理解・数分規模の多段タスクの計画を受け持ち、複数ロボットの協調が新たに加わった。Gemini Robotics On-Device 2は機体上でローカル実行する低遅延版。デモでは人型ロボットが「じょうろを下の棚の緑の箱に入れて」の指示でテーブルへ歩き、じょうろを掴み、棚まで運んで収めるまでを一連で実行し、散らかった部屋の片付けでは歩行・しゃがみ・伸び上がり・操作を連続でこなした。タスクは数分におよび、数百の判断を重ねる。同一の学習ポリシー・同一のチェックポイントで、Apptronik Apollo 2+SharpaWaveハンド (22自由度)、Apollo 2+Inspireハンド、Franka Duo+Robotiqグリッパの3種の機体を制御した。新しい双腕機体への適応は「数時間・たいてい200例に満たないデータ」と明記された。成功率には幅がある。全身マニピュレーションはテーブルから把持68.4%・床から45.7%・棚から76.3%。多指ハンドは電球を外す92%に対しねじ込みは36%、ゴミ袋縛り44%、ジップロック袋40%、ちりとり32%。グリッパ系は挿入89.6%・工具キッティング78.9%・一般pick/place 74.2%。安全面ではベンチマークASIMOV-Agenticを導入し、危険なツール呼び出しの拒否、実行可能性の予測と不確かなときの人間への介入要請、人接近時の安全停止を測る。一般公開は推論担当のER 2のみ (Google AI Studioで公開・Gemini Enterprise Agent Platformでは限定プレビュー) で、体を動かすVLAとOn-Device 2はearly-accessパートナー限定。DeepMindは「動く速さにはまだ進歩の余地がある」とも記した。
運営: AI Quotidia 編集部
海外 AI ニュースを毎朝、日本語で解説する個人運営メディアです。記事は AI を活用して作成し、人手による確認・編集を経て公開しています。