人型ロボット、初めて入る30軒の家で家事3課題。Figure「Helix 2.5」の完全成功は420回中237回(56%)

Style ← お好みの文体を選べます。選択は自動で記憶されます

人型ロボット、初めて入る30軒の家で家事3課題。Figure「Helix 2.5」の完全成功は420回中237回(56%)【2026年9月】

人型ロボット、初めて入る30軒の家で家事3課題。Figure「Helix 2.5」の完全成功は420回中237回(56%) インフォグラフ

米Figureが、人型ロボット向けのAIモデル「Helix 2.5」を発表しました (現地時間2026年9月17日(木)・同社公式ブログ)。データを一度も集めていないサンフランシスコ・ベイエリアの30軒の家に人型ロボットを持ち込み、おもちゃの片付け・タオル畳み・ベッドメイクの3課題を計420回試行したところ、最後までやり切った完全成功は237回 (56%) だった、と同社は説明しています。

「初めて入る家で、その場で家事をする」という言い方は、同社の原文にあるものです。同時に、ゼロショット (その場所や物で一度も練習せずに初見でやること) の範囲は家と物に限られ、課題のやり方は別の場所で教えてあります。成功率の定義と、Figure自身と同業他社がこの数字をどう読んでいるかを、発表の範囲で確かめます。

この記事のポイント

  • Figureが「Helix 2.5」を発表。人の行動動画データセット「Index」だけでゼロから事前学習 (特定の課題を教える前に、大量のデータで土台を作る学習) し、1つの土台モデルに3つの課題を追加で教えた (現地時間2026年9月17日(木))
  • 30軒の未知の家で420回試行、完全成功は237回 (56%)。部分点はなく、安全のため人が介入した回は失敗に数える (同社発表)
  • 課題別はベッドメイク67%・タオル畳み62%・おもちゃ片付け40%。Indexなしで同条件学習したモデルは合計35回 (チャートでは8%、Figureのブログ本文では9%)
  • 「ゼロショット」は家と物についての語。課題は別の場所で集めたデータで教えており、何も教えずに家事を覚えた話とは別
  • 評価は同社内で、第三者検証は未確認。出荷時期や価格の発表とは別で、Figure自身も「解決したわけではない」と書いている

何が起きたのか

Figureは米国の人型ロボット企業で、Helixはそのロボットを動かすAIモデルの名前です。前版のHelix 02 (2026年1月公開) は、ロボットが働く場所で集めたデータから学んでいた、と同社は今回のブログで振り返っています。

Helix 2.5の新しさは、学び方にあります。同社によると、Index (Figureが集めている人間の行動動画のデータセット。一般の人がスマホアプリで家事や仕事を自撮りして投稿し、対価を受け取る) だけを使い、事前学習をゼロから行いました。文章AIと同じ作り方を、ロボットの全身動作に持ち込んだ形です。

その土台の上に、リビングの片付け・タオル畳み・ベッドメイクの3つの行動を、別の場所で集めた微調整データ (課題のやり方を教えるための追加データ) で教えました。教えたモデルを、評価する家ではデータ収集も調整もせずに、そのまま持ち込んでいます。

30軒・420回・完全成功56%の中身

評価の条件は、同社ブログの付録にあるとおりです。30軒はいずれもロボットが初めて入る家で、家にあるソファやベッド、作業台をそのまま使います。評価に使ったおもちゃ・タオル・寝具は課題を教えたデータに出てこないものを選び、初期配置は毎回、人が投げ散らかしたり乱したりして変えています。課題ごとに1つのチェックポイント (学習途中で保存したモデルの状態) を30軒すべてで使い回し、家ごとの調整はしていません。

成功の定義も課題ごとに決まっています。片付けは、散らばった13〜15個のおもちゃを全部かごに入れる (1個につき1分)。タオル畳みは、全部を畳んでかごに入れる (1枚につき3分)。ベッドメイクは、枕2つと掛け布団の角を上に置き、掛け布団を平らにする (要素ごとに1分)。制限時間を超えた回と、安全のために人が介入した回は、失敗として数えます。部分点はありません。

この定義で、3課題×140回=420回のうち、完全成功は237回でした。課題別に見ると、ベッドメイク94回 (67%)、タオル畳み87回 (62%)、おもちゃ片付け56回 (40%) で、床に散らばった物を拾い集める課題が最も低くなっています。Indexを使わずに同じ条件で学習したモデルは、合計35回 (8%) でした。

Figure自身と同業他社の読み方

同社はブログの中で、汎用の人型ロボットが解決したわけではない、と自ら書いています。ゼロショットという語も、評価した家と操作した物についてのもので、課題は微調整データで指定した、と原文が範囲を限定した書き方です。

同業のSunday Robotics共同創業者Tony Zhao氏らは、DeepTech (MIT Technology Review中国版) の2026年9月18日(金)の記事によると、237/420という完全成功率に疑問を呈しました。同記事はこれを、完全な課題では半分近くが失敗する意味だと説明し、役に立つ仕事には成功率だけでなく信頼性の見方が要る、と論じています。同記事はSunday社の衣類畳みの成功率99.1%を対比に挙げていますが、こちらもSunday社の自社数字で、課題も条件も別です。

動画の編集や遠隔操作の有無について、Figureのブログ本文に明示の記述はありません。同社が根拠として示しているのは「自律」という表現と、人が介入した試行を失敗に数える採点規則です。Humanoids Daily (2026年9月17日(木)) によると、CEOのBrett Adcock氏は約4時間の延長映像をXに投稿しており、同メディアはこの映像だけで420回の完全な記録にはならないと注記しています。

数字の読み方 (自社評価と、チャートと本文の二つの数字)

30軒・420回・237回という数字は、すべてFigureの社内評価です。同社は「blind evaluations」(評価する家の事前情報なしの評価) と表現していますが、第三者機関による追試は2026年9月19日(土)時点で未確認です。「業界初」にあたる記述も、原文は「我々の知る限り」という限定つきです。

Indexなしの成功率は、チャートでは35/420 (8%)、本文では9%と書かれています。課題別のIndexなしはタオル9%・おもちゃ5%・ベッド11%で、本文の9%がどの集計に基づくかはブログに説明がありません。両方を使うときは、チャートの値と本文の表現を分けて引く必要があります。

評価に使った台数、評価期間、1回あたりの所要時間、出荷台数や価格は未公表です。

日本の読者にとっての意味

人型ロボットの発表を読むときに手元に置いておきたいのは、成功率の定義です。今回の発表はその定義を付録まで公開しているので、次に同じ種類の数字を読むときの練習台です。「片付けができた」が、13〜15個を全部かごに入れて1個1分以内、と決まって初めて、56%は比べられる数字になります。人が手を出した回を失敗に数える規則があるかどうかでも、同じ56%の重さは別物です。何が初めてで何が教え済みかも同じで、今回は家と物が初めてで、課題のやり方は教えてあります。

評価はサンフランシスコ・ベイエリアの30軒で、畳や布団、狭い動線といった日本の家での試行は今後の課題として残っています。Indexのアプリは2026年8月時点で108か国からダウンロードされていると同社は説明していますが、日本での提供状況は未確認です。Quotidiaが次回の比較点に置くのは、最も低かったおもちゃ片付けの40%です。

まとめ(FAQ)

Q. 人型ロボットが家事をこなす段階になったのですか?
A. 今回は研究成果の実験報告で、出荷や価格、家庭向け提供は発表の範囲外です。3つの決まった課題を最後までやり切れたのが420回中237回で、Figure自身も汎用の人型ロボットはまだ途中だと位置づけています。

Q. 「初めての家」で、何も教えずに家事を覚えたのですか?
A. 初めてなのは家と、そこにある物です。おもちゃ片付け・タオル畳み・ベッドメイクのやり方は、別の場所で集めたデータで教えてあります。

Q. 56%は「家事の56%ができる」という意味ですか?
A. 課題ごとに決めた完了条件を満たした試行の割合です。おもちゃ片付けは40%、ベッドメイクは67%と課題で差があります。

Q. 遠隔操作や編集の有無は確認できますか?
A. Figureのブログに明示の記述はなく、採点規則として、安全のため人が介入した試行は失敗に数えると書かれています。第三者による追試も、2026年9月19日(土)時点で未確認です。

検証メモ(出典と確認の範囲)
  • 本記事の数字は、Figureの公式ブログ (現地時間2026年9月17日(木)) の本文・図1のチャート・付録の採点基準に基づきます。日本語では日本時間2026年9月18日(金)にロボスタが報じています。米国時間の発表時刻は確認していません。
  • 課題別の回数 (94/140・87/140・56/140・Indexなし12/7/16) は図1のチャートから読み取った値です。本文は「9%から56%」と表記しています。
  • 「ゼロショット」の範囲とチェックポイントの固定は同ブログの本文、初期配置の乱し方は本文の表1、成功の定義と制限時間、人が介入した試行の扱いは付録の記述です。
  • 遠隔操作や動画の編集の有無について、ブログ本文に明示の記述はありません。Brett Adcock氏の約4時間の延長映像は、Humanoids Daily (2026年9月17日(木)) の記載で、X本体は確認していません。
  • Tony Zhao氏の発言はDeepTech (MIT Technology Review中国版・2026年9月18日(金)) の記事によります。X上の原文は確認していません。Sunday社の99.1%は同社の自社数字です。
  • 評価は同社内で行われたもので、第三者機関の追試は2026年9月19日(土)時点で確認していません。The Verge・Ars Technica・IEEE Spectrumの記事の有無も未確認です。
  • 評価に使った機体名 (Figure 03) は二次報道の記載で、ブログ本文には明記がありません。台数・評価期間・所要時間・出荷や価格は公表されていません。
  • Indexの数字 (108か国) は同社の2026年8月25日(火)の記事によります。
  • 日付は日本時間で記載しています。掲載日 (2026年9月22日(火)) 時点の情報です。

Quotidia の視点

Physical AI (ロボットのように体を持って動く AI) の発表では、見出しの動詞より先に採点規則を探すことにしている。今回のFigureは、その規則を付録に全部書いた。部分点なし、制限時間あり、安全のため人が手を出した回は失敗、家と物は初見で課題は教え済み。この規則の下での56%は、見出しの「初めての家で家事」より厳しい数字で、同時に、自社内の評価で第三者の追試がまだない数字でもある。Sunday RoboticsのTony Zhao氏らの疑問 (DeepTechの言い方では「半分近くは失敗」) と、Figure自身の「解決したわけではない」は、同じ237回を反対側から見ていて、どちらも数字を動かさない。次回の比較点は、3課題の中で最も低いおもちゃ片付けの40%に置く。散らかり方が毎回違う床から13〜15個を拾い集める課題は、家と物が初見であることの負荷が最も直接に出る場所で、「初めての家」という見出しの重さはここで決まる。日本の家 (畳・布団・狭い動線) での数字は今回ない。人型ロボットが家に来る日の話は、その数字が出てからでよい。

関連記事:

運営: AI Quotidia 編集部

海外 AI ニュースを毎朝、日本語で解説する個人運営メディアです。記事は AI を活用して作成し、人手による確認・編集を経て公開しています。