2024年に設立されたロボティクス・スタートアップのGeneralistは、約2億ドルの資金調達を実施し、企業価値が30億ドルに達したと発表しました。8VCが主導した今回の増資により、シリーズBの累計調達額は6億ドルに達しました。これは、数秒間の動画から新しい作業を学習できるロボットの実現が間近に迫っていると、投資家が確信していることを示しています。

資金調達の急増と出資者の顔ぶれ

規制当局への提出書類によると、今回の2億ドルの注入は、6月にRadical Venturesが主導した4億ドルのラウンドから始まったシリーズBを拡大するものです。今回のラウンドでは、Nvidia、Union Square Ventures、Bezos Expeditions、そしてAIの先駆者であるFei-Fei Liといった有力な名前がGeneralistの投資家リストに加わりました。彼らの参画は、多くのロボットプラットフォームに対して単一のAI「脳」を提供することが、工場、倉庫、サービス現場における自動化の新たな波を引き起こすという信念を裏付けています。

Gen 1.5:超短時間のデモからの学習

Generalistの最大の強みは、その基盤モデルであるGen 1.5です。あらゆる動作を手作業で作成する代わりに、このモデルはロボットにビデオクリップ(多くの場合、わずか3〜12秒間)を見せ、デモンストレーションされたタスクを再現させることができます。このアプローチは模倣学習に基づいています。AIは視覚的な入力から動きの手がかり、物体との相互作用、タイミングを抽出し、それをロボットのアクチュエータへの制御コマンドに変換します。理論上、ロボットは短い録画を見せられるだけで、毎週数十の新しいスキルを習得できる可能性があり、変化する環境に自動化を導入するために必要な時間と専門知識を大幅に削減できます。

投資家が追い求める「ChatGPTモーメント」

Generalistは、大規模言語モデルがソフトウェアにもたらした画期的な進歩をハードウェアにもたらそうとする、激しい競争の中にいます。Physical Intelligenceや、ソフトバンクが支援するSkild AIといった競合他社は、すでに100億ドルを超える評価額を誇っており、ロボティクスにおける広範な「ChatGPTモーメント」の物語を加速させています。その前提はシンプルです。最小限のデータで微調整(ファインチューニング)可能な、汎用性の高い学習済みモデルがあれば、企業は制御スタックを一から再構築することなく、ロボット機能を容易に追加できるようになります。

物理データのボトルネックと懐疑的な声

しかし、この期待には現実的な障壁があります。大規模言語モデルはインターネット上の膨大なテキストによって成長しますが、ロボットが学習データを生成するには物理的な相互作用が必要です。センサーは力、接触、3D形状を捉えなければならず、新しいシナリオごとに新しいデータ収集が必要になる場合があります。一部の専門家は、高品質で多様な物理データセットの不足により、真に汎用的なロボット知能が商業的に実現可能になるまでには、まだ数年かかる可能性があると警告しています。現実世界のデモンストレーションが継続的に供給されなければ、Gen 1.5のような柔軟なモデルであっても、学習した環境を超えて汎用化することに苦労する可能性があります。

今後の注目点

  • 導入試験: 物流センターや製造ラインなど、Generalistの次なる公開テストの場において、Gen 1.5がラボでのデモから、ノイズが多く予測不可能な現場へとどれだけスケールできるかが明らかになります。
  • データパイプラインの開発: 自動データキャプチャ(例:モデルにデータを供給するカメラ群)の進展により、物理データのボトルネックが緩和される可能性があります。
  • 競合の動き: 最初の広く採用可能なロボット基盤モデルを巡る競争はまだ初期段階にあるため、競合他社の資金調達ラウンドや提携の発表に注目してください。

まとめ: Generalistの30億ドルという評価額は、単一のAIモデルが今日のチャットボットのようにロボットを適応可能にできるという強い信念を反映しています。しかし、その道のりは、短いビデオクリップを信頼性の高い現実世界の動作へと変換できるかどうかにかかっており、このエンジニアリング上の課題が、その約束が日常的な自動化へとつながるかどうかを決定することになるでしょう。