中国のOrcaワールドモデル、アクションラベルなしで特化型ロボティクスに匹敵する性能を実現
中国の研究者による画期的な成果が、統一されたワールドモデルが直接的な教師なしでロボティクスを習得できることを証明し、AIの知能の根本的な定義に挑戦しています。Orcaモデルは、ビデオを通じて世界がどのように変化するかを観察するだけで、AIが複雑な物理的アクションを駆動できる深い内部理解を構築できることを示しています。
二重学習エンジン:「無意識」と「意識」のモード
Orcaは、内部的な「世界の状態(world state)」を構築するために、二段構えのトレーニングアプローチを採用しており、従来の特化型モデルとは一線を画しています。第一の手法である「無意識学習(unconscious learning)」では、ラベルのない12万5,000時間のビデオを処理します。このフェーズにおいて、モデルは抽象的な空間内で将来のフレームを予測し、キャプションを一切必要とせずに、動きのパターン、物体の遮蔽、シーンのダイナミクスを把握します。
第二の手法である「意識学習(conscious learning)」では、言語による指示や説明を導入します。ビデオをセグメント化し、その結果生じる状態の変化にラベルを付けることで、Orcaは特定のアクションとその物理的な結果との間の因果関係を学習します。この組み合わせにより、モデルは生の視覚的知覚と高度な言語的推論の間のギャップを埋めることができます。
入れ替え可能な知能モジュールを備えた「凍結されたコア」
Orcaのアーキテクチャは、極めて高い汎用性を実現するように設計されています。事前学習済みのQwen3.5言語・画像モデルを「凍結されたコア(frozen core)」として利用します。タスクごとにシステム全体を再学習させる代わりに、研究者はこの安定した基盤に、特化型の軽量な「ヘッド(heads)」を取り付けます。
- テキスト出力: 既存のQwen3.5言語ヘッドを使用。
- 画像生成: Stable Diffusion 3.5に接続された小さなアダプターを採用し、内部の世界の状態を視覚的な予測へと変換します。
- ロボット制御: 世界の状態を物理的な動きに変換するために特別に訓練された、カスタム構築の「Action Expert」モジュールを利用します。
このモジュール化により、モデルが質問に答えたり、ビデオを生成したり、機械の腕を制御したりする場合でも、世界に対する中心的な理解が一貫して保たれることが保証されます。
特化型モデルや巨大モデルを凌駕する性能
Orca-4Bのパフォーマンス指標は驚異的です。テキストベースのビデオベンチマークにおいて、Orca-4Bは平均51.8%を達成し、Emu3 (34B) のようなはるかに大規模なモデルや、DeepSeek-VL2-3Bのような特化型VLMを上回りました。PRICE-V0.1ベンチマークによる画像予測タスクでは、Orca-4Bは59.8%を記録し、FLUX.2 smallのようなハイエンドな生成モデルを凌駕しました。
最も印象的なのは、ボウルを積み重ねたり砂糖をすくったりといった5つの操作タスクにおいて、Orcaがロボットのアクションデータのみで構築されたシステムである $\pi$0.5 と同等の性能を示したことです。極めて重要な点は、Orcaが膨大な事前学習フェーズにおいて、アクションラベルを一度も目にすることなくこれを達成したことです。さらに、特化型モデルが反復的なループに陥りやすい場面でも、失敗した把握(grasp)をやり直すなど、優れたエラーリカバリ能力も見せました。
なぜこれがAIの未来にとって重要なのか
Orcaは、現代のロボティクスにおける最も重大なボトルネックの一つである「ラベル付きアクションデータの慢性的な不足」を解決します。AIが受動的な観察を通じて「世界の物理学」を学習できることを証明することで、この研究は、何百万時間もの手動によるラベル付けされた遠隔操作データを必要とせずに、新しい環境に配備できる汎用ロボットへの道を切り開きます。
主なポイント
- 教師なしの基盤: Orcaはラベルのないビデオの「無意識学習」を通じて世界のダイナミクスを学習し、コストのかかる人間によるアノテーション済みデータセットへの依存を軽減します。
- モジュール式アーキテクチャ: 凍結されたQwen3.5コアと入れ替え可能なアダプターを使用することで、一つのモデルがテキスト、画像、ロボット制御のすべてにおいて同時に優れた性能を発揮できます。
- ロボティクスにおける同等性: Orca-4Bは、事前学習中にアクションラベルに一度も触れていないにもかかわらず、操作タスクにおいて特化型ロボティクスシステムの性能に匹敵します。