デジタル完結型のAI時代は、ソフトウェアの知能と物理的な実行力の間の溝を埋めようとするスタートアップの台頭により、進化を遂げている。Meta AIの元研究者たちが設立した新しいベンチャー企業、Perceptronは、マシンが現実世界をナビゲートし、相互作用することを可能にする最先端のビジョンモデルを開発することで、この動きを牽引している。
二項対立を打破する:汎用モデル vs 特化型モデル
長年、産業オートメーションは技術的なデッドロックに陥っていた。開発者は通常、すべてのインスタンスに対して高価で専用のクラウドGPUを必要とする大規模な汎用基盤モデルか、知覚や制御は扱えるものの両方をこなす能力を欠いた、狭い範囲の特化型モデルのどちらかを選択しなければならなかった。
Perceptronの共同創設者であるArmen AghajanyanとAkshat Shrivastava(両名ともMetaのFundamental AI Research (FAIR)部門の出身)は、新しいモデル「Isaac 0.5」を通じてこの問題を解決しようとしている。単一の反復的なタスク向けに設計された既存のソフトウェアとは異なり、Isaac 0.5は汎用モデルである。これにより、ロボットは特定の動きをハードコードされるのではなく、さまざまな環境に適応できる「知覚、推論、行動」する能力を備えることになる。
物理的知能のメカニズム
Perceptronのアプローチの複雑さを理解するには、荷物の仕分けといった標準的な倉庫作業を見る必要がある。ロボットは単に「箱を持ち上げる」ことはできない。まずラベルを読み取り、周囲の状況をマッピングするための空間分析を行い、最適なピックアップ順序を決定し、物理的な軌道を計画しなければならない。
Isaac 0.5は、これらの多段階の認知プロセスを管理するように設計されている。このモデルは大規模にトレーニングされており、多様な設定やシナリオを認識するために、100万時間の一般的なビデオデータを学習している。物理的な器用さを習得するために、同社は「ego video」(ウェアラブルカメラによる一人称視点)とUMIビデオ(人間の反復的な動作の記録)を活用し、動きがどのようにタスクの完了につながるかをAIに学習させた。Shrivastava氏は、このレベルの「アルゴリズムの錬金術(algorithmic alchemy)」を実現するために、画像、テキスト、ビデオ、およびロボットの軌道にわたるペタバイト規模のデータセットを構築したと述べている。
オープンウェイト戦略と市場拡大
透明性と開発者の採用を促進する動きとして、PerceptronはIsaac 0.5をオープンウェイトモデルとしてリリースしている。これにより、研究者やエンジニアはパラメータやトレーニング資料を検査することができ、予測可能性が極めて重要となる高リスクな産業環境にAIを統合するための重要なステップとなる。
Bessemer Venture Partnersが主導する2,100万ドルの資金調達ラウンドに支えられ、Perceptronは幅広い分野のインテリジェンス・レイヤーとしての地位を確立しようとしている。主な焦点は物流と製造業にあるが、同社はセキュリティ、モビリティ、さらにはメディアやエンターテインメントへの即時の応用も見込んでいる。柔軟なインテリジェンス・レイヤーを提供することで、Perceptronは、ビジョン誘導型ロボットが世界の産業界全体でどのように動作するかを変革することを目指している。
主なポイント
- ギャップを埋める: Isaac 0.5は、汎用的な「知覚、推論、行動」フレームワークを提供することで、リソースを大量に消費する汎用モデルと、制限のある特化型モデルの間の選択を排除することを目指している。
- 大規模なトレーニング規模: このモデルは、一人称視点(ego-centric)やUMIビデオを含む100万時間のビデオデータを活用し、ロボットに複雑な空間タスクや手作業を学習させる。
- オープンウェイトによるアクセシビリティ: Isaac 0.5をオープンウェイトでリリースすることで、Perceptronは、最先端のビジョンAIを産業ワークフローへより深く検査し、迅速に統合することを可能にする。
Perceptronは、ロボットに統一された「知覚・推論・行動」の脳を与えることを約束する、オープンウェイトのビジョンモデル「Isaac 0.5」を発表した。同スタートアップはBessemer Venture Partnersが主導する2,100万ドルの資金を調達しており、このモデルを物流、製造、その他の物理的オートメーション市場向けの、そのまま導入可能なインテリジェンス・レイヤーとして位置づけている。
なぜこのローンチが重要なのか
産業用ロボットは、長年トレードオフを強いられてきた。大規模な汎用基盤モデルを導入すれば、常にクラウドGPUへのアクセス費用がかかり、タスク特化型の狭いビジョンシステムに固執すれば、環境が変化したときに柔軟性を失う。Isaac 0.5は、インスタンスごとのクラウド計算を必要とせずに、知覚、計画、制御を処理できる単一のモデルとして、その中間領域をターゲットにしている。
今日のロボットの脳が抱える問題
一般的な倉庫ロボットの役割は、単に箱を掴むだけではありません。ラベルを読み取り、乱雑な中からアイテムを見つけ出し、最適なピッキング順序を決定し、衝突のないアームの軌道を計算しなければなりません。これらすべてをリアルタイムで行う必要があります。既存のソリューションでは、通常、これらのステップが個別のソフトウェアコンポーネントに分割されています。ラベル用の軽量な検出器、モーション用の手動設計されたプランナー、そして実行用のルールベースのコントローラーといった具合です。この分割は統合のオーバーヘッドを生み出し、新しい製品、パッケージスタイル、またはレイアウトが登場した際のロボットの適応能力を制限してしまいます。
Isaac 0.5 がどのようにそのギャップを埋めようとしているか
Meta FAIRの元研究者であるArmen AghajanyanとAkshat Shrivastavaの両共同創設者は、Isaac 0.5を単一のエンドツーエンドのネットワークとして構築しました。このモデルは、屋内・屋外を問わず多種多様なシーンをカバーする、約100万時間の一般的なビデオデータで学習されています。重要なのは、学習セットにウェアラブルカメラで撮影された一人称視点の映像である「ego video」や、人間の反復的な動作を記録した「UMI video」も含まれている点です。Perceptronは、視覚ストリームとロボットの軌道データをペアにしてネットワークに供給することで、モデルが視覚的な手がかりをどのように物理的な動きへと変換するかを学習すると主張しています。
同社によれば、そのデータセットはペタバイト規模の画像、テキスト、ビデオ、およびロボットの軌道に及びます。この広範なデータにより、Isaac 0.5は個別の制御モジュールなしで、新しい物体を認識し、そのアフォーダンス(どのように掴めるか)を推論し、モーションプランを生成する能力を持つことを目的としています。
オープンウェイトモデル:透明性と実用性の両立
APIのみを提供するほとんどの商用AI製品とは異なり、PerceptronはIsaac 0.5をオープンウェイトとしてリリースしています。エンジニアはパラメータを検査したり、独自のデータでネットワークを微調整したり、モデルをエッジハードウェアに直接組み込んだりすることが可能です。
