GyaanSetu AI

AI、機械学習、LLMのインサイト。

1515 articlesDeep, practical knowledge

Claude Opus 5、Meta Muse Spark 1.1、Geminiが2026年LLMランキングをリード

20のモデルに対して同一のワークロードを用いたベンチマークの結果、特化型ルーティング(specialist-routing)アプローチによってAIコストの削減とレイテンシの低減が可能であることが明らかになりました。一方で、常にフラッグシップモデルをデフォルトで使用すると、コストの増大やリトライの増加を招く傾向があります。

AI · 3 分で読めます

クロスモーダルAIがソフトロボットのメンテナンス時間を34%削減、モデルサイズを60%縮小

パイロットプラントにおいて、視覚、音声、言語に特化した教師ネットワークが、対照学習を通じて埋め込みを融合させるコンパクトな多言語対応の生徒モデルに情報を供給します。量子化によって生徒モデルを60%軽量化することで、エッジデバイスでの動作を可能にし、メンテナンスサイクルを3分の1削減することに成功しました。

AI · 3 分で読めます

x402:オンチェーンのマイクロペイメントにより、AIエージェントが数秒でAPI決済を実現

x402プロトコルは、HTTP 402ステータスをライブコマースのトリガーへと進化させます。これにより、AIエージェントは単一のリクエストサイクル内で、JSON形式の価格読み取り、ブロックチェーン・トランザクションへの署名、そしてデータの受信までを完結でき、APIキーやサブスクリプションの管理も不要になります。

AI · 3 分で読めます

AgenticXのオープンソースMCPサーバーにCVSS 9.8のコマンドインジェクションの脆弱性が判明

24個の中位MCPサーバーにわたる5,911個のソースファイルを調査した結果、あるセキュリティ研究者がAgenticXにおいて、単一のサンドボックス・コマンドインジェクションの脆弱性を発見しました。この脆弱性により、攻撃者はDockerコンテナ内に任意のシェルコマンドを注入することが可能であり、CVSSスコアは9.8と評価されています。

AI · 3 分で読めます

BYD HyWorldVLA、NAVSIM v1で90.59 PDMSを達成

BYD HyWorldVLA、NAVSIM v1で90.59 PDMSを達成。BYDが自動運転基盤モデル市場に参入。同社の新しいモデルであるHyWorldVLAは、NAVSIM v1ベンチマークで90.59 PDMSを記録しました。T…

AI · 3 分で読めます

電子機器製造におけるAI導入方法

電子機器製造におけるAI導入方法。目的もなくAIモデルを構築するのはやめましょう。まずは製造現場の課題から始めましょう。成功するAIプロジェクトは、特定の課題を解決するものです。例えば…

AI · 3 分で読めます

AIエージェントのダッシュボードが見逃す「サイレント・フェイラー」:3層シグナルモデルが浮き彫りにする課題

ほとんどのモニタリングツールは、フレームワークが成功を報告した際にのみ「正常」ステータスを表示しますが、空のペイロード、過剰なツール呼び出し、あるいはハンドオフの失敗などは、依然としてダウンストリーム・サービスを麻痺させ、収益の損失を招く可能性があります。

AI · 3 分で読めます

OpenAIのARC-AGI-3スコア38.3%が、公式ハーネスでのテストでは7.8%に急落

OpenAIのGPT-5.6 Solは、独自のRetained ReasoningおよびCompaction設定を用いることでARC-AGI-3において38.3%を記録しましたが、ベンチマークの公開ハーネスでは同モデルのスコアが7.8%にまで低下し、公平な評価や推論スタックにおけるトリックの役割を巡る議論を呼んでいます。

AI · 4 分で読めます

AOIデータを実用的なAIアセットへと変える、ステップバイステップのプレイブック

本ガイドでは、限定的なパイロットプロジェクトの定義、判定結果を紐付けたAOI画像の収集、そして既存の検査フローと並行したAIランキングエンジンの導入まで、製造業者が取り組むべきプロセスを解説します。これにより、誤検知率の低減と検査時間の短縮を、数値として明確に実現することが可能になります。

AI · 4 分で読めます

OpenAIのGPT-5.6 Sol、カスタムResponses APIを使用してARC-AGI-3で38.3%を達成

OpenAIの38.3%という成功率は、公式のARC-AGI-3ハーネスでモデルを評価した場合、7.8%まで低下します。これは、同モデルの優位性が、独自のResponses APIに組み込まれた2つの推論時のトリック(保持された推論とコンテキスト圧縮)に起因していることを示しています。

AI · 4 分で読めます

明示的な「ツールを使用する」プロンプトが、誤作動するAIアシスタントの修正を保証

著者は、目標のみを促すナッジ(回復率0.16)と、ツールの再実行を明示的に許可する「アクション・ライセンシング」プロンプトを比較し、完璧な1.00の回復率を達成しました。この修正は、エージェントがツールを呼び出せ、かつツールが不正な入力を検知できる場合にのみ機能します。

AI · 3 分で読めます

Ruflo AIのCVE-2026-59726が最高スコアの10.0を獲得 — 直ちに3.16.3へのアップグレードが必要

この脆弱性は、RufloのDockerコンテナがModel Context Protocolブリッジをすべてのネットワークインターフェースにバインドしていることに起因しており、インターネットに接続された攻撃者によるリモートコード実行、LLM APIキーへの完全なアクセス、およびモデルメモリの改ざんを許す恐れがあります。

AI · 3 分で読めます

ロストアップデート(更新消失)バグにより、1つのエージェントが他の4つのエージェントを密かに上書き

5つのエージェントによる並行テストにおいて、4つの書き込みが密かに消失し、消失した作業と同数のトークンが無駄になった。Compare-and-set(比較してセット)ゲートを導入することで、すべての書き込みが正常に反映されるようになったが、トークン消費量は5ユニットから9ユニットへと増加した。

AI · 4 分で読めます

無料枠でもGeminiエージェントをcronジョブのようにスケジュール実行できるようになりました

今回のアップデートでは、ツール呼び出しを検査する「環境フック」、支出の暴走を防ぐ「厳格な予算上限」、そしてAPIを軽量なcronとして機能させる「スケジュール済みトリガー」という、3つの新しい開発者向けコントロールが導入されます。なお、これに伴い、セキュリティの責任はユーザー側に移管されます。

AI · 2 分で読めます