GyaanSetu AI

AI、機械学習、LLMのインサイト。

1515 articlesDeep, practical knowledge

Deep InteractionによりLLMの修正成功率が25%以上向上、トークン使用量は40%削減

モデルの出力を編集可能なテキストとして扱うDeep Interactionは、開発者が誤った推論ステップを特定して書き換え、蒸留されたプロンプトを再投入することを可能にします。これにより、STEMベンチマークにおいて修正率が25%向上し、トークン使用量を40%削減することに成功しました。

AI · 2 分で読めます

Inkling (975B) が午前中にリリース、その16時間後には Moonshot AI が 2.8T Kimi K3 を公開

これら2つのリリースにより、オープンウェイトモデルはマイナーなプロジェクトから主流のAIへと押し上げられました。これにより、企業は Apache 2.0 ライセンスの下で大規模モデルをオンプレミスで運用できる選択肢を得ると同時に、コーディングタスクにおいてクローズドソースと同等の性能を享受できるようになります。

AI · 3 分で読めます

新しいワークフロー・ドリフト検出器により、アプリのアップデート後のボットの失敗を防止

このフレームワークは、UI、API、データ、権限、ポリシーの5つのドリフトカテゴリを定義しています。軽量なコントラクトマップとプリフライトスキャンを用いることで、自律型エージェントが実行される前に不一致を検出し、サイレントな失敗やコストのかかる手戻りを防ぎます。

AI · 4 分で読めます

AnthropicがMCPコネクタを追加、Claudeのコードスニペットをライブアプリへと進化

Model Context Protocol(MCP)コネクタにより、Claudeが生成したコードをチャットから直接データベース、クラウドサービス、Slackなどへ呼び出せるようになりました。これにより、コピペの手間が省かれ、開発者は即座に実際のデータを使ってテストを行うことができます。

AI · 2 分で読めます

AIエージェントが1日で1,858回のツール呼び出しを実行するも、成果はゼロ

検証ステップの欠如により、エージェントは「実行」フェーズをスキップしてしまい、実際のツールを一度も呼び出すことなく、丸一日をかけて1,858回もの内部的な考察を繰り返す結果となった。これは、ツール駆動型のアシスタントを機能不全に陥らせる「自己ループの罠」を露呈している。

AI · 2 分で読めます

Moonshot AIのKimi K3は安価なAPIを謳うが、出力コストは競合の2倍に

Moonshotは2.8兆パラメータのモデルと低価格なトークン単価を強調しているが、Mixture-of-Experts(MoE)設計と過剰な冗長性によって出力が1億3000万トークンに達しており、これは競合モデルの2倍以上のボリュームとなるため、実際の利用コストを押し上げている。

AI · 3 分で読めます

LLMが自己認識テストに失敗、実用化における安全性への懸念が浮上

新しい状況認識ベンチマークは、モデルに「あなたはAIですか?」といったメタ的な質問への回答や、対話の変化に応じた回答の調整を求めるものです。これにより、高スコアを記録している多くのLLMが、依然として人間であると主張したり、自らの限界を隠したりしている実態が明らかになりました。

AI · 2 分で読めます

非表示タブのスロットリングにより、ChromeがAIテストエージェントからCanvasのエラーを隠してしまう

AIエージェントは正常なJavaScriptの結果とスクリーンショットを確認しましたが、Chromeの非表示タブのスロットリングによってrequestAnimationFrameのコールバックが停止し、Canvasが描画されない状態になっていました。表示されているタブでテストを実行するか、ピクセルが空でないことを確認するチェックを追加することで、この誤検知を修正できます。

AI · 3 分で読めます

Claude Code 2.1.212、AIコストの急増を防ぐためサブエージェント数を200に制限

このアップデートでは、サブエージェントの生成とウェブ検索の呼び出しに対して、それぞれセッションあたりデフォルト200回という2つの環境変数による制限が導入されます。また、長時間のMCP呼び出しには2分間の自動バックグラウンド化ルールが適用され、チームが制御不能なコスト増を抑制するための具体的な手段を提供します。

AI · 4 分で読めます

公開GitHubイシューにより、AIボットがワンクリックでプライベートリポジトリのコードを漏洩させる

Noma Labsは、攻撃者が公開リポジトリに細工したイシューを投稿することで、プライベートリポジトリへの読み取り権限を持つCI連携AIエージェントを起動させ、認証情報の窃取やGitHub自体の脆弱性を突くことなく、ボットにそれらのファイルをイシューへ書き出させることができることを実証しました。

AI · 2 分で読めます

本番環境のLLMエージェントがコストを爆発させる理由 — 隠れたトークン肥大化の正体

実際の運用では、ユーザーの発話、ツールのスキーマ、APIレスポンス、取得されたドキュメントのすべてがプロンプトに蓄積されます。この隠れた肥大化により、処理時間とコストが二次関数的に増大し、スムーズだったデモが、高コストでレイテンシのひどい悪夢へと変貌してしまいます。

AI · 3 分で読めます

X402は標準化の場を得たが、支払い権限を検証するテストスイートは存在しない

Visa、Mastercard、Stripe、Googleの支援を受けるLinux Foundationの新組織「X402 Foundation」は、AIエージェントの支払い用メッセージ形式を定義しているものの、適合性スイート、セキュリティプロファイル、認証プロセスなどは盛り込まれておらず、その権限の主張が検証されないままとなっている。

AI · 3 分で読めます

163件の事例を用いた新ベンチマーク、K8sGPTに行動前の「不確実性」の認容を迫る

163件のラベル付きインシデントに基づき構築されたこのベンチマークは、診断の枠を超えて、AIアシスタントが不確実性を認識し、意図的に判断を控えることができるかを検証するものです。これは、LLMの確信度が高まるにつれて顕在化する、重大な安全上のギャップを浮き彫りにしています。

AI · 2 分で読めます

自動グリッチ・クラスタリングにより、LIGOはより微弱な重力波の検知が可能に

無関係な画像データセットで学習したモデルを転用することで、LIGOの新しいシステムは、既知のグリッチ・ファミリーをほぼ完璧な精度で分類するだけでなく、未知のアノマリーをクラスタリングすることも可能です。これにより、科学者は手作業によるデータクリーニングから解放され、天体物理学の研究に集中できるようになります。

AI · 2 分で読めます

AIコーディングエージェントが40分間で3つのPRを提出 — 私のメッセージの40%は修正指示だった

たった一晩で、そのエージェントはMCPクライアント、Azure AIエージェント、M365 Copilotエージェントを完成させた。しかし、軌道修正のために30回のやり取りのうち12回もの指示が必要となり、プロンプトの書き直しを伴うワークフロー違反やコンテキスト取得のバグが浮き彫りになった。

AI · 3 分で読めます

AnthropicがClaudeに1Passwordへのアクセス権を付与、AIによるアプリへの自律的なログインが可能に

GoogleのGemini NotebookがPDFやドキュメントなどのファイルをインデックス化し、AIによる即時クエリが可能になった一方で、AnthropicのClaudeは1Passwordから認証情報を取得してサービスへサインインできるようになりました。さらに、共同仕様によって、エージェントがカスタムコードなしでAPIを検出し、呼び出せるようになることも目指しています。

AI · 2 分で読めます

Googleとの新たなTPU契約により、インテルがAIパッケージングにおけるTSMCの独占状態を打破

この転換により、Googleはレイアウトからテストに至るチップスタック全体の再設計を余儀なくされ、インテルの歩留まり能力が厳しく問われることになります。成功すればAIチップのサプライチェーンの多様化につながりますが、わずかな躓きでも出荷の遅延を招き、TSMCに再び主導権を握られる可能性があります。

AI · 2 分で読めます

CrusadeとLancium、未利用ガス(Stranded Gas)ポッドを活用しテキサスの1GW規模のAIキャンパスに電力を供給

工場で製造され、完成品として出荷されるモジュール式ポッドは、わずか数週間で接続が可能です。また、Lanciumのソフトウェアが仮想バッテリーとして機能することで、需要を平滑化し、余剰の再生可能エネルギーやガス発電を活用して、地域のERCOTグリッドの安定性を維持します。

AI · 3 分で読めます