WeMM-Embedding 2B:2048次元ではなく256次元を選ぶべき理由
多くの人は、埋め込みモデルを取得すると、そのフルサイズのベクトルをそのままパイプラインに投入してしまいます。それはもうやめましょう。
TencentのWeMM-Embeddingは、テキスト、画像、動画、ドキュメントを扱えます。その20億パラメータ版は、すでにプロダクション環境での利用が可能です。
最大の特徴はMatryoshka embeddingsです。一度の処理で、64、128、256、512、1024、または2048次元のベクトルを出力できます。
なぜ低次元のベクトルが重要なのか
- パフォーマンス: 256次元において、画像および動画タスクの精度は2048次元版の98.7%を維持しています。
- スピード: ベクトルが小さければ、インデックスの再構築時間を大幅に短縮できます。
- コスト: ストレージやメモリへの支出を大幅に抑えられます。
- 効率性: 256次元で十分な場合に2048次元を使用するのは、単なるリソースの浪費です。
この2Bモデルは、MMEB-v2リーダーボードにおいて、多くのより大規模な競合モデルを上回っています。すでにプロダクション環境のコンポーネントとして採用されており、WeChatの検索、Eコマース、ソーシャルメディアなどで活用されています。
ドキュメントにはより多くのスペースが必要
スクリーンショットやその他の視覚的なドキュメントには、高密度のテキストや複雑なレイアウトが含まれています。次元を削減すると、写真よりも精度が低下しやすくなります。
テスト方法
- システム全体を一度に刷新しようとしないでください。
- 現在のセットアップでうまくいかないクエリを20個選びます。スクリーンショット、商品画像、ドキュメントのページを混ぜてください。
- それらのクエリを2Bモデルで実行します。
- 結果が改善されれば、変更を適用します。改善されなければ、時間とコストを無駄にせずに済みます。
コンテンツタイプごとにスコアカードを作成しておきましょう。商品写真は256次元で十分かもしれませんが、PDFページにはより高い最小次元が必要になるかもしれません。
出典: https://dev.to/bean_bean/wemm-embedding-2b-chon-vector-256-chieu-vi-2048-2igd
