GyaanSetu AI

Wawasan AI, machine learning, dan LLM.

1515 articlesDeep, practical knowledge

Agentic Retrieval Memangkas Biaya Kueri Hingga 82x Lipat vs RAG Klasik

Agen ini menulis ulang kueri, memutuskan apakah pencarian diperlukan, memecah pertanyaan kompleks menjadi beberapa sub-langkah, dan melakukan koreksi mandiri saat bukti kurang kuat, memberikan sitasi untuk setiap klaim, serta memangkas penggunaan token secara drastis.

AI · 3 min read

API COS Baru Memungkinkan Browser Berbagi Model AI 33 GB Antar Situs

Dengan mengganti pencarian URL dengan hash berbasis konten, API COS memungkinkan situs mana pun untuk meminta file yang nilai SHA-256-nya sudah diketahui, sehingga browser dapat menyajikan model AI 33 GB yang sama ke berbagai origin tanpa perlu mengunduhnya kembali.

AI · 2 min read

Google Gemma-4 31B Lolos Uji Kecocokan Token pada AWS Inferentia Namun Menghasilkan Kalimat Tak Bermakna

Inferentia2 INF2.24xlarge mereproduksi aliran token yang persis sama dengan referensi CPU, tetapi kedua proses tersebut menggunakan prompt yang salah format karena tidak menyertakan templat obrolan dan penanda giliran, sehingga menyebabkan Gemma-4 terjebak dalam loop tak terbatas berisi kalimat tak bermakna. Perangkat keras tersebut hanya mengulang bug yang ada pada kode referensi.

AI · 3 min read

Peneliti Mandiri Pangkas Tagihan Agen LLM 31% Menjadi $651 dengan Mencatat Setiap Token

Dengan menambahkan lapisan logging PostgreSQL yang mencatat nama model, jumlah token, jenis tugas, dan biaya per panggilan, peneliti tersebut mengidentifikasi bahwa hasil pencarian SEC mentah membuat prompt membengkak. Meringkas hasil tersebut dan mengarahkan pengecekan sederhana ke model yang lebih murah berhasil mendorong penghematan sebesar 31% dan meningkatkan akurasi.

AI · 3 min read