Modelinizden Önce Test Düzenekleriniz Size Yalan Söyleyecek
Değerlendirme skor tablonuz her iki motorun da başarısız olduğunu söyledi.
Llama3.2 6 durumun 5'inde başarısız oldu. Anthropic Sonnet 6 durumun 6'sında da başarısız oldu.
Etiket "malformed" idi. Ancak nedenler farklıydı.
Bir başarısızlık, kredilerin bitmesi nedeniyle oluşan bir API hatasıydı. Bir başarısızlık, bir CLI komutundan gelen terminal kontrol baytlarının metni bozmasıydı. Bir başarısızlık, ayrıştırıcının (parser) okuyamadığı, markdown işaretleri içine alınmış geçerli bir JSON idi.
Eğer o ilk özeti yayınlasaydım, yalan söylemiş olurdum. Kendi kodumdaki hatalar için modelleri suçlamış olurdum.
Bu hataları, özete güvenmek yerine ham kayıtları inceleyerek buldum.
İlk hata, Ollama'yı çağırmak için bir CLI subprocess kullandığım için meydana geldi. Komut, spinner'lar ve imleç hareketleri gibi terminal animasyonları üretti. Bu ANSI kontrol baytları verilerimin içine girdi. Ayrıştırıcı görünmez karakterleri gördü ve çöktü.
Çözüm: CLI subprocess yerine doğrudan bir HTTP API'ye geçmek.
İkinci hata, LLM'lerin genellikle JSON'ı markdown işaretleri içine almasından kaynaklanıyordu. Ayrıştırıcım, ham dize üzerinde json.loads() kullanıyordu. Ters tırnakları gördü ve hata verdi.
Çözüm: Ayrıştırmadan önce kod işaretlerini temizleyen bir fonksiyon eklemek.
Veri akışını (pipe) düzelttiğimde gerçek sonuçlar ortaya çıktı.
Modeller "ölü" değildi. Sadece test düzeneği tarafından bozuluyorlardı. Düzeltmeden sonra, iki model arasındaki kalite farkı görünür ve ölçülebilir hale geldi.
Yapay zeka değerlendirme hattınız (pipeline) için dersler:
- Ham çıktıyı saklayın. Eğer özet "malformed" diyorsa, tek gerçeklik kaynağınız ham çıktıdır.
- Başarısızlık nedenini kaydedin. Sadece "malformed" demeyin. "API hatası" veya "ayrıştırma hatası" deyin.
- Test standartlarınızı sabitleyin. Sonuçları daha iyi göstermek için kurallarınızı değiştirmeyin.
- Test düzeneğini, test edilen sistemin bir parçası olarak kabul edin.
Yargılanan tek şey model değil. Kodunuz da öyle.
Kaynak: https://dev.to/kenielzep97/your-harness-will-lie-to-you-before-your-model-does-662
İsteğe bağlı öğrenme topluluğu: https://t.me/GyaanSetuAi
