Seu Harness Mentirá para Você Antes do Seu Modelo

Seu placar de avaliação disse que ambos os motores falharam.

Llama3.2 falhou em 5 de 6 casos. Anthropic Sonnet falhou em 6 de 6 casos.

O rótulo era "malformado". Mas as causas eram diferentes.

Uma falha foi um erro de API porque os créditos acabaram. Uma falha foi causada por bytes de controle de terminal de um comando CLI que corromperam o texto. Uma falha foi um JSON válido envolvido em delimitadores de markdown que o parser não conseguiu ler.

Se eu tivesse publicado aquele primeiro resumo, eu teria mentido. Eu teria culpado os modelos por falhas no meu próprio código.

Encontrei esses bugs analisando os registros brutos em vez de confiar no resumo.

O primeiro bug aconteceu porque usei um subprocesso de CLI para chamar o Ollama. O comando produziu animações de terminal, como spinners e movimentos de cursor. Esses bytes de controle ANSI foram parar nos meus dados. O parser detectou caracteres invisíveis e travou.

A correção: Mudar de um subprocesso de CLI para uma API HTTP direta.

O segundo bug aconteceu porque os LLMs frequentemente envolvem o JSON em delimitadores de markdown. Meu parser usava json.loads() na string bruta. Ele detectou as crases e falhou.

A correção: Adicionar uma função para remover os delimitadores de código antes do parsing.

Assim que corrigi o pipeline, os resultados reais apareceram.

Os modelos não estavam "mortos". Eles estavam apenas sendo corrompidos pelo harness. Após a correção, a diferença de qualidade entre os dois modelos tornou-se visível e mensurável.

Lições para o seu pipeline de avaliação de IA:

  • Mantenha a saída bruta. Se o resumo disser "malformado", a saída bruta é sua única fonte de verdade.
  • Registre o motivo da falha. Não diga apenas "malformado". Diga "erro de API" ou "erro de parsing".
  • Congele seus padrões de teste. Não mude suas regras para fazer os resultados parecerem melhores.
  • Trate o harness como parte do sistema em teste.

O modelo não é a única coisa em julgamento. Seu código também é.

Fonte: https://dev.to/kenielzep97/your-harness-will-lie-to-you-before-your-model-does-662

Comunidade de aprendizado opcional: https://t.me/GyaanSetuAi