Kipimo kipya cha API 12 za mifano mikubwa ya lugha (LLM) kimegundua kuwa karibu kila huduma inarudisha JSON inayolingana na muundo (schema) uliouomba, lakini kundi kubwa la wachache hutoa thamani ambazo si za kweli kiuhalisia. Gharama ya tokeni ya muundo huo huo inabadilika kutoka tokeni kadhaa hadi karibu elfu tano. Watengenezaji wanaojenga mifumo ya uchukuaji wa data (extraction pipelines) au mawakala wanaojiendesha kwa data (data-driven agents) hawawezi tena kuamini kuwa “schema-valid” ni ishara ya “ukweli”.

Kwa nini jaribio hili ni muhimu

Watoa huduma za API wamekuwa wakitangaza “matokeo yaliyopangwa” (structured output) kama njia ya kuondoa makosa ya uchambuzi (parsing errors). Ahadi ni rahisi: mpe modeli muundo wa JSON, na itajaza sehemu husika bila wewe kuandika kodi tata ya usindikaji wa baadaye (post-processing code). Kiuhalisia, mifumo mingi ya uzalishaji tayari inategemea dhamana hii ili kuepuka hitilafu na kuweka mifumo ya uchambuzi (analytics pipelines) katika hali nzuri. Dhamana hii inapokuwa ya nusu kweli, hitilafu huingia kimyakimya, na makadirio ya gharama kulingana na matumizi ya tokeni yanaharibika sana.

Habari njema: miundo sasa inazingatiwa kwa kiasi kikubwa

  • Modeli nyingi katika seti ya majaribio zilitoa JSON iliyopita uhakiki mkali.
  • Usimamizi wa uandishi uliowekewa mipaka (Constrained decoding) – modeli zinazofunga msimbo (decoder) kwenye muundo haziwezi kutoa herufi zisizohusika, hivyo paketi zisizo na mpangilio (malformed payloads) zimekaribia kutoweka kabisa.
  • Kiwango cha makosa ya uchambuzi (Parse-error rates) – watengenezaji hawahitaji tena kuweka kila wito (call) kwenye kuzuia makosa (try-catch blocks) kwa ajili ya hitilafu za sintaksi ya JSON.

Habari mbaya: uhalali ≠ usahihi

Muundo halali hauhakikishii thamani halali. Nne kati ya modeli kumi na mbili—DeepSeek V4, Qwen, na GLM-5.2 (hizi mbili za mwisho zinatokea kwa majina mawili tofauti katika ripoti)—zilitoa JSON iliyopangwa vizuri lakini iliyokuwa na namba zisizo sahihi wakati hali ya “kufikiri” (au chain-of-thought) ilipowashwa.

  • Katika modeli ya Qwen, uchukuaji rahisi wa hesabu uliongezeka kutoka jibu 1 sahihi kati ya 16 ukiwa na uwezo wa kufikiri (reasoning) hadi sahihi 8 kati ya 8 uwezo huo unapozimwa.
  • DeepSeek V4 Pro ilionyesha mabadiliko kama hayo: usahihi wa uchukuaji ulipanda kutoka 1/8 hadi 7/8 mara tu modeli ilipoacha kujaribu kuelezea hatua zake.

Hatua ya ziada ya kufikiri inaingiliana na msimbo uliowekewa mipaka (constrained decoder), ikiruhusu modeli kuingia katika hali ya kuweweseka (hallucination) huku bado ikizingatia mabano ya nje.

Upande mbaya: mshangao wa gharama za tokeni na vigezo vilivyopuuzwa

  • Muundo wa majibu wa Claude – wakati unatumika kupitia vituo (endpoints) vinavyoendana na OpenAI, Claude ilipuuza kabisa alama ya response_format, ikirudisha matokeo ambayo hayazingatii muundo kwa 0%. Modeli hii inaunga mkono wito uliopangwa, lakini kupitia kiolesura cha asili cha Anthropic cha tool-call pekee.
  • Uongezekaji wa tokeni za muundo (Schema token inflation) – muundo mdogo wa 12 KB unagharimu tokeni 30 kwenye DeepSeek, lakini paketi hiyo hiyo ilitumia tokeni 4,959 kwenye Claude.
  • Kutokuwa na uthabiti katika malipo – baadhi ya watoa huduma huhesabu muundo kama sehemu ya maelekezo (prompt), wakitoza kwa kila tokeni inayotumika; wengine huuchukulia kama sehemu ya bure. Kwa kiwango kikubwa, bili ya muundo inaweza kuzidi gharama ya maudhui yaliyozalishwa na modeli.

Hatua za kuchukua kwa watengenezaji sasa

  1. Haki thamani, si muundo tu – uhakiki wa muundo hautagundua jibu la namba ambalo si sahihi ingawa linaendana na aina inayotarajiwa. Ongeza ukaguzi mahususi wa nyanja (kiwango, kipimo, uwiano wa nyanja mbalimbali).
  2. Zima hali ya chain-of-thought kwa ajili ya uchukuaji wa data kwenye DeepSeek, Qwen, na GLM unapohitaji kujaza sehemu kwa uhakika. Hatua ya ziada ya kufikiri ni ya hiari, si lazima kwa ajili ya usahihi.
  3. Kagua matumizi ya tokeni – rekodi ni tokeni ngapi kila ombi linatumia, ikiwa ni pamoja na sehemu ya muundo, na ulinganishe bili kutoka kwa watoa huduma tofauti kabla ya kuanza matumizi makubwa.
  4. Jaribu uwezo wa kubadilika (portability) – muundo unaofanya kazi kwenye OpenAI unaweza kupuuzwa kimyakimya kwenye Gemini au Claude. Fanya ukaguzi wa haraka kwenye kila jukwaa lengwa kabla ya kutuma kodi yako.

Hoja kinyume kutoka kwa watoa huduma

Baadhi ya watoa huduma wanahoji kuwa hali ya “kufikiri” ni chaguo la mtengenezaji lililokusudiwa kwa kazi ambapo maelezo ni muhimu zaidi kuliko usahihi wa uchukuaji wa data. Claude hupuuza alama ya response_format na kushauri kutumia wito wa zana (tool calls) wa asili wa Anthropic badala yake. Maelezo hayo kitaalamu ni sahihi, lakini yanahamishia mzigo kwa watengenezaji kujua ni hali ipi ya kuchagua na jinsi ya kupanga bajeti kwa ajili ya ada za siri za tokeni.

Hitimisho

Muundo wa JSON si tena wavu wa usalama; ni muundo tu. Hakikisha data iliyo ndani inalingana na ukweli, ufuatilie gharama za siri za tokeni, na kumbuka kuwa “kufikiri” kwa modeli kunaweza kuharibu hata matokeo yanayoonekana kuwa safi kabisa.