Timu ya utafiti ilitengeneza router ili kuamua ikiwa modeli ya lugha ya bei rahisi inaweza kushughulikia ombi la kodi, ikiwa na lengo la kupunguza gharama za inference, lakini router hiyo haikuweza kushinda kipimo cha msingi cha “never-escalate”. Kushindwa huku kunaonyesha kwa nini vipimo vinavyolenga usahihi vinapotosha mifumo ya cascade na huashiria ishara ambazo kwa kweli zinakamata ugumu.

Kwa nini router ilikuwa muhimu

Mifumo ya cascade ya modeli hutuma kila ombi kwa modeli ndogo zaidi inayoweza kulijibu kwa usahihi. Ikiwa router itatuma prompt rahisi kwa modeli ya bei rahisi, mfumo huo utaruka utendaji (compute) wa gharama kubwa unaohitajika kwa modeli kubwa zaidi. Timu hiyo ilifundisha router kwa kutumia kazi 539 za kodi halisi—428 rahisi na 111 ngumu—ikitarajia itajifunza ni lini modeli ya bei rahisi itatosha.

Namba zilizoshindwa

  • AUC ya data iliyowekwa kando (area under the ROC curve): 0.594
  • Kiwango cha cross-validation cha mara 5: 0.55 – 0.57
  • Kiwango bora (threshold): kinaendana na sera ya “never escalate”

AUC ya data iliyowekwa kando ilikuwa 0.594 na cross-validation ilikuwa kati ya 0.55 hadi 0.57, ikimaanisha kuwa kimitambuzi (classifier) kinatofautisha kwa shida kati ya kesi rahisi na ngumu. Wakati kiwango bora (optimal threshold) kinapoiga sera ambayo haitumii modeli ya gharama kubwa kamwe, router haiongezi thamani yoyote. Inafanya kazi kama kimitambuzi cha kudumu badala ya mtoa maamuzi.

Kile ambacho majaribio yalijaribu

Watafiti walilinganisha seti tatu za sifa (feature sets):

Seti ya sifa AUC
Sifa 11 rahisi za juu (mfano, idadi ya token, uwepo wa maneno muhimu) 0.610
Prompt embedding ya vipimo 1024 (semantic vector) 0.552
Zote mbili zikiunganishwa 0.609

Kwa kushangaza, sifa rahisi za juu zilifanya vizuri zaidi kuliko semantic embedding ya vipimo vingi. Embedding hiyo ilikamata mada ya prompt lakini si ugumu wake wa asili. Kuipa router rasimu ya modeli ya bei rahisi iliongeza AUC hadi 0.640, ikionyesha kuwa ishara zinazotokea wakati wa uundaji (generation) zina habari nyingi zaidi kuliko zile zilizopo kwenye prompt pekee.

Mapungufu mawili ya msingi

1. Usahihi ni kipimo kisichofaa

Router lazima iboreshe uwiano kati ya gharama na usahihi (cost-accuracy trade-off) ikilinganishwa na sera ya kawaida, si tu kutabiri usahihi. Ikiwa haiwezi kushinda sera ya “never escalate,” haitoi faida ya gharama, bila kujali usahihi wa jumla. Vipimo vya kawaida kama AUC vinapuuza kipengele cha kiuchumi cha mfumo wa cascade.

2. “Always escalate” si ukomo

Jaribio lilichukulia kuwa modeli ya gharama kubwa haikosei, likichukulia “kila wakati tumia modeli kubwa” kama ukomo wa juu. Katika hali halisi, modeli kubwa wakati mwingine iliharibu majibu ambayo modeli ya bei rahisi iliyapata kwa usahihi. Router bora inayojua ni lini kubaki na modeli ya bei rahisi inaweza kushinda kipimo cha msingi cha “always escalate” kwa takriban pointi 4.2 katika kipimo cha gharama kilichochaguliwa. Pengo hili linaonyesha kuwa ukomo wa utendaji wa modeli ya gharama kubwa ni mdogo kuliko ilivyodhaniwa.

Kubuni ishara bora za routing

Matokeo yanapendekeza mwelekeo m ثلاثة wa kivitendo:

  • Jumuisha ishara za wakati wa uundaji (generation-time). Kuipa router matokeo ya kati ya modeli ya bei rahisi (rasimu yake) kunakamata ugumu ambao prompt pekee huuficha.
  • Vipaumbele sifa za juu zinazohusiana na kazi. Vipimo rahisi—kama vile urefu, uwepo wa kanuni (operators) fulani, au alama za mtindo wa kodi—vinaweza kuwa na uwezo mkubwa wa kutabiri kuliko semantic embeddings za jumla.
  • Pima mafanikio kwa vipimo vinavyozingatia gharama. Badala ya usahihi safi au AUC, tathmini ni idadi gani ya simu (calls) za gharama kubwa zinazozuiwa huku ukidumisha viwango vya ubora vinavyolengwa.

Funzo: Router inayoboresha usahihi pekee haiwezi kuhakikisha akiba ya gharama; routing bora inahitaji ushahidi wa wakati wa uundaji na tathmini inayozingatia gharama.