Wakala watano wa Gemini 3.5 Flash wakifanya kazi pamoja kwa wakati halisi walitatua 87 % ya seti ya maswali 30 ya Project Euler, wakishinda wakala watano wanaofanya kazi peke yao (72 %) na misingi yote miwili ya kura ya wengi (80 % peke yao, 90 % kwa ushirikiano). Mchakato wa ushirikiano pia ulipunguza dakika nne kwenye muda wa wastani wa utekelezaji, ukishuka kutoka dakika 14 kwa kila tatizo hadi dakika 10, huku suluhisho nyingi zikipatikana ndani ya dakika tano.

Kwa nini jaribio hili ni muhimu

Msaidizi wa uandishi wa kodi wa AI tayari huandaa vipande vya kodi, hurekebisha makosa ya kodi (debug), na kutengeneza programu nzima. Watafiti kwa kawaida hujaribu modeli moja kwenye maelekezo (prompt) na kutathmini jibu lake. Jaribio hili linauliza swali tofauti: je, kikundi cha wakala kinachoshirikiana matokeo wanapofanya kazi kinaweza kufanya vizuri zaidi kuliko mbinu ya "hekima ya umati" (wisdom of the crowd) inayojumuisha tu majibu huria?

Maswali ya Project Euler hutumika kama kipimo cha kawaida cha fikra za kialgorithimu. Yanachanganya maarifa ya hisabati na uandishi wa kodi wenye ufanisi, jambo linaloyafanya yawe kielelezo kizuri cha kazi za programu za ulimwengu halisi ambapo usahihi na kasi ni muhimu.

Jinsi jaribio lilivyowekwa

  • Wakala: Mifano mitano ya Gemini 3.5 Flash inayofikiwa kupitia jukwaa la Antigravity.
  • Mazingira:
    1. Kila wakala alishughulikia kila tatizo peke yake, akitoa jibu lake mwenyewe.
    2. Wakala hao hao watano walishirikiana kwa wakati halisi, wakitangaza matokeo ya kati na kuthibitisha hatua za kila mmoja.
    3. Kwa mipangilio yote miwili, mkusanyaji rahisi wa kura ya wengi aliunganisha majibu huria matano.
  • Vipimo: Usahihi (asilimia ya majibu sahihi) na muda wa utekelezaji (muda wa wastani kwa kila tatizo, pamoja na mgawanyo wa muda wa kukamilika).

Nini namba zinafichua

  • Usahihi wa peke yake: 72 %
  • Usahihi wa ushirikiano: 87 %
  • Usahihi wa kura ya wengi wa peke yake: 80 %
  • Usahihi wa kura ya wengi wa ushirikiano: 90 %

Muda wa utekelezaji ulipungua kutoka wastani wa dakika 14 kwa wakala wa peke yake hadi dakika 10 kwa kikundi cha ushirikiano. Mchakato mwingi wa ushirikiano ulikamilika chini ya dakika tano, wakati majaribio ya peke yake mara nyingi yalifikia kikomo cha dakika 30 cha muda wa kusubiri (timeout).

Uchunguzi muhimu yanayoelezea pengo hilo

  • Haiwezekani kwa mmoja, inawezekana kwa wengi – Katika tatizo moja, wakala wote wa peke yake walishindwa, lakini timu ya ushirikiano ilibadilishana matokeo ya sehemu na kwa pamoja ikafikia jibu sahihi.
  • Kugundua makosa kupitia uhakiki wa pande zote – Wakala binafsi wakati mwingine waliingia kwenye mitego ya kimantiki; kikundi kiligundua makosa haya kwa kulinganisha maelezo kwa wakati halisi.
  • Upatikanaji wa suluhisho wa haraka – Wakala yeyote alipogundua thamani muhimu ya kati, alitangaza ugunduzi huo, na kuruhusu wengine kuruka kazi zisizo za lazima na kufikia suluhisho la mwisho kwa haraka zaidi.

Gharama na mipaka iliyofichika

Jaribio lilitumia wakala watano tu; bado haijulikani ikiwa ufanisi huo huo utaongezeka hadi kwa makumi au mamia. Aidha, mkusanyaji wa kura ya wengi bado ulifanya vizuri (90 % kwa ushirikiano).

Nini cha kufuatilia baadaye

  • Majaribio ya upanuzi – Je, wakala mia moja bado wataongeza usahihi, au gharama za uratibu zitatawala?
  • Utaalamu wa majukumu – Kugawa kazi maalum (kwa mfano, wakala mmoja anazingatia nadharia ya namba, mwingine kwenye uboreshaji/optimization) kunaweza kuongeza faida kuliko ushirikiano wa kawaida.
  • Vipimo pana zaidi – Kutumia mfumo uleule kwenye changamoto za kutengeneza kodi, seti za kurekebisha makosa (debugging suites), au ujenzi wa programu za ulimwengu halisi kutajaribu ikiwa mafanikio hayo yatadumu nje ya mafumbo ya hisabati.

Hitimisho

Ushirikiano wa wakati halisi miongoni mwa wakala wa uandishi wa kodi wa AI unaweza kuongeza viwango vya mafanikio na kasi katika kazi za kialgorithimu, ukishinda majaribio ya peke yake na hata kura rahisi ya umati. Mbinu hii ina matumaini, lakini uwezo wake wa kupanuka na ufanisi wa gharama bado ni maswali ambayo