107 વિવિધ કાર્યોના બેન્ચમાર્ક દર્શાવે છે કે AutoGen સફળતાનો દર (success rate), લેટન્સી (latency) અને ટોકન ખર્ચ (token cost) માં LangGraph અને CrewAI ને પાછળ છોડી દે છે, જે સરેરાશ 10.2 સેકન્ડમાં 90% પૂર્ણતા દર અને પ્રતિ રન માત્ર 10,700 ટોકનનો ઉપયોગ કરે છે. પ્રોડક્શન-ગ્રેડ AI પાઇપલાઇન્સ બનાવતા ડેવલપર્સ માટે આ આંકડા મહત્વના છે કારણ કે તેઓ એ છુપા ખર્ચાઓને ખુલ્લા કરે છે જે સામાન્ય ડેમોમાં ક્યારેય દેખાતા નથી.
વાસ્તવિક દુનિયાનું પરીક્ષણ શા માટે મહત્વનું છે
એજન્ટ ફ્રેમવર્ક માટેના મોટાભાગના જાહેર ડેમો માત્ર સિંગલ-સ્ટેપ ઉપયોગના કિસ્સાઓ સુધી મર્યાદિત હોય છે – જેમ કે PDF ચેટ, સાદો સેલ્સ બોટ અથવા બેઝિક ડેટા ફેચ. આ ઉદાહરણો એ બાબત છુપાવે છે કે જ્યારે કાર્યભાર (workload) ડઝનબંધ સ્ટેપ્સ, કન્ડિશનલ બ્રાન્ચિસ અને મોટા પ્રોમ્પ્ટ કોન્ટેક્સ્ટ સુધી વિસ્તરે છે ત્યારે સિસ્ટમ કેવી રીતે વર્તે છે. નવો બેન્ચમાર્ક દરેક ફ્રેમવર્કને એવા વ્યાપક સિનારિયોમાંથી પસાર કરે છે જે સ્ટેટ શેરિંગ (state sharing), પેરેલલ એક્ઝિક્યુશન (parallel execution) અને ટોકન કાર્યક્ષમતા પર દબાણ લાવે છે, જે ડેવલપર્સને પ્રોડક્શનના પડકારોની ઝલક આપે છે.
સામસામેના આંકડા
| ફ્રેમવર્ક | સફળતાનો દર | સરેરાશ લેટન્સી | સરેરાશ ટોકન વપરાશ |
|---|---|---|---|
| AutoGen | 90 % | 10.2 s | 10,700 |
| LangGraph | 85 % | 12.9 s | 11,900 |
| CrewAI | 78 % | 19.1 s | 14,350 |
સફળતાનો દર એ માપે છે કે અંતિમ આઉટપુટ કાર્યના સચોટતાના માપદંડોને પૂર્ણ કરે છે કે નહીં. લેટન્સી એ શરૂઆતથી અંત સુધીનો કુલ સમય છે, અને ટોકન વપરાશ મોડેલ દ્વારા પ્રોસેસ કરવામાં આવતી કુલ પ્રોમ્પ્ટ લંબાઈ દર્શાવે છે, જે ખર્ચનો અંદાજ આપે છે.
ફ્રેમવર્કનું ઊંડું વિશ્લેષણ
AutoGen – ઝડપ અને કાર્યક્ષમતા, પરંતુ ડિબગિંગમાં મુશ્કેલી
AutoGen નું આર્કિટેક્ચર આખી પાઇપલાઇનમાં સ્ટેટ શેર કરે છે, જેનાથી દરેક સ્ટેપ પર સમાન કોન્ટેક્સ્ટ ફરીથી મોકલવાની જરૂર રહેતી નથી. ઇન-બિલ્ટ અસિંક્રોનસ એક્ઝિક્યુશન સ્વતંત્ર બ્રાન્ચિસને પેરેલલમાં ચલાવવાની મંજૂરી આપે છે, જે સૌથી ઓછી લેટન્સી અને ટોકન સંખ્યા લાવે છે. તેની સામેનો નુકસાન વિઝિબિલિટી (visibility) છે: કારણ કે વર્
