107 વિવિધ કાર્યોના બેન્ચમાર્ક દર્શાવે છે કે AutoGen સફળતાનો દર (success rate), લેટન્સી (latency) અને ટોકન ખર્ચ (token cost) માં LangGraph અને CrewAI ને પાછળ છોડી દે છે, જે સરેરાશ 10.2 સેકન્ડમાં 90% પૂર્ણતા દર અને પ્રતિ રન માત્ર 10,700 ટોકનનો ઉપયોગ કરે છે. પ્રોડક્શન-ગ્રેડ AI પાઇપલાઇન્સ બનાવતા ડેવલપર્સ માટે આ આંકડા મહત્વના છે કારણ કે તેઓ એ છુપા ખર્ચાઓને ખુલ્લા કરે છે જે સામાન્ય ડેમોમાં ક્યારેય દેખાતા નથી.

વાસ્તવિક દુનિયાનું પરીક્ષણ શા માટે મહત્વનું છે

એજન્ટ ફ્રેમવર્ક માટેના મોટાભાગના જાહેર ડેમો માત્ર સિંગલ-સ્ટેપ ઉપયોગના કિસ્સાઓ સુધી મર્યાદિત હોય છે – જેમ કે PDF ચેટ, સાદો સેલ્સ બોટ અથવા બેઝિક ડેટા ફેચ. આ ઉદાહરણો એ બાબત છુપાવે છે કે જ્યારે કાર્યભાર (workload) ડઝનબંધ સ્ટેપ્સ, કન્ડિશનલ બ્રાન્ચિસ અને મોટા પ્રોમ્પ્ટ કોન્ટેક્સ્ટ સુધી વિસ્તરે છે ત્યારે સિસ્ટમ કેવી રીતે વર્તે છે. નવો બેન્ચમાર્ક દરેક ફ્રેમવર્કને એવા વ્યાપક સિનારિયોમાંથી પસાર કરે છે જે સ્ટેટ શેરિંગ (state sharing), પેરેલલ એક્ઝિક્યુશન (parallel execution) અને ટોકન કાર્યક્ષમતા પર દબાણ લાવે છે, જે ડેવલપર્સને પ્રોડક્શનના પડકારોની ઝલક આપે છે.

સામસામેના આંકડા

ફ્રેમવર્ક સફળતાનો દર સરેરાશ લેટન્સી સરેરાશ ટોકન વપરાશ
AutoGen 90 % 10.2 s 10,700
LangGraph 85 % 12.9 s 11,900
CrewAI 78 % 19.1 s 14,350

સફળતાનો દર એ માપે છે કે અંતિમ આઉટપુટ કાર્યના સચોટતાના માપદંડોને પૂર્ણ કરે છે કે નહીં. લેટન્સી એ શરૂઆતથી અંત સુધીનો કુલ સમય છે, અને ટોકન વપરાશ મોડેલ દ્વારા પ્રોસેસ કરવામાં આવતી કુલ પ્રોમ્પ્ટ લંબાઈ દર્શાવે છે, જે ખર્ચનો અંદાજ આપે છે.

ફ્રેમવર્કનું ઊંડું વિશ્લેષણ

AutoGen – ઝડપ અને કાર્યક્ષમતા, પરંતુ ડિબગિંગમાં મુશ્કેલી

AutoGen નું આર્કિટેક્ચર આખી પાઇપલાઇનમાં સ્ટેટ શેર કરે છે, જેનાથી દરેક સ્ટેપ પર સમાન કોન્ટેક્સ્ટ ફરીથી મોકલવાની જરૂર રહેતી નથી. ઇન-બિલ્ટ અસિંક્રોનસ એક્ઝિક્યુશન સ્વતંત્ર બ્રાન્ચિસને પેરેલલમાં ચલાવવાની મંજૂરી આપે છે, જે સૌથી ઓછી લેટન્સી અને ટોકન સંખ્યા લાવે છે. તેની સામેનો નુકસાન વિઝિબિલિટી (visibility) છે: કારણ કે વર્