Tencent ఈ వారం WeMM-Embedding మోడల్ను విడుదల చేసింది, ఇది 2 బిలియన్ పారామితులు కలిగిన మల్టీమోడల్ సిస్టమ్. ఇది ఇప్పటికే WeChat యొక్క సెర్చ్, రికమెండేషన్ మరియు ఇ-కామర్స్ పైప్లైన్లలో అంతర్భాగంగా ఉంది. ఈ విడుదల ప్రాముఖ్యత ఏమిటంటే, ఇది వాస్తవ ప్రపంచ రిట్రీవల్ క్వాలిటీ (retrieval quality), తక్కువ లాటెన్సీ (low latency) మరియు చిన్న ఇండెక్స్ సైజులను అందించే మోడల్ను చూపుతుంది.
"డిప్లాయ్మెంట్ స్టోరీ" చుట్టూ ఇంత హడావిడి ఎందుకు?
చాలా కొత్త AI మోడల్స్ క్యూరేటెడ్ డేటాసెట్లపై స్కోర్లను పోల్చే మెరిసే బెంచ్మార్క్ టేబుల్స్తో వస్తాయి. ఆ నంబర్లు పరిశోధకులు తమ పాయింట్ను నిరూపించుకోవడానికి సహాయపడతాయి, కానీ అవి ఉత్పత్తులను నడిపించే మెట్రిక్స్లోకి (metrics) చాలా అరుదుగా మారుతాయి: అంటే ఒక క్వెరీ ఎంత వేగంగా వస్తుంది, ఇండెక్స్ ఎంత మెమరీని వినియోగిస్తుంది మరియు వినియోగదారులు సృష్టించే అస్పష్టమైన (noisy) కంటెంట్తో మోడల్ ఎంత బాగా తట్టుకుంటుంది అనేది ముఖ్యం. WeMM మొదటి రోజు నుండే ప్రొడక్షన్-గ్రేడ్ కాంపోనెంట్గా ఉండటం ద్వారా ఈ విధానాన్ని మారుస్తుంది. ఇది ఏదైనా టీమ్ అడాప్ట్ చేసే వరకు వేచి ఉండే ల్యాబ్ ప్రయోగం కాదు; ఇది ఇప్పటికే Channels, Moments మరియు ఇ-కామర్స్ రంగాలలో పనిచేస్తోంది.
డెవలపర్లు గమనించాల్సిన సాంకేతిక అంశాలు
నిజమైన మల్టీమోడల్ హ్యాండ్లింగ్ (True multimodal handling) – ఈ మోడల్ టెక్స్ట్, ఇమేజెస్, వీడియో ఫ్రేమ్స్ మరియు డాక్యుమెంట్ థంబ్నెయిల్స్ను ఒకే ఎంబెడ్డింగ్ స్పేస్లోకి తీసుకుంటుంది. ఒక వినియోగదారు "sunset" అని టైప్ చేస్తే, టెక్స్ట్ మరియు విజన్-ఓన్లీ పైప్లైన్లను విడివిడిగా కలపాల్సిన అవసరం లేకుండానే, దానికి సరిపోయే వీడియో క్లిప్, ఫోటో లేదా వార్తా కథనాన్ని పొందవచ్చు.
సైజు ముఖ్యం, కానీ మీరు అనుకున్నట్లు కాదు – లీడర్బోర్డ్లలో ఆధిపత్యం వహిస్తున్న 9 బిలియన్ల కంటే ఎక్కువ పారామితులు కలిగిన మోడల్స్తో పోలిస్తే, 2 బిలియన్ పారామితులతో ఈ మోడల్ "చిన్నది". అయినప్పటికీ, ఇంటరాక్టివ్ సర్వీసులకు అవసరమైన లాటెన్సీ బడ్జెట్లను ఇది అందుకోగలదు. లైవ్ సిస్టమ్లో మీ హార్డ్వేర్కు సరిపోయే మోడల్, పెద్దదైన మరియు నెమ్మదైన మోడల్ కంటే మెరుగైన పనితీరును కనబరచగలదు.
Matryoshka ఎంబెడ్డింగ్స్ డైమెన్షన్ ఫ్లెక్సిబిలిటీని ఇస్తాయి – WeMM "Matryoshka" ఎంబెడ్డింగ్స్కు మద్దతు ఇస్తుంది, అంటే ఒకే నెట్వర్క్ 256 లేదా 512 డైమెన్షన్ల వంటి వివిధ పొడవుల వెక్టార్లను అవుట్పుట్గా ఇవ్వగలదు. 512 నుండి 256 డైమెన్షన్లకు తగ్గించినా, మెమరీ వినియోగాన్ని సగానికి తగ్గిస్తూనే, రిట్రీవల్ పనితీరు దాదాపు పూర్తిగా అలాగే ఉంటుందని పరీక్షలు చూపుతున్నాయి. ఇది స్టోరేజ్ ఖర్చులను నేరుగా తగ్గిస్తుంది మరియు నియర్-నైబర్ సెర్చ్లను (nearest-neighbor searches) వేగవంతం చేస్తుంది.
రిట్రీవల్ సిస్టమ్స్ను నిర్మించడానికి మూడు ఆచరణాత్మక నియమాలు
మీ స్వంత డేటాపై ధృవీకరించుకోండి – బెంచ్మార్క్లు క్లీన్గా ఉంటాయి; కానీ ప్రొడక్షన్ డేటా గందరగోళంగా (messy) ఉంటుంది. మీ వినియోగదారులు స్క్రీన్షాట్లు, చేతితో రాసిన నోట్స్ లేదా తక్కువ రిజల్యూషన్ వీడియోలను అప్లోడ్ చేస్తే, అది మీకు సరిపోతుందో లేదో నిర్ణయించే ముందు ఆ ఖచ్చితమైన మిశ్రమంపై మోడల్ను రన్ చేయండి.
వెక్టర్ పొడవును ఖర్చును తగ్గించే సాధనంగా (cost lever) పరిగణించండి – పెద్ద వెక్టార్లు సిమిలారిటీ సెర్చ్కు అవసరమైన కంప్యూట్ మరియు ఇండెక్స్ కోసం డిస్క్ స్పేస్ రెండింటినీ పెంచుతాయి. మీ క్వాలిటీ టార్గెట్ను చేరుకునే అతి చిన్న డైమెన్షన్తో ప్రారంభించండి. రీకాల్ (recall) లేదా ప్రిసిషన్ (precision) స్పష్టంగా తగ్గినప్పుడు మాత్రమే స్కేల్ చేయండి.
విడివిడి పైప్లైన్లను (siloed pipelines) నివారించండి – ప్రతి మోడాలిటీ కోసం విడివిడి ఎన్కోడర్లను నిర్మించడం వల్ల, ఫైనల్ ర్యాంకింగ్ స్టేజ్ కోసం మీరు వెయిటింగ్ స్కీమ్లను మాన్యువల్గా తయారు చేయాల్సి వస్తుంది. ఒక యూనివర్సల్ ఎంబెడ్డింగ్ లేయర్ ఆ గ్లూ కోడ్ను (glue code) తొలగిస్తుంది, ఇంజనీరింగ్ ఓవర్హెడ్ను తగ్గిస్తుంది మరియు A/B టెస్టింగ్ను సులభతరం చేస్తుంది.
విస్తృతమైన ప్రభావం
సెర్చ్ లేదా రికమెండేషన్పై ఆధారపడే కంపెనీలకు, ఎంబెడ్డింగ్ మోడల్ ఎంపిక అనేది ఇన్ఫ్రాస్ట్రక్చర్ ఖర్చును నిర్ణయించగలదు. వినియోగదారుల అంచనాలు పెరుగుతున్న కొద్దీ లాటెన్సీ బడ్జెట్లు తగ్గుతాయి; ప్రతి క్వెరీకి కొన్ని మిల్లీసెకన్ల సమయం కూడా అదనంగా తీసుకుంటే, అది సర్వీస్ పనితీరును దెబ్బతీసి, వినియోగదారులు వెళ్ళిపోయేలా (churn) చేయవచ్చు.
Apache 2.0 లైసెన్స్ కింద వెయిట్స్ను ఓపెన్ సోర్స్ చేయాలనే Tencent నిర్ణయం డెవలపర్ల కోసం ఖర్చును కూడా తగ్గిస్తుంది. ప్రొప్రైటరీ కాంట్రాక్ట్ల కోసం చర్చలు జరపడం లేదా మొదటి నుండి మోడల్ను నిర్మించడం బదులు, టీమ్లు చెక్పాయింట్ను డౌన్లోడ్ చేసుకుని, డొమైన్-స్పెసిఫిక్ డేటాపై ఫైన్-ట్యూన్ చేసి, కొన్ని ఫెయిల్యూర్ కేసులతో దానిని అంచనా వేయవచ్చు.
మోడల్ ఎక్కడ లోపించవచ్చు
ఈ మోడల్ నాలుగు మోడాలిటీలను—టెక్స్ట్, ఇమేజెస్, వీడియో మరియు డాక్యుమెంట్లను—హ్యాండిల్ చేస్తుంది, కానీ అన్ని రకాల ఇన్పుట్ రకాలను కవర్ చేయదు.
తదుపరి ఏమి గమనించాలి
ముగింపు (Takeaway)
ప్రొడక్షన్ పరిమితులను దృష్టిలో ఉంచుకుని నిర్మించినప్పుడు, ఒక మధ్యస్థ పరిమాణం కలిగిన మల్టీమోడల్ ఎంబెడ్డింగ్ మోడల్ రోజువారీ క్వెరీలను హ్యాండిల్ చేయగలదని WeMM నిరూపిస్తుంది. డెవలపర్లకు సందేశం స్పష్టంగా ఉంది: వాస్తవ ప్రపంచ రిట్రీవల్ క్వాలిటీకి ప్రాధాన్యత ఇవ్వండి, వెక్టర్ డైమెన్షన్లను వీలైనంత చిన్నవిగా ఉంచండి మరియు మోడాలిటీలను ఒకే ఎంబెడ్డింగ్ లేయర్లోకి ఏకీకృతం చేయండి. ఈ ఎంపికలు లాటెన్సీని తగ్గించగలవు, స్టోరేజ్ ఖర్చులను తగ్గించగలవు మరియు అంతిమంగా వినియోగదారులకు మెరుగైన అనుభవాన్ని అందించగలవు.
