Tencent ఈ వారం WeMM-Embedding మోడల్‌ను విడుదల చేసింది, ఇది 2 బిలియన్ పారామితులు కలిగిన మల్టీమోడల్ సిస్టమ్. ఇది ఇప్పటికే WeChat యొక్క సెర్చ్, రికమెండేషన్ మరియు ఇ-కామర్స్ పైప్‌లైన్‌లలో అంతర్భాగంగా ఉంది. ఈ విడుదల ప్రాముఖ్యత ఏమిటంటే, ఇది వాస్తవ ప్రపంచ రిట్రీవల్ క్వాలిటీ (retrieval quality), తక్కువ లాటెన్సీ (low latency) మరియు చిన్న ఇండెక్స్ సైజులను అందించే మోడల్‌ను చూపుతుంది.

"డిప్లాయ్‌మెంట్ స్టోరీ" చుట్టూ ఇంత హడావిడి ఎందుకు?

చాలా కొత్త AI మోడల్స్ క్యూరేటెడ్ డేటాసెట్‌లపై స్కోర్‌లను పోల్చే మెరిసే బెంచ్‌మార్క్ టేబుల్స్‌తో వస్తాయి. ఆ నంబర్లు పరిశోధకులు తమ పాయింట్‌ను నిరూపించుకోవడానికి సహాయపడతాయి, కానీ అవి ఉత్పత్తులను నడిపించే మెట్రిక్స్‌లోకి (metrics) చాలా అరుదుగా మారుతాయి: అంటే ఒక క్వెరీ ఎంత వేగంగా వస్తుంది, ఇండెక్స్ ఎంత మెమరీని వినియోగిస్తుంది మరియు వినియోగదారులు సృష్టించే అస్పష్టమైన (noisy) కంటెంట్‌తో మోడల్ ఎంత బాగా తట్టుకుంటుంది అనేది ముఖ్యం. WeMM మొదటి రోజు నుండే ప్రొడక్షన్-గ్రేడ్ కాంపోనెంట్‌గా ఉండటం ద్వారా ఈ విధానాన్ని మారుస్తుంది. ఇది ఏదైనా టీమ్ అడాప్ట్ చేసే వరకు వేచి ఉండే ల్యాబ్ ప్రయోగం కాదు; ఇది ఇప్పటికే Channels, Moments మరియు ఇ-కామర్స్ రంగాలలో పనిచేస్తోంది.

డెవలపర్లు గమనించాల్సిన సాంకేతిక అంశాలు

  • నిజమైన మల్టీమోడల్ హ్యాండ్లింగ్ (True multimodal handling) – ఈ మోడల్ టెక్స్ట్, ఇమేజెస్, వీడియో ఫ్రేమ్స్ మరియు డాక్యుమెంట్ థంబ్‌నెయిల్స్‌ను ఒకే ఎంబెడ్డింగ్ స్పేస్‌లోకి తీసుకుంటుంది. ఒక వినియోగదారు "sunset" అని టైప్ చేస్తే, టెక్స్ట్ మరియు విజన్-ఓన్లీ పైప్‌లైన్‌లను విడివిడిగా కలపాల్సిన అవసరం లేకుండానే, దానికి సరిపోయే వీడియో క్లిప్, ఫోటో లేదా వార్తా కథనాన్ని పొందవచ్చు.

  • సైజు ముఖ్యం, కానీ మీరు అనుకున్నట్లు కాదు – లీడర్‌బోర్డ్‌లలో ఆధిపత్యం వహిస్తున్న 9 బిలియన్ల కంటే ఎక్కువ పారామితులు కలిగిన మోడల్స్‌తో పోలిస్తే, 2 బిలియన్ పారామితులతో ఈ మోడల్ "చిన్నది". అయినప్పటికీ, ఇంటరాక్టివ్ సర్వీసులకు అవసరమైన లాటెన్సీ బడ్జెట్‌లను ఇది అందుకోగలదు. లైవ్ సిస్టమ్‌లో మీ హార్డ్‌వేర్‌కు సరిపోయే మోడల్, పెద్దదైన మరియు నెమ్మదైన మోడల్ కంటే మెరుగైన పనితీరును కనబరచగలదు.

  • Matryoshka ఎంబెడ్డింగ్స్ డైమెన్షన్ ఫ్లెక్సిబిలిటీని ఇస్తాయి – WeMM "Matryoshka" ఎంబెడ్డింగ్స్‌కు మద్దతు ఇస్తుంది, అంటే ఒకే నెట్‌వర్క్ 256 లేదా 512 డైమెన్షన్ల వంటి వివిధ పొడవుల వెక్టార్లను అవుట్‌పుట్‌గా ఇవ్వగలదు. 512 నుండి 256 డైమెన్షన్లకు తగ్గించినా, మెమరీ వినియోగాన్ని సగానికి తగ్గిస్తూనే, రిట్రీవల్ పనితీరు దాదాపు పూర్తిగా అలాగే ఉంటుందని పరీక్షలు చూపుతున్నాయి. ఇది స్టోరేజ్ ఖర్చులను నేరుగా తగ్గిస్తుంది మరియు నియర్-నైబర్ సెర్చ్‌లను (nearest-neighbor searches) వేగవంతం చేస్తుంది.

రిట్రీవల్ సిస్టమ్స్‌ను నిర్మించడానికి మూడు ఆచరణాత్మక నియమాలు

  1. మీ స్వంత డేటాపై ధృవీకరించుకోండి – బెంచ్‌మార్క్‌లు క్లీన్‌గా ఉంటాయి; కానీ ప్రొడక్షన్ డేటా గందరగోళంగా (messy) ఉంటుంది. మీ వినియోగదారులు స్క్రీన్‌షాట్‌లు, చేతితో రాసిన నోట్స్ లేదా తక్కువ రిజల్యూషన్ వీడియోలను అప్‌లోడ్ చేస్తే, అది మీకు సరిపోతుందో లేదో నిర్ణయించే ముందు ఆ ఖచ్చితమైన మిశ్రమంపై మోడల్‌ను రన్ చేయండి.

  2. వెక్టర్ పొడవును ఖర్చును తగ్గించే సాధనంగా (cost lever) పరిగణించండి – పెద్ద వెక్టార్లు సిమిలారిటీ సెర్చ్‌కు అవసరమైన కంప్యూట్ మరియు ఇండెక్స్ కోసం డిస్క్ స్పేస్ రెండింటినీ పెంచుతాయి. మీ క్వాలిటీ టార్గెట్‌ను చేరుకునే అతి చిన్న డైమెన్షన్‌తో ప్రారంభించండి. రీకాల్ (recall) లేదా ప్రిసిషన్ (precision) స్పష్టంగా తగ్గినప్పుడు మాత్రమే స్కేల్ చేయండి.

  3. విడివిడి పైప్‌లైన్‌లను (siloed pipelines) నివారించండి – ప్రతి మోడాలిటీ కోసం విడివిడి ఎన్‌కోడర్‌లను నిర్మించడం వల్ల, ఫైనల్ ర్యాంకింగ్ స్టేజ్ కోసం మీరు వెయిటింగ్ స్కీమ్‌లను మాన్యువల్‌గా తయారు చేయాల్సి వస్తుంది. ఒక యూనివర్సల్ ఎంబెడ్డింగ్ లేయర్ ఆ గ్లూ కోడ్‌ను (glue code) తొలగిస్తుంది, ఇంజనీరింగ్ ఓవర్‌హెడ్‌ను తగ్గిస్తుంది మరియు A/B టెస్టింగ్‌ను సులభతరం చేస్తుంది.

విస్తృతమైన ప్రభావం

సెర్చ్ లేదా రికమెండేషన్‌పై ఆధారపడే కంపెనీలకు, ఎంబెడ్డింగ్ మోడల్ ఎంపిక అనేది ఇన్‌ఫ్రాస్ట్రక్చర్ ఖర్చును నిర్ణయించగలదు. వినియోగదారుల అంచనాలు పెరుగుతున్న కొద్దీ లాటెన్సీ బడ్జెట్‌లు తగ్గుతాయి; ప్రతి క్వెరీకి కొన్ని మిల్లీసెకన్ల సమయం కూడా అదనంగా తీసుకుంటే, అది సర్వీస్ పనితీరును దెబ్బతీసి, వినియోగదారులు వెళ్ళిపోయేలా (churn) చేయవచ్చు.

Apache 2.0 లైసెన్స్ కింద వెయిట్స్‌ను ఓపెన్ సోర్స్ చేయాలనే Tencent నిర్ణయం డెవలపర్ల కోసం ఖర్చును కూడా తగ్గిస్తుంది. ప్రొప్రైటరీ కాంట్రాక్ట్‌ల కోసం చర్చలు జరపడం లేదా మొదటి నుండి మోడల్‌ను నిర్మించడం బదులు, టీమ్‌లు చెక్‌పాయింట్‌ను డౌన్‌లోడ్ చేసుకుని, డొమైన్-స్పెసిఫిక్ డేటాపై ఫైన్-ట్యూన్ చేసి, కొన్ని ఫెయిల్యూర్ కేసులతో దానిని అంచనా వేయవచ్చు.

మోడల్ ఎక్కడ లోపించవచ్చు

ఈ మోడల్ నాలుగు మోడాలిటీలను—టెక్స్ట్, ఇమేజెస్, వీడియో మరియు డాక్యుమెంట్లను—హ్యాండిల్ చేస్తుంది, కానీ అన్ని రకాల ఇన్‌పుట్ రకాలను కవర్ చేయదు.

తదుపరి ఏమి గమనించాలి

ముగింపు (Takeaway)

ప్రొడక్షన్ పరిమితులను దృష్టిలో ఉంచుకుని నిర్మించినప్పుడు, ఒక మధ్యస్థ పరిమాణం కలిగిన మల్టీమోడల్ ఎంబెడ్డింగ్ మోడల్ రోజువారీ క్వెరీలను హ్యాండిల్ చేయగలదని WeMM నిరూపిస్తుంది. డెవలపర్లకు సందేశం స్పష్టంగా ఉంది: వాస్తవ ప్రపంచ రిట్రీవల్ క్వాలిటీకి ప్రాధాన్యత ఇవ్వండి, వెక్టర్ డైమెన్షన్లను వీలైనంత చిన్నవిగా ఉంచండి మరియు మోడాలిటీలను ఒకే ఎంబెడ్డింగ్ లేయర్‌లోకి ఏకీకృతం చేయండి. ఈ ఎంపికలు లాటెన్సీని తగ్గించగలవు, స్టోరేజ్ ఖర్చులను తగ్గించగలవు మరియు అంతిమంగా వినియోగదారులకు మెరుగైన అనుభవాన్ని అందించగలవు.