एका डेव्हलपरने जगातील प्रत्येक समुद्री बंदर (seaport) आणि विमानतळाची (airport) यादी असलेली एक मोफत, शोधण्यायोग्य (searchable) इंडेक्स प्रसिद्ध केली आहे—ज्यामध्ये ३,८०४ बंदरे आणि ९,६४० विमानतळांचा समावेश आहे—आणि यासाठी कोणत्याही नोंदणीची किंवा पेमेंटची आवश्यकता नाही. theportindex.online ही वेबसाइट वापरकर्त्यांना डेटा ब्राउझ करण्याची किंवा पूर्ण डेटासेट CSV किंवा JSON फॉरमॅटमध्ये डाउनलोड करण्याची सुविधा देते.

या इंडेक्सची गरज का होती

जगातील समुद्री बंदरांच्या स्वच्छ आणि अद्ययावत (up-to-date) यादी शोधण्याच्या उद्देशाने निर्माता कामाला लागला, पण त्याला अडथळा आला: बहुतेक व्यावसायिक सेवा पैसे भरल्यानंतरच उपलब्ध होतात आणि सार्वजनिकरित्या उपलब्ध असलेल्या याद्या अनेकदा अनेक वर्षे जुन्या असतात. अपूर्ण किंवा जुन्या डेटावर अवलंबून राहिल्यामुळे विश्लेषकांना (analysts) स्प्रेडशीट्स स्वच्छ करण्यात तासनतास वाया घालवावे लागतात, ज्यामुळे संपूर्ण उद्योगाचा खर्च वाढतो. अमेरिकन सरकारचा पोर्ट इंडेक्स, एक आंतरराष्ट्रीय लोकेशन कोड डिरेक्टरी आणि एक क्राउडसोर्स केलेले विमानतळ डेटाबेस या तीन सार्वजनिक स्रोतांना एकत्र करून, डेव्हलपरने एक एकत्रित संदर्भ (unified reference) तयार केला जो कोणीही त्वरित वापरू शकतो.

पडद्यामागील डेटा स्रोत

  • NGA World Port Index – अमेरिकन सरकारचा एक संकलन, जो प्रत्येक मान्यताप्राप्त समुद्री बंदरासाठी मूलभूत तपशील प्रदान करतो.
  • UN/LOCODE – संयुक्त राष्ट्रांची लोकेशन कोड प्रणाली, जी बंदरे आणि विमानतळांसाठी प्रमाणित आयडेंटिफायर्स (identifiers) जोडते.
  • OurAirports – विमानतळांच्या माहितीचा एक समुदाय-शासित (community-maintained) संग्रह, ज्यामध्ये रनवेची लांबी आणि कोऑर्डिनेट्सचा समावेश आहे.

प्रत्येक स्रोत चित्राचा एक वेगळा भाग दर्शवतो, परंतु एकटा कोणताही स्रोत वापरण्यायोग्य, शोधण्यायोग्य कॅटलॉग प्रदान करत नाही. त्यांना एकत्र करण्यासाठी केवळ कॉपी-पेस्ट पुरेसे नव्हते; डेव्हलपरला विसंगती (inconsistencies), डुप्लिकेट नोंदी आणि गहाळ फील्ड्स (missing fields) सोडवावे लागले.

डेटा क्लीनिंग: तीन कठीण धडे

  1. एम्बेड केलेल्या न्यूलाईन्समुळे (newlines) साधे पार्सर्स (parsers) बिघडतात – ज्या CSV फाईल्समध्ये कोटेड फील्ड्समध्ये लाइन ब्रेक्स असतात, त्यांना साध्या “split on newline” कमांडने विभागता येत नाही. रो (rows) अखंड ठेवण्यासाठी योग्य CSV पार्सर आवश्यक आहे.
  2. आउटलायर व्हॅल्यूजमुळे (Outlier values) चुका लपल्या जातात – काही तेल टर्मिनल्सनी ९०० मीटर खोली दर्शवली होती, जी संख्या बंदराची नसून मूरिंग बुयची (mooring buoys) आहे. खोलीवर आधारित रँकिंग विश्वसनीय ठेवण्यासाठी अशक्य वाटणाऱ्या संख्या फिल्टर करणे आवश्यक होते.
  3. शून्य (Zeros) अनेकदा प्लेसहोल्डर्स असतात – शून्य म्हणून नोंदवलेली खोली सहसा याचा अर्थ असा असतो की मोजमाप माहित नाही, याचा अर्थ असा नाही की पाणी सपाट आहे. शून्य ही गहाळ माहिती (missing data) म्हणून मानल्यामुळे खोलीवर अवलंबून असलेल्या कोणत्याही विश्लेषणाची अखंडता जपली जाते.

केवळ कच्च्या आकड्यांच्या पलीकडे मूल्य वाढवणे

ही इंडेक्स केवळ कोऑर्डिनेट्सची यादी करण्यापेक्षा अधिक काही करते. बंदरांसाठी, ती खोलीचे रूपांतर अशा जहाजांच्या वर्गांमध्ये करते जे सुरक्षितपणे डॉक करू शकतात, ज्यामुळे एक मेट्रिक व्यावहारिक निर्णय सहाय्यक (decision aid) बनते. विमानतळांसाठी, रनवेची लांबी तिथे कार्यान्वित होऊ शकणाऱ्या विमानांच्या प्रकारांशी जोडली जाते, ज्यामुळे वैमानिकांना आणि नियोजकांना क्षमतेचे त्वरित मूल्यांकन करता येते.

एक 'स्पेशियल ग्रिड' (spatial grid) प्रत्येक बंदराला त्याच्या जवळच्या विमानतळांशी आणि उलट जोडते, ज्यामुळे ही वेबसाइट एक शोध साधन (exploration tool) बनते. वापरकर्ते, उदाहरणार्थ, एखादे बंदर असलेल्या ठिकाणापासून किती जवळची विमानतळे आहेत हे शोधू शकतात—हे वैशिष्ट्य मल्टिमॉडल फ्रेट प्लॅनिंगसाठी उपयुक्त आहे.

मोठ्या प्रमाणावर स्टॅटिक-साइट इंजिन तयार करणे

संपूर्ण फ्रंट एंड Next.js वर स्टॅटिक जनरेशनसह चालते. बिल्ड प्रक्रियेदरम्यान, सुमारे १४,००० पेजेस—प्रत्येक बंदर आणि विमानतळासाठी एक—प्री-रेंडर केले जातात. डेटाबेस किंवा सर्व्हर-साइड लॉजिक नसल्यामुळे, वेबसाइटचा कोणताही चालू संगणकीय खर्च (ongoing compute costs) येत नाही; ती कंटेंट-डिलिव्हरी नेटवर्क (CDN) वर चालते जी जगभरात त्वरित पेजेस सर्व्ह करते.

SEO मधील अडचणी आणि 'थिन-कंटेंट'वर उपाय

हजारो टेम्पलेटेड पेजेस अपलोड केल्यामुळे सर्च इंजिनमध्ये समस्या निर्माण होऊ शकतात, जे साइटला “थिन कंटेंट” (thin content) मानून रँकिंगमध्ये दंड (penalize) लावू शकतात. जेव्हा AdSense अर्ज नाकारला गेला, तेव्हा डेव्हलपरला या समस्येचा सामना करावा लागला. उपाय म्हणून, प्रत्येक श्रेणीतील सर्वोच्च ४०० उच्च-गुणवत्तेच्या पेजेस वगळता इतर सर्व पेजेसना noindex निर्देश (directive) देण्यात आला, परंतु व्हिजिटर्ससाठी सर्व पेजेस लाईव्ह ठेवले. हे क्रॉलर्सना सांगते की केवळ सर्वात मौल्यवान पेजेस शोध निकालांमध्ये दिसले पाहिजेत, ज्यामुळे पूर्ण डेटासेट उपलब्ध करून देतानाच विश्वासार्हता देखील जपली जाते.

कोणाला फायदा होतो आणि मर्यादा काय आहेत

  • लॉजिस्टिक्स कंपन्या अनेक PDF मध्ये शोध घेण्याऐवजी कार्गो शिप बंदराच्या खोलीच्या मर्यादेत बसते की नाही हे त्वरित तपासू शकतात.
  • एअरलाइन प्लॅनर्सना रनवे-टू-एअरक्राफ्ट मॅपिंगचा त्वरित प्रवेश मिळतो, जो मार्ग व्यवहार्यता अभ्यासासाठी (route feasibility studies) उपयुक्त आहे.
  • डेव्हलपर्स आणि संशोधकांना स्वच्छ, मशीन-रीडेबल डेटा मिळतो जो कस्टम टूल्समध्ये इम्पोर्ट केला जाऊ शकतो.

प्रकल्पासाठी पुढे काय आहे

निर्माता अतिरिक्त वैशिष्ट्यांवर फीडबॅकसाठी समुदायाला विनंती करत आहे.

निष्कर्ष (Takeaway)

डेटा-क्लीनिंगमधील अडचणींवर मात करून, इन्फरन्स लेयर्स जोडून आणि स्टॅटिक जनरेशनद्वारे सर्व्हरचा खर्च टाळून, डेव्हलपर हे दाखवून देतो की एक लीन आर्किटेक्चर जागतिक स्तरावर उपयुक्त साधन देऊ शकते—जर तुम्ही वेळोवेळी होणारे अपडेट्स स्वीकारण्यास तयार असाल आणि सर्च-इंजिनच्या मार्गदर्शक तत्त्वांकडे लक्ष ठेवत असाल.