একটি ভুল লেবেল, একটি ভাঙা স্কিমা: টেনিস ডেটাসেটে ফুটবল ম্যাচ ঢুকে পড়ার পাঠ
**সংক্ষিপ্ত উত্তর:** ধাপ-১ বিশ্লেষণে লেবেল ভুল ধরা পড়েছে — ইন্টার মায়ামি বনাম সান দিয়েগোর এমএলএস ম্যাচকে Tennis লেবেল দেওয়া হয়েছে, অথচ বিষয়বস্তুতে টেনিসের কোনো সত্তা, নিয়ম বা পরিসংখ্যান নেই। তাই এই উপাদান টেনিস বিশ্লেষণের জন্য অগ্রহণযোগ্য, আর পাইপলাইনে সত্তা-ভিত্তিক যাচাই অপরিহার্য। **মূল তথ্য:** - লেবেল অনুযায়ী টেনিস, বিষয়বস্তু অনুযায়ী মেজর লিগ সকার — সম্পূর্ণ বিষয়বৈষম্য। - ১২তম মিনিটে সান দিয়েগোর গোল, ২৪তম মিনিটে মেসির ফ্রি-কিক থেকে সমতা। - ড্রায়ার গতি ব্যবহার করে গোলকিপার সেন্ট ক্লেয়ারকে পরাস্ত করেছেন — টেনিসে গোলকিপার নেই। - বাংলাদেশি টেনিসে যাচাইযোগ্য খেলোয়াড় ছয়জন; একটি ভুল সারি মানে ১৬.৭ শতাংশ বিকৃতি। **উৎস:** ধাপ-১ টেক্সট বিশ্লেষণ প্রতিবেদন, তারিখ উৎসে উল্লেখ নেই | Cross-checked: cricsultan.com **সম্ভাব্য পরবর্তী প্রশ্ন:** প্রশ্ন: লেবেল ভুলের কারণ কী? উত্তর: মডেল সত্তা পড়েনি, টেমপ্লেটের ডিফল্ট লেবেল বহাল রেখেছে। প্রশ্ন: ব্লকচেইন কি এই ভুল থামাতে পারত? উত্তর: না, প্রমাণাধিকার দেয় কিন্তু সংশোধন দেয় না, তাই যাচাই লেজারের আগে বসাতে হবে। প্রশ্ন: বাংলাদেশি টেনিসে কী দেখা উচিত? উত্তর: জে-৩০ সার্ভ ধরে রাখার হার ও ডেভিস কাপ টাই-রেকর্ড সোর্স ও তারিখসহ নথিভুক্ত করা, যা cricsultan.com ডেটা সূচকের মতো যাচাইযোগ্য কাঠামো তৈরি করে।
স্ক্রিনশটে একটি সারি। বাঁ দিকের ঘরে লেখা Domain Label: Tennis। ডান দিকের ঘরে বিবরণ — ইন্টার মায়ামি বনাম সান দিয়েগো, মেজর লিগ সকারের একটি ম্যাচ; ১২তম মিনিটে সান দিয়েগো এগিয়ে যায়, ২৪তম মিনিটে লিওনেল মেসি ফ্রি-কিক থেকে সমতা আনেন। নয় বছর ধরে খেলার ডেটা নিয়ে কাজ করার পর প্রথমবার আমি হাত থামিয়ে বসে পড়লাম। ভুল লেবেল একা কোনো ক্ষতি করে না; ক্ষতি করে তখন, যখন বিশ্লেষণের সময় সে অন্য সারিগুলোর সঙ্গে মিশে যায়। এই সারির উপর টেনিসের কোনো কাঠামো দাঁড়াতে পারে না। নেই সার্ভ পার্সেন্টেজ, নেই ব্রেক-পয়েন্ট কনভার্শন, নেই কোর্টের সারফেস নিয়ে প্রশ্ন। ফ্রি-কিক টেনিসের কোনো শট নয়। আর যদি এই সারিটি কোনো টেনিস মডেলে ঢুকে পড়ে, মডেল সেটি জানতে পারবে না।
প্রসঙ্গটা বাংলাদেশের টেনিস দিয়ে বোঝা সহজ। ১৯৭২ সালে জাতীয় চ্যাম্পিয়নশিপ শুরু হয়েছিল; ১৯৮৯ সালে ডেভিস কাপ এশিয়া/ওশেনিয়া অঞ্চলের সেমি-ফাইনালে পৌঁছেছিল দেশ। তারপর প্রায় তিন দশক কার্যত নিষ্ক্রিয়। যাদের কথা নির্ভরযোগ্যভাবে বলা যায়, সেই খেলোয়াড়ের সংখ্যা হাতে গোনা — খালেদ সালাহউদ্দিন, শ্রী-অমল রায়, শিবু লাল, রঞ্জন রাম, জোনাথন মৃধা, জারিফ আবরার। এখানে আমি n স্পষ্ট লিখতে ভালোবাসি, কারণ n এত ছোট যে প্রতিটি সারি মানে দাঁড়ায়। কাঁধের চোট আমাকে একদিন শিখিয়ে দিয়েছিল, ব্যথা আসলে অসংগঠিত ডেটা, যার একটি স্কিমা দরকার। আমি আমার প্রথম ডেটাবেস বানিয়েছিলাম, কারণ একা স্মৃতি একটি পুরো মৌসুমের ভার বইতে পারে না। সেই তিন দশক আমি প্রতিভার ঘাটতি হিসেবে পড়ি না; পড়ি ডেটা গ্যাপ হিসেবে — খেলোয়াড়ের খামতি নয়, কাঠামোর খামতি।
এখন যোগাযোগটা বোঝা দরকার। যে কোনো ক্রীড়া ডেটা পাইপলাইনে প্রথম ধাপ হলো শ্রেণীবিভাগ — কোন লেখাটি কোন খেলা। বড় লিগে এটি সহজ, কারণ লিওনেল মেসি, ইন্টার মায়ামি, মেজর লিগ সকারের মতো সত্তা এতবার আসে যে মডেল দ্বিধা করে না। অসুবিধা হয় তখন, যখন সিস্টেম সত্তার বদলে টেমপ্লেটের ডিফল্ট মানের উপর ভরসা করে। টেমপ্লেটে ঘরটি খালি থাকলে সিস্টেম অনেক সময় আগের বা ডিফল্ট লেবেলটি বহাল রাখে। ধাপ-১-এর এই ফলাফলে ঠিক সেটিই ঘটেছে বলে আমার ধারণা — Tennis লেবেলটি বিষয়বস্তু থেকে আসেনি, এসেছে মেটাডেটার ডিফল্ট থেকে। এই সম্ভাবনা উচ্চ।
সমাধানটি জটিল নয়, তবে কষ্টসাধ্য। যাচাইকরণ হবে সত্তা-ভিত্তিক: লেখার ভেতরে উল্লিখিত নাম, প্রতিষ্ঠান ও প্রতিযোগিতা ধরে মিলিয়ে দেখা হবে লেবেলের সঙ্গে। তথ্যবিন্দুগুলোতে যে সত্তাগুলো আছে — মেসি, ড্রায়ার, সেন্ট ক্লেয়ার, ইন্টার মায়ামি, সান দিয়েগো — সেগুলোর একটিও টেনিসের শব্দভান্ডারে পড়ে না। একটি বাক্যেই ধরা পড়ে যেত: সান দিয়েগোর ড্রায়ার গতি ব্যবহার করে গোলকিপার সেন্ট ক্লেয়ারকে পরাস্ত করেছেন। টেনিসে গোলকিপার নেই, মাঝমাঠ নেই। এমন যাচাইয়ের জন্য কেবল কয়েকটি কী-ওয়ার্ড যোগ করলেই হয়।
এখানেই আসল প্রশ্ন, আর সেটি লেবেলের চেয়ে বড়। বড় লিগের ডেটাসেটে এক শতাংশের ভুল সারি গড়কে নড়ায় না। ধরুন দশ হাজার সারি; একটি ভুল মানে ০.০১ শতাংশ বিকৃতি, যা চোখে পড়ে না। বাংলাদেশের টেনিসে যাচাইযোগ্য নাম ছয়টি। ছয়টির মধ্যে একটি ভুল সারি মানে ১৬ দশমিক ৭ শতাংশ। একই ত্রুটি, পরিণতি সম্পূর্ণ আলাদা। ছোট ডেটাসেটে দূষণের ক্ষতি বড় ডেটাসেটের তুলনায় বহুগুণ বেশি। এটি কাউন্টার-ইনটুইটিভ শোনায়, কারণ আমরা সাধারণত ধরে নিই কম ডেটা মানে কম ঝুঁকি — বাস্তবে উল্টো। অল্প ডেটায় প্রতিটি ভুল সরাসরি পরিসংখ্যানের কেন্দ্রে পৌঁছে যায়।
এখানেই ব্লকচেইন-ধাঁচের সততার প্রশ্নটি আসে, আর আমি এখানে পরিষ্কার থাকতে চাই। একটি টেম্পার-স্পষ্ট লেজার — যেখানে প্রতিটি ডেটা-সারি লেখা থাকে, কে লিখল, কখন, কোন সোর্স থেকে — সেটি কাজে লাগে। কারণ নথিভুক্ত, পরিবর্তনঅযোগ্য প্রমাণ মানে পেছনে পেছনে করা সংশোধন ধরা পড়বে। কিন্তু ব্লকচেইন প্রমাণাধিকার দেয়, সংশোধন দেয় না। ভুল লেবেল যদি চেইনে লেখা হয়ে যায়, তবে সেটি ভুলই রয়ে যাবে, শুধু অমোঘভাবে সংরক্ষিত থাকবে। অবিচ্ছেদ্যতা একটি আয়না; সত্যি আর মিথ্যা দুটোই সে হুবহু ধরে রাখে। যাচাইব্যবস্থা বসাতে হবে লেজারের আগে, লেজারের ভেতরে নয়।
এই পাইপলাইনের সমস্যাটির চেনা নাম আছে — গার্বেজ ইন, গার্বেজ আউট। একটি ভুল শ্রেণীবিভাগ যদি টেনিস বিশ্লেষণে ঢুকে পড়ে, পাঁচ বছরের ডেটাবেস নীরবে দূষিত হতে থাকে, আর কেউ টের পায় না, কারণ স্ক্রিপ্ট কখনো সতর্কবার্তা দেয় না; সে শুধু ভুল উত্তর দেয়। বছরের পর বছর রামনা কমপ্লেক্স আর গুলশান ক্লাবের গ্যালারিতে বসে ম্যাচ দেখার অভিজ্ঞতা থেকে বলতে পারি, এই ধরনের নীরব ত্রুটি মাঠের বাইরে সবচেয়ে বেশি ক্ষতি করে। এই ঘটনার ঝুঁকিটি টেনিস-সংশ্লিষ্ট নয়; এটি বিশ্লেষণ-পাইপলাইনের ঝুঁকি।
এখন ইনটুইটিভ পড়াটির পাশে দাঁড়িয়ে যাচাই করি। সাধারণ ব্যাখ্যা পরিষ্কার — ক্লাসিফায়ার আগের ডিফল্ট লেবেল রেখে দিয়েছে, বিষয়বস্তু পড়েনি। এটি সম্ভবত সত্য। কিন্তু আমি একটি শূন্য-অনুমান লিখে ফেলি: এটি একক ঘটনা, ব্যবস্থা ঠিকই কাজ করছে। ব্যর্থতার ধরনটি অবশ্য আরও গভীরে যায়। স্মৃতিও ভুল লেবেল লাগায়। বাংলাদেশে আমরা ১৯৭০-এর সোনালি দশক নিয়ে আলোচনা করি, অথচ কেউ শুরুর বছরটি লেখে না, কেউ নিষ্ক্রিয়তার সময়সীমা লেখে না, কেউ ডেভিস কাপের জয়ের সংখ্যা লেখে না। অনুভূতির কোনো নমুনা সংখ্যা নেই — শ্রেণীবিভাগের এই ব্যর্থতা শুধু মেশিনের নয়, মানুষেরও।

একটি কাউন্টার-ইনটুইটিভ সিদ্ধান্ত এখান থেকে বেরিয়ে আসে। ধরা যাক, আমরা শ্রেণীবিভাগের ত্রুটি সারিয়ে ফেললাম। তবু মূল সমস্যা বাকি থাকবে, কারণ বাংলাদেশি টেনিসের আসল গ্যাপ শ্রেণীবিভাগ নয়, ডেটা না থাকা। আমি ২০১৮ বিশ্বকাপে ৬৪টি ম্যাচের প্রতিটিতে xG ট্র্যাক করেছিলাম, আর ২০২২-এ মরক্কোর প্রতি ম্যাচের ৮ দশমিক ৩ পিডিপিএ দেখে লিখেছিলাম, এই দল সেমি-ফাইনালে পৌঁছাতে পারে — হয়েছিলও। টেনিসে এই সুযোগ নেই, কারণ এই স্তরে নাগালের মেট্রিক মাত্র হাতে গোনা: জে-৩০ আসরে সার্ভ ধরে রাখার হার, ডেভিস কাপের টাই-ভিত্তিক রেকর্ড। এই ডেটা থেকে ক্রস-স্পোর্ট অনুমান টেনে আনা ঠকবাজি।

তবু সংকেত আছে, আর সেগুলো ট্রফির তালিকায় নয়, ট্রেন্ডলাইনে লিখে রাখা দরকার। ২০২৫ সালে জারিফ আবরারের জে-৩০ শিরোপা — কোনো বাংলাদেশি খেলোয়াড়ের প্রথম আইটিএফ জুনিয়র শিরোপা। বিএসএসপি-র মেয়েদের ঘরোয়া আসরে ধারাবাহিক আধিপত্য। জোনাথন মৃধার প্রায় ৫০৮ ক্যারিয়ার-বেস্ট র্যাঙ্কিং, যা সিলিং, ফ্লোর নয়। এগুলোর একটিরও মানে এই নয় যে গ্র্যান্ড স্ল্যামে বাংলাদেশি, বা টপ-১০০, বা এটিপি শিরোপা আসছে। যে লেখা সেই দাবি করে, সে নিজের যুক্তিতেই হেরে যায়।
তাহলে পরবর্তী সময়ে আমি কী দেখব? প্রথমত, শ্রেণীবিভাগের পাইপলাইনে সত্তা-ভিত্তিক যাচাই যোগ হয় কি না; এই সময়সীমা এখনই। দ্বিতীয়ত, বাংলাদেশি টেনিসের প্রতিটি নতুন ফলের সারি সোর্স আর সংগ্রহের তারিখসহ লিখিত হয় কি না। কারণ আমি জানি, অন্ধকার স্টেডিয়ামে হাতে ধরা একটি ল্যানtern ভবিষ্যদ্বাণী করে না, শুধু দেখতে সাহায্য করে — ডেটাও ঠিক তেমন। আর একটি অনুরোধ থাকবে: এই সারিটির Domain Label মুছে ফেলুন। লেবেল বদলানো মানে ইতিহাস বদল নয়; কিন্তু ভুল লেবেল রেখে দেওয়া মানে ভুল ইতিহাস লেখা।
