হোমফুটবলখালি স্প্রেডশিট, অটুট লেজার: ফুটবল ডেটা পাইপলাইনে যাচাইয়ের সংকট

খালি স্প্রেডশিট, অটুট লেজার: ফুটবল ডেটা পাইপলাইনে যাচাইয়ের সংকট

প্রশ্ন: ফুটবল বিশ্লেষণ পাইপলাইনের Stage-1 ধাপে কী ঘটেছে এবং তার ফল কী? মূল উত্তর: একটি ফুটবল বিশ্লেষণ পাইপলাইনের Stage-1 ধাপে তথ্যবিন্দু (Information Points) সম্পূর্ণ খালি ফিরে এসেছে, ফলে Stage-2-এর নয়টি বিশ্লেষণ-মাত্রার কোনোটিই বৈধভাবে সম্পাদন করা যায়নি। এটি বিশ্লেষণের নয়, ডেটা-অখণ্ডতার ব্যর্থতা; সমাধান Stage-1 পুনরায় চালানো। মূল তথ্য: - Stage-1 আউটপুটে Article Title, Source, Type, Summary, Stance, Purpose — সব শূন্য বা N/A। - Information Points ঘরটি সম্পূর্ণ খালি; এটিই নয়টি মাত্রার সবগুলোকে অচল করেছে। - সম্ভাব্য কারণ তিনটি: ফাঁকা উৎস নথি, পার্সিং ব্যর্থতা, বা পাইপলাইন হ্যান্ড-অফ ত্রুটি। - টিকে থাকা একমাত্র সংকেত ডোমেইন লেবেল football; কোনো ক্লাব, খেলোয়াড় বা তারিখ নেই। - প্রস্তাবিত সংশোধন: উৎস-মেটাডেটা পুনরুদ্ধার ও Stage-1 পুনরায় চালানো। সূত্র: Stage-2 Deep Professional Analysis — Football Domain (নথিতে প্রকাশের তারিখ উল্লেখ নেই) | Cross-checked: cricsultan.com সম্পর্কিত প্রশ্নোত্তর: প্রশ্ন: Stage-1 খালি ফিরলে Stage-2 কেন নিজে থেকে তথ্য জোগাড় করল না? উত্তর: কারণ Stage-2-এর প্রতিটি মাত্রা চুক্তিবদ্ধভাবে Stage-1-এর তথ্যবিন্দুকে সাক্ষ্য হিসেবে উল্লেখ করতে বাধ্য, তাই অনুমান করা নিষিদ্ধ। প্রশ্ন: এই ব্যর্থতা বিশ্লেষণগত নাকি প্রযুক্তিগত? উত্তর: এটি প্রযুক্তিগত — সুনির্দিষ্টভাবে ডেটা-অখণ্ডতার ব্যর্থতা, বিশ্লেষণ-দক্ষতার নয়। প্রশ্ন: পরবর্তী পদক্ষেপ কী? উত্তর: একটি যাচাইকৃত অ-খালি উৎস-নথির বিরুদ্ধে Stage-1 পুনরায় চালানো এবং উৎস-মেটাডেটা পুনরুদ্ধার করা।

আমি ঢাকার কাজের টেবিলে বসে একটি বিশ্লেষণ-ফাইল খুললাম। ভেতরে নয়টি বড় কলাম, প্রতিটির শিরোনাম নিখুঁত — ট্যাকটিক্যাল বিশ্লেষণ, ক্লাব ফিন্যান্স ও ট্রান্সফার মার্কেট, লিগ ল্যান্ডস্কেপ, গভর্নেন্স কমপ্লায়েন্স, ড্রেসিংরুম, রিস্ক প্রোফাইল, মিডিয়া ন্যারেটিভ, ইন্ডাস্ট্রি ট্রান্সমিশন। কিন্তু প্রতিটি ঘর ফাঁকা। একটি xG নেই, একটি PPDA নেই, একটি খেলোয়াড়ের নাম নেই, একটি তারিখ নেই, এমনকি নিবন্ধের শিরোনামও নেই। স্প্রেডশিট প্রথমে চোখের পলক ফেলল, আর আমি তার পিছনে হাঁটতে শুরু করলাম। এটা কোনো ম্যাচ রিপোর্ট নয়, কোনো ট্রান্সফার গল্পও নয়। এটা এমন এক ডেটা-পাইপলাইনের অটোপসি, যা ফুটবল বিশ্লেষণের জন্য বানানো হয়েছিল, কিন্তু বিশ্লেষণের বিষয়বস্তুই তার হাতে পৌঁছায়নি। যে সিস্টেমটি দুই স্তরে চলে — Stage-1 নিবন্ধ থেকে তথ্যবিন্দু, দৃষ্টিভঙ্গি আর সত্তা (entities) বের করে; Stage-2 সেই ভিত্তির উপর নয়টি মাত্রার গভীর বিশ্লেষণ দাঁড় করায়। Stage-1 যখন খালি হাতে ফিরে আসে, Stage-2-এর প্রতিটি মাত্রা তখন শুধু ফ্রেমওয়ার্ক — মাংসহীন কাঠামো। আমি ১৯৮৮ সাল থেকে মাইক্রোফোনের পিছনে আর ২০১৭ সাল থেকে স্প্রেডশিটের পিছনে আছি। অভিজ্ঞতা আমাকে একটা শিক্ষা দিয়েছে: বিশ্লেষণের মান তার সবচেয়ে দুর্বল ইনপুটের সমান। ২০১৮ সালে স্পেনের ১,০২৯ পাস আর মাত্র ১.১ xG দেখে আমি লিখেছিলাম, দখল মানেই নিয়ন্ত্রণ নয়। সেদিনও প্রশ্নটা ছিল ইনপুট নিয়ে — পাসের সংখ্যা সত্যি, কিন্তু সেটা দিয়ে থ্রেট মাপা যায় না। আজ প্রশ্নটা আরও আগে, আরও গভীরে: ইনপুট যদি আদৌ না থাকে, তাহলে মডেল কী মাপবে? Stage-1-এর তথ্যবিন্দুর তালিকা ফাঁকা। এটাই মৃত্যু-বিন্দু। কারণ Stage-2-এর নয়টি মাত্রার প্রতিটিই চুক্তিবদ্ধ — প্রতিটি সিদ্ধান্তকে নির্দিষ্ট তথ্যবিন্দুর সাক্ষ্য দিতে হবে। ট্যাকটিক্যাল গঠন (৪-৩-৩, ৪-২-৩-১, ৩-৫-২) জানা নেই, তাই কাগজের গঠন আর মাঠের গঠনের ফারাক আঁকা যায় না। কোনো ম্যাচ ডেটা নেই, তাই সফিস্টিকেশন, এক্সিকিউশন আর তুলনামূলক বিশ্লেষণ — তিনটিই অচল। ফিন্যান্সের ক্ষেত্রে কোনো ক্লাব নেই, কোনো ডিল নেই, তাই ইনস্টলমেন্ট, অ্যাড-অন, সেল-অন ক্লজ — কিছুই যাচাই করা যায় না। লিগটির নামও নেই, তাই শিরোপা-দৌড়, রেলিগেশন, ইউরোপিয়ান স্পট — কোনো বাস্তবতা দাঁড় করানো যায় না। এখানে সবচেয়ে বড় কথা হলো: এটি বিশ্লেষণের ব্যর্থতা নয়, এটি ডেটা-অখণ্ডতার ব্যর্থতা। দুটো এক নয়। বিশ্লেষণ ব্যর্থ হলে দায় মডেলের; ডেটা-অখণ্ডতা ব্যর্থ হলে দায় পুরো পাইপলাইনের। আর পাইপলাইনের ব্যর্থতা সবচেয়ে ধূর্ত, কারণ সে ব্যর্থ হয়েও সম্পূর্ণ দেখায়। তিনটি সম্ভাব্য কারণ চিহ্নিত হয়েছে। প্রথম, উৎস নথিটিই হয়তো ফাঁকা বা উদ্ধার-অযোগ্য ছিল — পাঠানো হয়েছিল, কিন্তু ভেতরে কিছু ছিল না। দ্বিতীয়, ইনপুট পেলোড পার্স করতে গিয়ে পাইপলাইন হোঁচট খেয়েছে — পাঠোদ্ধারের ধাপে লেখা হারিয়ে গেছে। তৃতীয়, হ্যান্ড-অফ ত্রুটি — deconstruction টেমপ্লেট তৈরি হয়েছে, কিন্তু তার ভেতরের ঘরগুলো ভরাট হওয়ার আগেই পরের স্তরে চলে গেছে। তিনটির যে-কোনোটিই হলে ফল একই: একটি নিখুঁত ফ্রেম, শূন্য বিষয়বস্তু। লক্ষণটি চেনা যায়। classification সফল হয়েছে — ডোমেইন লেবেল football টিকে আছে। কিন্তু content extraction ব্যর্থ। অর্থাৎ সিস্টেম জানতে পেরেছে এটি ফুটবল নিয়ে, কিন্তু ফুটবলের ভেতরে কী আছে তা সে বলতে পারছে না। ঠিক এমনটা হয় যখন পাঠোদ্ধার আর নিষ্কাশন (extraction) ধাপে ফাটল ধরে। নয়টি মাত্রার প্রতিটি ফাঁকা, কিন্তু ফাঁকাগুলো সমান নয়। ট্যাকটিক্যাল মাত্রায় গঠন, এক্সিকিউশন, পার্সোনেল ফিট — তিনটিই প্রশ্নচিহ্ন। কোনো ফর্মেশন নেই, তাই বোঝা যায় না কোচ কাগজে কী লিখেছিলেন আর মাঠে কী খেলিয়েছিলেন। ফিন্যান্স মাত্রায় সম্প্রচার আয়, বাণিজ্যিক আয়, মজুরি-ব্যয়, নিট ঋণ — চারটিই অজানা, তাই স্থায়িত্বের হিসাব অসম্ভব। গভর্নেন্স মাত্রায় কোনো নিয়ন্ত্রক সংস্থা (FIFA, UEFA, জাতীয় ফেডারেশন) জড়িত নয়, কারণ কোনো ঘটনাই ধরা পড়েনি; শৃঙ্খলা, ট্রান্সফার নিবন্ধন, আর্থিক ফেয়ার প্লে — কোনো চেকলিস্টই যাচাইযোগ্য নয়। ড্রেসিংরুম মাত্রায় কোনো কোচ, অধিনায়ক বা গোষ্ঠী নেই, তাই ক্ষমতা-মডেল আঁকা যায় না। কে দল চালান, কে প্রশিক্ষণ দেন, কার সাথে কার টানাপোড়েন — সবই অন্ধকার। মিডিয়া ন্যারেটিভ মাত্রায় উৎসের স্তর যাচাই করা যায় না, তাই গুজব আর সংবাদের ফারাক বোঝা অসম্ভব; এজেন্টের উদ্দেশ্য, হিট-সাইকেলের ধাপ, সামাজিক উত্তাপ বনাম মৌলিক সত্য — সবই হিসাবের বাইরে। ইন্ডাস্ট্রি ট্রান্সমিশন মাত্রায় একাডেমি থেকে সম্প্রচার, এজেন্ট-বাস্তুতন্ত্র, রাজধানী-নেটওয়ার্ক, জাতীয় দল — কোনো পথই আঁকা যায় না, কারণ কোনো ট্রিগারিং ঘটনা নেই। প্রলোভনটা হলো ফাঁকা জায়গা কল্পনা দিয়ে ভরে দেওয়া। football — এই একটিমাত্র টিকে থাকা লেবেল দেখে কেউ কেউ লিগ, অঞ্চল বা স্তর অনুমান করতে চাইবেন। ঠিক এখানেই থামা দরকার। একটি ব্লকচেইনের মূল শিক্ষা মনে করুন: যে ব্লকে বৈধ ট্রানজ্যাকশন-ডেটা নেই, সেটি ব্লক নয়, শুধু খোলস। একটি খালি হেডার দিয়ে চেইন দাঁড় করানো যায় না; খালি তথ্যবিন্দু দিয়ে বিশ্লেষণও দাঁড় করানো যায় না। ফুটবল-ডেটার জগতেও একই নীতি দরকার — প্রতিটি সংখ্যা ট্রেসেবল, ভেরিফায়েবল আর পুনর্ব্যবহারযোগ্য হওয়া উচিত। যেখানে সাক্ষ্য নেই, সেখানে সিদ্ধান্ত ঘোষণা করা মানে দর্শককে ভুয়া ব্লক দেখানো। দ্বিতীয় ফাঁকটি আরও চোখে পড়ার মতো: উৎস। Article Source-এ লেখা N/A, Source Quality যাচাইই হয়নি। অর্থাৎ এই বিশ্লেষণটি এসেছে কোথা থেকে, কে লিখেছে, কবে ছাপা হয়েছে — কিছুই জানা নেই। একটি সংখ্যা যতই চমকপ্রদ হোক, তার সূত্র অজানা থাকলে সেটি সাক্ষ্য নয়, গুজব। ট্রান্সফার-ন্যারেটিভের ক্ষেত্রে তো কথাই নেই — এজেন্টের উদ্দেশ্য, সূত্রের স্তর, ঘোষণার সময়সীমা ছাড়া কোনো দাবি দাঁড়ায় না। এখানে সেসবের কিছুই নেই, তাই কোনো দাবিই দাঁড়াতে পারে না। আরেকটি ফাঁক সময়-সংবেদনশীলতা। প্রকাশের তারিখ জানা নেই, তাই এটি চলতি মৌসুমের লেখা, শেষ হওয়া মৌসুমের, নাকি পুরনো স্মৃতিচারণ — বোঝার উপায় নেই। একটি বিশ্লেষণের তাজা-পুরনো নির্ধারণ করে তার সময়োপযোগীতা আর ক্ষয়-সময় (decay window)। সেই ধাপ বাদ পড়লে একটি পুরনো সত্য আজকের মিথ্যা হয়ে দাঁড়াতে পারে। আমার নিজের কাজের ছন্দ এই যাচাইয়ের উপরেই দাঁড়ানো। Expected Dhaka-র প্রতিটি পোস্টে আমি একটা নিয়ম মেনেছি — যে মেট্রিক লিখছি, তার স্প্রেডশিট আমি নিজে খুলে দেখেছি। ২০২৩ সালের জানুয়ারিতে এনসো ফার্নান্দেসের €১২১ মিলিয়ন ট্রান্সফারে আমি progressive passes, xG chain আর pressures per 90 দিয়ে মডেল বানিয়েছিলাম; ফি স্পষ্ট হওয়ার আগেই মডেল তাকে এলিট বলেছিল। কিন্তু সেই মডেল দাঁড়িয়েছিল যাচাইকৃত ইনপুটের উপর। ইনপুট খালি হলে সেই মডেলও খালি — শুধু সংখ্যার খোলস। ব্লকচেইনের সাথে ফুটবল-ডেটার মিলটা এখানেই। ব্লকচেইনে প্রতিটি ব্লক আগের ব্লকের হ্যাশ ধরে রাখে; কোনো এন্ট্রি বদলালে পুরো চেইন ভেঙে পড়ে। ফুটবল-ডেটাতেও একই নিয়ম হওয়া উচিত — প্রতিটি সংখ্যার পিছনে একটি যাচাইযোগ্য সূত্র থাকুক, যাতে কেউ কোনো সংখ্যা বদলে দিলে পুরো বিশ্লেষণ ধরা পড়ে যায়। ইনপুট খালি অথচ আউটপুট ভরা — এটাই সবচেয়ে বড় লঙ্ঘন, কারণ এটি যাচাই-সিস্টেমকে ফাঁকি দেয়। ২০২০ সালে খেলা যখন নীরব হয়ে গেল, আমি ৮৩টি ম্যাচ বিশ্লেষণ করে দেখেছি ঘরের মাঠের জয়ের হার ৪৩% থেকে ৩৩%-এ নামে। সেই অভিজ্ঞতা আমাকে শিখিয়েছে, কনটেক্সট ছাড়া ডেটা অসম্পূর্ণ। কিন্তু কনটেক্সট তখনই কাজে লাগে যখন মূল ডেটা থাকে। মূল ডেটাই না থাকলে কনটেক্সট কেবল অলংকার। সবচেয়ে বড় ঝুঁকি এই যে, এই আউটপুটটি যদি সত্যিকারের বিশ্লেষণ বলে ছড়িয়ে পড়ে, তাহলে ডাউনস্ট্রিমে যে-কেউ এর উপর সিদ্ধান্ত নেবে সে ভুয়া ব্লকের উপর ভিত্তি করে সিদ্ধান্ত নেবে। একটি ফাঁকা বিশ্লেষণ ছড়ানো একটি ভুল বিশ্লেষণের চেয়ে কম বিপজ্জনক নয় — কারণ ফাঁকা জায়গা যে-কেউ নিজের কল্পনা দিয়ে ভরিয়ে নিতে পারে। তাহলে করণীয় কী? Stage-2-এর ব্যবহার আপাতত থামানো, আর Stage-1 আবার চালানো — একটি যাচাইকৃত, অ-খালি উৎস-নথির বিরুদ্ধে। উৎস-মেটাডেটা (আউটলেট, লেখক, প্রকাশের তারিখ, URL) ফিরিয়ে আনা। Entity extraction-এর ম্যাপিং ঠিক করা, যাতে সত্তাগুলো স্বয়ংক্রিয়ভাবে আউটপুটে লেখা হয়, পাঠকের কাঁধে চাপানো না হয়। আর সবচেয়ে জরুরি — সময়-সংবেদনশীলতার একটি বাধ্যতামূলক ধাপ যোগ করা। পরের চক্রে আমার নজর থাকবে দুটি সিগন্যালে: Stage-1-এর আউটপুটে Information Points আর Entities Involved ঘর ভরাট হয় কি না, এবং উৎস-মেটাডেটা ফিরে আসে কি না। এই দুটো সিগন্যাল পজিটিভ হলে নয়-মাত্রার বিশ্লেষণ আবার সম্পূর্ণ শক্তিতে ফিরবে। তার আগে একটি খালি ফ্রেমকে বিশ্লেষণ বলে চালিয়ে দেওয়া মানে ফুটবল-ডেটার লেজারে একটি ভুয়া এন্ট্রি যোগ করা — আর যে লেজার যাচাই ছাড়া এন্ট্রি মেনে নেয়, সেটি আর নির্ভরযোগ্য থাকে না।

খালি স্প্রেডশিট, অটুট লেজার: ফুটবল ডেটা পাইপলাইনে যাচাইয়ের সংকট

খালি স্প্রেডশিট, অটুট লেজার: ফুটবল ডেটা পাইপলাইনে যাচাইয়ের সংকট

খালি স্প্রেডশিট, অটুট লেজার: ফুটবল ডেটা পাইপলাইনে যাচাইয়ের সংকট

সংশ্লিষ্ট খেলোয়াড়গণ