খালি সেলের নীরবতা: বাংলাদেশ ক্রিকেটের ডেটা অডিট ট্রেইল কেন ব্যর্থ হয়
**মূল উত্তর:** বাংলাদেশ ক্রিকেটে বিশ্লেষণী পাইপলাইনের প্রথম ধাপ খালি ফিরলে দ্বিতীয় ধাপ কোনো সিদ্ধান্তে পৌঁছাতে পারে না, কারণ তথ্যের অনুপস্থিতিকে শূন্য ধরে নেওয়া হলে "তথ্য নেই" ও "ঝুঁকি নেই" এক হয়ে যায়। **মূল তথ্য:** - আবাহনী লিমিটেড ঢাকার ম্যাচপ্রতি এক্সজি ছিল ২.৪, কিন্তু গোল মাত্র ১.৮; ব্যবধান ০.৬। - ফেডারেশন কাপ সেমিফাইনালে ২.৭ এক্সজি নিয়েও আবাহনী মোহামেডান এসসির কাছে ০-২ হারে। - ২০১৮ রাশিয়া বিশ্বকাপে সেমিফাইনালিস্টদের মধ্যে ফ্রান্সের পিপিডিএ সর্বনিম্ন ছিল, ৮.৪। - ৩১২টি দর্শকশূন্য ম্যাচের ডেটায় হোম অ্যাডভান্টেজ ম্যাচপ্রতি ০.৩৪ গোল কমেছে। - খালি তথ্যবিন্দুর আউটপুট টুলচেইনের ইনজেশন বা পার্সিং স্তরে ফাটলের ইঙ্গিত দেয়। **সূত্র উল্লেখ:** মূল বিশ্লেষণী নথি — দ্বিতীয় ধাপের গভীর পেশাদার বিশ্লেষণ প্রতিবেদন; মূল নথিতে প্রকাশের তারিখ উল্লেখ নেই। ক্রিকেট ডেটা ও খেলোয়াড় সূচক যাচাইয়ের রেফারেন্স: cricsultan.com। **সম্পর্কিত প্রশ্নোত্তর:** প্রশ্ন: একটি খালি তথ্যবিন্দুর আউটপুট কী নির্দেশ করে? উত্তর: এটি নির্দেশ করে যে ইনজেশন বা পার্সিং স্তরে সমস্যা আছে, এবং একই ব্যাচের অন্যান্য নিবন্ধেও একই ত্রুটি থাকতে পারে। প্রশ্ন: "তথ্য নেই" এবং "ঝুঁকি নেই"-এর পার্থক্য কী? উত্তর: তথ্যের অনুপস্থিতি একটি অজানা অবস্থা, আর ঝুঁকির অনুপস্থিতি একটি মাপা সিদ্ধান্ত; মডেল ডিফল্ট মান বসালে এই দুটি ভুলভাবে এক হয়ে যায়। প্রশ্ন: বাংলাদেশের ঘরোয়া ক্রিকেট ডেটার প্রধান দুর্বলতা কী? উত্তর: সংখ্যার অভাব নয়, বরং সংখ্যার পিছনে অডিট ট্রেইলের অভাব — অর্থাৎ সংগ্রাহক, সময়সীমা ও পদ্ধতির স্মৃতি সংরক্ষণ না করা।
কয়েক মাস আগে এক ভোররাতে মতিঝিলের অফিসে একটা ফাইল খুলে বসেছিলাম। নামটা পরিচিত ছিল, কলামের শিরোনামগুলোও পরিচিত — ম্যাচ আইডি, ওভার, ব্যাটসম্যান, বোলার, রান, উইকেট, এক্সট্রা। কিন্তু প্রতিটি সারি ফাঁকা। ফাইলের শেষে সিস্টেমের রিপোর্ট: প্রসেসিং সফল।
সেই রিপোর্টটাই আমাকে থামিয়ে দিয়েছিল। মেশিন আমার কাছে মিথ্যে বলেনি। সে নির্দিষ্ট কোনো ম্যাচ সম্পর্কে ভুল দাবি করেনি, কোনো খেলোয়াড়ের গড় বানিয়ে দেয়নি, কোনো দলকে অন্যায়ভাবে এগিয়ে রাখেনি। সে যা করেছে, তা আরও সূক্ষ্ম: ফাঁকা ঘরগুলোকে হিসাবের বাইরে ফেলে দিয়ে নিজের কাজ শেষ বলে ঘোষণা করেছে।

বছর পঞ্চাশের বেশি বয়সে এসে একটা জিনিস আমি বুঝেছি। ক্রিকেট অ্যানালিটিক্সে সবচেয়ে বড় বিপদ ভুল সংখ্যা নয়। সবচেয়ে বড় বিপদ হলো অনুপস্থিত সংখ্যাকে চুপচাপ শূন্য ধরে নেওয়া। আজকের লেখাটা সেই ধরে নেওয়ার অভ্যাস নিয়ে।
প্রসঙ্গ: দুই ধাপের পাইপলাইন আর আমাদের নিজের মাঠের বাস্তবতা
আমি যে নথিটা পড়েছি, সেটা ছিল একটা বিশ্লেষণী পাইপলাইনের দ্বিতীয় ধাপ। প্রথম ধাপের কাজ একটা ম্যাচ রিপোর্ট বা নিবন্ধ থেকে কাঁচা তথ্যবিন্দু তুলে আনা — কে কত রান করল, কোন ওভারে কী হলো, কোচ কী মন্তব্য করলেন। দ্বিতীয় ধাপ সেই তথ্যবিন্দুগুলোর উপর বসে আটটা মাত্রায় গভীর বিশ্লেষণ করে: ফরম্যাট ও ম্যাচের প্রকৃতি, খেলোয়াড়ের কারিগরি ও ডেটা, দলের অবস্থান ও র্যাঙ্কিং, লিগ ও বাণিজ্যিক বাস্তুসংস্থান, নিয়ম ও প্রশাসন, ঝুঁকির হিসাব, জনমত ও প্রত্যাশার ব্যবধান, এবং শিল্পে সংক্রমণ।
সেই দ্বিতীয় ধাপের নথিটা আমার হাতে এসে পৌঁছেছিল একটা খোলস হিসেবে। আটটা মাত্রাই ছিল, কিন্তু প্রতিটার ঘরে একটাই বাক্য: পর্যাপ্ত তথ্য নেই, তাই মূল্যায়ন করা যায় না। কোনো নিবন্ধের শিরোনাম ছিল না। সূত্র ছিল না। তথ্যবিন্দুর তালিকা ছিল খালি। জড়িত সত্তার তালিকা ছিল খালি। কেবল একটা ডোমেইন লেবেল ঝুলে ছিল: ক্রিকেট।
এখানে একটা কথা পরিষ্কার করা দরকার। সেই নথিটা ব্যর্থ হয়নি। সে নিজের সীমা স্বীকার করেছে, যা পেশাদারিরই লক্ষণ। যেটা ব্যর্থ হয়েছে, সেটা হলো তার আগের ধাপ — যে ধাপ তথ্য তুলে আনার কথা ছিল, সে চুপ করে ফিরে এসেছে, আর কেউ টের পায়নি।

আমাদের দেশের ক্রিকেটে এই চুপ করে ফিরে আসার ঘটনা নতুন নয়। ঘরোয়া লিগের স্কোরকার্ড আছে, কিন্তু বল-বল ট্র্যাকিং নেই বললেই চলে। ঢাকা প্রিমিয়ার লিগের একটা ম্যাচে কে কোন বলটা কোন লাইনে করল, সেটা হয়তো কারও খাতায় টুকে রাখা হয়েছে, হয়তো হয়নি। জাতীয় দলের সিরিজে আমরা ট্র্যাকিং পাই, কিন্তু সেটা আমাদের নিজের তৈরি নয়, সেটা বাইরের সম্প্রচারক বা ভেন্ডরের দয়া। ফলে আমাদের বিশ্লেষণী ভিত্তিটা একটা কাচের মেঝের উপর দাঁড়ানো: যতক্ষণ বাইরের কেউ বল-বল ডেটা দিচ্ছে, ততক্ষণ আমরা ধনী; যেদিন সে থামবে, সেদিন আমরা খালি হাতে।
আমি এই জায়গায় আগেও দাঁড়িয়েছি। ২০১৭ সাল। তখন দেশের স্পোর্টস নিউ মিডিয়া ফুঁসে উঠছে, আর আমি মতিঝিলের ওই ছোট অফিসে বসে বাংলাদেশ প্রিমিয়ার লিগের জন্য আমার প্রথম এক্সজি মডেল বানাচ্ছি। পনেরো বছরের অভিজ্ঞতা তখন পিছনে, তবু মডেলটা প্রকাশ করতে ছয় সপ্তাহ বেশি লাগিয়ে ফেলেছিলাম। মিড-সিজন ডেডলাইন হাতছাড়া হলো। কারণ সহজ: আমি প্রতিটা সংখ্যাকে আবার যাচাই করতে চেয়েছিলাম।
আরও পিছনে যাই। ১৯৯৪ সালের আইসিসি ট্রফিতে বাংলাদেশ-কেনিয়ার সেই ম্যাচে আমি কমেন্টারি বক্সে ছিলাম। সেদিন আমি বুঝেছিলাম, ভাষা দিয়ে একটা ম্যাচ বর্ণনা করা যায়, কিন্তু ব্যাখ্যা করা যায় না। ব্যাখ্যার জন্য দরকার ছিল এমন কিছু, যা আমার চোখের বাইরে থাকত। সেই অভাবটাই আমাকে বছরের পর বছর ধরে স্প্রেডশিটের দিকে টেনে নিয়ে গেছে।
মূল বিশ্লেষণ: "নেই" আর "শূন্য" কখনো এক নয়
আবাহনী লিমিটেড ঢাকার সেই শিরোপা-অভিযানে আমি দেখলাম, তাদের ম্যাচপ্রতি এক্সজি ছিল লিগের সর্বোচ্চ, ২.৪। কিন্তু গোল করল তারা ম্যাচপ্রতি মাত্র ১.৮। ফাঁকটা ০.৬।
এখানে একটা জিনিস বোঝা জরুরি, কারণ এখানেই আমাদের পেশাটার আসল সমস্যাটা লুকিয়ে আছে। ০.৬ এই সংখ্যাটা "কিছু নেই" নয়। এটা "শূন্য"ও নয়। এটা একটা ইতিবাচক প্রমাণ — প্রমাণ যে দলটা সুযোগ তৈরি করতে পারছিল, কিন্তু সুযোগ শেষ করতে পারছিল না। অথচ একই ডেটাসেট থেকে যদি কেউ শুধু গোলের কলামটা তুলে নিত, সে দেখত ১.৮, আর সিদ্ধান্তে আসত আক্রমণটা মাঝারি মানের।
সেটাই ছিল আমার প্রথম শিক্ষা। যেখানে একটা মেট্রিক নেই, সেখানে শূন্য বসিয়ে দেওয়া মানে একটা মিথ্যে বানানো — শুধু মিথ্যেটা কেউ উচ্চারণ করে না, স্প্রেডশিট করে।
কোচিং স্টাফের কাছে আমি সেই ০.৬ গ্যাপের ব্যাখ্যা নিয়ে গেলাম। প্রথমে তারা উড়িয়ে দিলেন। "ছেলেরা ভালো খেলছে, ফল আসবে।" ফল এল, কিন্তু উল্টো দিক থেকে। ফেডারেশন কাপের সেমিফাইনালে মোহামেডান এসসির কাছে ০-২ হেরে গেল আবাহনী, অথচ সেই ম্যাচে তাদের এক্সজি ছিল ২.৭। ম্যাচের পর ফোনটা বাজল।
আমি এখানে বিজয়ের গল্প বলছি না। আমি বলছি, আমার মডেল তখনই মূল্যবান হলো, যখন মাঠের ফলটা তার বিরুদ্ধে গেলেও সে আগে থেকেই সেই সম্ভাবনার কথা বলে রেখেছিল। আর সেটা সম্ভব হয়েছিল শুধু একটা কারণে: আমি খালি ঘরগুলোকে শূন্য ধরে নিইনি, খালি ঘরগুলোকে প্রশ্ন হিসেবে রেখে দিয়েছিলাম।
২০১৮ সালের রাশিয়া বিশ্বকাপে আমি একই শৃঙ্খলা আরও বড় মাপে চালালাম। ঢাকা থেকে, রাত জেগে, টাইম জোনের বিরুদ্ধে লড়ে, ৬৪টা ম্যাচের ডেটা ট্র্যাক করলাম। দেখলাম, সেমিফাইনালিস্টদের মধ্যে ফ্রান্সের পিপিডিএ সবচেয়ে কম — ৮.৪। মানে তারা নিজেদের অর্ধে গভীর ব্লকে বসে কষ্ট স্বীকার করতে রাজি ছিল। আর তাদের ট্রানজিশন থেকে ম্যাচপ্রতি এক্সজি ছিল ১.৮, টুর্নামেন্টে সর্বোচ্চ। ফাইনালের আগেই আমি লিখেছিলাম, ক্রোয়েশিয়ার বিরুদ্ধে ফ্রান্স জিতবে। ফাইনালের তিন দিন পর, প্রতিটা সংখ্যা ৭২ ঘণ্টা ধরে আবার যাচাই করে, বিশ্লেষণটা প্রকাশ করলাম।
এখানে আমার একটা লাইন আমি প্রায়ই লিখি, এবং আজ এটা লেখার সবচেয়ে দরকার: পিপিডিএ কোনো মেট্রিক নয়, পিপিডিএ একটা স্বীকারোক্তি — দলটা কীভাবে কষ্ট করতে রাজি, তার জবানবন্দি। ঠিক তেমনই, একটা খালি তথ্যঘরও একটা স্বীকারোক্তি। সেটা বলছে, আমি জানি না, কিন্তু আমি জানতে চাইনি।
এই জায়গায় একটা সতর্কতা জরুরি। পিপিডিএ নিজে কোনো সত্য নয়, সে সত্যের একটা ছায়া। কম পিপিডিএ মানে গভীর ব্লক, কিন্তু গভীর ব্লক কেন — দুর্বল মিডফিল্ড, না কি সচেতন পরিকল্পনা, সেটা পিপিডিএ বলে না। তাই আমি কখনো একা পিপিডিএ উদ্ধৃত করি না। তার পাশে রাখি একটা নির্দিষ্ট ম্যাচের দৃশ্য, আর একটা পরীক্ষা: যদি পরের ম্যাচে দলটা উঁচু লাইনে উঠে আসে, তাহলে আমার ব্যাখ্যাটা ভুল প্রমাণিত হবে। যে বিশ্লেষণ ভুল প্রমাণ করার পথ খোলা রাখে না, সেটা বিশ্লেষণ নয়, সেটা প্রচার।
দুই হাজার বিশ সালের সময়টা আমাকে আরও কঠিন শিক্ষা দিল। যখন স্টেডিয়ামগুলো ফাঁকা, আমি বুন্দেসলিগা, প্রিমিয়ার লিগ আর আমাদের নিজের লিগ মিলিয়ে ৩১২টা ম্যাচের ডেটা নিয়ে বসলাম। দেখলাম, হোম অ্যাডভান্টেজ ম্যাচপ্রতি ০.৩৪ গোল কমে গেছে। তারপর রিগ্রেশন মডেল বানিয়ে দেখলাম, প্রধান কারণ দর্শক-সমর্থন নয়, রেফারির পক্ষপাত — যা দর্শকশূন্য পরিবেশে কমে গেছে।
সেই ফলাফল আমার নিজের খেলোয়াড়ি অভিজ্ঞতার বিরুদ্ধে গেল। আমি ক্রিকেটার ছিলাম, আমি জানি মাঠে দর্শক থাকলে কী হয়। আমি আমার নব্বইয়ের দশকের নিজের ম্যাচের টেপগুলো বের করে সপ্তাহের পর সপ্তাহ দেখলাম। প্রক্রিয়াটা বেদনাদায়ক ছিল, কিন্তু দরকারি। সেই থেকে আমি লেখায় স্পষ্টভাবে আলাদা করতে শুরু করলাম: এটা খেলোয়াড়ি সহজবোধ্যতা, আর এটা ডেটার সিদ্ধান্ত।
এই আলাদা করার অভ্যাসটাই এখন আমাকে পাইপলাইনের খালি ঘরগুলো বুঝতে সাহায্য করছে। কারণ ২০২০ সালে যেটা বুঝলাম, তা হলো: আমি ডেটার উপর আস্থা রাখতে শিখেছি, কিন্তু অন্ধভাবে নয়। আমি মডেল বানাই সন্ন্যাসীরা পাণ্ডুলিপি নকল করার মতো — ধীরে, আর ভুলের ভয় নিয়ে।
আর এখন সেই ভয়টা আমাকে বলছে, একটা বিশ্লেষণী পাইপলাইনে সবচেয়ে বিপজ্জনক লাইনটা কোনো ভুল সংখ্যা নয়। সবচেয়ে বিপজ্জনক লাইনটা হলো ডিফল্ট মান। যখন তথ্য পাওয়া যায় না, তখন সিস্টেম যদি চুপচাপ একটা নিরপেক্ষ মান বসিয়ে দেয় — শূন্য, বা গড়, বা "কোনো ঝুঁকি নেই" — তখন ডেটার অভাবটা অদৃশ্য হয়ে যায়, অথচ সিদ্ধান্তটা থেকে যায়।
এখানেই "তথ্য নেই" আর "ঝুঁকি নেই" এক হয়ে যায়। আর এই এক হয়ে যাওয়াটাই আমাদের সবচেয়ে বড় পেশাগত ব্যর্থতা।
আমি ব্যাখ্যা করি কেন। ধরা যাক, একটা খেলোয়াড় ইনজুরির কারণে খেলেননি। তার টুর্নামেন্ট গড় নেই। এখন যদি মডেল ওই গড়ের ঘরে শূন্য বসায়, তাহলে পরের ধাপে কেউ হিসাব করবে, দলটার ব্যাটিং গড় কমে গেছে। অথচ বাস্তবে ওই খেলোয়াড় খেলেনইনি। এখানে সংখ্যাটা মিথ্যে নয় — সংখ্যাটা অস্তিত্বহীন, আর আমরা তাকে অস্তিত্ব দিয়ে দিয়েছি।
ঠিক এই জায়গায় আমার লাইনটা মনে রাখা দরকার: স্প্রেডশিট কখনোই শত্রু ছিল না, শত্রু ছিল তার উপর আমার অন্ধ আস্থা।
খালি তথ্যবিন্দু নিয়ে আরও একটা কথা বলার আছে। এমন খালি আউটপুট শুধু একটা ম্যাচ বা একটা নিবন্ধ সম্পর্কে কিছু বলে না। এটা টুলচেইন সম্পর্কেও কথা বলে। এটা বলছে, ইনজেশন বা পার্সিং স্তরে কোথাও একটা ফাটল আছে। হয় সোর্স নিবন্ধটাই ফাঁকা ছিল, নয় টেক্সট নিষ্কাশনের সময় কিছু হারিয়ে গেছে, নয় ডেটা ফরম্যাট বদলে গেছে আর কেউ টের পায়নি। যেটাই হোক, সমস্যাটা একটা ম্যাচের বিশ্লেষণে সীমাবদ্ধ নয়। একই ব্যাচে থাকা অন্য নিবন্ধগুলোতেও একই ফাটল থাকতে পারে।
আর এখানেই সাংবাদিক আর ডেটা ইঞ্জিনিয়ারের কাজ এক হয়ে যায়। সাংবাদিকের প্রশ্ন: সূত্র কী, তারিখ কী, কে বলল? ইঞ্জিনিয়ারের প্রশ্ন: ফিল্ডটা কেন খালি এল, কে ফাঁকা করল, আর সেটা কে টের পাবে?
আমাদের দেশের ক্রিকেট ডেটার সবচেয়ে বড় দুর্বলতা সেটাই। সংখ্যা কম নয়, আমাদের সংখ্যার পিছনে অডিট ট্রেইল নেই। এই যে অ্যাভারেজটা লিখছি, এটা কোন বছর থেকে, কত ম্যাচের, হোম না অ্যাওয়ে, কতগুলো নট-আউট বাদ পড়েছে — এসবের উত্তর বেশিরভাগ সময় আমরা দিতে পারি না। ফলে দুইটা বিশ্লেষক একই খেলোয়াড় নিয়ে দুই রকম সিদ্ধান্তে পৌঁছান, আর কেউ কাউকে ভুল প্রমাণ করতে পারেন না। এটা ভুলের সমস্যা নয়, যাচাইয়ের সমস্যা।
আর যাচাই না থাকলে লম্বা সময় ধরে যে জিনিসটা জমে, সেটা জ্ঞান নয়, সেটা প্রবাদ। আমাদের ক্রিকেট-লেখালেখিতে এই প্রবাদের ভাণ্ডার বেশ বড়। "ও বড় ম্যাচের খেলোয়াড়", "ও চাপ নিতে পারে না", "ওর টেকনিক নেই" — এগুলো অনেক সময় একটা-দুইটা ম্যাচের স্মৃতি থেকে জন্মানো বাক্য, যার পিছনে কোনো নমুনা নেই। মাশরাফি মর্তুজা, সাকিব আল হাসান, তামিম ইকবাল, মুশফিকুর রহিম — এই নামগুলোর পিছনে জমে থাকা অনেক বাক্যেরও একই অবস্থা। বাক্যগুলো এত জোরে বলা হয়, যে সিদ্ধান্ত নেওয়ার সময় মানুষ সত্যি বলে ধরে নেয়।
এখানে আমার দ্বিতীয় বড় লাইনটা কাজে লাগে: আমি প্যাটার্ন খুঁজে পাইনি, ডেটার ভেতরে প্যাটার্নটাই আমাকে খুঁজে পেয়েছে। অর্থাৎ, আমি আগে থেকেই ঠিক করে বসি না যে অমুক খেলোয়াড় খারাপ। আমি সংখ্যাগুলো সাজিয়ে রাখি, আর দেখি কোন গল্পটা নিজে থেকে দাঁড়ায়। যদি দাঁড়াতে না চায়, আমি জোর করি না।
নমুনা-আকারের ব্যাপারে সৎ থাকা আমার জন্য বিলাসিতা নয়, পেশাগত শৃঙ্খলা। বাংলাদেশের ঘরোয়া ক্রিকেটে একজন তরুণ ব্যাটসম্যানের হয়তো চারটা ফার্স্ট-ক্লাস ম্যাচ আছে। চার ম্যাচ থেকে "সে বড় মঞ্চের জন্য তৈরি" — এই সিদ্ধান্তে আসা ঠিক ততটাই দায়িত্বজ্ঞানহীন, যতটা চার ম্যাচ থেকে "সে ব্যর্থ" বলে দেওয়া। অথচ প্রথম বাক্যটা আমাদের সংবাদমাধ্যমে অনেক বেশি লেখা হয়, কারণ আশার গল্প বিক্রি হয়, আর সন্দেহ বিরক্ত করে।
তাই আমি লিখতে বসে আগে জিজ্ঞেস করি: এই সংখ্যাটা কোথা থেকে এল, কতজনের, কত সময়ের, আর কে এটা সংগ্রহ করেছে? যে পক্ষটা এই সংখ্যা থেকে লাভবান হবে, সে-ই কি এটা সংগ্রহ করেছে? বিশেষ করে ট্রান্সফার উইন্ডোতে। আমাদের অঞ্চলে ট্রান্সফার গুজবের ভেতরে সত্যের পরিমাণ কম, আর এজেন্টের স্বার্থের পরিমাণ বেশি। একটা ফি-এর খবর শুনলে আমি আগে জিজ্ঞেস করি, রিলিজ ক্লজটা কী, বেতন-বিলটা কে বহন করছে, আর চুক্তির মেয়াদ কত। কারণ ফি একটা গল্প, কিন্তু চুক্তির কাঠামো একটা দলিল।
একটা ট্রান্সফার গুজবের তথ্যবিন্দুর তালিকা অনেক সময় ঠিক ওই ফাঁকা স্প্রেডশিটের মতোই হয়। "ক্লাব আগ্রহী" লেখা আছে, কিন্তু কত ফি, কত বছরের চুক্তি, মেডিকেল কখন, বাই-আউট কত — কোনো ঘরে কিছু নেই। অথচ পাঠক সেই গুজব পড়ে একটা সিদ্ধান্তে পৌঁছে যান। এটাই খালি ঘরের আসল ক্ষতি: সে নিজে মিথ্যে বলে না, কিন্তু মিথ্যেকে জায়গা করে দেয়।
প্রতিকূল কোণ: ব্যর্থতা খালি আউটপুটে নয়, চুপ করে থাকার ব্যবস্থায়
এখন সেই জায়গায় আসি যেখানে আমাকে আমার নিজের প্রথম সিদ্ধান্তটার বিরুদ্ধে দাঁড়াতে হয়।
প্রচলিত পাঠটা সহজ। প্রথম ধাপ খালি ফিরেছে, তাহলে প্রথম ধাপটা আবার চালাও, ব্যাচটা স্ক্যান করো, তারপর কাজে ফেরো। ব্যবহারিক, দ্রুত, এবং আমার মতে অসম্পূর্ণ।
কারণ সমস্যাটা খালি আউটপুটে নয়। সমস্যাটা হলো, ওই সিস্টেমের নিজের অস্তিত্বে এমন কোনো বাক্য নেই যেটা দিয়ে সে বলতে পারে, আমি জানি না। সে জানে "সফল", সে জানে "ব্যর্থ", সে জানে "শূন্য"। সে জানে না "অনুপস্থিত"। অথচ বাস্তব ডেটায় সবচেয়ে বেশি যা ঘটে, সেটা হলো অনুপস্থিতি।
দ্বিতীয় প্রতিকূল পাঠটা আরও অস্বস্তিকর। আমরা সহজে ধরে নিই, খালি আউটপুট মানে কোনো তথ্য নেই। কিন্তু দ্বিতীয় ধাপের নথিটা নিজেই একটা তথ্য তৈরি করেছে — এই তথ্য যে প্রথম ধাপের পাইপলাইনে একটা সমস্যা আছে। নথির লেখক নিজেই লিখেছেন, সবচেয়ে বড় ঝুঁকিটা হলো, কেউ যেন এই "তথ্য নেই"-কে "ঝুঁকি নেই" ভেবে না ফেলে। এটা সঠিক পেশাগত দূরদৃষ্টি, এবং এই বাক্যটাই আমার কাছে পুরো নথির সবচেয়ে মূল্যবান অংশ।
তৃতীয় প্রতিকূল পাঠটা আমাদের দেশ নিয়ে। অনেকে বলেন, বাংলাদেশের ক্রিকেটে সমস্যা ডেটার অভাব। আমি সেটা মানি না। আমাদের সমস্যা ডেটার অভাব নয়, আমাদের সমস্যা ডেটার স্মৃতিভ্রংশ। আমাদের কাছে স্কোর আছে, কিন্তু সেই স্কোর কীভাবে তৈরি হলো, কে লিখল, কোন শর্তে লিখল — সেই স্মৃতি আমরা মুছে ফেলি। আর স্মৃতি ছাড়া সংখ্যা শুধু সংখ্যা, জ্ঞান নয়।
একটা প্যারাডক্স এখানে দাঁড়ায়, আর প্যারাডক্স আমার কাছে দেয়াল নয়, প্যারাডক্স হলো এমন একটা দরজা যার হাতল নেই — যতক্ষণ না তুমি তার মানচিত্র আঁকো। আমাদের প্যারাডক্সটা এই: যে লিগে বল-বল ডেটা সবচেয়ে কম, সেই লিগের গল্প সবচেয়ে বেশি বলা হয়। কম প্রমাণ মানে বেশি কল্পনা, আর বেশি কল্পনা মানে বেশি আত্মবিশ্বাস। এটা উল্টো সম্পর্ক, এবং এটা আমাদের ক্রিকেট-সংস্কৃতির গভীরে বসে আছে।
আর এখানে একটা সাংবাদিকতার প্রশ্নও জড়ানো। প্রথম ধাপের পাইপলাইনে যদি খালি আউটপুট আসে, আর কেউ সেটা যাচাই না করে সোজা দ্বিতীয় ধাপে পাঠিয়ে দেয়, তাহলে সাংবাদিকতার দিক থেকে যেটা ঘটে সেটা বড় বিপদ নয় — যেটা ঘটে সেটা আরও ধূর্ত। নিবন্ধটা বেরিয়ে যায়, সেটা পড়তে ঠিক লাগে, তার কোনো বাক্য ভুল প্রমাণ করা যায় না, কিন্তু সেটা কোনো সত্যের সাক্ষ্য দেয় না। এটাই সাংবাদিকতার সবচেয়ে কঠিন রূপ: ভুলের মতো দেখতে নয়, ঠিক আছে বলে মনে হয়।
আমার নিজের পেশায় আমি এই ভুলটা করেছি। ২০১৭ সালে মডেলটা সময়মতো প্রকাশ না করে আমি ডেডলাইন হারিয়েছি। কেউ আমাকে বকেনি, কারণ আমি সঠিক কাজ করেছিলাম। কিন্তু সেদিন একটা প্রশ্ন আমার মাথায় আসেনি, আজ আসে: আমি যদি শুধু গোলের কলাম দেখতাম, কেউ ধরতে পারত কি? না, পারত না। কারণ আমার আউটপুটে কোনো ফাঁকা ঘর থাকত না। ফাঁকা ঘরগুলো থাকত শুধু আমার মাথায়।
পরের রাউন্ডে যা দেখতে হবে
সেই ভোররাতে খালি ফাইলটার দিকে তাকিয়ে আমার মনে পড়েছিল আমার নিজের একটা লাইন: ডেটা কথা বলেনি, আমাকে আগে তার নীরবতা শিখতে হয়েছে।

আমি এখনো শিখছি। পরের রাউন্ডে আমি খেয়াল রাখব, পাইপলাইনটা নিজের অসম্পূর্ণতার কথা বলতে শিখল কি না — অর্থাৎ কোনো "তথ্য অপর্যাপ্ত" সংকেত ছাড়া ওই ফলাফল কোনো ট্রেন্ড ডেটাবেসে জমা পড়ছে কি না। খেয়াল রাখব, একই ব্যাচের বাকি নিবন্ধগুলোও খালি ফিরেছে কি না, কারণ একটা ফাঁকা আউটপুট দুর্ঘটনা, পরপর পাঁচটা ফাঁকা আউটপুট কাঠামো। আর খেয়াল রাখব, আমাদের ঘরোয়া ক্রিকেটে কোনো ম্যাচের বল-বল ডেটা প্রকাশিত হলে তার সঙ্গে সংগ্রাহকের নাম আর সংগ্রহের পদ্ধতি লেখা আছে কি না।
যদি না থাকে, তাহলে সংখ্যাটা থাকলেও আমরা কিছু জানব না। আর জানা না জানার মধ্যেকার পার্থক্যটাই শেষ পর্যন্ত ক্রিকেট-বিশ্লেষণের একমাত্র সম্পদ।
শেষে একটা প্রশ্ন রেখে যাই। একটা স্প্রেডশিট যদি নিজের ফাঁকা ঘরগুলো সম্পর্কে সৎ হতে শেখে, আর আমরা যদি সেই সততা বরদাস্ত করতে পারি, তাহলে বাংলাদেশের ক্রিকেট-লেখালেখি কি আরও দুর্বল হবে, না কি প্রথমবারের মতো সত্যি হবে?
