২৯ সেপ্টেম্বর, ২০২৬ · ৫ মিনিটের পাঠ
একটি একক ছবি থেকে পরিমাণের আকার অনুমান করার পিছনে বিজ্ঞান
একটি একক ফটোগ্রাফ থেকে একটি খাবারের পুষ্টি উপাদান অনুমান করা, উপরিভাগে, উপকারী হওয়ার জন্য অনেক বেশি অনির্দিষ্ট হওয়া উচিত বলে মনে হয়। কোনো স্কেল জড়িত নেই, কোনো সঠিক উপাদান তালিকা নেই, এবং খাবারের ভিতরে কী ঘটছে তা দেখার কোনো উপায় নেই। তবুও, বাস্তবে, ফটো-ভিত্তিক অনুমান যথেষ্ট কাছাকাছি পৌঁছায় যে এটি বেশিরভাগ দৈনন্দিন খাবারের জন্য সত্যিকারভাবে উপকারী। কারণটি নির্ভর করে একটি প্লেট খাবারে আসলে কতটা ভিজ্যুয়াল তথ্য থাকে তার উপর।
একটি ছবি একসাথে বেশ কয়েকটি উপকারী সংকেত বহন করে: শনাক্তযোগ্য খাদ্য আইটেম এবং তাদের সাধারণ বিভাগ (প্রোটিন, শ্বেতসার, সবজি, সস), একে অপরের সাথে তাদের আপেক্ষিক অনুপাত, ফ্রেমে প্লেট, বাটি, বা পাত্রের মতো পরিচিত রেফারেন্স বস্তুর তুলনায় তাদের আয়তন, এবং প্রস্তুতির পদ্ধতি সম্পর্কে ভিজ্যুয়াল সূত্র — ভাজা বনাম গ্রিলড, উদাহরণস্বরূপ, যা একই বেস উপাদানের জন্যও অর্থপূর্ণভাবে ভিন্ন ক্যালরি প্রোফাইল বহন করে।
এটি অনেক বড় এবং দ্রুত স্কেলে, একটি প্রশিক্ষিত ডায়েটিশিয়ান একটি পরামর্শের সময় একটি খাবার ভিজ্যুয়ালি অনুমান করার সময় যা করেন তার অনুরূপ একটি প্রক্রিয়া — তারাও প্লেট ওজন করছেন না, তারা অভিজ্ঞতা থেকে যুক্তি করছেন একটি নির্দিষ্ট ধরনের খাবারের একটি নির্দিষ্ট আয়তন সাধারণত কতটা ওজনের এবং কী ধারণ করে। প্রচুর পরিমাণে খাদ্য চিত্র এবং পুষ্টি ডেটায় প্রশিক্ষিত একটি বড় ভাষা মডেল একই ধরনের ভিজ্যুয়াল যুক্তির একটি সংস্করণ করছে, শুধু স্বয়ংক্রিয় এবং প্রায় তাৎক্ষণিক।
এই পদ্ধতির নির্ভুলতা স্বাভাবিকভাবে বিভিন্ন ধরনের খাবারের মধ্যে অসম। একটি গ্রিলড চিকেন ব্রেস্ট, একটি বেকড আলু, বা এক বাটি ভাত তুলনামূলকভাবে নির্ভুলভাবে অনুমান করা সহজ কারণ তাদের আয়তন এবং ঘনত্ব মোটামুটি পূর্বাভাসযোগ্য এবং তাদের ভিজ্যুয়াল সীমানা স্পষ্ট। একটি স্টু, একটি ক্যাসেরোল, বা এমন কিছু যেখানে উপাদান মিশ্রিত এবং আংশিকভাবে লুকানো — একটি সসে মিশে থাকা অতিরিক্ত তেল, মাখন, বা ক্রিম — নির্ভুলভাবে অনুমান করা স্বাভাবিকভাবে কঠিন, কারণ ক্যালরি উপাদানের একটি অর্থপূর্ণ অংশ একেবারেই দৃশ্যমান নয়।
এই কারণেই ফটো অনুমানকে ল্যাব-স্তরের নির্ভুলতার দাবির পরিবর্তে একটি দ্রুত, যুক্তিসঙ্গত অনুমান হিসেবে স্থাপন করা হয়েছে, এবং কেন এটি প্যাকেজড খাবারের জন্য বারকোড স্ক্যানিংয়ের সাথে জুটি বাঁধা হয়েছে যার ইতিমধ্যে একটি সঠিক, মুদ্রিত উত্তর উপলব্ধ রয়েছে। দুটি পদ্ধতি বিভিন্ন সমস্যার জন্য উপযুক্ত: বারকোড স্ক্যানিং যেখানে সঠিক ডেটা ইতিমধ্যে বিদ্যমান, ফটো অনুমান যেখানে এটি নেই এবং কখনো থাকবে না, কারণ খাবারটি শুরু থেকেই কখনো একটি লেবেল সহ আসার কথা ছিল না।
এটিও উল্লেখযোগ্য যে ফটো অনুমান অতিরিক্ত প্রসঙ্গের সাথে উন্নত হয়, এই কারণেই ছবির সাথে একটি আইটেমের নাম বা একটি সংক্ষিপ্ত বিবরণ প্রদান করা — শুধু একটি লেবেলবিহীন ছবির পরিবর্তে "ভাতের সাথে চিকেন স্টির ফ্রাই" — ছবি নিজে থেকে বহন করার চেয়ে একটি বেশি সঠিক অনুমান তৈরি করতে থাকে। ভিজ্যুয়াল তথ্য এবং পাঠ্য বিবরণ উভয়ই সম্ভাব্য পুষ্টি মানের পরিসর সংকুচিত করে, এবং উভয়কে একত্রিত করা একাকী নির্ভর করার চেয়ে ধারাবাহিকভাবে ভালো পারফর্ম করে।
ফটো-ভিত্তিক অনুমান সম্পর্কে চিন্তা করার বাস্তবসম্মত উপায় হলো এটি যে বিকল্পটি আসলে প্রতিস্থাপন করছে তার তুলনায় একটি উল্লেখযোগ্য নির্ভুলতা আপগ্রেড হিসেবে — নিকটতম-শব্দের আইটেমের জন্য একটি ডেটাবেস সার্চ থেকে একটি মোটামুটি অনুমান — একটি রান্নাঘরের স্কেল এবং একটি সম্পূর্ণ উপাদান তালিকার প্রতিযোগী হিসেবে নয়। বিপুল সংখ্যাগরিষ্ঠ ঘরে তৈরি খাবারের জন্য, এটি সময়ের একটি ভগ্নাংশে প্রদত্ত একটি অর্থপূর্ণভাবে ভালো অনুমান, যা সেই ট্রেড-অফ যা আসলে গুরুত্বপূর্ণ ট্র্যাকিং দিনের পর দিন চলতে থাকে কিনা তার জন্য।