29 September 2026 · 5 menit membaca
Ilmu di Balik Memperkirakan Porsi dari Satu Foto
Memperkirakan kandungan nutrisi suatu makanan dari satu foto terdengar, sekilas, seperti seharusnya terlalu tidak akurat untuk berguna. Tidak ada timbangan yang terlibat, tidak ada daftar bahan yang pasti, dan tidak ada cara melihat apa yang terjadi di dalam makanan. Namun, dalam praktiknya, estimasi berbasis foto mendekati cukup untuk benar-benar berguna bagi sebagian besar makanan sehari-hari. Alasannya terletak pada seberapa banyak informasi visual yang sebenarnya dikandung sepiring makanan.
Sebuah foto membawa beberapa sinyal berguna sekaligus: item makanan yang bisa dikenali dan kategori umumnya (protein, karbohidrat, sayur, saus), proporsi relatifnya satu sama lain, volumenya relatif terhadap objek referensi yang dikenal seperti piring, mangkuk, atau alat makan dalam bingkai, dan petunjuk visual tentang metode memasak — digoreng versus dipanggang, misalnya, yang membawa profil kalori yang cukup berbeda bahkan untuk bahan dasar yang identik.
Ini adalah proses yang mirip, pada skala yang jauh lebih besar dan lebih cepat, dengan yang dilakukan ahli gizi terlatih saat memperkirakan secara visual suatu makanan selama konsultasi — mereka juga tidak menimbang piring itu, mereka bernalar dari pengalaman tentang apa yang biasanya dibutuhkan dan dikandung oleh volume tertentu dari jenis makanan tertentu. Model bahasa besar yang dilatih dengan sejumlah besar gambar makanan dan data nutrisi melakukan versi dari penalaran visual yang sama, hanya saja otomatis dan hampir instan.
Akurasi pendekatan ini secara alami tidak merata di berbagai jenis makanan. Dada ayam panggang, kentang panggang, atau semangkuk nasi relatif mudah diperkirakan secara akurat karena volume dan kepadatannya cukup bisa diprediksi dan batas visualnya jelas. Rebusan, casserole, atau apa pun yang bahannya tercampur dan sebagian tersembunyi — minyak, mentega, atau krim ekstra yang tercampur dalam saus — secara bawaan lebih sulit diperkirakan dengan tepat, karena sebagian besar kandungan kalorinya sama sekali tidak terlihat.
Inilah tepatnya alasan estimasi foto diposisikan sebagai perkiraan yang cepat dan masuk akal alih-alih klaim presisi tingkat laboratorium, dan mengapa dipadukan dengan pemindaian barcode untuk makanan kemasan yang sudah memiliki jawaban tepat dan tercetak. Kedua metode ini cocok untuk masalah yang berbeda: pemindaian barcode di mana data yang tepat sudah ada, estimasi foto di mana data itu tidak ada dan tidak akan pernah ada, karena makanan itu memang tidak akan pernah dilengkapi label sejak awal.
Perlu dicatat juga bahwa estimasi foto membaik dengan konteks tambahan, itulah sebabnya memberikan nama item atau deskripsi singkat bersama foto — "tumis ayam dengan nasi" alih-alih sekadar gambar tanpa label — cenderung menghasilkan perkiraan yang lebih akurat dibanding yang bisa diberikan foto itu sendiri. Informasi visual dan deskripsi teks sama-sama mempersempit rentang nilai nutrisi yang mungkin, dan menggabungkan keduanya secara konsisten mengungguli hanya mengandalkan salah satu saja.
Cara realistis untuk memikirkan estimasi berbasis foto adalah sebagai peningkatan akurasi signifikan dibanding alternatif yang sebenarnya digantikannya — tebakan kasar dari pencarian database untuk item dengan nama terdekat — alih-alih sebagai pesaing timbangan dapur dan daftar bahan lengkap. Bagi sebagian besar makanan buatan rumah, itu adalah perkiraan yang jauh lebih baik yang diberikan dalam sebagian kecil waktu, yang merupakan kompromi yang sebenarnya penting agar pencatatan terus berlanjut hari demi hari.