返回部落格

2026年9月29日 · 5 分鐘閱讀

從單張照片估算份量背後的科學

從單張照片估算一餐的營養成分,表面上聽起來應該太不精確、不可能有實際用處。這裡面沒有秤重,沒有確切的食材清單,也無從得知食物內部究竟發生了什麼。然而實際上,以照片為基礎的估算,對絕大多數的日常餐點來說,已經足夠接近真實數字、真正派得上用場。原因在於,一盤食物其實蘊含著遠比想像中更多的視覺資訊。

一張照片同時承載了好幾種有用的訊號:可辨識的食物項目及其大致類別(蛋白質、澱粉、蔬菜、醬汁)、彼此之間的相對比例、相對於畫面中盤子、碗、餐具等已知參考物的體積,以及關於烹調方式的視覺線索——比如油炸還是燒烤,即使基底食材完全相同,這兩種方式的卡路里組成也會有明顯差異。

這和一位受過訓練的營養師在諮詢時,用目視方式估算一餐的過程其實很相似,只是規模大得多、速度也快得多——營養師同樣不會真的去秤那盤食物,而是憑經驗推斷某種體積的某類食物,通常重量和成分大概是多少。一個在大量食物影像和營養資料上訓練出來的大型語言模型,做的正是同一種視覺推理的另一個版本,只是變成了自動化、近乎即時完成。

這種方法的準確度,自然會因食物種類不同而有高低之分。烤雞胸肉、烤馬鈴薯或一碗米飯相對容易準確估算,因為它們的體積和密度頗為可預測,視覺上的邊界也很清楚。燉菜、焗烤料理,或任何食材混合在一起、部分被遮蔽的食物——比如拌入醬汁裡的額外油脂、奶油或鮮奶油——本質上就更難精確估算,因為有相當一部分的卡路里根本看不見。

這正是為什麼照片估算的定位,是一種快速、合理的估算,而不是宣稱達到實驗室等級的精準度,也是為什麼它會搭配條碼掃描,用於那些本來就印有確切答案的包裝食品。這兩種方法適用於不同的問題:條碼掃描用在確切數據已經存在的地方,照片估算則用在數據不存在、也永遠不會存在的地方,因為那道菜從一開始就不可能附帶營養標示。

同樣值得一提的是,照片估算會隨著額外的脈絡資訊而變得更準確,這也是為什麼在照片之外附上品項名稱或簡短描述——例如「雞肉炒飯配米飯」,而不只是一張沒有標註的圖片——往往能得出比單靠照片更準確的估算。視覺資訊和文字描述都能縮小可能的營養數值範圍,兩者結合使用,效果持續優於單獨依賴其中任何一種。

比較實際的看待方式,是把照片估算視為對它真正取代的那個替代方案——在資料庫裡搜尋名稱相近品項所得出的粗略猜測——一次顯著的準確度提升,而不是把它拿來和廚房秤加上完整食材清單相比較。對絕大多數自家煮的餐點來說,這代表用一小部分的時間,換來一個明顯更好的估算值,而這正是決定追蹤習慣能不能日復一日持續下去的關鍵取捨。

Scan to download app