2026年9月29日 · 5 分钟阅读
从一张照片估算分量背后的科学原理
单凭一张照片去估算一顿饭的营养成分,表面上听起来似乎太不精确,不可能有实际用处。没有秤,没有精确的食材清单,也无法看到食物内部发生了什么。然而在实践中,基于照片的估算,对于绝大多数日常餐食来说,已经足够接近真实值,真正发挥了作用。原因归根结底在于,一盘食物实际上包含了多少视觉信息。
一张照片同时携带了好几种有用的信号:可识别的食物种类及其大致类别(蛋白质、淀粉、蔬菜、酱汁)、它们彼此之间的相对比例、相对于画面中盘子、碗或餐具等已知参照物的体积,以及关于烹饪方式的视觉线索——比如油炸还是烤制,即便是同一种基础食材,这两种做法的热量情况也会有明显不同。
这和一位训练有素的营养师在咨询过程中凭视觉估算一餐食物时所做的事情,本质上是类似的过程,只是规模大得多、速度也快得多——营养师同样不会去称量这盘菜,而是凭经验推断,某种食物在某个体积下通常重多少、包含什么成分。一个在海量食物图像和营养数据上训练出来的大语言模型,所做的正是同一种视觉推理的另一个版本,只不过是自动化的、近乎瞬间完成的。
这种方法的准确度,在不同类型的食物之间自然会有高低之分。一块烤鸡胸肉、一个烤土豆,或者一碗米饭,相对容易准确估算,因为它们的体积和密度都比较可预测,视觉边界也很清晰。而一道炖菜、一份焗烤菜,或者任何食材混合在一起、部分被遮盖住的菜品——比如融入酱汁里的额外的油、黄油或奶油——本质上就更难精确估算,因为相当一部分热量根本看不见。
这正是为什么照片估算被定位为一种快速、合理的估算,而不是宣称达到实验室级别的精确度,也是为什么它要和条形码扫描搭配使用——后者针对的是那些已经有精确印刷数据可用的包装食品。这两种方法适用于不同的问题:条形码扫描用于已经存在精确数据的地方,照片估算用于那些不存在、也永远不会存在精确数据的地方,因为这道菜从一开始就不可能附带一张标签。
还值得一提的是,照片估算会随着额外的背景信息而变得更准确,这也是为什么在照片之外提供一个菜品名称或简短描述——比如写上"鸡肉炒饭",而不只是一张没有任何标注的图片——往往能比单靠照片本身得出更准确的估算。视觉信息和文字描述,都会缩小可能的营养数值范围,而把两者结合起来使用,其效果始终优于只依赖其中一种。
看待基于照片的估算,更现实的方式,是把它当作对它真正要取代的那个选项——从数据库里搜索一个听起来最接近的结果、再粗略一猜——的一次重大精度升级,而不是把它当作厨房秤和完整食材清单的竞争对手。对绝大多数家常餐食来说,这意味着用远远更短的时间,得到一个明显更好的估算,而这正是真正决定记录习惯能否日复一日坚持下去的那笔取舍。