2026년 9월 29일 · 5분 읽기
사진 한 장으로 분량을 추정하는 것이 가능한 과학적 이유
사진 한 장으로 식사의 영양 정보를 추정한다는 건 겉으로 보기엔 쓸모 있기엔 너무 부정확할 것 같아요. 저울도 없고, 정확한 재료 목록도 없고, 음식 안에서 무슨 일이 일어나는지 볼 방법도 없으니까요. 그런데도 실제로는 사진 기반 추정이 일상적인 식사 대부분에 대해 충분히 쓸만한 수준으로 들어맞아요. 그 이유는 접시 위 음식 하나에 실제로 얼마나 많은 시각 정보가 담겨 있는지에 있어요.
사진 한 장은 여러 유용한 신호를 동시에 담고 있어요. 식별 가능한 음식과 그 대략적인 카테고리(단백질, 전분, 채소, 소스), 서로 간의 상대적인 비율, 화면에 함께 담긴 접시나 그릇, 식기 같은 기준 물체 대비 부피, 그리고 조리법에 대한 시각적 단서, 예를 들어 튀겼는지 구웠는지는 같은 기본 재료라도 칼로리 프로필을 의미 있게 다르게 만들어요.
이건 숙련된 영양사가 상담 중에 음식을 눈으로 추정할 때 하는 것과 비슷한 과정을, 훨씬 더 큰 규모로 훨씬 더 빠르게 해내는 거예요. 영양사도 접시 무게를 재지 않고, 특정 종류의 음식이 특정 부피일 때 보통 얼마나 무겁고 보통 무엇을 담고 있는지를 경험에 기반해 추론해요. 방대한 양의 음식 이미지와 영양 데이터로 훈련된 거대언어모델은 같은 시각적 추론을 자동화되고 거의 즉각적인 방식으로 수행하고 있는 거예요.
이 방식의 정확도는 음식 종류에 따라 자연스럽게 차이가 나요. 구운 닭가슴살, 구운 감자, 밥 한 그릇처럼 부피와 밀도가 꽤 예측 가능하고 시각적 경계가 분명한 음식은 비교적 정확하게 추정하기 쉬워요. 반면 스튜나 캐서롤처럼 재료가 섞여 있고 일부가 숨겨진 음식, 소스에 섞여 들어간 추가 기름이나 버터, 크림 같은 것들은 칼로리의 상당 부분이 아예 눈에 보이지 않기 때문에 본질적으로 정밀하게 추정하기가 더 어려워요.
바로 이런 이유로 사진 추정은 실험실 수준의 정밀함을 주장하는 게 아니라 빠르고 합리적인 추정치로 자리매김하고 있고, 이미 정확한 숫자가 인쇄되어 있는 포장식품에는 바코드 스캔이 함께 쓰이는 거예요. 두 방법은 서로 다른 문제에 맞춰져 있어요. 정확한 데이터가 이미 존재하는 곳에는 바코드 스캔을, 그런 데이터가 없고 앞으로도 없을, 애초에 라벨이 붙을 일이 없었던 음식에는 사진 추정을 쓰는 거죠.
또한 사진 추정은 추가적인 맥락이 있으면 더 정확해진다는 점도 짚어둘 만해요. 그래서 사진만 올리는 것보다 "밥을 곁들인 닭고기 볶음"처럼 이름이나 짧은 설명을 함께 제공하면 더 정확한 추정치가 나오는 경향이 있어요. 시각 정보와 텍스트 설명 둘 다 있을 법한 영양 수치의 범위를 좁혀주고, 둘을 함께 쓰는 쪽이 둘 중 하나에만 의존하는 것보다 꾸준히 더 나은 결과를 내요.
사진 기반 추정을 현실적으로 바라보는 방식은, 이것이 주방 저울과 완전한 재료 목록의 경쟁자라는 게 아니라, 실제로 대체하고 있는 것, 즉 가장 비슷해 보이는 항목을 데이터베이스에서 찾는 대략적인 추측에 비해 정확도가 크게 향상된 것이라는 거예요. 압도적으로 많은 집밥 메뉴에서는 그게 훨씬 짧은 시간 안에 의미 있게 더 나은 추정치를 제공하는 거고, 그게 바로 기록이 매일매일 계속될지를 실제로 좌우하는 절충이에요.