Powrót do Bloga

29 września 2026 · 5 min czytania

Nauka stojąca za szacowaniem porcji na podstawie jednego zdjęcia

Szacowanie zawartości odżywczej posiłku na podstawie jednego zdjęcia na pierwszy rzut oka brzmi jak coś, co powinno być zbyt niedokładne, by być przydatne. Nie ma w to zaangażowanej wagi, dokładnej listy składników, ani sposobu, by zobaczyć, co dzieje się wewnątrz jedzenia. A jednak w praktyce szacowanie na podstawie zdjęcia trafia wystarczająco blisko, by być naprawdę przydatnym dla zdecydowanej większości codziennych posiłków. Powód sprowadza się do tego, ile informacji wizualnej faktycznie zawiera talerz jedzenia.

Zdjęcie niesie jednocześnie kilka użytecznych sygnałów: rozpoznawalne produkty żywnościowe i ich ogólną kategorię (białko, skrobia, warzywo, sos), ich wzajemne proporcje, ich objętość względem znanych obiektów odniesienia, takich jak talerz, miska czy sztućce w kadrze, oraz wizualne wskazówki co do metody przygotowania — na przykład smażone kontra grillowane, co niesie znacząco inny profil kaloryczny nawet dla identycznego podstawowego składnika.

To proces podobny, na dużo większą i szybszą skalę, do tego, co robi wyszkolony dietetyk, wizualnie szacując posiłek podczas konsultacji — też nie waży talerza, tylko wnioskuje z doświadczenia o tym, ile zwykle waży i co zwykle zawiera dana objętość danego rodzaju jedzenia. Duży model językowy wytrenowany na ogromnych ilościach obrazów jedzenia i danych żywieniowych wykonuje wersję tego samego rozumowania wizualnego, tylko zautomatyzowaną i niemal natychmiastową.

Dokładność tego podejścia jest naturalnie nierówna w zależności od rodzaju jedzenia. Grillowaną pierś z kurczaka, pieczonego ziemniaka czy miskę ryżu stosunkowo łatwo oszacować dokładnie, bo ich objętość i gęstość są dość przewidywalne, a ich wizualne granice są wyraźne. Gulasz, zapiekanka, czy cokolwiek, gdzie składniki są wymieszane i częściowo ukryte — dodatkowy olej, masło czy śmietana wmieszane w sos — jest z natury trudniejsze do dokładnego oszacowania, ponieważ znacząca część kaloryczności w ogóle nie jest widoczna.

Dokładnie dlatego szacowanie przez zdjęcie jest przedstawiane jako szybkie, rozsądne oszacowanie, a nie twierdzenie o laboratoryjnej precyzji, i dlatego jest połączone ze skanowaniem kodów kreskowych dla produktów pakowanych, które już mają dostępną dokładną, wydrukowaną odpowiedź. Obie metody są dopasowane do różnych problemów: skanowanie kodu kreskowego tam, gdzie dokładne dane już istnieją, szacowanie przez zdjęcie tam, gdzie ich nie ma i nigdy nie będzie, bo posiłek od początku nie miał mieć żadnej etykiety.

Warto też zauważyć, że szacowanie przez zdjęcie poprawia się przy dodatkowym kontekście, dlatego podanie nazwy dania lub krótkiego opisu obok zdjęcia — „smażony kurczak z warzywami i ryżem” zamiast samego, nieopisanego obrazu — zwykle daje dokładniejsze oszacowanie, niż niesie samo zdjęcie. Zarówno informacja wizualna, jak i opis tekstowy zawężają zakres prawdopodobnych wartości żywieniowych, a ich połączenie konsekwentnie daje lepsze wyniki niż poleganie tylko na jednym z nich.

Realistyczny sposób myślenia o szacowaniu przez zdjęcie to postrzeganie go jako znaczącej poprawy dokładności w stosunku do alternatywy, którą faktycznie zastępuje — przybliżonego zgadywania na podstawie wyszukiwania w bazie danych najbliżej brzmiącej pozycji — a nie jako konkurenta dla wagi kuchennej i pełnej listy składników. Dla przytłaczającej większości domowych posiłków to znacząco lepsze oszacowanie dostarczone w ułamku czasu, co jest kompromisem, który naprawdę decyduje o tym, czy śledzenie trwa dzień po dniu.

Scan to download app