29. září 2026 · 5 min čtení
Věda za odhadováním porcí z jediné fotky
Odhadovat nutriční obsah jídla z jediné fotografie zní na první pohled jako něco, co by mělo být příliš nepřesné na to, aby to bylo užitečné. Není v tom zapojená žádná váha, žádný přesný seznam ingrediencí a žádný způsob, jak vidět, co se děje uvnitř jídla. A přesto se v praxi odhad podle fotky dostane dost blízko na to, aby byl pro naprostou většinu každodenních jídel skutečně užitečný. Důvod spočívá v tom, kolik vizuální informace talíř jídla ve skutečnosti nese.
Fotka nese několik užitečných signálů najednou: rozpoznatelné potravinové položky a jejich obecnou kategorii (bílkovina, příloha, zelenina, omáčka), jejich vzájemné relativní proporce, jejich objem vzhledem ke známým referenčním objektům jako talíř, miska nebo příbory v záběru, a vizuální stopy o způsobu přípravy – smažené versus grilované například, což nese výrazně odlišný kalorický profil i u identické základní ingredience.
Je to podobný proces, jen v mnohem větším a rychlejším měřítku, jako to, co dělá vyškolený dietolog při vizuálním odhadování jídla během konzultace – ani on talíř neváží, uvažuje na základě zkušenosti o tom, co typicky váží a typicky obsahuje daný objem daného druhu jídla. Velký jazykový model natrénovaný na obrovském množství fotografií jídla a výživových dat dělá verzi stejného vizuálního uvažování, jen automatizovanou a téměř okamžitou.
Přesnost tohoto přístupu je přirozeně nerovnoměrná napříč různými druhy jídla. Grilovaná kuřecí prsa, pečený brambor nebo miska rýže se dají odhadnout relativně přesně, protože jejich objem a hustota jsou poměrně předvídatelné a jejich vizuální hranice jsou jasné. Dušené jídlo, zapékaná mísa, nebo cokoli, kde jsou ingredience smíchané a částečně skryté – extra olej, máslo nebo smetana zapracovaná do omáčky – se vrozeně hůř odhaduje přesně, protože podstatná část kalorického obsahu vůbec není viditelná.
Přesně proto se odhad podle fotky prezentuje jako rychlý, rozumný odhad, ne jako nárok na laboratorní přesnost, a proto se kombinuje se skenováním čárového kódu u balených potravin, které už mají dostupnou přesnou, vytištěnou odpověď. Obě metody jsou vhodné pro jiné problémy: skenování čárového kódu tam, kde přesná data už existují, odhad podle fotky tam, kde neexistují a nikdy existovat nebudou, protože jídlo nikdy nemělo přijít se štítkem.
Stojí také za zmínku, že odhad podle fotky se zlepšuje s dalším kontextem, a proto uvedení názvu položky nebo stručného popisu spolu s fotkou – „kuřecí stir-fry s rýží“ místo jen neoznačeného obrázku – obvykle vede k přesnějšímu odhadu, než jaký nese samotná fotka. Vizuální informace i textový popis zužují rozsah pravděpodobných nutričních hodnot, a jejich kombinace konzistentně překonává spoléhání se jen na jedno z nich.
Realistický způsob, jak přemýšlet o odhadu podle fotky, je jako o výrazném vylepšení přesnosti oproti alternativě, kterou ve skutečnosti nahrazuje – hrubému odhadu z vyhledávání v databázi podle nejpodobnějšího názvu – ne jako o konkurentovi kuchyňské váhy a kompletního seznamu ingrediencí. U naprosté většiny domácích jídel je to podstatně lepší odhad doručený za zlomek času, což je kompromis, na kterém skutečně záleží, aby sledování pokračovalo den za dnem.