29. septembra 2026 · 5 min čítania
Veda za odhadovaním veľkosti porcií z jednej fotky
Odhadovanie nutričného obsahu jedla z jednej fotografie znie na prvý pohľad, akoby malo byť priveľmi nepresné na to, aby bolo užitočné. Nie je pri tom zapojená žiadna váha, žiadny presný zoznam surovín a žiadny spôsob, ako vidieť, čo sa deje vnútri jedla. A predsa v praxi odhad z fotky pristane dostatočne blízko na to, aby bol pre drvivú väčšinu bežných jedál naozaj užitočný. Dôvod spočíva v tom, koľko vizuálnej informácie tanier jedla v skutočnosti obsahuje.
Fotka nesie naraz niekoľko užitočných signálov: rozpoznateľné potraviny a ich všeobecnú kategóriu (bielkovina, škrob, zelenina, omáčka), ich vzájomné relatívne pomery, ich objem vzhľadom na známe referenčné objekty, ako je tanier, miska alebo príbor v zábere, a vizuálne vodidlá o spôsobe prípravy – vyprážané oproti grilovanému, napríklad, čo pri identickej základnej surovine nesie výrazne odlišný kalorický profil.
Ide o podobný proces, len v oveľa väčšom a rýchlejšom meradle, aký robí vyškolený dietológ, keď počas konzultácie vizuálne odhaduje jedlo – ani on tanier neváži, uvažuje zo skúsenosti o tom, koľko zvyčajne váži a čo zvyčajne obsahuje daný objem daného druhu jedla. Veľký jazykový model natrénovaný na obrovskom množstve fotografií jedla a nutričných dát robí verziu rovnakého vizuálneho uvažovania, len automatizovane a takmer okamžite.
Presnosť tohto prístupu je prirodzene nerovnomerná naprieč rôznymi druhmi jedla. Grilovaná kuracia prsia, pečený zemiak alebo miska ryže sa dajú odhadnúť pomerne presne, pretože ich objem a hustota sú celkom predvídateľné a ich vizuálne hranice sú jasné. Dusené jedlo, zapekaná misa, alebo čokoľvek, kde sú suroviny premiešané a čiastočne skryté – olej, maslo alebo smotana zapracované do omáčky – sa odhaduje prirodzene ťažšie presne, pretože podstatná časť kalorického obsahu vôbec nie je viditeľná.
Presne preto sa odhad z fotky prezentuje ako rýchly, rozumný odhad, nie ako nárok na presnosť laboratórnej úrovne, a preto sa spája so skenovaním čiarových kódov pri balených potravinách, ktoré už majú k dispozícii presnú, vytlačenú odpoveď. Tieto dve metódy sú vhodné na rozdielne problémy: skenovanie čiarového kódu tam, kde presné dáta už existujú, odhad z fotky tam, kde neexistujú a nikdy existovať nebudú, pretože dané jedlo nikdy nemalo mať štítok.
Oplatí sa tiež poznamenať, že odhad z fotky sa zlepšuje s ďalším kontextom, a preto pridanie názvu položky alebo krátkeho popisu popri fotke – „kuracia osmažená zelenina s ryžou“ namiesto len neoznačeného obrázka – zvyčajne prináša presnejší odhad, než aký nesie samotná fotka. Vizuálna informácia aj textový popis obe zužujú rozsah pravdepodobných nutričných hodnôt, a ich kombinácia dôsledne prekonáva spoliehanie sa len na jedno z nich.
Realistický spôsob, ako premýšľať o odhade z fotky, je ako o výraznom zlepšení presnosti oproti alternatíve, ktorú skutočne nahrádza – hrubému odhadu z vyhľadávania v databáze pre najbližšie znejúcu položku – nie ako o konkurentovi kuchynskej váhy a kompletného zoznamu surovín. Pre drvivú väčšinu domácich jedál ide o výrazne lepší odhad dodaný za zlomok času, čo je kompromis, na ktorom skutočne záleží pri tom, či sledovanie pokračuje deň čo deň.