2026. szeptember 29. · 5 perces olvasás
A tudomány az adagméretek egyetlen fotóból történő becslése mögött
Egy étel tápértékének egyetlen fényképből történő becslése elsőre úgy hangzik, mintha túlságosan pontatlan lenne ahhoz, hogy hasznos legyen. Nincs mérleg, nincs pontos összetevőlista, és nincs mód látni, mi történik az étel belsejében. Mégis, a gyakorlatban a fotó alapú becslés elég közel kerül ahhoz, hogy valóban hasznos legyen a mindennapi ételek túlnyomó többségénél. Az ok abban rejlik, mennyi vizuális információt tartalmaz valójában egy tányér étel.
Egy fotó egyszerre több hasznos jelzést hordoz: az azonosítható ételeket és azok általános kategóriáját (fehérje, keményítő, zöldség, szósz), egymáshoz viszonyított arányukat, a képen látható tányérhoz, tálhoz vagy evőeszközökhöz viszonyított térfogatukat, valamint az elkészítési módra utaló vizuális jeleket — például a sütött kontra grillezett ételt, amely érdemben eltérő kalóriaprofilt hordoz még azonos alapanyag esetén is.
Ez hasonló folyamat, csak sokkal nagyobb léptékben és gyorsabban, mint amit egy képzett dietetikus tesz, amikor vizuálisan becsül meg egy ételt egy konzultáció során — ő sem mérlegeli a tányért, hanem tapasztalatból következtet arra, hogy egy adott mennyiségű, adott típusú étel jellemzően mennyit nyom és mit tartalmaz. Egy hatalmas mennyiségű ételfotón és tápértékadaton betanított nagy nyelvi modell ugyanennek a vizuális következtetésnek egy változatát végzi, csak automatizáltan és szinte azonnal.
Ennek a megközelítésnek a pontossága természetesen egyenetlen a különböző ételtípusok között. Egy grillezett csirkemell, egy sült krumpli vagy egy tál rizs viszonylag könnyen pontosan becsülhető, mert a térfogatuk és sűrűségük meglehetősen kiszámítható, és a vizuális határaik egyértelműek. Egy ragu, egy rakott étel, vagy bármi, ahol az összetevők össze vannak keverve és részben rejtve vannak — extra olaj, vaj vagy tejszín egy szószba keverve —, eleve nehezebben becsülhető pontosan, mert a kalóriatartalom egy jelentős része egyáltalán nem látható.
Pontosan ezért pozícionálják a fotó alapú becslést gyors, ésszerű becslésként, nem pedig laboratóriumi szintű pontosság igényével, és ezért párosítják vonalkód-olvasással a csomagolt élelmiszerekhez, amelyeknél már eleve pontos, nyomtatott válasz áll rendelkezésre. A két módszer eltérő problémákra alkalmas: a vonalkód-olvasás ott, ahol már létezik pontos adat, a fotó alapú becslés pedig ott, ahol nincs, és sosem is lesz, mert az étel eleve sosem jött volna címkével.
Érdemes azt is megjegyezni, hogy a fotó alapú becslés javul további kontextussal, ezért egy étel nevének vagy rövid leírásának megadása a fotó mellett — „csirkés wok rizzsel" egy puszta, felirat nélküli kép helyett — általában pontosabb becslést eredményez, mint amit a fotó önmagában hordoz. A vizuális információ és a szöveges leírás egyaránt szűkíti a valószínű tápértékek tartományát, és a kettő kombinálása következetesen felülmúlja azt, ha csak egyikre támaszkodunk.
A fotó alapú becslésről reálisan úgy érdemes gondolkodni, mint jelentős pontosságbeli javulásról ahhoz az alternatívához képest, amit valójában felvált — egy durva találgatáshoz egy adatbázis-keresésből a legközelebbinek hangzó tétel alapján —, nem pedig egy konyhai mérleg és egy teljes összetevőlista versenytársaként. Az otthon főzött ételek túlnyomó többségénél ez egy érdemben jobb becslés, a töredék idő alatt szállítva, és ez az a kompromisszum, amely valójában számít abban, hogy a naplózás napról napra folytatódik-e.