Tornar al Blog

29 de setembre del 2026 · 5 min de lectura

La ciència darrere d'estimar porcions a partir d'una sola foto

Estimar el contingut nutricional d'un àpat a partir d'una sola fotografia sona, a primera vista, com una cosa que hauria de ser massa imprecisa per ser útil. No hi ha cap bàscula involucrada, no hi ha cap llista exacta d'ingredients, i no hi ha manera de veure què passa dins del menjar. I tanmateix, a la pràctica, l'estimació per foto s'acosta prou com per ser genuïnament útil per a la gran majoria dels àpats quotidians. La raó té a veure amb quanta informació visual conté realment un plat de menjar.

Una foto porta diversos senyals útils alhora: els aliments identificables i la seva categoria general (proteïna, midó, verdura, salsa), les seves proporcions relatives entre si, el seu volum relatiu a objectes de referència coneguts com el plat, el bol o els coberts dins de l'enquadrament, i pistes visuals sobre el mètode de preparació —fregit versus a la planxa, per exemple, cosa que comporta un perfil calòric significativament diferent fins i tot per al mateix ingredient base.

Aquest és un procés semblant, a una escala molt més gran i ràpida, al que fa un dietista format quan estima visualment un àpat durant una consulta: tampoc pesa el plat, raona a partir de l'experiència sobre el que típicament pesa i conté un volum determinat d'un tipus determinat de menjar. Un model de llenguatge entrenat amb enormes quantitats d'imatges d'aliments i dades nutricionals fa una versió d'aquest mateix raonament visual, només que automatitzat i gairebé instantani.

La precisió d'aquest enfocament és naturalment desigual entre diferents tipus de menjar. Una pit de pollastre a la planxa, una patata al forn, o un bol d'arròs són relativament fàcils d'estimar amb precisió perquè el seu volum i densitat són força previsibles i els seus límits visuals són clars. Un guisat, una cassola, o qualsevol cosa on els ingredients estan barrejats i parcialment amagats —oli extra, mantega o nata incorporats en una salsa— és inherentment més difícil d'estimar amb precisió, perquè una part important del contingut calòric no és visible en absolut.

Per això exactament l'estimació per foto es presenta com una estimació ràpida i raonable, no com una afirmació de precisió de laboratori, i per això es combina amb l'escaneig de codis de barres per a aliments envasats que ja tenen una resposta exacta i impresa disponible. Els dos mètodes estan pensats per a problemes diferents: l'escaneig de codi de barres on les dades exactes ja existeixen, l'estimació per foto on no existeixen i mai existiran, perquè l'àpat mai anava a portar una etiqueta per començar.

També val la pena notar que l'estimació per foto millora amb context addicional, raó per la qual donar el nom d'un plat o una breu descripció juntament amb la foto —"salteat de pollastre amb arròs" en lloc de només una imatge sense etiquetar— tendeix a produir una estimació més precisa de la que dona la foto per si sola. Tant la informació visual com la descripció de text acoten el rang de valors nutricionals probables, i combinar-les supera de manera constant confiar només en una de les dues.

La manera realista de pensar en l'estimació per foto és com una millora significativa de precisió respecte a l'alternativa que realment reemplaça —una suposició aproximada a partir d'una cerca a una base de dades pel nom més semblant— en lloc de com una competidora d'una bàscula de cuina i una llista completa d'ingredients. Per a la gran majoria dels àpats casolans, això és una estimació significativament millor entregada en una fracció del temps, que és l'equilibri que realment importa perquè el seguiment continuï dia rere dia.

Scan to download app