Torna al Blog

29 settembre 2026 · 5 min di lettura

La scienza dietro la stima delle porzioni da una singola foto

Stimare il contenuto nutrizionale di un pasto da una singola fotografia sembra, in superficie, qualcosa che dovrebbe essere troppo impreciso per essere utile. Non c'è nessuna bilancia coinvolta, nessuna lista esatta di ingredienti, e nessun modo di vedere cosa succede dentro il cibo. Eppure, nella pratica, la stima tramite foto si avvicina abbastanza da essere genuinamente utile per la stragrande maggioranza dei pasti quotidiani. Il motivo si riduce a quanta informazione visiva contenga davvero un piatto di cibo.

Una foto porta con sé diversi segnali utili contemporaneamente: gli alimenti identificabili e la loro categoria generale (proteina, amido, verdura, salsa), le loro proporzioni relative tra loro, il loro volume rispetto a oggetti di riferimento noti come il piatto, la ciotola o le posate inquadrate, e indizi visivi sul metodo di preparazione — fritto contro alla griglia, per esempio, il che comporta un profilo calorico significativamente diverso anche per lo stesso ingrediente di base.

Questo è un processo simile, su una scala molto più ampia e veloce, a quello che fa un dietista esperto quando stima visivamente un pasto durante una consulenza — non sta nemmeno lui pesando il piatto, sta ragionando dall'esperienza su ciò che un dato volume di un dato tipo di cibo pesa e contiene tipicamente. Un modello linguistico di grandi dimensioni addestrato su enormi quantità di immagini di cibo e dati nutrizionali sta facendo una versione dello stesso ragionamento visivo, solo automatizzato e quasi istantaneo.

L'accuratezza di questo approccio è naturalmente disomogenea tra diversi tipi di cibo. Un petto di pollo alla griglia, una patata al forno, o una ciotola di riso sono relativamente facili da stimare con precisione perché il loro volume e la loro densità sono abbastanza prevedibili e i loro confini visivi sono chiari. Uno stufato, una teglia al forno, o qualsiasi cosa in cui gli ingredienti sono mescolati e parzialmente nascosti — olio extra, burro o panna incorporati in una salsa — è intrinsecamente più difficile da stimare con precisione, perché una parte significativa del contenuto calorico semplicemente non è visibile.

Per questo esatto motivo la stima tramite foto è presentata come una stima veloce e ragionevole piuttosto che come una pretesa di precisione da laboratorio, e per questo viene abbinata alla scansione del codice a barre per il cibo confezionato che ha già una risposta esatta e stampata disponibile. I due metodi sono adatti a problemi diversi: la scansione del codice a barre dove i dati esatti esistono già, la stima tramite foto dove non esistono e non esisteranno mai, perché il pasto non sarebbe mai arrivato con un'etichetta in primo luogo.

Vale anche la pena notare che la stima tramite foto migliora con contesto aggiuntivo, motivo per cui fornire il nome di un piatto o una breve descrizione insieme alla foto — "saltato di pollo con riso" invece di una semplice immagine senza etichetta — tende a produrre una stima più accurata di quella che dà la foto da sola. Sia l'informazione visiva che la descrizione testuale restringono l'intervallo dei valori nutrizionali probabili, e combinarle supera costantemente l'affidarsi a una sola delle due.

Il modo realistico di pensare alla stima tramite foto è come un significativo miglioramento di accuratezza rispetto all'alternativa che sta effettivamente sostituendo — una supposizione approssimativa da una ricerca nel database per l'elemento dal nome più simile — piuttosto che come una concorrente di una bilancia da cucina e di un elenco completo di ingredienti. Per la stragrande maggioranza dei pasti fatti in casa, è una stima considerevolmente migliore fornita in una frazione del tempo, che è il compromesso che conta davvero perché il tracciamento continui giorno dopo giorno.

Scan to download app