29 septembre 2026 · 5 min de lecture
La science derrière l'estimation des portions à partir d'une seule photo
Estimer le contenu nutritionnel d'un repas à partir d'une seule photographie semble, à première vue, devoir être bien trop imprécis pour être utile. Il n'y a aucune balance impliquée, aucune liste exacte d'ingrédients, et aucun moyen de voir ce qui se passe à l'intérieur de la nourriture. Et pourtant, en pratique, l'estimation par photo s'approche suffisamment pour être réellement utile pour la grande majorité des repas quotidiens. La raison tient à la quantité d'informations visuelles que contient réellement une assiette de nourriture.
Une photo transporte plusieurs signaux utiles à la fois : les aliments identifiables et leur catégorie générale (protéine, féculent, légume, sauce), leurs proportions relatives entre eux, leur volume par rapport à des objets de référence connus comme l'assiette, le bol ou les couverts présents sur l'image, et des indices visuels sur la méthode de préparation — frit versus grillé, par exemple, ce qui implique un profil calorique significativement différent même pour un ingrédient de base identique.
C'est un processus similaire, à une échelle bien plus grande et plus rapide, à celui qu'effectue un diététicien formé en estimant visuellement un repas pendant une consultation — il ne pèse pas non plus l'assiette, il raisonne à partir de l'expérience sur ce que pèse et contient habituellement un certain volume d'un certain type de nourriture. Un modèle de langage entraîné sur d'énormes quantités d'images alimentaires et de données nutritionnelles effectue une version de ce même raisonnement visuel, simplement automatisé et quasi instantané.
La précision de cette approche est naturellement inégale selon les types d'aliments. Une poitrine de poulet grillée, une pomme de terre au four, ou un bol de riz sont relativement faciles à estimer avec précision parce que leur volume et leur densité sont assez prévisibles et leurs limites visuelles sont claires. Un ragoût, un gratin, ou tout plat où les ingrédients sont mélangés et partiellement cachés — de l'huile, du beurre ou de la crème incorporés dans une sauce — est intrinsèquement plus difficile à estimer précisément, car une part importante du contenu calorique n'est tout simplement pas visible.
C'est exactement pourquoi l'estimation par photo est présentée comme une estimation rapide et raisonnable plutôt qu'une prétention à une précision de laboratoire, et pourquoi elle est associée au scan de code-barres pour les produits emballés qui ont déjà une réponse exacte et imprimée disponible. Les deux méthodes sont adaptées à des problèmes différents : le scan de code-barres là où des données exactes existent déjà, l'estimation par photo là où elles n'existent pas et n'existeront jamais, parce que le repas n'allait de toute façon jamais avoir d'étiquette.
Il vaut aussi la peine de noter que l'estimation par photo s'améliore avec un contexte supplémentaire, ce qui explique pourquoi indiquer le nom d'un plat ou une brève description en plus de la photo — "sauté de poulet au riz" plutôt qu'une simple image sans légende — tend à produire une estimation plus précise que celle que la photo apporte seule. L'information visuelle et la description textuelle réduisent toutes deux la fourchette de valeurs nutritionnelles probables, et les combiner surpasse systématiquement le fait de ne s'appuyer que sur l'une des deux.
La façon réaliste de considérer l'estimation par photo est comme une amélioration significative de précision par rapport à l'alternative qu'elle remplace réellement — une supposition approximative issue d'une recherche dans une base de données pour l'article au nom le plus proche — plutôt que comme une concurrente d'une balance de cuisine et d'une liste complète d'ingrédients. Pour l'écrasante majorité des repas faits maison, c'est une estimation nettement meilleure livrée en une fraction du temps, ce qui est le compromis qui compte réellement pour que le suivi se poursuive jour après jour.