Le 2 octobre 2026, l'agence de communication Reputation Age a mis en ligne une étude réalisée avec Bubbling, une plateforme française qui mesure la présence des marques dans les assistants conversationnels. Présentée sous le titre « Les résultats semestriels vus par ChatGPT et Gemini », elle tient en sept pages datées de septembre. Son chiffre principal porte sur les comptes semestriels de 39 sociétés du CAC 40 : 40 % des chiffres restitués par les deux assistants sont incorrects.
Les confusions entre indicateurs invitent aussi à examiner les limites du texte non structuré et les implicites du langage courant. Entre le 25 et le 28 août 2026, après la publication des résultats du premier semestre, 8 671 conversations ont été menées avec ChatGPT et Gemini, soit 34 684 réponses générées. Un « persona de journaliste économique » automatisé posait des questions sur les chiffres publiés, les indicateurs mis en avant par chaque entreprise, son récit financier et la comparaison avec ses concurrents.
Un second scénario demandait au moteur si l'entreprise était le bon choix pour un client potentiel. La croissance publiée, juste dans 42 % des cas Le taux de restitution correcte dépend de l'indicateur demandé. Le résultat net est juste dans 67 % des réponses, la dette nette dans 66 %, le chiffre d'affaires dans 65 %, la croissance organique dans 64 %, le free cash-flow dans 62 % et l'EBITDA dans 57 %.
La croissance publiée ferme la marche avec 42 %. L'étude distingue deux familles d'erreurs. La première regroupe les chiffres obsolètes ou inventés, de 19 % des réponses sur le résultat net à 36 % sur l'EBITDA.
Dans la seconde, le moteur cite un chiffre officiel de l'entreprise qui ne correspond pas à la question, ce qui arrive dans 24 % des réponses sur la croissance publiée. Les auteurs relèvent aussi des confusions entre croissance organique et publiée, ou entre trimestre et semestre. Par société, ce défaut de sélection touche 46 % des vérifications sur BNP Paribas, 43 % sur Crédit Agricole et 26 % sur EssilorLuxottica.
« L'IA trouve le bon document mais y prend le mauvais chiffre », résume le document. Le classement va de Capgemini (81 % de réponses correctes) et Airbus (80 %) à Crédit Agricole (32 %), EssilorLuxottica et BNP Paribas (35 % chacune). Ce classement d'exactitude ne publie que seize noms, ceux des sept sociétés les mieux restituées et des neuf moins bien restituées.
Sept taux de croissance pour un seul chiffre d'affaires Même le communiqué semestriel de Capgemini, la société la mieux restituée de l'échantillon, montre combien la croissance se prête à la confusion. Relu le 4 octobre 2026, ce document du 30 juillet annonce dès sa première page un chiffre d'affaires de 12 082 millions d'euros en hausse de 8,8 %, puis une croissance de 11,3 % à taux de change constants sur le semestre et de 11,6 % au deuxième trimestre. Le tableau de rapprochement placé en annexe ajoute la croissance publiée de chaque trimestre, 7,0 % puis 10,5 %, et la croissance à changes constants du premier, 11,0 %.
Les perspectives fixent un objectif annuel de 8,5 % à 9 % à changes constants, dont environ 5 points apportés par les acquisitions. Pour le seul chiffre d'affaires du groupe, le document aligne donc sept taux de croissance, dont deux seulement portent sur le semestre écoulé (8,8 % publiés, 11,3 % à changes constants), et aucun taux de croissance organique pour le groupe. Un assistant interrogé sur la croissance organique de Capgemini ne trouve pas de réponse directe dans le communiqué, et les 11,3 % incluent l'apport des acquisitions WNS et Cloud4C, que le texte mentionne.
L'étude attribue une part des erreurs à la manière dont les émetteurs structurent et publient leur information. Le cas Capgemini montre que cette difficulté existe jusque chez le mieux classé, sans suffire à expliquer seule les écarts entre sociétés. Les entreprises, origine de 78 % des citations Selon le document, 78 % des sources utilisées par les deux assistants renvoient aux sites des entreprises (espaces presse et investisseurs, documents de résultats), 19,5 % à d'autres sources comme les sites de diffusion de communiqués et la SEC, 2,42 % aux sites financiers comme MarketScreener ou Boursorama, et 0,08 % à la presse, limitée à Bloomberg et au Monde.
Les auteurs attribuent cette quasi-absence au blocage des robots d'IA par la « quasi-totalité » des éditeurs de presse. Le même document précise que les citations de sources sont « presque exclusivement » le fait de ChatGPT, Gemini ne citant « presque jamais de liens ». Cette répartition décrit donc surtout le comportement d'un seul des deux assistants.
Sur les messages que les entreprises veulent faire passer, la moyenne est de 67 % de restitution correcte pour les trois indicateurs et les trois messages mis en avant par chacune, de 97 % pour Michelin à 33 % pour EssilorLuxottica. Le scénario du client potentiel fournit une mesure d'une autre nature, sur 1 144 conversations de quatre échanges. La part d'avis favorables y tombe de 5,6 % en première réponse à 0,5 % au quatrième échange, celle d'avis défavorables passe de 7,0 % à 12,6 %.
Une méthode résumée en trois mots-clés La méthode tient dans un encadré de la page 3 : « jumeaux numériques, conversations multi-tours, codage hybride ». Plusieurs paramètres qui conditionnent le résultat n'y figurent pas. Le PDF ne publie ni les questions posées ni le nombre de chiffres vérifiés par société ou par indicateur.
Les versions des modèles ne sont pas précisées, pas plus que l'activation de la recherche web, la tolérance retenue pour juger un chiffre correct (arrondi, périmètre, chiffre retraité) ou la part du codage confiée à des humains. Le document ne ventile pas l'exactitude entre ChatGPT et Gemini. Il ne dit pas non plus quelle valeur du CAC 40 a été laissée de côté, ni pourquoi, et ne publie pas le classement complet des 39 sociétés.
Les deux auteurs ont une activité commerciale liée au sujet. Bubbling se présente dans l'étude comme une plateforme de pilotage de la visibilité des marques dans les IA génératives et propose sur son site un « diagnostic IA préliminaire ». Reputation Age, agence de communication et de réputation, affiche sur sa page d'accueil une offre de conseil consacrée à l'IA.
La page de présentation conclut que les entreprises doivent travailler « la lisibilité pour les IA, par les IA » de leurs communiqués, ce qui rejoint le métier de Bubbling. Rien n'indique un contrôle extérieur du protocole. Notre lecture : les limites du texte non structuré « Quelle est ta marge ? » Dans une conversation professionnelle, la question paraît simple.
Elle laisse pourtant plusieurs choix ouverts : marge brute, nette ou opérationnelle, exprimée en euros ou en pourcentage, sur quelle période ? Entre interlocuteurs habitués à travailler ensemble, le contexte peut suffire à lever ces ambiguïtés. Un autre lecteur peut comprendre autre chose.
Le langage courant repose ainsi sur des implicites qui précèdent l'arrivée des LLM. La polyvalence des grands modèles de langage tient notamment à leur capacité à traiter des demandes formulées librement, avec des raccourcis, des approximations et un vocabulaire variable. Cette tolérance rend le même outil utilisable dans de nombreux métiers, sans exiger une requête formalisée à l'avance. Elle devient une difficulté lorsque l'on attend un chiffre précisément défini : l'assistant peut retenir une interprétation plausible et répondre sans rendre visible le choix qu'il a fait.
La fluidité de la réponse ne permet alors pas de savoir si les deux interlocuteurs parlent du même indicateur. Cette lecture reste distincte du résultat de l'étude. Les questions posées ne sont pas publiées : impossible de déterminer quelle part des erreurs vient de leur formulation, de la présentation des documents ou d'un mauvais traitement par le modèle malgré des indications explicites.
Les données obsolètes ou inventées constituent aussi une catégorie d'erreurs à part. Rendre les définitions explicites réduit la place laissée à l'interprétation ; l'exactitude du chiffre retenu reste à vérifier dans la source. Le texte non structuré peut disperser la définition d'un chiffre entre une phrase, un tableau et une note en annexe. Le cas Capgemini illustre ce travail de rapprochement entre valeur, période et mode de calcul.
Pour fiabiliser un usage financier, notre recommandation est d'associer explicitement chaque donnée à sa définition, son unité, sa période et son périmètre, dans la source comme dans la demande. Un tableau ou un format structuré aide à conserver ces liens, à condition que les champs eux-mêmes soient définis sans ambiguïté. Face à une demande de « marge » non précisée, l'assistant devrait demander laquelle avant de choisir un chiffre.
Le harness, et la limite du shadow AI Une réponse technique existe déjà : entourer le modèle d'un harness adapté au métier. Ce terme désigne l'environnement logiciel qui organise ses entrées, ses appels aux outils et la restitution des résultats, comme le décrit Anthropic. Dans un usage financier, ce cadre peut associer un référentiel d'indicateurs, des sources approuvées, des règles de calcul et des contrôles automatiques.
Sa fiabilité doit être mesurée sur des cas métier, y compris des demandes ambiguës et des données manquantes. Pour reprendre l'exemple de la marge, le dispositif peut exiger que l'utilisateur confirme l'indicateur, la période et le périmètre avant toute restitution. Il peut confier le calcul à un outil déterministe, vérifier les unités et conserver la référence exacte du document utilisé.
Si une information requise manque, une règle logicielle peut bloquer la restitution du chiffre et demander une précision ou une validation humaine. L'efficacité de ce dispositif dépend aussi de la qualité des données et des contrôles retenus. C'est précisément la limite du shadow AI que nous retenons ici : le collaborateur interroge directement ChatGPT ou Claude sans passer par le harness de l'entreprise.
Les définitions métier, les sources validées et les contrôles intégrés à ce dispositif ne sont alors plus appliqués à sa demande. La vérification repose sur l'utilisateur, qui peut reprendre une réponse convaincante dans un reporting sans avoir levé les ambiguïtés. L'accès à un modèle performant ne suffit donc pas à reproduire les conditions d'un usage validé par l'organisation.
Dans l'exemple de la marge, un chiffre exact repris de ChatGPT peut ainsi rejoindre la mauvaise colonne d'un tableau parce que l'utilisateur et l'assistant n'avaient pas retenu la même définition. ST Stephane Nachez Rédaction ActuIA — actualités, données et analyses sur l'intelligence artificielle pour les décideurs.