- Sur le classement Vectara (mis à jour le 22 septembre 2026), le taux d'hallucination en résumé de document va de 1,8 % à 24,2 % ; les grands modèles grand public se situent autour de 10 à 15 %.
- Plus gros ne veut pas dire plus fidèle : sur ce test, GPT-5.4 nano (3,1 %) fait mieux que GPT-5 high (15,1 %), et Claude Haiku 4.5 (9,8 %) mieux que Claude Opus 4.7 (12,0 %).
- Même les outils juridiques spécialisés se trompaient dans 17 à 33 % des requêtes testées par Stanford (2024).
- Les tribunaux ont recensé plus de 1 600 affaires dans le monde impliquant des contenus inventés par l'IA (juin 2026), dont plusieurs en France depuis décembre 2025.
- Pour 200 documents par mois, une relecture proportionnée au risque coûte 260 €, contre 667 € pour une relecture intégrale, et vérifie mieux les documents engageants.
Qu'est-ce qu'une hallucination de l'IA, concrètement ?
Une hallucination est une réponse d'IA générative fausse ou non étayée, présentée avec la même assurance qu'une réponse juste. Le modèle ne « ment » pas : il prédit la suite de mots la plus probable, sans base de faits qu'il consulterait. Quand l'information manque, il comble le vide avec quelque chose de vraisemblable.
En entreprise, les hallucinations prennent presque toujours l'une de ces quatre formes :
- Chiffres : un pourcentage, un prix ou un montant qui n'existe dans aucune source.
- Citations : une étude, un article de loi, une décision de justice ou une page web inventés ou mal attribués.
- Calendrier : une date d'entrée en vigueur, une échéance ou une version de produit erronée.
- Coordonnées et noms : un interlocuteur, une adresse, une raison sociale, un numéro de contrat inexacts.
Retenez ces quatre « C » : ils servent plus bas de grille de relecture. Le reste du texte (structure, reformulation, ton) est rarement le problème ; ce sont les éléments vérifiables qui posent le risque.
Il faut aussi distinguer deux situations. Quand l'IA travaille sur un document que vous lui donnez (résumé, extraction, réponse à partir d'une base interne), l'erreur consiste à affirmer ce que le document ne dit pas. Quand elle répond de mémoire, sans source, le risque est bien plus élevé : c'est là que naissent les références fantômes.
Quel modèle hallucine le moins en 2026 ?
La mesure publique la plus suivie est le classement Vectara. Le protocole : chaque modèle résume plus de 7 700 articles en n'utilisant que leur contenu, puis un modèle d'évaluation (HHEM-2.3) vérifie que chaque résumé est fidèle à sa source. Le taux d'hallucination est la part des résumés qui affirment quelque chose d'absent du document.
| Modèle (classement Vectara, 22/09/2026) | Taux d'hallucination en résumé | Lecture iaCockpit |
|---|---|---|
| Ant Group finix_s1_32b | 1,8 % | Meilleur score, modèle peu diffusé en Europe |
| OpenAI GPT-5.4 nano | 3,1 % | Petit modèle, très fidèle pour résumer |
| Google Gemini 2.5 Flash-Lite | 3,3 % | Idem, coût d'usage faible |
| Mistral Large (2411) | 4,5 % | Meilleur score Mistral, mais version ancienne |
| Anthropic Claude Haiku 4.5 | 9,8 % | Meilleur score de la famille Claude |
| Google Gemini 3.1 Pro (préversion) | 10,4 % | Dans la moyenne des grands modèles |
| Anthropic Claude Opus 4.7 | 12,0 % | Modèle haut de gamme, moins fidèle sur ce test |
| OpenAI GPT-5 high (août 2025) | 15,1 % | Le raisonnement poussé n'aide pas ici |
| Mistral Medium (2508) | 22,7 % | À éviter pour les résumés sans relecture |
Deux enseignements, que l'on ne lit presque jamais dans les comparatifs :
- Le modèle le plus puissant n'est pas le plus fidèle. Les grands modèles ont tendance à enrichir, interpréter, compléter : c'est une qualité pour rédiger, un défaut pour résumer. Pour un compte rendu ou une synthèse de contrat, un petit modèle bien cadré peut être à la fois moins cher et plus sûr.
- Une même marque varie du simple au quintuple. Chez Mistral, le score va de 4,5 % à 24,2 % selon la version. Choisir « un éditeur » ne suffit pas : c'est le modèle précis, et sa version, qui compte.
Limite à garder en tête : ce classement ne mesure qu'une tâche, la fidélité d'un résumé à un texte fourni. Il ne dit rien de la qualité du raisonnement, ni du taux d'invention quand l'IA répond sans document. Testez toujours le modèle sur vos propres documents avant de généraliser un usage.
Combien d'erreurs attendre sur un mois de travail ?
Traduisons ces pourcentages en volume, car c'est ce qui parle à un dirigeant. Prenons une PME qui fait produire ou résumer 200 documents par mois par l'IA (comptes rendus, synthèses, réponses clients, notes internes). Si chaque document a la même probabilité d'erreur que dans le test Vectara :
| Taux d'hallucination du modèle | Documents avec au moins une erreur, par mois | Par an |
|---|---|---|
| 3 % (petit modèle bien choisi) | 6 | 72 |
| 10 % (grand modèle courant) | 20 | 240 |
| 15 % (modèle peu fidèle en résumé) | 30 | 360 |
C'est un ordre de grandeur, pas une prévision : vos documents ne ressemblent pas aux articles du test, et une bonne consigne fait baisser le taux. Mais le message est clair : à ces volumes, une erreur par jour ouvré est un scénario réaliste si personne ne vérifie. La question n'est donc pas « l'IA se trompe-t-elle ? » mais « lesquelles de ces erreurs arrivent chez un client, un juge ou un banquier ? ».
Les outils spécialisés ne font pas disparaître le problème. Une étude de Stanford publiée en mai 2024 a testé plus de 200 questions juridiques sur des outils de recherche professionnels : Lexis+ AI s'est trompé dans plus de 17 % des cas et l'outil de Westlaw dans plus de 34 %, soit mieux que GPT-4 seul, mais loin de zéro.
Quelles erreurs coûtent vraiment cher à une entreprise ?
Une erreur dans une note interne se corrige en deux minutes. Une erreur publiée ou signée engage l'entreprise. Trois affaires suffisent à fixer les idées :
- Air Canada (février 2024) : le chatbot de la compagnie a inventé une règle de remboursement pour un deuil. Le tribunal civil de Colombie-Britannique a condamné la compagnie à verser 812,02 dollars canadiens au client, en refusant l'idée que le chatbot serait responsable de ses propres propos. Le montant est faible ; le principe, lui, vaut pour toute entreprise : ce que dit votre IA, c'est vous qui le dites.
- Deloitte Australie (octobre 2025) : un rapport de 237 pages facturé environ 440 000 dollars australiens au ministère de l'Emploi contenait des références académiques inexistantes et une citation de jugement inexacte. Le cabinet a accepté de rembourser la dernière tranche du contrat. Coût réel : la marge, et surtout la réputation.
- Tribunaux français (décembre 2025) : le tribunal judiciaire de Périgueux (18 décembre), le tribunal administratif de Grenoble (3 décembre) et celui d'Orléans (29 décembre) ont relevé des jurisprudences introuvables dans des écritures, rapporte Le Monde Informatique. Les juges ont invité les parties à vérifier leurs références. À l'échelle mondiale, la base de Damien Charlotin comptait déjà plus de 1 600 décisions de ce type en juin 2026.
« Dans les PME que nous accompagnons, l'hallucination qui coûte n'est presque jamais spectaculaire : c'est un délai de préavis faux dans un e-mail client, ou un chiffre de marché inventé dans une proposition commerciale. Le point commun est toujours le même : un document engageant, envoyé sans relecture des éléments vérifiables. » — Équipe iaCockpit
Pour les assistants qui parlent directement aux clients, chatbot ou standard téléphonique, le risque est plus élevé car il n'y a pas de relecture avant diffusion. C'est pourquoi un agent vocal IA sérieux s'appuie sur une base de réponses validées et transfère à un humain dès que la question sort de son périmètre, plutôt que d'improviser. Notre comparatif des outils IA de relation client détaille ce critère.
Tous les outils IA ne se valent pas sur la fiabilité
Comparez assistants, outils de synthèse et chatbots selon vos cas d'usage avant de les confier à vos équipes.
Comparer tous les outils IA sur iaCockpitComment réduire les hallucinations, technique par technique ?
Aucune technique ne suffit seule ; leur combinaison fait baisser le taux d'erreur et, surtout, rend les erreurs restantes faciles à repérer.
| Technique | Ce qu'elle change | Effort pour une PME |
|---|---|---|
| Fournir le document source | L'IA résume ou répond à partir d'un texte, au lieu de sa mémoire | Nul : joindre le fichier |
| Exiger des citations précises | Chaque affirmation pointe vers un passage vérifiable | Faible : une ligne dans la consigne |
| Autoriser « non trouvé » | L'IA cesse de combler les trous par des inventions | Faible : une ligne dans la consigne |
| Connecter une base interne (RAG) | Réponses ancrées dans vos procédures, tarifs, contrats | Moyen : outil ou intégrateur |
| Choisir le modèle selon la tâche | Petit modèle fidèle pour résumer, grand modèle pour rédiger | Faible si l'outil propose le choix |
| Activer la recherche web pour l'actualité | Évite les informations périmées (prix, lois, versions) | Nul : option de l'assistant |
| Relecture humaine proportionnée | Intercepte les erreurs restantes là où elles coûtent | Variable : voir le calcul ci-dessous |
Une consigne type, à coller en fin de prompt pour toute tâche factuelle :
« Appuie-toi uniquement sur les documents fournis. Pour chaque chiffre, date, nom ou référence, indique entre crochets le passage source. Si l'information n'y figure pas, écris NON TROUVÉ au lieu de la déduire. »
Pour ancrer l'IA dans vos propres documents à l'échelle de l'entreprise, notre guide du RAG en entreprise explique les options et leur coût. Et pour les comptes rendus, le cas d'usage le plus répandu, comparez les outils IA de compte rendu de réunion sur leur capacité à renvoyer au passage exact de l'enregistrement.
Le piège des agents : quand l'IA agit seule (envoyer un e-mail, modifier un fichier, interroger un logiciel), une hallucination devient une action. Les garde-fous recommandés par l'ANSSI pour les agents connectés aux outils de l'entreprise sont détaillés dans notre article sur les agents IA et l'injection de prompt.
Combien coûte la vérification humaine ?
C'est l'angle que les guides oublient : la relecture a un coût, souvent supérieur à celui des licences. Reprenons notre PME de 200 documents assistés par mois, avec un coût horaire complet de 40 €.
| Stratégie de vérification | Temps par mois | Coût mensuel | Ce qu'elle protège |
|---|---|---|---|
| Aucune relecture | 0 h | 0 € | Rien : environ 20 documents fautifs par mois à 10 % |
| Relecture intégrale, 5 min par document | 16,7 h | 667 € | Tout, mais superficiellement |
| Vérification des 4 C seulement, 2 min par document | 6,7 h | 267 € | Les éléments vérifiables, uniformément |
| Vérification proportionnée au risque | 6,5 h | 260 € | Les documents engageants, en profondeur |
Le détail de la dernière ligne : 140 brouillons internes à 1 minute (lecture rapide), 50 documents courants à 2 minutes (contrôle des 4 C), 10 documents engageants à 15 minutes (chaque chiffre et chaque référence vérifiés à la source). Total : 140 + 100 + 150 = 390 minutes, soit 6,5 heures.
Elle coûte moins que la relecture intégrale et consacre trois fois plus de temps aux dix documents qui peuvent réellement coûter cher (15 minutes contre 5). Et le bilan reste très positif : si l'IA fait gagner 15 minutes par document, les 200 documents libèrent 50 heures, soit 2 000 € de temps. Après 260 € de vérification et, par exemple, 10 licences Copilot Business à 18,20 € HT (182 €), le gain net reste d'environ 1 558 € par mois.
Moralité : la vérification n'est pas une taxe qui annule le bénéfice de l'IA, c'est une ligne budgétaire à prévoir dès le départ, comme nous le faisons dans notre estimation du budget réel d'un stack IA de PME.
Quelle règle de relecture adopter dès lundi ?
- Classer les usages en trois niveaux. Interne et jetable (brouillon, idées) ; courant (e-mail client standard, compte rendu) ; engageant (devis, contrat, document juridique ou financier, publication, réponse à un litige).
- Fixer une règle par niveau. Lecture rapide ; contrôle des 4 C ; vérification source par source et validation par un responsable nommé.
- Imposer la consigne « sources ou NON TROUVÉ » dans les prompts partagés de l'équipe.
- Tenir un registre des erreurs pendant un mois : quel outil, quelle tâche, quel type de « C ». Vous saurez où durcir et où alléger.
- Former les équipes à reconnaître les signaux d'une hallucination (précision suspecte, référence introuvable, chiffre rond sans source).
Ce dernier point n'est pas qu'une bonne pratique : l'AI Act demande aux entreprises qui utilisent l'IA de veiller à un niveau suffisant de maîtrise par leur personnel, ce que nous détaillons dans notre article sur la formation IA obligatoire en entreprise. Une formation pratique, comme celles de Maîtrise l'IA, couvre précisément l'écriture de consignes sourcées et la vérification. Enfin, une règle de relecture ne sert à rien si les salariés passent par leurs comptes personnels : notre méthode pour détecter et encadrer le shadow AI complète ce dispositif.