evidoria

← Retour à la liste

Bonne pratique Importée

Chatbots Municipaux Testés — un Audit Indépendant Révèle que les Chatbots IA des Communes Néerlandaises ne Répondent Correctement qu'à 1 Question sur 10

Pays-Bas · The Hague · Voir le profil de Pays-Bas · Voir le profil de The Hague

Preuves: Observationnel / avant-après Top 88% 33/100 · Demandez à Evidence Copilot à propos de cette pratique

Un audit indépendant sur 39 chatbots municipaux néerlandais a révélé que seulement 10 % des questions obtenaient une réponse correcte, avec 64 % d'erreurs répétées dans les ~30 communes partageant le chatbot « Gem » ; la VNG a reconnu que ces outils « ne sont pas encore finis ».

39
Chatbots municipaux testés (2nd edition, Dec 2025-Feb 2026)
8
Questions par chatbot
312
Total des échanges question-réponse
64 %
Réponses erronées
23 %
Réponses ne renvoyant qu'un lien hypertexte
10 %
Réponses correctes
3 %
Aucune réponse produite
0 of 39
Chatbots ayant correctement répondu à la question sur la collecte des déchets
~30
Communes partageant le chatbot « Gem »
at most 10 of 39
Chatbots estimés réellement fondés sur un LLM
Chatbots Municipaux Testés — un Audit Indépendant Révèle que les Chatbots IA des Communes Néerlandaises ne Répondent Correctement qu'à 1 Question sur 10

Détails

Maturité
Établie
Promoteur
Independent researchers Wiep Hamstra and Jules Ernst; response from VNG (Vereniging van Nederlandse Gemeenten) and the Ministry of the Interior and Kingdom Relations (BZK)
Période
Fieldwork December 2025 - early February 2026; published 9 March 2026 (second annual edition; first edition June 2025)
Mots-clés
chatbots, citizen services, digital accessibility, government oversight, generative AI evaluation

Contexte

Depuis juin 2025, les chercheurs indépendants Wiep Hamstra et Jules Ernst mènent un audit non financé des chatbots municipaux déployés par les collectivités locales néerlandaises, à la suite d'indices précoces laissant penser que ces outils présentés comme relevant de l'IA pourraient ne pas être aussi performants qu'annoncé.

Objectifs

Tester de façon systématique et reproductible la précision avec laquelle les chatbots municipaux répondent à de véritables questions de citoyens, et suivre l'évolution de leurs performances dans le temps.

Activités

Pour la deuxième édition (travail de terrain de décembre 2025 à début février 2026, publiée le 9 mars 2026), les chercheurs ont testé 39 chatbots municipaux avec les huit mêmes questions de citoyens chacun — un mélange de demandes de services courants (collecte des encombrants, statut d'un permis) et de questions liées aux élections (remplacement d'une carte électorale perdue) —, soit 312 échanges question-réponse au total.

Résultats

Les résultats sont restés globalement inchangés par rapport à la première édition : 64 % des réponses étaient erronées, 23 % ne renvoyaient qu'un lien hypertexte (souvent vers une page ne contenant pas la réponse), 10 % étaient correctes et 3 % n'ont produit aucune réponse. Aucun des 39 chatbots n'a répondu correctement, sans aide, à une question de base sur la collecte des déchets ménagers. Les chercheurs estiment qu'au maximum 10 des 39 outils sont réellement fondés sur un modèle de langage ; la plupart reposent sur des paires question-réponse scriptées et maintenues manuellement. Comme près de 30 communes utilisent sous licence le même produit de chatbot « Gem », des réponses erronées identiques se propagent simultanément dans toutes ces communes.

Conclusions

VNG, l'association représentant les communes néerlandaises, a publiquement reconnu ces résultats, indiquant que les nouveaux chatbots d'IA « ne sont toujours pas des produits finis » et que la qualité des données détermine si un bot donne une réponse obsolète ou hallucinée ; elle a également relevé que les chatbots avaient réduit le volume d'appels aux centres d'appels, une affirmation que l'audit n'a pas testée de manière indépendante. En tant que contrôle récurrent, méthodologiquement cohérent et mené de façon indépendante sur un outil d'IA public largement déployé, cet audit constitue un cas rare de reddition de comptes rigoureuse pour l'IA municipale — même si ce qu'il met en évidence relève surtout de l'échec que de la réussite.

Mise en œuvre

Coût indicatif
Faible (< 50 k€)
Délai jusqu’aux résultats
Moyen (1–3 ans) — First edition published June 2025; second edition fieldwork December 2025-early February 2026, published 9 March 2026.
Personnel et compétences
Conducted by two independent researchers, Wiep Hamstra (communications) and Jules Ernst (digital accessibility), on an unfunded basis, VNG (association of Dutch municipalities) and the Ministry of the Interior and Kingdom Relations (BZK) responded publicly but did not run the audit themselves

Conditions de réussite

  • Standardised set of eight citizen questions applied identically across all 39 chatbots, repeated for a second consecutive year for comparability
  • Findings made public with named methodology, enabling accountability pressure on municipalities and the shared 'Gem' platform vendor

Modes d’échec courants

  • 64% of the 312 tested answers were wrong, 23% returned only a (often unhelpful) hyperlink, 3% produced no response, and only 10% were correct
  • Not one of the 39 chatbots correctly answered a basic household waste-collection question unaided
  • At most 10 of 39 tools are estimated to actually be powered by a language model; most rely on hand-maintained scripted Q&A pairs, so the 'AI chatbot' framing overstates the underlying technology
  • Because nearly 30 municipalities license the same shared 'Gem' chatbot, identical wrong answers propagate across all of them simultaneously
  • VNG itself acknowledged the tools are 'still no finished products' and that data-quality gaps drive both outdated and hallucinated answers

Où cela s’applique

Type de gouvernance
independent civil-society audit of municipal government tools
Échelle
national - 39 municipalities, ~30 sharing one shared chatbot product
Niveau de revenu
high-income

Kit de réplication

Artefacts réutilisables de cette pratique — tels que publiés par leurs sources.

Vous portez cette pratique ? Revendiquez-la — les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.

Sources de données

D'où proviennent les informations de cette pratique, et quand.

Pièces jointes

Pratiques similaires qui pourraient vous être utiles