Chatbots Municipales Puestos a Prueba — una Auditoría Independiente Revela que los Chatbots de IA de los Ayuntamientos Neerlandeses Solo Responden Correctamente a 1 de Cada 10 Preguntas
Una auditoría a 39 chatbots municipales neerlandeses halló que solo el 10% de las preguntas recibió respuesta correcta, con un 64% erróneas y errores idénticos en los ~30 municipios que comparten el chatbot 'Gem'; la VNG admitió que 'aún no son productos terminados'.
39
Chatbots municipales evaluados (2nd edition, Dec 2025-Feb 2026)
8
Preguntas por chatbot
312
Total de intercambios de pregunta-respuesta
64 %
Respuestas incorrectas
23 %
Respuestas que devolvieron únicamente un enlace
10 %
Respuestas correctas
3 %
Sin respuesta producida
0 of 39
Chatbots que respondieron correctamente a la pregunta sobre recogida de residuos
~30
Municipios que comparten el chatbot ‘Gem’
at most 10 of 39
Chatbots que se estima que están realmente impulsados por un LLM
Detalles
Madurez
Consolidada
Promotor
Independent researchers Wiep Hamstra and Jules Ernst; response from VNG (Vereniging van Nederlandse Gemeenten) and the Ministry of the Interior and Kingdom Relations (BZK)
Período
Fieldwork December 2025 - early February 2026; published 9 March 2026 (second annual edition; first edition June 2025)
Palabras clave
chatbots, citizen services, digital accessibility, government oversight, generative AI evaluation
Contexto
Desde junio de 2025, los investigadores independientes Wiep Hamstra y Jules Ernst llevan a cabo una auditoría no financiada de los chatbots municipales implantados por los gobiernos locales neerlandeses, tras indicios iniciales de que estas herramientas etiquetadas como IA podrían no rendir como se anunciaba.
Objetivos
Poner a prueba de forma sistemática y repetible la precisión con la que los chatbots municipales responden a preguntas reales de los ciudadanos, y hacer seguimiento de si el rendimiento mejora con el tiempo.
Actividades
Para la segunda edición (trabajo de campo entre diciembre de 2025 y principios de febrero de 2026, publicada el 9 de marzo de 2026), los investigadores pusieron a prueba 39 chatbots municipales con las mismas ocho preguntas de ciudadanos cada uno —una combinación de consultas de servicios habituales (recogida de enseres, estado de permisos) y preguntas relacionadas con elecciones (sustitución de una tarjeta de votación perdida)—, con un total de 312 intercambios de pregunta-respuesta.
Resultados
Los resultados se mantuvieron en gran medida sin cambios respecto a la primera edición: el 64% de las respuestas fueron incorrectas, el 23% devolvió únicamente un enlace (a menudo a una página sin la respuesta), el 10% fueron correctas y el 3% no produjo ninguna respuesta. Ninguno de los 39 chatbots respondió correctamente, sin ayuda, a una pregunta básica sobre la recogida de residuos domésticos. Los investigadores estiman que, como máximo, 10 de las 39 herramientas están realmente impulsadas por un modelo de lenguaje; la mayoría se basa en pares de pregunta-respuesta programados y mantenidos manualmente. Dado que casi 30 municipios tienen licencia del mismo producto de chatbot ‘Gem’, respuestas erróneas idénticas se propagan simultáneamente por todos ellos.
Conclusiones
VNG, la asociación que representa a los municipios neerlandeses, reconoció públicamente los resultados, señalando que los nuevos chatbots de IA “todavía no son productos acabados” y que la calidad de los datos determina si un bot ofrece una respuesta obsoleta o alucinada; también indicó que los chatbots han reducido el volumen de llamadas a los centros de atención, una afirmación que la auditoría no verificó de forma independiente. Como control recurrente, metodológicamente coherente y realizado de forma independiente sobre una herramienta de IA de cara al público ampliamente implantada, la auditoría constituye un caso poco frecuente de rendición de cuentas rigurosa en materia de IA municipal, aunque lo que evidencia sea sobre todo el fracaso, y no el éxito.
Implementación
Coste indicativo
Bajo (< 50 000 €)
Tiempo hasta resultados
Medio (1–3 años) — First edition published June 2025; second edition fieldwork December 2025-early February 2026, published 9 March 2026.
Personal y competencias
Conducted by two independent researchers, Wiep Hamstra (communications) and Jules Ernst (digital accessibility), on an unfunded basis, VNG (association of Dutch municipalities) and the Ministry of the Interior and Kingdom Relations (BZK) responded publicly but did not run the audit themselves
Condiciones para el éxito
Standardised set of eight citizen questions applied identically across all 39 chatbots, repeated for a second consecutive year for comparability
Findings made public with named methodology, enabling accountability pressure on municipalities and the shared 'Gem' platform vendor
Modos de fallo comunes
64% of the 312 tested answers were wrong, 23% returned only a (often unhelpful) hyperlink, 3% produced no response, and only 10% were correct
Not one of the 39 chatbots correctly answered a basic household waste-collection question unaided
At most 10 of 39 tools are estimated to actually be powered by a language model; most rely on hand-maintained scripted Q&A pairs, so the 'AI chatbot' framing overstates the underlying technology
Because nearly 30 municipalities license the same shared 'Gem' chatbot, identical wrong answers propagate across all of them simultaneously
VNG itself acknowledged the tools are 'still no finished products' and that data-quality gaps drive both outdated and hallucinated answers
Dónde encaja
Tipo de gobernanza
independent civil-society audit of municipal government tools
Escala
national - 39 municipalities, ~30 sharing one shared chatbot product
Nivel de ingresos
high-income
Kit de replicación
Artefactos reutilizables de esta práctica — tal como los publican sus fuentes.
¿Usted implementa esta práctica?
Reivindíquela —
los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.
Fuentes de datos
De dónde se obtuvo la información de esta práctica, y cuándo.