Le Grand Débat National de 2019 en France a mobilisé le pipeline de TAL d'un consortium de sept entreprises pour classer et synthétiser près de 2 millions de contributions en ligne et plus de 16 000 registres locaux, provenant de 1,5 million de citoyens, en 19 arbres de connaissances publics en environ deux semaines.
1.93 million contributions
Contributions en ligne analysées (January–April 2019)
16,000+ registers
Registres municipaux numérisés (2019)
~1.5 million citizens
Citoyens représentés dans les registres locaux (2019)
19 knowledge trees
Arbres de connaissances thématiques produits (2019)
Détails
Maturité
Abandonnée
Promoteur
French Government (Grand Débat National) with Roland Berger, Cognito, Bluenove, OpinionWay, Qwam, Res Publica and Missions Publiques
Période
Jan 2019 – Apr 2019
Mots-clés
citizen consultation, natural language processing, deliberative democracy
Contexte
À la suite des manifestations des 'gilets jaunes', le gouvernement français a lancé en 2019 le Grand Débat National, invitant les citoyens de tout le pays à exprimer leurs opinions sur la fiscalité, les services publics, la démocratie et l'environnement. Le gouvernement a mandaté un consortium de sept entreprises, dirigé par Roland Berger, pour traiter les réponses reçues à l'aide du traitement automatique du langage naturel.
Activités
Le consortium a numérisé les registres manuscrits locaux (avec Numen et la Bibliothèque Nationale de France) et a analysé près de 1,93 million de contributions en ligne ainsi que plus de 16 000 registres municipaux représentant environ 1,5 million de citoyens, à l'aide d'un pipeline d'analyse lexicologique contextualisée pour classer le texte en catégories prédéfinies et produire 19 arbres de connaissances thématiques, des équipes de synthèse humaine achevant l'analyse écrite finale en environ deux semaines.
Résultats
L'examen indépendant de l'Institut Montaigne a conclu que le dispositif avait su gérer l'ampleur de l'exercice mais présentait des limites techniques : il peinait avec l'ironie, le langage ambigu et les formulations quasi dupliquées, la participation penchait vers des hommes plus âgés, plus instruits et propriétaires de leur logement, et le système pouvait signaler mais pas distinguer pleinement les campagnes coordonnées de la répétition spontanée de la base.
Mise en œuvre
Coût indicatif
Moyen (50 k€–500 k€)
Délai jusqu’aux résultats
Court (< 1 an)
Personnel et compétences
Seven-firm consortium led by Roland Berger (Cognito, Bluenove, OpinionWay, Qwam, Res Publica, Missions Publiques), Numen and Bibliothèque Nationale de France for register digitization, Human synthesis teams for final written analysis
Conditions de réussite
Rapid multi-firm mobilization within a compressed timeframe
Predefined taxonomy/categories to structure classification
Human synthesis teams to complete final analysis rather than relying on NLP output alone
Modes d’échec courants
NLP pipeline struggled with irony, ambiguous language and near-duplicate phrasing
Could not fully distinguish coordinated campaigns from organic grassroots repetition
Participation skewed toward older, more educated, home-owning men, limiting representativeness
Où cela s’applique
Type de gouvernance
national government consultation
Échelle
national
Niveau de revenu
high-income
Vous portez cette pratique ?
Revendiquez-la —
les porteurs vérifiés obtiennent un contact public sur la page et peuvent proposer des corrections.
Sources de données
D'où proviennent les informations de cette pratique, et quand.