evidoria

← Volver al listado

Buena práctica Importada

Anytime Testing Machine (ATM) — La evaluación formativa de Pratham y Anthropic impulsada por Claude en escuelas indias

India · Mumbai · Ver el perfil de India

Pratham y Anthropic pilotaron el Anytime Testing Machine (Claude), que corrige respuestas manuscritas y da retroalimentación personalizada, elevando la concordancia con evaluadores humanos de ~30% a ~80% en 1.500 estudiantes y 5.000+ mujeres del programa Second Chance.

~30 %
Concordancia de precisión de corrección con evaluadores humanos (antes del refinamiento) (2026 pilot)
~80 %
Concordancia de precisión de corrección con evaluadores humanos (después del refinamiento) (2026 pilot)
~90 %
Concordancia de la generación de preguntas con los parámetros de la Taxonomía de Bloom (2026 pilot)
1500 students
Alumnos en el proyecto piloto inicial (2026)
Anytime Testing Machine (ATM) — La evaluación formativa de Pratham y Anthropic impulsada por Claude en escuelas indias

Detalles

Madurez
Piloto
Promotor
Pratham Education Foundation, with Anthropic
Período
2026-present
Palabras clave
education technology, assessment, nonprofit

Contexto

En febrero de 2026, Anthropic anunció su primera alianza estratégica entre un laboratorio de IA y una organización educativa sin fines de lucro de la India, la Pratham Education Foundation, para co-desarrollar el Anytime Testing Machine (ATM), un sistema integral de evaluación formativa impulsado por Claude para escuelas indias.

Objetivos

El sistema busca corregir respuestas manuscritas de los alumnos conforme a rúbricas alineadas con el currículo y generar retroalimentación personalizada en hindi e inglés, con los docentes revisando y aprobando toda la retroalimentación generada por IA antes de que llegue a los alumnos.

Actividades

Los alumnos escriben sus respuestas a mano, las fotografían, y el sistema convierte las imágenes en texto y evalúa las respuestas mediante un enfoque de LLM como evaluador («LLM-as-a-judge»). La herramienta se puso a prueba con 1.500 alumnos en 20 escuelas y se adaptó al programa Second Chance de Pratham, que apoya a más de 5.000 mujeres que se preparan para el examen nacional de décimo grado en la India.

Resultados

El refinamiento iterativo elevó la concordancia de precisión de corrección del sistema con evaluadores humanos expertos de aproximadamente el 30% al 80%, y la precisión en la generación de preguntas alcanzó cerca del 90% de concordancia con los parámetros de la Taxonomía de Bloom. Se trata de métricas de calidad de corrección y de generación de preguntas, no de mejoras verificadas en el aprendizaje del alumnado, y aún no se ha publicado ninguna evaluación independiente de resultados de aprendizaje.

Conclusiones

Anthropic y Pratham planean ampliar el ATM a 100 escuelas y el programa Second Chance a 15.000 mujeres para finales de 2026, y están diseñando un ensayo controlado aleatorizado bajo la metodología Teaching at the Right Level (TaRL) para medir el impacto en el aprendizaje.

Implementación

Coste indicativo
Medio (50 000–500 000 €) — Funded through Anthropic's strategic partnership with Pratham; no public budget figures, but involves proprietary LLM API usage and iterative development cycles.
Tiempo hasta resultados
Corto (< 1 año) — Piloted from February 2026; expansion to 100 schools and 15,000 Second Chance learners targeted by end of 2026, with an RCT under the TaRL methodology in the design stage.
Personal y competencias
Pratham Education Foundation, Anthropic (technical/AI partner), Teachers (review and approve all AI-generated feedback before students see it)

Condiciones para el éxito

  • Human-in-the-loop teacher review of all AI-generated feedback before release to students
  • Iterative refinement cycles that measurably improved grading-accuracy alignment with human graders
  • Existing Pratham Second Chance programme infrastructure to reach women preparing for board exams

Modos de fallo comunes

  • Initial grading-accuracy alignment with human graders was only about 30%, showing early LLM-graded assessment can be unreliable without iterative human correction
  • No independent learning-outcome evaluation exists yet; a planned RCT has not been completed

Dónde encaja

Tipo de gobernanza
nonprofit + private AI-lab partnership
Escala
pilot (20 schools, 1,500 students; Second Chance track scaling toward 15,000 women)
Nivel de ingresos
lower-middle-income

Habitualmente financiado por

Philanthropic / foundation funding

Vías de financiación indicativas para prácticas de este tipo: compruebe siempre las convocatorias vigentes y las reglas de elegibilidad de cada programa.

¿Usted implementa esta práctica? Reivindíquela — los implementadores verificados obtienen un contacto público en la página y pueden proponer correcciones.

Fuentes de datos

De dónde se obtuvo la información de esta práctica, y cuándo.

Adjuntos

Prácticas similares que pueden serle útiles

★ 33

Detección de escritura por IA de Turnitin

Estados Unidos

Detección de escritura por IA ampliamente implementada — pero falsos positivos documentados, sesgos contra escritores no nativos de inglés, y …