evidoria

← Voltar à navegação

Boa prática Importada

Anytime Testing Machine (ATM) — Avaliação formativa da Pratham e da Anthropic com o Claude em escolas indianas

Índia · Mumbai · Ver o perfil de Índia

A Pratham e a Anthropic testaram o Anytime Testing Machine, com Claude, que corrige respostas manuscritas e dá feedback personalizado, elevando a concordância com avaliadores humanos de ~30% para ~80% em 1.500 estudantes e 5.000+ mulheres do programa Second Chance.

~30 %
Alinhamento da precisão de correção com avaliadores humanos (antes do refinamento) (2026 pilot)
~80 %
Alinhamento da precisão de correção com avaliadores humanos (após o refinamento) (2026 pilot)
~90 %
Alinhamento da geração de perguntas com os parâmetros da Taxonomia de Bloom (2026 pilot)
1500 students
Alunos no projeto-piloto inicial (2026)
Anytime Testing Machine (ATM) — Avaliação formativa da Pratham e da Anthropic com o Claude em escolas indianas

Detalhes

Maturidade
Piloto
Promotor
Pratham Education Foundation, with Anthropic
Período
2026-present
Palavras-chave
education technology, assessment, nonprofit

Contexto

Em fevereiro de 2026, a Anthropic anunciou a sua primeira parceria estratégica com um laboratório de IA e uma organização sem fins lucrativos da área da educação na Índia, a Pratham Education Foundation, para co-desenvolver o Anytime Testing Machine (ATM), um sistema de avaliação formativa integral alimentado pelo Claude para escolas indianas.

Objetivos

O sistema visa corrigir respostas manuscritas dos alunos com base em grelhas de avaliação alinhadas com o currículo e gerar feedback personalizado em hindi e inglês, com os professores a rever e aprovar todo o feedback gerado por IA antes de chegar aos alunos.

Atividades

Os alunos escrevem as respostas à mão, fotografam-nas, e o sistema converte as imagens em texto e avalia as respostas através de uma abordagem de LLM como avaliador ("LLM-as-a-judge"). A ferramenta foi testada com 1.500 alunos em 20 escolas e adaptada para o programa Second Chance da Pratham, que apoia mais de 5.000 mulheres a preparar o exame nacional do 10.º ano da Índia.

Resultados

O refinamento iterativo elevou o alinhamento da precisão de correção do sistema com avaliadores humanos especializados de cerca de 30% para cerca de 80%, e a precisão de geração de perguntas atingiu cerca de 90% de alinhamento com os parâmetros da Taxonomia de Bloom. Trata-se de métricas de qualidade de correção e de geração de perguntas, não de ganhos verificados na aprendizagem dos alunos, e ainda não foi publicada nenhuma avaliação independente de resultados de aprendizagem.

Conclusões

A Anthropic e a Pratham planeiam alargar o ATM a 100 escolas e o programa Second Chance a 15.000 mulheres até ao final de 2026, e estão a conceber um ensaio controlado aleatorizado segundo a metodologia Teaching at the Right Level (TaRL) para medir o impacto na aprendizagem.

Implementação

Custo indicativo
Médio (50 mil–500 mil €) — Funded through Anthropic's strategic partnership with Pratham; no public budget figures, but involves proprietary LLM API usage and iterative development cycles.
Tempo até resultados
Curto (< 1 ano) — Piloted from February 2026; expansion to 100 schools and 15,000 Second Chance learners targeted by end of 2026, with an RCT under the TaRL methodology in the design stage.
Equipa e competências
Pratham Education Foundation, Anthropic (technical/AI partner), Teachers (review and approve all AI-generated feedback before students see it)

Condições de sucesso

  • Human-in-the-loop teacher review of all AI-generated feedback before release to students
  • Iterative refinement cycles that measurably improved grading-accuracy alignment with human graders
  • Existing Pratham Second Chance programme infrastructure to reach women preparing for board exams

Modos de falha comuns

  • Initial grading-accuracy alignment with human graders was only about 30%, showing early LLM-graded assessment can be unreliable without iterative human correction
  • No independent learning-outcome evaluation exists yet; a planned RCT has not been completed

Onde se enquadra

Tipo de governação
nonprofit + private AI-lab partnership
Escala
pilot (20 schools, 1,500 students; Second Chance track scaling toward 15,000 women)
Nível de rendimento
lower-middle-income

Habitualmente financiado por

Philanthropic / foundation funding

Vias de financiamento indicativas para práticas deste tipo — verifique sempre os avisos abertos e as regras de elegibilidade de cada programa.

Implementa esta prática? Reivindique-a — implementadores verificados obtêm um contacto público na página e podem propor correções.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Anexos

Práticas semelhantes que podem ser úteis

★ 33

Deteção de escrita por IA da Turnitin

Estados Unidos da América

Deteção de escrita por IA amplamente implementada — mas falsos positivos documentados, preconceito contra escritores não-nativos de inglês, e acusações …