evidoria

← Voltar à navegação

Boa prática Importada

CoBRA — O Projeto-Piloto de Reconhecimento de Voz com IA da RTI International para Avaliação da Leitura Oral nas Filipinas

Filipinas · San Fernando (Pampanga) · Ver o perfil de Filipinas

Evidência: Quase-experimental Top 73% 40/100 · Pergunte a Evidence Copilot sobre esta prática

O piloto de 2022 da RTI (USAID/DepEd) testou pontuação por voz com IA da fluência de leitura oral em 42 escolas filipinas. A IA subestimou as palavras por minuto em 21,8 (inglês) e 25,1 (filipino) vs. avaliadores humanos, e o DepEd cancelou a expansão.

1,063 Grades 4-6
Alunos testados, inglês (Jun-Jul 2022)
933 Grades 4-6
Alunos testados, filipino (Jun-Jul 2022)
21.8 avg words, vs human regraders
Subestimação pela IA das palavras corretas por minuto, inglês
60%
Texto assinalado/saltado incorretamente, filipino
CoBRA — O Projeto-Piloto de Reconhecimento de Voz com IA da RTI International para Avaliação da Leitura Oral nas Filipinas

Detalhes

Maturidade
Descontinuada
Promotor
RTI International; USAID All Children Reading (ACR)–Philippines; Philippines Department of Education (DepEd)
Período
February–November 2022 (development Feb–Apr; pilot Jun–Jul; final report Nov 2022)
Palavras-chave
primary education, reading assessment, speech recognition, EdTech evaluation

Contexto

O CoBRA (Computer-Based Reading Assessment) foi uma ferramenta-piloto do programa All Children Reading da USAID nas Filipinas, combinando um plugin de gravação de voz, o Speech Recognition Engine da Google para filipino e um algoritmo de pontuação baseado em aprendizagem automática para calcular as palavras corretas por minuto e a precisão de leitura a partir das gravações da leitura oral dos alunos, tendo como referência o padrão Phil-IRI. A RTI International desenvolveu-a entre fevereiro e abril de 2022 e testou-a em regime piloto com o DepEd entre junho e julho de 2022, em 42 escolas.

Objetivos

Testar se a pontuação por reconhecimento de voz baseado em IA poderia substituir a avaliação humana da fluência de leitura oral em inglês e filipino, à escala nacional.

Atividades

O projeto-piloto testou 1063 alunos em inglês e 933 em filipino, do 4.º ao 6.º ano, e formou ou orientou 145 professores e 67 coordenadores de TIC. O relatório final da RTI (apresentado em novembro de 2022) realizou uma análise de validade concorrente, reavaliando de forma independente e manual uma subamostra de 346 avaliações em inglês e 345 em filipino, comparando-as com as pontuações da IA.

Resultados

A IA subestimou as palavras corretas por minuto em, em média, 21,8 em inglês e 25,1 em filipino, relativamente aos reavaliadores humanos, e assinalou incorretamente ou saltou 21% do texto em inglês e 60% do texto em filipino que os alunos realmente leram. A variância das pontuações por ano de escolaridade entre a IA e a avaliação humana variou entre 31-48% em inglês e 37-64% em filipino, agravando-se à medida que os textos se tornavam mais complexos. Mais de 90% dos 81 professores inquiridos consideraram a ferramenta fácil de utilizar e sentiram que a pontuação era 'geralmente exata' -- uma perceção que os dados quantitativos de validade não confirmaram.

Conclusões

O projeto-piloto de segunda fase, de maior dimensão, previsto pelo DepEd foi cancelado, oficialmente atribuído a uma reorganização institucional e a custos de licenciamento insustentáveis; o próprio relatório da RTI concluiu que a pontuação por IA 'não é suficientemente exata nem fiável para ser utilizada como meio independente de medir as competências de fluência de leitura oral dos alunos'. A prática está catalogada como um resultado negativo rigorosamente avaliado e reportado com honestidade.

Implementação

Custo indicativo
Médio (50 mil–500 mil €)
Tempo até resultados
Curto (< 1 ano)
Equipa e competências
RTI International development and evaluation team, 145 trained teachers and 67 ICT coordinators (DepEd)

Condições de sucesso

  • Benchmarking against an established national reading-assessment standard (Phil-IRI)
  • Independent human re-grading of a representative subsample for validity testing

Modos de falha comuns

  • Substantial undercounting and misflagging of text vs human graders
  • Teacher perception of accuracy not supported by the quantitative validity data
  • Second-phase pilot cancelled due to reorganisation and unsustainable licensing costs

Implementa esta prática? Reivindique-a — implementadores verificados obtêm um contacto público na página e podem propor correções.

Fontes de dados

De onde foi obtida a informação desta prática, e quando.

Anexos

Práticas semelhantes que podem ser úteis