Novidades
Rodadas do benchmark de alucinação e estudos sobre IA e BNCC.
-
A terceira rodada do benchmark
Medimos 19 modelos em 17.100 respostas sobre a BNCC, sem acesso a nenhuma fonte. A fidelidade ao texto oficial vai de 88% a 3%, e a régua de avaliação mudou para separar quem inventa de quem recusa responder.
-
Por que a BNCC precisa de um benchmark próprio
Um modelo pode acertar o código e trocar o texto de uma habilidade. Veja por que avaliamos as respostas sobre a BNCC, como fazemos os testes e o que muda quando a IA pode consultar a fonte.
Receba cada nota por e-mail
Uma mensagem por lançamento, com o mesmo texto desta página. Nada além disso.