bncc.dev

Novidades

Rodadas do benchmark de alucinação e estudos sobre IA e BNCC.

  1. A terceira rodada do benchmark

    Medimos 19 modelos em 17.100 respostas sobre a BNCC, sem acesso a nenhuma fonte. A fidelidade ao texto oficial vai de 88% a 3%, e a régua de avaliação mudou para separar quem inventa de quem recusa responder.

    Benchmark
  2. Por que a BNCC precisa de um benchmark próprio

    Um modelo pode acertar o código e trocar o texto de uma habilidade. Veja por que avaliamos as respostas sobre a BNCC, como fazemos os testes e o que muda quando a IA pode consultar a fonte.

    Benchmark

Receba cada nota por e-mail

Uma mensagem por lançamento, com o mesmo texto desta página. Nada além disso.