Com o uso do MCP, a alucinação com a BNCC some das IAs
Fizemos as mesmas 300 perguntas sobre a BNCC para os modelos de IA, primeiro de memória e depois consultando a fonte oficial pelo MCP. De memória, as IAs inventam. Consultando, param de inventar.
É um conector. Em vez de responder de memória, a IA consulta as aprendizagens verificadas da bncc.dev antes de responder, como um professor que abre o documento em vez de citar de cabeça. Como funciona →
Alucinação é qualquer código ou texto da BNCC que não confere com o documento oficial. As contagens completas estão na tabela detalhada.
No teste, a IA consultou a BNCC em todas as 1.800 perguntas quando o MCP estava ligado. Nenhuma resposta saiu só da memória. Nas listas pedidas, as IAs citaram 1.375 códigos, como EF67LP08, e todos existem no documento oficial.
A queda, modelo a modelo
Cada modelo respondeu às mesmas perguntas nas duas situações. A alucinação caiu em todos. Usar o MCP não piorou nenhuma resposta.
de memória · consultando o MCP
As barras estão na mesma escala. A largura inteira equivale a 50%. Os dois modelos da Maritaca foram medidos no mesmo estudo; os números deles estão no relatório completo.
Números completos, com os intervalos de confiança
| Modelo | Sem o MCP | Controle (na pergunta) | Com o MCP | Δ MCP, pontos |
|---|---|---|---|---|
| Gemini 3.7 Flashvia OpenRouter | 13,1% | 0,0% | 0,0% | -13,1IC95 [-17,6; -9,3] · 237 pares |
| GPT-5.6 SolAPI direta, sem raciocínio nesta rota | 21,4% | 0,3% | 0,0% | -21,4IC95 [-26,3; -17,0] · 238 pares |
| Grok 4.6API direta | 27,2% | 0,0% | 0,0% | -27,2IC95 [-33,6; -21,8] · 238 pares |
| Claude Sonnet 4.6Amazon Bedrock | 31,1% | 0,0% | 0,0% | -30,0IC95 [-36,8; -24,1] · 232 pares |
| DeepSeek V4 FlashAPI direta | 37,4% | 0,0% | 0,0% | -37,4IC95 [-45,1; -30,9] · 238 pares |
| Kimi K3API direta | 39,8% | 0,0% | 0,0% | -39,8IC95 [-48,2; -32,8] · 238 pares |
Δ é a queda em pontos percentuais entre a condição sem o MCP e a condição com o MCP, comparando as mesmas perguntas. O intervalo (IC 95%) vem de reamostragem por item, com semente registrada. Perguntas sobre códigos reais da tarefa de existência e itens especiais não contam como alucinação, então ficam fora dessa conta. Respostas com falha técnica também ficam de fora.
A conexão feita pela própria empresa de IA também zerou a alucinação
Algumas empresas de IA têm um recurso próprio para ligar seus modelos a servidores como o nosso. Nesse caminho, a própria plataforma da empresa consulta o mcp.bncc.dev, sem nenhum programa nosso no meio. É o que acontece quando você cola o endereço no seu assistente. Repetimos o teste por esse caminho e o resultado foi o mesmo. Nenhuma invenção em 1.227 respostas, nas três empresas que completaram a medição.
Detalhes por empresa
| Empresa | Modelo testado | Alucinação | Ignorou a fonte |
|---|---|---|---|
| OpenAI | GPT-5.6 SolResponses API, com raciocínio | 0,0% | 0 de 300 |
| xAI | Grok 4.6Responses API | 0,0% | 0 de 300 |
| Anthropic | Claude Sonnet 5Messages API, connector MCP | 0,0% | 0 de 300 |
| A medição do Google (Gemini 3.7 Flash) ficou incompleta, com 91 de 300 respostas, por instabilidade do serviço nos dias do estudo. Entra numa atualização desta série. | |||
Como medimos
- A fonte consultada e o gabarito que julga as respostas são o mesmo dataset, mantido por nós. Por isso o estudo tem uma condição de controle, com a listagem oficial colada na própria pergunta, sem servidor no meio. Nela, a alucinação também foi de 0,0%. O mérito é do dado; o MCP é a forma de entregá-lo.
- As mesmas 300 perguntas do leaderboard, nas quatro tarefas. Os 60 códigos falsos foram verificados um a um.
- 8 modelos, escolhidos por critério fixado antes da medição. As regras, as hipóteses e a análise foram registradas por escrito antes da primeira chamada, e cada resposta está publicada, julgamento por julgamento, no GitHub.
- Cada condição usa as mesmas perguntas, com a mesma redação. O julgamento é o mesmo do leaderboard.
Ressalvas por modelo
- GPT-5.6 Sol foi medido sem raciocínio na rota direta, porque a API exige desligá-lo para usar ferramentas em Chat Completions. A condição connector mede o modelo com raciocínio.
- Gemini 3.7 Flash foi medido via OpenRouter, pela indisponibilidade da rota direta do Google nos dias do estudo.
- Kimi K3 só aceita temperatura 1 na API; o protocolo pede 0.
- Claude Sonnet 4.6 reaproveita a condição sem o MCP da rodada oficial de 15 a 18/ago, na mesma rota e configuração.
- Sabiá-4 e Sabiazinho-4 foram medidos no estudo. Os resultados deles estão no relatório da Release, fora desta página.
- Qwen (Alibaba) ficou fora do estudo, sem rota de API disponível na data.
Sua IA pode responder assim hoje
O conector que zerou a alucinação no estudo é o mesmo que qualquer assistente pode usar. Basta colar uma URL no Claude, no ChatGPT ou no seu editor.
Conferir e reproduzir · Release estudo-fonte-v0.1.0 ↗ · pré-registro ↗ · DECISOES.md D14 ↗ · respostas brutas, julgamentos e resumo estatístico no repositório.