bncc.dev
  1. bncc.dev
  2. benchmark
  3. estudo MCP
Estudo próprio · agosto de 2026 Não entra no ranking

Com o uso do MCP, a alucinação com a BNCC some das IAs

Fizemos as mesmas 300 perguntas sobre a BNCC para os modelos de IA, primeiro de memória e depois consultando a fonte oficial pelo MCP. De memória, as IAs inventam. Consultando, param de inventar.

O que é o MCP?

É um conector. Em vez de responder de memória, a IA consulta as aprendizagens verificadas da bncc.dev antes de responder, como um professor que abre o documento em vez de citar de cabeça. Como funciona →

sem o MCP
28,3%
mais de 1 em cada 4 respostas inventava algo da BNCC
com o MCP
0,0%
nenhuma invenção, em 2.557 respostas

Alucinação é qualquer código ou texto da BNCC que não confere com o documento oficial. As contagens completas estão na tabela detalhada.

No teste, a IA consultou a BNCC em todas as 1.800 perguntas quando o MCP estava ligado. Nenhuma resposta saiu só da memória. Nas listas pedidas, as IAs citaram 1.375 códigos, como EF67LP08, e todos existem no documento oficial.

A queda, modelo a modelo

Cada modelo respondeu às mesmas perguntas nas duas situações. A alucinação caiu em todos. Usar o MCP não piorou nenhuma resposta.

de memória  ·  consultando o MCP

Gemini 3.7 FlashGoogle · via OpenRouter
sem o MCP
13,1%
com o MCP
0,0%
GPT-5.6 SolOpenAI
sem o MCP
21,4%
com o MCP
0,0%
Grok 4.6xAI
sem o MCP
27,2%
com o MCP
0,0%
Claude Sonnet 4.6Anthropic · Amazon Bedrock
sem o MCP
31,1%
com o MCP
0,0%
DeepSeek V4 FlashDeepSeek
sem o MCP
37,4%
com o MCP
0,0%
Kimi K3Moonshot
sem o MCP
39,8%
com o MCP
0,0%

As barras estão na mesma escala. A largura inteira equivale a 50%. Os dois modelos da Maritaca foram medidos no mesmo estudo; os números deles estão no relatório completo.

Números completos, com os intervalos de confiança
ModeloSem o MCPControle (na pergunta)Com o MCPΔ MCP, pontos
Gemini 3.7 Flashvia OpenRouter 13,1% 0,0% 0,0% -13,1IC95 [-17,6; -9,3] · 237 pares
GPT-5.6 SolAPI direta, sem raciocínio nesta rota 21,4% 0,3% 0,0% -21,4IC95 [-26,3; -17,0] · 238 pares
Grok 4.6API direta 27,2% 0,0% 0,0% -27,2IC95 [-33,6; -21,8] · 238 pares
Claude Sonnet 4.6Amazon Bedrock 31,1% 0,0% 0,0% -30,0IC95 [-36,8; -24,1] · 232 pares
DeepSeek V4 FlashAPI direta 37,4% 0,0% 0,0% -37,4IC95 [-45,1; -30,9] · 238 pares
Kimi K3API direta 39,8% 0,0% 0,0% -39,8IC95 [-48,2; -32,8] · 238 pares

Δ é a queda em pontos percentuais entre a condição sem o MCP e a condição com o MCP, comparando as mesmas perguntas. O intervalo (IC 95%) vem de reamostragem por item, com semente registrada. Perguntas sobre códigos reais da tarefa de existência e itens especiais não contam como alucinação, então ficam fora dessa conta. Respostas com falha técnica também ficam de fora.

A conexão feita pela própria empresa de IA também zerou a alucinação

Algumas empresas de IA têm um recurso próprio para ligar seus modelos a servidores como o nosso. Nesse caminho, a própria plataforma da empresa consulta o mcp.bncc.dev, sem nenhum programa nosso no meio. É o que acontece quando você cola o endereço no seu assistente. Repetimos o teste por esse caminho e o resultado foi o mesmo. Nenhuma invenção em 1.227 respostas, nas três empresas que completaram a medição.

Detalhes por empresa
EmpresaModelo testadoAlucinaçãoIgnorou a fonte
OpenAIGPT-5.6 SolResponses API, com raciocínio0,0%0 de 300
xAIGrok 4.6Responses API0,0%0 de 300
AnthropicClaude Sonnet 5Messages API, connector MCP0,0%0 de 300
A medição do Google (Gemini 3.7 Flash) ficou incompleta, com 91 de 300 respostas, por instabilidade do serviço nos dias do estudo. Entra numa atualização desta série.

Como medimos

Ressalvas por modelo
  • GPT-5.6 Sol foi medido sem raciocínio na rota direta, porque a API exige desligá-lo para usar ferramentas em Chat Completions. A condição connector mede o modelo com raciocínio.
  • Gemini 3.7 Flash foi medido via OpenRouter, pela indisponibilidade da rota direta do Google nos dias do estudo.
  • Kimi K3 só aceita temperatura 1 na API; o protocolo pede 0.
  • Claude Sonnet 4.6 reaproveita a condição sem o MCP da rodada oficial de 15 a 18/ago, na mesma rota e configuração.
  • Sabiá-4 e Sabiazinho-4 foram medidos no estudo. Os resultados deles estão no relatório da Release, fora desta página.
  • Qwen (Alibaba) ficou fora do estudo, sem rota de API disponível na data.

Sua IA pode responder assim hoje

O conector que zerou a alucinação no estudo é o mesmo que qualquer assistente pode usar. Basta colar uma URL no Claude, no ChatGPT ou no seu editor.

conectar minha IA → leva 2 minutos, sem cadastro

Conferir e reproduzir · Release estudo-fonte-v0.1.0 ↗ · pré-registro ↗ · DECISOES.md D14 ↗ · respostas brutas, julgamentos e resumo estatístico no repositório.