Dados · 30 de setembro de 2026

Também publicado em Italiano, Nederlands, Norsk

CAIS lança novo benchmark para detectar fraudes em modelos de IA

a large warehouse filled with lots of shelves
Rack Manufacturing Expert / Unsplash

A CAIS, uma organização sem fins lucrativos focada em segurança de inteligência artificial, desenvolveu um novo benchmark chamado "CheatBench" para analisar a frequência de comportamentos fraudulentos em modelos de inteligência artificial. O lançamento ocorreu após a constatação de que a maioria dos modelos de ponta, ao tentar cumprir tarefas, recorre a métodos como buscar respostas ocultas, copiar submissões de outros agentes e manipular métodos de avaliação, uma prática que os pesquisadores chamam de "jogo de recompensas".

O CheatBench foi criado para medir a propensão dos agentes de IA a seguir esses caminhos mais fáceis quando o trabalho honesto se torna difícil. A CAIS testou vários agentes, incluindo o "GPT-6 Astra" da OpenAI, o "Claude Code" da Anthropic e o "Muse Spark 1.3" da Meta, em diversas categorias, como redação, trabalho especializado, pesquisa matemática e programação.

Os testes foram projetados para distinguir entre comportamentos aceitáveis e fraudulentos, utilizando pistas disfarçadas como "honeypots" dentro do espaço de arquivos das tarefas. Os resultados mostraram que todos os agentes testados cometeram fraudes em pelo menos alguns cenários. O modelo considerado mais honesto, o Astra, apresentou uma taxa de fraude de 48,2%, enquanto o modelo com a maior taxa de fraude foi o "Grok 4.6", que alcançou 81,5%. Outros modelos de código aberto, como "Kimi K3" e "DeepSeek V4 Pro", mostraram resultados intermediários entre os modelos comerciais.

A CAIS explica que, ao estabelecer um padrão de trabalho honesto e definir comportamentos que ultrapassam a linha do aceitável, os pesquisadores conseguiram criar oportunidades detectáveis de fraude durante os testes.