Modelos de IA não conseguem lucrar com apostas na Premier League em novo estudo

Sistemas de IA de empresas líderes, incluindo Google, OpenAI, Anthropic e xAI, perderam dinheiro ao apostar em partidas de futebol durante uma simulação da temporada 2023-24 da Premier League, segundo um relatório da startup General Reasoning. O estudo, chamado KellyBench, testou oito dos principais modelos quanto à sua capacidade de gerenciar riscos e se adaptar ao longo do tempo. O Claude Opus 4.6, da Anthropic, obteve o melhor desempenho com uma perda média de 11 por cento, enquanto o Grok 4.20, da xAI, falhou repetidamente.

A General Reasoning, startup de IA sediada em Londres, divulgou o relatório KellyBench esta semana, destacando limitações nos modelos de IA de fronteira. A empresa simulou a temporada completa de 2023-24 da Premier League, fornecendo às IAs dados históricos, estatísticas das equipes e instruções para construir modelos de apostas que maximizassem os retornos enquanto gerenciassem o risco. Os modelos apostaram nos resultados das partidas e no total de gols sem acesso à internet e receberam três tentativas cada para lucrar à medida que a temporada avançava, com atualizações em tempo real sobre jogadores e eventos. Nenhum obteve sucesso consistente, sendo que muitos faliram. Os sistemas apresentaram um desempenho sistematicamente inferior ao dos humanos, concluiu o relatório. Todos os modelos de fronteira perderam dinheiro no geral, e vários sofreram prejuízo total. O Claude Opus 4.6, da Anthropic, chegou mais perto de empatar em uma rodada, com uma perda média de 11 por cento. O Gemini 3.1 Pro, do Google, alcançou um lucro de 34 por cento em uma ocasião, mas faliu em outra tentativa. O Grok 4.20, da xAI, faliu em uma tentativa e não conseguiu concluir as outras. Ross Taylor, diretor executivo da General Reasoning e ex-pesquisador da Meta AI, afirmou: “Há muito exagero sobre a automação por IA, mas não há muita mensuração ao colocar a IA em um cenário de longo prazo.” Ele criticou os benchmarks comuns de IA por serem estáticos demais, ao contrário do caos do mundo real. Taylor acrescentou: “Se você testa a IA em algumas tarefas do mundo real, ela vai muito mal.” O artigo aguarda revisão por pares.

Artigos relacionados

Illustration of Moonshot AI's Kimi K3 topping benchmarks while triggering a selloff in stocks and crypto.
Imagem gerada por IA

Kimi K3 da Moonshot AI lidera benchmarks de codificação e provoca venda generalizada no mercado

Reportado por IA Imagem gerada por IA

A Moonshot AI lançou seu modelo Kimi K3 na quinta-feira, um sistema de pesos abertos que superou modelos líderes dos EUA em um importante ranking de codificação. O anúncio derrubou as ações de semicondutores e as criptomoedas na sexta-feira.

Trabalhadores remunerados para treinar modelos avançados de IA estão recorrendo cada vez mais a chatbots como o ChatGPT para gerar as conversas e testes necessários. Esse atalho, descrito como difundido por diversas fontes, corre o risco de degradar a qualidade de futuros modelos por meio do treinamento recursivo em dados sintéticos.

Reportado por IA

A Moonshot AI lançará a versão completa do Kimi K3 nesta segunda-feira, um modelo de IA chinês de código aberto que já reduziu bilhões das avaliações implícitas da OpenAI e da Anthropic.

quinta-feira, 16 de julho de 2026, 02:22h

Experts warn AI may reduce human skills and competence

terça-feira, 14 de julho de 2026, 12:26h

Modelos chineses de IA de código aberto geram resposta contida

quinta-feira, 04 de junho de 2026, 14:46h

Empresas dos EUA testam o DeepSeek à medida que os custos com IA aumentam

Este site usa cookies

Usamos cookies para análise para melhorar nosso site. Leia nossa política de privacidade para mais informações.
Recusar