Três pesquisadores da startup Axiom Math, especializada em matemática para IA, conectaram quatro dos maiores modelos de linguagem do mercado ao volante de um Toyota Corolla 2022. A tarefa era simples: percorrer 130 metros de um corredor de cones num estacionamento vazio, a 0,94 mph. Um humano ficou no banco do motorista com o pé pronto para frear.

O experimento, chamado DrivingBench, foi realizado no final de setembro de 2026. Os modelos de IA dirigindo carro usavam imagens das câmeras como entrada e devolviam comandos de texto para direção, aceleração e frenagem. O hardware intermediário era o sistema open source Comma, usado em projetos de direção assistida.

Só um dos quatro modelos completou o percurso.

Os resultados, modelo por modelo

O GPT-6 Astra, da OpenAI, foi o único a completar o curso dos 130 metros. Falhou na primeira tentativa e concluiu na segunda em 5 minutos e 22 segundos. Identificou bem o ambiente ao redor, mas reagia com lentidão, o que fazia o carro desviar dezenas de metros antes de corrigir a rota.

O Claude Fable 5.1, da Anthropic, chegou a 45% do percurso na melhor tentativa. Identificou os obstáculos com clareza, mas ficou excessivamente cauteloso — hesitando antes de cada manobra em vez de executar com fluidez.

O Grok 4.6, da xAI, teve sua melhor marca em 22,6 metros (cerca de 11% do curso). Reagia rápido, mas sem precisão suficiente para manter o carro na rota.

O GPT-5.6 Sol, também da OpenAI, completou apenas 6% do percurso. A terceira tentativa chegou a 17,1 metros, pouco mais do que a primeira.

De 11 tentativas totais nos quatro modelos, 8 falharam antes do primeiro cone.

O problema que nenhum laboratório esperava

O maior obstáculo não foi a falta de capacidade técnica, mas um comportamento inesperado: os modelos recusavam dirigir ao perceber que o ambiente era real, não simulado. Quando os pesquisadores diziam que o carro era parte de um exercício, os modelos citavam segurança como motivo para não agir.

A solução? Batizar todos os componentes como "sandbox". Com o rótulo, os modelos passaram a operar de forma consistente. Conforme Aditya Ramabadran, um dos pesquisadores: "Acabamos tendo que chamar tudo de sandbox."

Isso aponta para uma tensão real nos agentes de IA autônomos: quando treinados para evitar danos, os modelos às vezes recusam tarefas legítimas em contextos físicos por excesso de cautela.

Por que isso importa para o seu negócio

Modelos de IA dirigindo carro não são o produto para o seu negócio — mas o princípio por trás do DrivingBench é exatamente o mesmo que governa qualquer automação com agentes de IA.

LLMs recebem entradas (texto, imagem, dados de sensores) e devolvem comandos de ação. No carro, o comando movia o volante. No seu negócio, o comando pode enviar um e-mail, publicar um post, preencher um formulário ou mover dinheiro.

O que o experimento mostra com clareza:

  • Latência importa. O atraso entre o input e o comando faz o carro desviar dezenas de metros. Na automação de negócios, o atraso pode causar retrabalho ou erro em cascata.
  • Calibração de cautela. Um modelo excessivamente cauteloso, como o Claude no carro, pode travar processos que precisam de decisão rápida.
  • Rótulos de contexto importam. O simples ato de chamar algo de "sandbox" mudou o comportamento dos modelos. No seu setup, as instruções de sistema e o contexto dado ao agente determinam o que ele vai (e não vai) fazer.

As empresas de direção autônoma dedicada, como Tesla e Waymo, não têm muito com que se preocupar por agora. O experimento com modelos de IA dirigindo carro prova que controlar hardware físico com LLMs é possível — e que a distância entre "funciona" e "funciona bem" ainda é medida em metros.

Fonte: IFLScience


Conteúdo reescrito e traduzido para PT pela redação luiscortex, revisado por humano.

Fonte: IFLScience / SuperCarBlondie