Claude Code vs Codex CLI chegaram a um empate técnico nos benchmarks — mas a diferença real está no quanto você paga por tarefa e em como cada ferramenta controla o acesso ao sistema.

O estudo RuBench testou as duas ferramentas em 25 tarefas de reparo de código, com três rodadas por tarefa, cobrindo Python, PHP, TypeScript e JavaScript, com especificações escritas em russo para eliminar viés de idioma.

O que os benchmarks dizem — e o que escondem

Claude Code com Opus 4.8 alcançou 78,7% de taxa de sucesso (pass@1). A versão com Sonnet 5 ficou em 74,7%. O Codex CLI com GPT-5.5 registrou 66,7%.

Parece uma vitória clara para o Claude Code vs Codex CLI. Os intervalos de confiança a 95% mostram outra coisa: Opus entre 59% e 90%, Sonnet entre 55% e 88%, Codex entre 47% e 82%. Na comparação direta Opus x GPT-5.5, o intervalo vai de −5,3 a +29,3 pontos percentuais. Zero está dentro desse intervalo — nas 25 tarefas testadas, não há diferença estatisticamente confiável entre as ferramentas.

Quem já acompanhou o comparativo de Claude Code vs Cursor vs Copilot sabe que benchmark isolado é ponto de partida, não sentença. Um teste específico de velocidade no Claude Code vs Codex vs Antigravity para Android mostra o mesmo empate sob outro ângulo.

Por que isso importa para o seu negócio

Para uma startup ou equipe de desenvolvimento que usa agente de codificação no dia a dia, o custo mensal é a conta que importa — não o benchmark abstrato.

ConfiguraçãoCusto por tarefaTokens de saídaCusto por reparo
Claude Code Opus 4.8US$ 3,1233.000US$ 3,96
Claude Code Sonnet 5US$ 2,4229.000US$ 3,24
Codex CLI GPT-5.5US$ 2,3416.000US$ 3,51

Com 300 tentativas mensais, o Claude Code Sonnet 5 sai em US$ 726 e o Codex em US$ 702 — diferença de US$ 24 por mês. O Opus fica em US$ 936. Quem tem assinatura Pro ou Max do Claude não paga por token nas sessões do agente, o que inverte o jogo para desenvolvedores com uso intenso.

O Codex gera apenas 16.000 tokens de saída por tarefa — menos da metade do Opus (33.000). Isso reduz o custo nas rotas pay-per-token, mas pode significar menos contexto por resposta em tarefas complexas.

No custo por reparo bem-sucedido, o Sonnet 5 vence com US$ 3,24 contra US$ 3,51 do Codex — porque a taxa de sucesso do Claude compensa o gasto extra em tokens.

Segurança e controle

Os dois agentes isolam execução no nível do sistema operacional, mas com filosofias diferentes.

O Claude Code usa permissões configuráveis (permitir / perguntar / negar) para cada tipo de ação, regras gerenciadas via .claude/settings.json e sandbox opcional de rede e sistema de arquivos. O Claude Code Mods e Projects de 2026 adicionou camadas de controle corporativo que são relevantes para equipes com políticas de segurança rígidas.

O Codex bloqueia a rede por padrão, limita o acesso ao workspace e pausa para qualquer ação fora dos limites aprovados. Configurações de aprovação determinam quando o agente para e aguarda confirmação humana.

Nenhum elimina completamente o risco de execução de código — mas o Claude Code oferece controle mais granular para equipes com compliance corporativo. A documentação oficial de ambas as ferramentas está disponível em claude.ai e na plataforma OpenAI.

Como escolher na prática

O estudo não cobriu Go, Rust, Swift, frameworks mobile ou projetos monorepo. Os pesquisadores alertam que "uma ordenação diferente poderia aparecer com outros idiomas ou frameworks." A escolha final depende de três variáveis:

  • Rota de cobrança: assinante Pro/Max do Claude usa sem custo extra por token; com chave de API própria, a diferença é mínima em volume baixo
  • Controles de segurança: Claude Code para equipes que precisam de permissões granulares; Codex para quem quer rede bloqueada por padrão
  • Ecossistema: equipes que já usam ChatGPT ganham integração direta com o Codex sem nova conta

Conteúdo reescrito e traduzido para PT pela redação luiscortex, revisado por humano.

Fonte: Google News — AI (EN)