Em uma comparação publicada em 29 de setembro de 2026, Codex foi considerado o agente que mais se aproximou visualmente das capturas do Foqos. Claude Code se destacou pelas alternâncias interativas, enquanto Google Antigravity preservou menos nuances da interface. Os resultados descrevem uma única avaliação qualitativa.
Três agentes reconstruíram o Foqos a partir das mesmas capturas
A tarefa era recriar em React as telas de um app de foco chamado Foqos. Claude Code, Codex e Google Antigravity receberam as mesmas capturas, cada um em um diretório separado, sem código-fonte ou arquivos de design.
O pedido priorizava a fidelidade visual e solicitava que os agentes implementassem as interações visíveis quando fosse razoável. Funções que dependessem de backend ou do sistema operacional poderiam usar dados locais ou simulados. Também não era permitido procurar externamente o app original ou seu código.
Modelos e condições do teste
A comparação usou as versões de linha de comando (CLI) dos três agentes. Claude Code trabalhou com Opus 5, Codex com GPT-6 Sol e Google Antigravity com Gemini 3.1 Pro. O nível mais alto de raciocínio foi ativado para todos.
| Agente e modelo | Resultado visual relatado | Detalhe destacado |
| Codex com GPT-6 Sol | Foi considerado o mais próximo das referências, sobretudo nas proporções, no espaçamento, nos cartões, na posição dos elementos, nos ícones e na tipografia. | O nome Foqos apareceu como “Fogos”. |
| Claude Code com Opus 5 | Teve diferenças em detalhes visuais, como ícones, espaçamento, tamanho dos elementos e tipografia. | Foi a única recriação descrita com alternâncias realmente interativas e incluiu controles de atividade ao vivo e de modo estrito que não apareciam nas capturas. |
| Google Antigravity com Gemini 3.1 Pro | Foi considerado o menos fiel dos três, embora o resultado tenha sido descrito como bem acabado e estruturado. | A grade de atividade pareceu mais uniforme porque não reproduziu diferenças sutis entre tons mais claros de roxo. |
Codex foi considerado o mais fiel visualmente
Na comparação, Codex ficou mais próximo das referências em vários elementos da composição: proporções, espaçamento, formato dos cartões, posicionamento, ícones e tipografia. O erro mais evidente foi trocar o nome do app de Foqos para “Fogos”.
Esse resultado foi uma avaliação visual daquele teste, não um ranking geral de agentes de programação. A tarefa e o app usados foram os mesmos para os três; a conclusão se limita às recriações avaliadas nessa comparação.
Claude Code trouxe alternâncias interativas e controles extras
Claude Code foi o único dos três resultados descrito como tendo alternâncias funcionais, que podiam ser ligadas e desligadas. A recriação também acrescentou controles de atividade ao vivo e de modo estrito que não estavam visíveis nas capturas de referência.
Assim, o resultado reuniu interação com elementos que não faziam parte das telas fornecidas. A comparação também apontou diferenças visuais menores em ícones, espaçamento, dimensões e tipografia.
Antigravity manteve o acabamento, mas perdeu nuances
Google Antigravity produziu uma interface considerada polida e bem estruturada, mas foi avaliado como o menos fiel ao desenho de referência. A diferença específica destacada estava na grade de atividade: tons de roxo mais claros ficaram menos diferenciados, deixando a área mais uniforme.
A tarefa avaliou uma interface em React
O pedido era reconstruir as telas em React, com dados locais ou simulados quando fossem necessárias funções de backend ou do sistema operacional. Portanto, a comparação avaliou recriações de interface, não uma reconstrução nativa do app para iOS nem o funcionamento de recursos do sistema.