OpenAI e Anthropic lançaram modelos novos na mesma terça-feira. No dia seguinte, já dava para ver o que as pessoas tinham feito com eles: uma versão jogável de Minecraft no navegador, a Market Street de São Francisco como era em 1906 e um jogo de ação com gatos criado durante uma transmissão.

Os anúncios trazem preços, gráficos e promessas. Os posts mostram algo mais interessante: o que sai do outro lado quando alguém entrega um trabalho inteiro para a IA. Nesta edição, eu reuni os lançamentos e as peças que seus primeiros usuários publicaram, com os comandos e os limites de cada teste quando eles aparecem.

Nesta edição

  • OpenAI e Anthropic lançaram Sol e Opus 5.5

  • Opus 5.5 virou cidade, simulador e jogo

  • Sol fez um jogo em minutos e corrigiu código

  • Dois modelos receberam o mesmo trabalho

  • Notícias rápidas

  • Opinião do Mateus

OpenAI e Anthropic lançaram Sol e Opus 5.5

Em 22 de setembro, a Anthropic apresentou o Claude Opus 5.5. A OpenAI lançou o GPT-6 Sol e o GPT-6 Luna no mesmo dia. Os produtos chegaram com papéis diferentes. A Anthropic coloca o Opus 5.5 como seu modelo forte para código e trabalhos longos. A OpenAI posiciona o Sol entre o Astra, seu topo de linha, e o Luna, voltado a tarefas de grande volume.

Há uma mudança simples para quem usa essas ferramentas. O Opus 5.5 entrou no Claude e no Claude Code para assinantes elegíveis, além da API. O Sol chegou ao Codex e ao ChatGPT Work nos planos pagos, também com acesso pela API. O Luna alcançou usuários Free e Go no aplicativo de desktop. É ali, dentro das ferramentas de trabalho, que os novos modelos começaram a ser testados.

Os preços ajudam a explicar por que tantas pessoas correram para experimentar. O Sol custa 2 dólares por milhão de tokens de entrada e 10 dólares por milhão de saída na API, metade do GPT-5.6 Sol. O Opus 5.5 passou a 4 e 20 dólares, queda de 20% diante do Opus 5. São valores publicados pelos fornecedores; cada projeto usa uma quantidade diferente de tokens.

Os benchmarks também melhoraram, mas contam só parte do lançamento. Nos testes divulgados pela Anthropic, Opus 5.5 atingiu 66,4% no Terminal-Bench 4.0. A Artificial Analysis mediu 58 pontos no Intelligence Index. Para o Sol, a mesma avaliadora registrou 57 pontos no Coding Agent Index, dois acima da versão 5.6. Cada índice tem ambiente e critério próprios.

Até aqui, parece mais uma rodada de placares. A diferença aparece quando abrimos os posts da Anthropic e da OpenAI e seguimos para as respostas dos criadores. Em menos de uma semana, ambos já tinham sido usados para fazer jogos, cenas em 3D, sites, vídeos e correções de código.

Opus 5.5 virou cidade, simulador e jogo

Alex Albert pediu ao Opus 5.5 que reconstruísse em Blender um trecho da Market Street de São Francisco na véspera do terremoto de 1906. No comando que publicou, ele citou mapas de incêndio, filme da época, fotografias e dados topográficos. Pediu que cada prédio guardasse a fonte de suas medidas e que o modelo escrevesse geradores em Python para fachadas, bondes e veículos. O vídeo mostra uma rua antiga inteira, com movimento de câmera. A precisão histórica de cada prédio ainda dependeria de conferência humana. O ponto visível é que o modelo juntou pesquisa, código e composição 3D numa peça que dá para examinar.

Ben Poole publicou outro tipo de passagem entre ideia e artefato: um desenho de catapulta virou uma simulação interativa. O post mostra o resultado em vídeo. Ele não informa ali todas as ferramentas usadas, nem o número de tentativas. Mesmo com esse limite, a peça deixa clara a mudança: um rascunho em papel passou a ser matéria-prima de software com física e controles.

Os jogos vieram logo depois. Noah Wachnik pediu uma versão jogável de Minecraft no navegador, com efeitos visuais avançados. Publicou vídeo, o comando e o tempo: 1 hora e 37 minutos, com esforço máximo. O resultado é uma demonstração feita sob condições específicas. O pedido saiu do texto e chegou a um ambiente em que alguém pode entrar e jogar.

Nem toda peça dependia de um jogo inteiro. DreW publicou uma animação curta feita com Opus 5.5. Addy Osmani mostrou um pelicano pedalando em Three.js. Nesses casos, o modelo foi usado para escrever a cena em código, permitindo mudar movimento e composição depois. Os vídeos não informam uma taxa de acerto nem o esforço total de produção.

O que une esses posts é a entrega visual feita com ferramentas que já existiam. Blender, Python, Three.js e o navegador continuam ali. O novo elemento é a velocidade com que uma pessoa consegue passar de uma descrição para algo que pode inspecionar, ajustar e mostrar. O comando virou um ponto de partida para construir.

GPT-6 Sol fez um jogo em minutos e corrigiu código

A equipe do The Neuron deu aos dois modelos uma tarefa curiosa durante uma transmissão: fazer um jogo no estilo Doom, só que com gatos. O GPT-6 Sol produziu um jogo com três fases, inimigos, pontos de vida, chaves, projéteis de novelo e um chefe chamado Meowlock. Segundo a equipe, foram cerca de dez minutos e meio de trabalho do modelo até a versão jogável.

O Opus 5.5 tomou outro caminho. Montou um plano mais elaborado e ainda trabalhava quando a transmissão precisou acabar, por volta dos 20 minutos. A própria equipe diz que os ambientes eram diferentes e que se tratava de uma única tarefa. O post mostra Sol construindo rápido uma peça que já podia ser jogada, dentro daquele ensaio.

O Sol também apareceu em trabalhos menos vistosos. Dan Shipper, da Every, contou que o adotou como escolha diária no Codex. Ele testou escrita, uso de computador e código com sua equipe. Numa prévia, o Sol acompanhou o Astra em 17 de 18 tentativas distribuídas por seis tarefas simples no computador. Shipper ainda viu um teto maior no Opus 5.5 para alguns projetos longos de código. É um relato de uso com trabalhos da Every, sem pretensão de cobrir todas as equipes.

No comparativo de Nate Herk, o melhor resultado do Sol veio numa revisão e correção de código. O autor submeteu a saída a 30 checagens; Sol passou nas 30, enquanto Opus passou em 29. Naquele ensaio, Sol levou 22 minutos e Opus, 40. Houve uma interrupção de segurança no caminho, seguida de instruções ajustadas para ambos. Herk publicou essa ressalva junto com o resultado.

Há bons motivos para olhar além da partida de gatos. O jogo mostra como Sol pode tirar uma ideia do papel depressa. O teste de código mostra que ele também pode vencer uma tarefa delimitada e verificável. Em ambos os casos, os posts trazem o produto e o contexto da tentativa. É isso que faz a diferença entre uma promessa de lançamento e um exemplo que vale abrir.

Dois modelos receberam o mesmo trabalho

As demonstrações mais fáceis de entender são aquelas em que alguém pede a mesma coisa aos dois modelos. Thorsten Ball pediu um texto de lançamento para uma função de seu produto, com uma captura da interface, a partir de duas publicações anteriores. Rodou o mesmo pedido com Sol, Opus 5.5, Astra e Fable 5.1. Todos receberam material de referência e precisavam entregar texto com imagem.

Ball preferiu a versão do Opus 5.5. Gostou mais do título e da captura criada por ele. Na conta estimada publicada no post, o trabalho saiu por 9,54 dólares com Opus e 3,10 dólares com Sol. Outra pessoa nas respostas preferiu o Sol por achar o título mais claro. É uma comparação de gosto editorial com um produto específico, não um placar definitivo. O valor do post está em mostrar lado a lado as peças e o pedido que as gerou.

Nate Herk fez uma rodada maior, com dez tarefas. Pediu site, edição de vídeo, pesquisa, jogo, revisão de código e uso do navegador. Deu sete vitórias ao Opus e uma ao Sol. Duas provas ficaram sem nota porque os agentes mexeram nos mesmos arquivos e atrapalharam a comparação. Herk expôs essa falha em vez de escondê-la.

No site de uma marca de café proteico, o Opus montou camadas em movimento, um produto que gira e uma abertura de lata com fumaça. O Sol também produziu um site navegável, mas Herk achou a apresentação visual mais simples. Os dois levaram cerca de 35 minutos. Opus custou 18,32 dólares nessa tentativa; Sol, 5,89. Em outra tarefa, o Sol venceu na correção de código. O mesmo autor viu qualidades diferentes conforme mudava o trabalho.

Esse conjunto mostra por que os posts merecem mais atenção que um vídeo isolado. A pessoa que avalia pode abrir o pedido, olhar o site, assistir ao vídeo e decidir se teria escolhido a mesma saída. A vitrine dos lançamentos ficou cheia de peças prontas, com acertos e falhas à vista.

Notícias rápidas

Voz em português entrou na disputa. O Google lançou Gemini 3.8 Flash TTS e Flash-Lite TTS em 23 de setembro. A empresa diz que os modelos suportam mais de 100 idiomas e cita o português brasileiro entre as línguas com boa preferência em avaliações cegas. Há um modelo novo para testar em narração e atendimento por voz.

Grok 4.7 também chegou. A SpaceXAI apresentou o modelo em 21 de setembro, com foco em código e tarefas longas. A Artificial Analysis marcou 46 no Intelligence Index, dois pontos acima do Grok 4.6. Foi mais um lançamento na semana dominada por Sol e Opus.

Claude ajudou a encontrar um sistema biológico incomum. Em 23 de setembro, a Anthropic divulgou sequências repetidas associadas a uma enzima e a uma proteína pouco conhecida. A empresa montou equipe e laboratório para estudar a descoberta. A aplicação científica ainda depende de novos testes.

O BID calculou cenários para a América Latina. Segundo o banco, adoção ampla de IA poderia elevar o PIB regional em 5,1% ao longo de uma década. Sem deslocamento de trabalhadores para áreas em crescimento, salários poderiam cair entre 13,5% e 20,9% nos cenários estudados. As duas faixas são projeções condicionais.

Vídeo ficou mais acessível no Google Vids. O Google anunciou clipes em 1080p com Gemini Omni no Vids, inclusive para contas gratuitas, e prometeu narração com Flash-Lite TTS. Outra ferramenta para quem quer montar um primeiro vídeo a partir de um roteiro.

Opinião do Mateus

Na edição #025, contei como foram meus testes com o Astra e o Fable 5.1. Hoje quero dividir minhas impressões sobre os novos modelos.

Vou começar com um vídeo que fiz para o ChatFunnel com um único prompt. Postei no LinkedIn, e você também pode assistir aqui embaixo.

Acredito que entramos em uma nova era. (Para ser mais específico, na 5Era 😆). Nosso trabalho está mudando dia após dia. Eu já nem sei mais o que é trabalhar sem abrir uma ferramenta de IA.

Por aqui, usamos IA para programar, criar sites, escrever roteiros de vídeo, buscar informações e fazer pesquisas. Ela está presente nas tarefas simples e nas complexas. Como eu sempre repito: quem sabe usar IA muito bem pode tomar o seu lugar.

No ChatFunnel, olho para esses exemplos pensando no que vale construir para um cliente ou para a nossa equipe. O jogo de gatos é divertido e mostra a velocidade do modelo. O site do café, a edição de vídeo e a correção de código estão mais próximos de trabalhos pelos quais alguém pagaria.

Os posts dão ideias. Para colocar alguma delas em prática, preciso começar por um problema nosso.