
Quatro modelos chegaram em três dias. A manchete mais barulhenta foi o 99,9% do GPT-6 Astra num teste de raciocínio. Só que o mesmo modelo marcou 62,7% quando perdeu uma peça do sistema que preservava seu contexto entre chamadas.
Enquanto a OpenAI mostrou velocidade no computador, a Anthropic cortou em 75% a leitura de cache do Fable 5.1. Google e Meta também lançaram modelos voltados a tarefas longas. No dia seguinte, a NVIDIA anunciou um acordo de 12,93 bilhões de dólares para comprar a Hugging Face, usada por mais de 18 milhões de pessoas. O modelo ficou mais capaz. A disputa agora inclui o caminho inteiro até a tarefa terminada.
Nesta edição
GPT-6 Astra expõe o custo de esquecer no meio da tarefa
Claude Fable 5.1 barateia o contexto e corta o ruído
A NVIDIA quer comprar o lugar onde a IA é descoberta
Google e Meta colocam preço na mesma disputa
Notícias rápidas
Opinião do Mateus
AGI? Tudo sobre o GPT-6 Astra

A OpenAI lançou o GPT-6 Astra em 3 de setembro, com acesso inicial limitado e expansão prevista nos dias seguintes para assinantes e clientes da API. A manchete mais fácil seria dizer que o novo modelo ficou mais inteligente. O dado que muda a leitura está em outro ponto: no ARC Prize, o Astra marcou 62,7% com a interface padrão e 99,9% quando recebeu um adaptador capaz de preservar seu estado de raciocínio entre chamadas. A diferença mostra quanto um modelo perde quando precisa reconstruir o próprio caminho no meio de uma tarefa longa.
O placar exige uma ressalva. O resultado de 62,7% usou esforço máximo, enquanto o de 99,9% usou esforço alto. Quando o nível foi mantido em high nos dois testes, a interface padrão caiu para 54,8% e o adaptador permaneceu em 99,9%. Portanto, a distância não cabe numa explicação única sobre memória ou interface. O próprio ARC Prize também afirma que saturar esse teste não comprova inteligência geral: os ambientes têm objetivos delimitados e regras fechadas. O número impressiona, mas mede uma condição específica.
Em tarefas no computador, a OpenAI diz que o Astra chegou a 72,6% no OSWorld 2.0, ante 65,7% do GPT-5.6 Sol. Nas simulações de latência divulgadas pela empresa, o tempo por tarefa caiu de cerca de 75 para 40 minutos, uma redução próxima de 47%. Esse ganho vale dentro das condições do teste. Ainda assim, ele aponta para uma mudança prática: a unidade de comparação deixa de ser a resposta mais bonita e passa a ser o trabalho concluído, com tempo, tentativas e contexto consumidos até o fim.
O preço da API reforça essa conta. A tarifa padrão é de 10 dólares por milhão de tokens de entrada e 50 dólares por milhão de tokens de saída, com cobranças próprias para cache e modo rápido. Um modelo mais caro por token pode custar menos por tarefa se concluir em menos chamadas. O inverso também vale: cada trecho esquecido força o sistema a reler arquivos, repetir instruções e refazer decisões. A fatura relevante soma tokens, duração, falhas e revisão humana.
Esse é o ponto que merece teste nas próximas semanas. Compare Astra com o modelo já usado pela sua equipe em uma tarefa longa e repetível, mantendo o mesmo material, o mesmo critério de aceite e o mesmo limite de tentativas. Registre minutos até a entrega, tokens gastos, correções humanas e quantas vezes o sistema perdeu uma decisão anterior.
Fontes: OpenAI, ARC Prize, Segurança do GPT-6 Astra
Claude Fable 5.1 barateia o contexto

A Anthropic lançou o Claude Fable 5.1 em 1º de setembro sem mexer nas tarifas principais da API: US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída. A mudança mais forte está na leitura de cache, que ficou 75% mais barata e passou a custar US$ 0,25 por milhão de tokens. Para tarefas longas, nas quais o modelo consulta várias vezes o mesmo contexto, essa redução altera o custo da tarefa mesmo sem desconto no token comum.
A distinção importa porque o corte de 75% não chega à fatura inteira. A Anthropic estima uma economia de cerca de 25% em tarefas típicas e de até 45% em trabalhos com uso intenso de agentes. O ganho depende de quanto contexto já foi armazenado e volta a ser lido durante a execução. Um fluxo curto, com pouco reaproveitamento, sentirá menos diferença. Já uma revisão de código que consulta repositório, instruções e histórico em várias etapas tende a capturar uma fatia maior do desconto.
O teste da CodeRabbit ajuda a enxergar a outra metade da conta: o tempo humano gasto para separar sinal de ruído. O Fable 5.1 cobriu 61% dos defeitos conhecidos, ante 61,9% do Fable 5, mas elevou a precisão de 32,8% para 37,3%. Ao mesmo tempo, o total de comentários caiu de 253 para 166. A cobertura ficou quase estável, enquanto a equipe recebeu 87 alertas a menos para examinar. Em revisão de código, cada comentário fraco cobra atenção de alguém antes de ser descartado.
O resultado também impede uma conclusão preguiçosa sobre esforço de raciocínio. No mesmo ensaio, o modo Low terminou cada revisão em 18min38s. O High levou 21min36s e encontrou menos defeitos conhecidos. Isso não prova que Low vence em todos os repositórios: a própria CodeRabbit avisa que comparações com outros modelos usaram versões diferentes do sistema de revisão. O dado útil é mais estreito. Gastar mais tempo e processamento não garantiu um resultado melhor naquele teste.
Fable 5.1 e Mythos 5.1 compartilham o mesmo modelo-base, mas chegam com salvaguardas e níveis de acesso distintos. O primeiro também já foi anunciado na AWS, ampliando os caminhos para empresas que mantêm dados e aplicações nessa nuvem.
Disponibilidade, preço de token e placar ainda contam. Só que a medida decisiva passa a incluir quantas vezes o contexto precisa ser reenviado, quantos alertas uma pessoa precisa filtrar e quanto tempo o fluxo leva até entregar algo aproveitável. Um preço menor no cache perde força se o modelo gerar retrabalho ou deixar defeitos passarem. Antes de trocar de modelo, rode a mesma tarefa completa e meça custo total, duração, falhas encontradas e comentários descartados.
Fontes: Anthropic, CodeRabbit, AWS
A NVIDIA quer comprar o lugar onde a IA é descoberta

Em 3 de setembro, a NVIDIA anunciou um acordo para comprar a Hugging Face por US$ 12.930.300.000. A frase precisa ser precisa: as partes assinaram um acordo, mas a compra ainda depende das etapas previstas até o fechamento. A empresa de Jensen Huang colocou quase US$ 13 bilhões no caminho que liga quem cria um modelo a quem decide usá-lo.
A Hugging Face reúne mais de 18 milhões de desenvolvedores, pesquisadores e criadores. Seu catálogo passa de 3 milhões de modelos, 500 mil conjuntos de dados e 1 milhão de aplicações. Mais de 200 mil empresas usam a plataforma para encontrar, comparar, adaptar e publicar sistemas de IA. Esses números explicam por que a NVIDIA enxergou valor num negócio que não fabrica chips: a Hugging Face influencia quais modelos ganham atenção e quais ferramentas chegam às equipes.
O anúncio amplia a disputa descrita nesta edição. OpenAI, Anthropic, Google e Meta competem por capacidade, custo e tempo até a tarefa concluída. A NVIDIA já fornece a base física para boa parte desse trabalho. Com a Hugging Face, ela busca presença também no ponto em que modelos são descobertos, testados e distribuídos. É uma posição capaz de revelar cedo quais arquiteturas crescem, quais conjuntos de dados circulam e onde a demanda por processamento está surgindo.
Jensen Huang afirmou que a Hugging Face seguirá aberta a diferentes modelos, frameworks, nuvens, serviços de inferência e plataformas de computação. Segundo o anúncio, ninguém terá de usar hardware da NVIDIA para construir ou publicar pela plataforma. Esse compromisso reduz a tensão inicial, mas ainda é uma promessa da compradora. O teste virá nas escolhas de produto, nos preços, nas integrações em destaque e na mesma facilidade de acesso dada aos chips rivais.
Até o fechamento, o fato comprovado é o acordo anunciado em 3 de setembro de 2026. A questão central para clientes e criadores será medir se a neutralidade prometida aparece nas decisões da plataforma. Se modelos e chips concorrentes mantiverem o mesmo espaço, a Hugging Face pode ganhar infraestrutura sem perder confiança. Se as escolhas começarem a favorecer a NVIDIA, os 18 milhões de membros terão de decidir quanto vale permanecer no maior catálogo de IA sob o controle de um fornecedor de computação.
Fontes: NVIDIA, Associated Press, Axios
Google e Meta colocam preço na mesma disputa

Google e Meta lançaram novos modelos no dia 2 de setembro. O Gemini 3.8 Flash chegou como a terceira versão Flash em seis semanas. O Muse Spark 1.3 entrou no Muse Code e na API da Meta com foco em tarefas longas e programação. As duas empresas escolheram o mesmo campo: sistemas que recebem um objetivo, usam ferramentas e seguem trabalhando por várias etapas.
O Google manteve o preço promocional do Gemini 3.7 Flash: 0,75 dólar por milhão de tokens de entrada e 3,75 dólares por milhão de saída. Essa tarifa expira em 31 de dezembro. A partir de 1º de janeiro de 2027, os valores anunciados sobem para 1,50 e 7,50 dólares. O próprio texto do lançamento acrescenta uma variável que a tabela de preços esconde. Em tarefas complexas, o 3.8 Flash faz mais etapas de raciocínio e chama ferramentas repetidas vezes. O custo unitário permanece baixo até dezembro, mas o consumo por tarefa pode crescer.
A Meta apresentou outra conta. Nos testes feitos por seus engenheiros, o Muse Spark 1.3 usou cerca de 20% menos chamadas de ferramentas e 25% menos tokens que a versão 1.2. A empresa também diz que o modelo conserva instruções detalhadas por mais tempo, percebe quando ficou preso e pede ajuda em vez de afirmar que terminou. Esses números vieram da própria Meta. Servem como hipótese para um teste interno, sem garantir a mesma economia em outro sistema.
Os lançamentos também mostram uma divisão de acesso. O Gemini 3.8 Flash está disponível nos produtos do Google e para desenvolvedores. A variante Flash Cyber, voltada a segurança, fica restrita a participantes do programa Fairwind. O Muse Spark 1.3 está disponível, enquanto a versão com esforço máximo ainda aguarda testes adicionais. A Meta cita pesos abertos em seus próximos passos; o anúncio atual não entrega esses pesos.
Essa sequência cria um problema para quem tenta escolher pelo anúncio mais recente. O Google publicou três versões Flash em seis semanas. A Meta já fala no próximo passo do Spark. Uma integração feita hoje pode receber outro modelo antes de o teste interno terminar. Por isso a ficha de avaliação precisa sobreviver ao nome do fornecedor. Os mesmos casos, limites e critérios devem continuar válidos quando chegar a próxima versão. Sem essa base, cada lançamento reinicia a discussão e ninguém aprende com a troca anterior.
Notícias rápidas
Caterpillar leva décadas de autonomia para a IA. A empresa está aplicando ao uso de IA o aprendizado acumulado com máquinas autônomas em minas remotas. O caso desloca a discussão do protótipo para sistemas que precisam funcionar longe do escritório. TechCrunch
Sony e Warner processam a Anthropic. As editoras acusam a empresa de violar direitos autorais no treino do Claude. A disputa amplia a pressão jurídica sobre dados usados para ensinar modelos comerciais. Mashable via Google News
Claude Code ajusta seu limite semanal. A Anthropic anunciou um nível permanente 25% acima da cota padrão. Como o bônus vigente era de 50%, usuários que consumiam toda a faixa temporária terão cerca de 17% menos espaço. BleepingComputer via Google News
Funcionários ficaram mais críticos sobre IA. Uma análise de avaliações no Glassdoor encontrou queda de 81% para 43% nos comentários positivos sobre IA desde 2019. A distância entre executivos e quem executa tarefas repetitivas indica que adoção e aceitação seguem ritmos diferentes. The Decoder
Testei o Astra e o Fable 5.1
Não dá pra negar que os novos modelos estão muito melhores, mas ainda estão longe do que eu considero AGI.
Vale lembrar que sou engenheiro mecatrônico de formação. Minha régua para AGI é muito alta.
No uso do dia a dia, porém, a diferença já aparece. Podemos esperar resultados melhores em vídeos, imagens, sites, páginas e microapps.
Os dois modelos têm um perfil bem agêntico. Conseguem navegar pela internet, usar o computador e controlar o mouse e o teclado. Como você deve ter visto no início desta edição, eles também são muito bons em modelagem 3D e na criação de jogos.
Há cerca de 12 anos, decidi criar um jogo para PC com meu primo. Começamos a estudar no YouTube como fazer modelagem 3D no Blender, um programa de modelagem e animação.
Levamos 34 dias para fazer um Pac-Man funcionar.
Eu ainda me lembro da sensação de ver o bicho se mexendo e a mecânica do jogo funcionando. Posso te afirmar: foi indescritível.
Hoje, uma IA consegue criar, em 22 minutos, um jogo muito mais completo e funcional do que aquele que fizemos.
Os tempos mudaram, amigos. O prazer de construir as coisas com as próprias mãos está se perdendo. Aos poucos, estamos delegando quase tudo para agentes de IA.
O ganho financeiro será maior, sem dúvida. Mesmo assim, eu ainda me pergunto o que vai acontecer quando o uso da IA se tornar comum e o número de pessoas empregadas diminuir.
Meu chute é este:
Muitos terão pouco. Poucos terão muito.
Uma minoria vai dominar a tecnologia, enquanto grande parte da população dependerá de auxílio do governo.
O trabalho como conhecemos vai mudar. O mundo também.
A produtividade pode quintuplicar ou até passar disso. Estou falando de dólares gerados por hora trabalhada. Esse salto deve ampliar tanto a riqueza produzida quanto a arrecadação pública, dando aos governos recursos para sustentar grande parte da população.
É um chute que considero provável.
Aprenda o quanto antes e crie riqueza o mais rápido que puder. A janela de oportunidade ficará aberta por pouco tempo.
