Pular para o conteúdo
Logos de ChatGPT, Claude, Gemini e Grok em uma interface tecnológica com gráficos de atualização e a data Setembro de 2026.
Voltar para o Blog

Novidades de IA em Setembro de 2026: O Que Mudou no ChatGPT, Claude, Gemini e Grok (e Qual Usar Agora)

Equipe Golber.
15 min de leitura
Notícias
Ouça este artigo

Novidades de IA em Setembro de 2026: O Que Mudou no ChatGPT, Claude, Gemini e Grok (e Qual Usar Agora)

0:00 / 23:06
1×
Sincronia do destaque
no ponto
Se a voz parecer atrás do trecho marcado, atrase o destaque
Logos de ChatGPT, Claude, Gemini e Grok em uma interface tecnológica com gráficos de atualização e a data Setembro de 2026.

Os primeiros treze dias de setembro concentraram mais lançamento de IA do que semestres inteiros: Anthropic, Google e OpenAI colocaram modelo de fronteira na rua em três dias consecutivos, a OpenAI emendou um gerador de imagens novo e depois fechou a venda do próprio plano mais caro, e a xAI prometeu um modelo que ainda não chegou. Reuni o que mudou em cada um, com data e fonte: o Fable 5.1 com cache quatro vezes mais barato e o maior salto do mês em benchmark de agente, o Gemini 3.8 Flash treze vezes mais barato que a fronteira, o GPT-6 Astra liderando em uso de computador e caindo em escrita, e a conta que mostra que Astra e Fable custam o mesmo na lista. No fim, a resposta que todo mundo busca, qual usar agora para cada tarefa, o padrão por trás dos quatro e o que vem nas próximas semanas.

Os primeiros treze dias de setembro de 2026 concentraram mais lançamento de IA do que semestres inteiros de anos anteriores. Anthropic, Google e OpenAI colocaram modelo de fronteira na rua em três dias consecutivos, a OpenAI emendou um gerador de imagens novo e depois fechou a venda do próprio plano mais caro, e a xAI prometeu um modelo que, até o fechamento deste texto, não chegou.

Este post é o resumo verificado do que mudou em cada um dos quatro, o que cada mudança significa na prática, quanto custa, e a resposta à pergunta que todo mundo faz: qual usar agora, para cada tipo de tarefa. Tudo com data, fonte e a distinção entre o que foi anunciado e o que foi de fato entregue.

Atualizado em 13 de setembro de 2026. Volto a atualizar quando o Grok 4.7 sair e quando o Pro 20x reabrir.

  • Claude Fable 5.1 (01/09): mesmo preço, cache 4 vezes mais barato, e o maior salto do mês em benchmark de agente científico: de 24,7% para 52,6%.

  • Gemini 3.8 Flash (02/09): terceiro Flash em seis semanas, mesmo preço do anterior, 13 vezes mais barato que os modelos de fronteira na entrada.

  • GPT-6 Astra (03/09): o melhor em uso de computador (72,6% no OS World), mas abaixo do Fable 5.1 no índice geral e caindo em escrita.

  • ChatGPT Images 2.5 (08/09) e a pausa do Pro 20x (10/09): a OpenAI lançou e racionou na mesma semana.

  • Grok 4.7: anunciado para 12/09, adiado em 11/09. Sem preço, sem benchmark, sem página de modelo.

  • Astra e Fable 5.1 custam exatamente o mesmo na lista, US$ 10 de entrada e US$ 50 de saída. A diferença real está no cache e no que cada um faz melhor.

A linha do tempo de setembro

Data

Quem

O que

01/09

Anthropic

Claude Fable 5.1 e Mythos 5.1

02/09

Google

Gemini 3.8 Flash e 3.8 Flash Cyber

02/09

xAI

Musk anuncia Grok 4.7 "em 10 dias"

03/09

OpenAI

GPT-6 Astra

08/09

OpenAI

ChatGPT Images 2.5, com Flare e Sunburst na API

10/09

OpenAI

Pausa nas novas assinaturas do Pro 20x (US$ 200)

11/09

xAI

Musk: Grok 4.7 "precisa de mais uns dias"

ChatGPT e OpenAI: lançou, lançou de novo e racionou

GPT-6 Astra (3 de setembro)

O que mudou: o novo modelo de fronteira da OpenAI, com foco em raciocínio, programação e uso de computador. Os números que importam: 72,6% no OS World, contra 65,7% da geração anterior, e 92,7% no ScreenSpot Pro, contra 76,9%. É o melhor modelo do mercado para operar uma tela como uma pessoa operaria. Na API, custa US$ 10 por milhão de tokens de entrada e US$ 50 de saída, com cache a US$ 1, e modos Batch e Flex pela metade.

O que não melhorou: no índice geral de inteligência que agrega vários benchmarks, o Astra ficou em 61,2, atrás do Fable 5.1, com 65,7. Em escrita, caiu do sexto para o décimo primeiro lugar. E foi classificado no nível "crítico" de risco em cibersegurança, o que significa mais recusas em pedidos dessa área.

Veredito: é o modelo para automação de tela e agente que opera software. Não é o melhor para texto. A análise completa está em GPT-6 Astra: os números que ninguém está mostrando.

ChatGPT Images 2.5 (8 de setembro)

O que mudou: até 50% menos latência, melhor fidelidade à foto de referência, e três ferramentas novas: Sketch para desenhar a composição dentro do chat, Templates de pôster, flyer e foto de produto, e comentários direto na imagem para editar só o que você marcou. Na API vieram dois modelos, Flare para volume e Sunburst para peça final, com a mesma tabela do GPT Image 2.

Veredito: a linha GPT Image continua a melhor em texto dentro da imagem e layout; mirou o fotorrealismo, que era território do Nano Banana. Sem benchmark publicado contra o Google ainda.

A pausa do Pro 20x (10 de setembro)

O que mudou: sete dias depois do Astra, a OpenAI suspendeu novas assinaturas do plano de US$ 200 por demanda acima da capacidade. Quem já assina não é afetado; quem cancelar não volta enquanto durar. O Pro 5x, a R$ 525 no Brasil, Plus, Go, API e planos corporativos seguem abertos.

Veredito: é o plano que vende uso mais barato por unidade, e portanto o primeiro a ser racionado quando falta máquina. O precedente de 2023 sugere reabertura em semanas.

Claude e Anthropic: o lançamento mais silencioso e o mais relevante

Claude Fable 5.1 e Mythos 5.1 (1º de setembro)

O que mudou: preço de entrada e saída inalterado em relação ao Fable 5, US$ 10 e US$ 50, mas a leitura de cache caiu de US$ 1,00 para US$ 0,25 por milhão de tokens, um corte de 4 vezes. A Anthropic diz que isso reduz o custo efetivo entre 25% e 45% em cargas típicas, e o beneficiário principal é quem roda agente de longa duração, que relê o mesmo contexto centenas de vezes.

Nos benchmarks, o salto que chama atenção é no Terminal-Bench-Science, de agente científico: 52,6%, contra 24,7% do Fable 5, 29,0% do Claude Opus 5 e 22,4% do GPT-5.6 Sol. No AutomationBench, da Zapier, 31,4% contra 17,1%. Janela de contexto de 1 milhão de tokens, saída máxima de 128 mil, raciocínio adaptativo sempre ligado e corte de conhecimento em junho de 2026.

A diferença entre Fable e Mythos: são o mesmo modelo, com salvaguardas diferentes. Quando os classificadores do Fable detectam pedido de cibersegurança, biologia, química ou destilação de modelo, a resposta é desviada para o Claude Opus, menos capaz. O Mythos remove essas restrições e fica restrito a organizações autorizadas, pelo programa Glasswing. O Financial Times estima algo em torno de 8 trilhões de parâmetros no Mythos e 5 trilhões no Fable.

O alerta para desenvolvedor: a versão 5.1 traz uma mudança que quebra código de agente existente, com erro 400. Se você atualizar o modelo sem ler a nota de migração, a integração para.

A nota honesta: pesquisadores independentes questionaram as alegações de descoberta de vulnerabilidade do Mythos, apontando que uma das falhas de destaque também foi encontrada por 8 de 8 modelos de código aberto testados, um deles com apenas 3,6 bilhões de parâmetros ativos.

Veredito: para trabalho longo de programação e agente, é o modelo mais forte disponível ao público, e ficou mais barato de operar sem mudar a tabela. Comparei os dois de fronteira em GPT-6 Astra vs Claude Fable 5.1: qual escolher.

Plataforma de desenvolvimento

Setembro também trouxe controle de orçamento por sessão, inferência com fixação geográfica, e habilidades carregadas via GitHub para os agentes gerenciados. Coisa de infraestrutura, que não vira manchete e que decide se uma empresa consegue usar o modelo em produção com previsibilidade de custo.

Gemini e Google: velocidade de lançamento como estratégia

Gemini 3.8 Flash e 3.8 Flash Cyber (2 de setembro)

O que mudou: o terceiro modelo Flash em seis semanas. O 3.6 Flash saiu em 22 de julho, o 3.7 veio em seguida, e o 3.8 chegou em 2 de setembro com melhorias em engenharia de software, fluxos de agente e raciocínio de várias etapas, pelo mesmo preço do 3.7: US$ 0,75 por milhão de tokens de entrada e US$ 3,75 de saída.

Junto veio o 3.8 Flash Cyber, especializado em detectar vulnerabilidade e corrigir código, com acesso restrito a um grupo de "defensores confiáveis" pelo programa Fairwind. É a resposta do Google ao Mythos da Anthropic: os dois laboratórios criaram, no mesmo mês, uma versão restrita do próprio modelo para segurança ofensiva e defensiva.

O que falta: um Pro novo. O Gemini 3.5 Pro seguia indisponível em julho, e a informação pública é de que o Google começou o pré-treinamento do Gemini 4. A estratégia visível é dominar a faixa de custo com o Flash enquanto o modelo grande não vem.

Veredito: para volume, o Gemini 3.8 Flash é imbatível em preço, com entrada 13 vezes mais barata que Astra e Fable. Não compete no topo de capacidade, e não pretende. O panorama da linha está em Gemini 3.6 Flash e 3.5 Flash-Lite: o que muda e se vale migrar, e a leitura de fundo em meus insights sobre o Gemini em 2026.

Nano Banana

Nenhum lançamento em setembro, e é exatamente por isso que entra aqui. O Nano Banana Pro e o Nano Banana 2, de fevereiro, seguem como referência em fotorrealismo, pele e luz. O Images 2.5 da OpenAI mirou esse ponto. Minha aposta, registrada em outro post, é que o Google responde em até 60 dias.

Grok e xAI: o modelo que ainda não chegou

Grok 4.7 (anunciado para 12 de setembro)

O que foi anunciado: em 2 de setembro, Musk publicou que o Grok 4.7 sairia "em 10 dias". Segundo ele, 2,1 trilhões de parâmetros, 40% acima do 1,5 trilhão do Grok 4.6, treinado com dados de engenharia da SpaceX, melhor que o antecessor "em todos os aspectos", com maior eficiência de token e inferência um pouco mais lenta.

O que foi entregue: nada, até o fechamento deste texto. Em 11 de setembro, Musk disse que o modelo "precisa de mais uns dias para cozinhar". A xAI não publicou página de modelo, preço, benchmark ou nota técnica.

O padrão: o Grok 5, prometido com 6 trilhões de parâmetros, já foi adiado de 2025 para 2026 e agora tem previsão de "antes do fim do ano". Musk declarou em setembro que acredita que o Grok 5 pode alcançar AGI. Registro sem comentário, porque a única coisa que vale registrar sobre a xAI é o que foi lançado, e o que foi lançado até agora em setembro é uma data.

Veredito: espere. Não planeje nada em cima do Grok 4.7 até ele existir com preço e benchmark. Quando sair, eu atualizo este post.

Os quatro lado a lado

GPT-6 Astra

Claude Fable 5.1

Gemini 3.8 Flash

Grok 4.7

Lançamento

03/09

01/09

02/09

adiado

Entrada (US$/1M)

10

10

0,75

não publicado

Saída (US$/1M)

50

50

3,75

não publicado

Cache (US$/1M)

1,00

0,25

sem tabela própria

não publicado

Ponto forte

Uso de computador

Agente longo, código, ciência

Custo em volume

a verificar

Ponto fraco

Escrita, recusas em cyber

Quebra código de agente antigo

Não é fronteira

Não existe ainda

A conta que a tabela esconde

Astra e Fable 5.1 têm a mesma tabela de lista. Onde a diferença aparece é no cache, e cache é o que agente consome. Uma carga típica de agente, com 10 milhões de tokens de entrada dos quais 80% são contexto repetido, mais 1 milhão de saída:

  • GPT-6 Astra: cerca de US$ 78

  • Claude Fable 5.1: cerca de US$ 72

  • Gemini 3.8 Flash: cerca de US$ 11

Entre os dois de fronteira a diferença é pequena. Entre eles e o Flash, é de sete vezes. A decisão econômica do mês não é "Astra ou Fable", é "a tarefa precisa de fronteira ou não". A maioria não precisa.

Qual usar agora, por tarefa

  • Agente que opera tela, preenche sistema, navega: GPT-6 Astra. Os 72,6% no OS World são a maior distância entre um modelo e os demais em qualquer benchmark deste mês.

  • Programação longa, refatoração, agente que roda horas: Claude Fable 5.1. O cache a US$ 0,25 e o contexto de 1 milhão foram feitos para isso.

  • Classificação, extração, resumo, atendimento em volume: Gemini 3.8 Flash. Treze vezes mais barato na entrada, e melhorou em raciocínio sem subir de preço.

  • Imagem com texto, layout, cartaz, foto de produto: ChatGPT Images 2.5. Imagem fotorrealista, retrato, luz: Nano Banana, até o Images 2.5 provar o contrário com benchmark.

  • Escrita longa, texto que vai para leitor: aqui eu não recomendo o Astra, que caiu para o décimo primeiro lugar em escrita. Claude segue sendo a escolha de quem escreve, e a comparação de uso no dia a dia está em ChatGPT, Claude, Gemini ou Grok: qual contratar.

  • Grok: espere o lançamento. Depois, teste. Sem preço e sem benchmark, não existe recomendação possível.

E para quem está decidindo se paga plano ou usa API, a conta está em vale a pena pagar IA.

Três laboratórios lançaram modelo de fronteira em três dias e cobraram o mesmo preço. Quando o preço converge, a escolha deixa de ser sobre quem é mais inteligente e passa a ser sobre quem é mais inteligente na sua tarefa.

O padrão por trás dos quatro

Três coisas que setembro deixou claras:

  1. O preço de fronteira congelou em US$ 10 e US$ 50. Astra e Fable 5.1 chegaram na mesma tabela dos antecessores. A competição migrou para cache, contexto e modos de desconto. Quem otimiza cache paga metade; quem não otimiza, paga lista.

  2. Modelo restrito virou categoria. Mythos na Anthropic, Flash Cyber no Google, nível "crítico" na OpenAI. Os três decidiram que a versão mais capaz em segurança não vai para o público. Isso é novo, e é uma linha que tende a ficar.

  3. Capacidade é racionada mesmo para quem paga. A pausa do Pro 20x é a prova. Empresa que depende de um único fornecedor descobriu isso num botão cinza. Quem tem cadeia de fallback entre provedores, como eu mantenho nos meus sistemas, não notou.

O que vem nas próximas semanas

  • Grok 4.7, quando "terminar de cozinhar". Sem data nova.

  • Reabertura do Pro 20x, que eu aposto para até 22 de outubro, possivelmente com limite menor ou preço maior.

  • Resposta do Google no Nano Banana ao Images 2.5, que aposto para até 8 de novembro.

  • Um Gemini Pro novo, que é a ausência mais visível do mercado. Sem sinal de data.

  • Benchmarks independentes do Astra e do Fable 5.1 em produção, que valem mais que qualquer número de lançamento.

Atualizo este post a cada uma dessas. Se você quer a versão mais rápida da OpenAI para tarefa curta, o GPT-5.6 Sol continua no ar e é outro animal, como mostrei em GPT-5.6 Sol a 750 tokens por segundo.

Perguntas frequentes

Quais foram as principais novidades de IA em setembro de 2026?

Claude Fable 5.1 e Mythos 5.1 em 1º de setembro, Gemini 3.8 Flash e 3.8 Flash Cyber em 2 de setembro, GPT-6 Astra em 3 de setembro, ChatGPT Images 2.5 em 8 de setembro, e a pausa nas novas assinaturas do ChatGPT Pro 20x em 10 de setembro. O Grok 4.7, anunciado para 12 de setembro, foi adiado sem nova data.

Qual é a melhor IA hoje: ChatGPT, Claude, Gemini ou Grok?

Depende da tarefa. GPT-6 Astra lidera em uso de computador, com 72,6% no OS World. Claude Fable 5.1 lidera em agente longo, programação e trabalho científico, com 52,6% no Terminal-Bench-Science e cache quatro vezes mais barato. Gemini 3.8 Flash lidera em custo, com entrada 13 vezes mais barata que os dois. Grok 4.7 ainda não foi lançado, então não há como avaliar.

O que mudou no Claude Fable 5.1?

Preço de entrada e saída inalterado em US$ 10 e US$ 50 por milhão de tokens, mas leitura de cache reduzida de US$ 1,00 para US$ 0,25, o que a Anthropic estima em 25% a 45% de economia em cargas típicas. Contexto de 1 milhão de tokens, saída de 128 mil, raciocínio adaptativo sempre ligado. No Terminal-Bench-Science saltou de 24,7% para 52,6%. Traz uma mudança que quebra código de agente antigo com erro 400.

Qual a diferença entre Claude Fable e Claude Mythos?

São o mesmo modelo com salvaguardas diferentes. No Fable, pedidos de cibersegurança, biologia, química ou destilação de modelo são desviados para o Claude Opus, menos capaz. O Mythos remove essas restrições e é restrito a organizações autorizadas pelo programa Glasswing. O Financial Times estima cerca de 8 trilhões de parâmetros no Mythos e 5 trilhões no Fable.

O GPT-6 Astra é melhor que o Claude Fable 5.1?

Em uso de computador, sim, com folga. No índice geral de inteligência, não: o Astra ficou em 61,2 contra 65,7 do Fable 5.1. Em escrita, o Astra caiu para o décimo primeiro lugar. Os dois custam o mesmo na tabela de lista; a diferença de custo real está no cache, US$ 1,00 no Astra contra US$ 0,25 no Fable.

Quanto custa o Gemini 3.8 Flash?

US$ 0,75 por milhão de tokens de entrada e US$ 3,75 de saída, o mesmo preço do 3.7 Flash. É o terceiro modelo Flash em seis semanas, com melhorias em engenharia de software, agentes e raciocínio de várias etapas. A versão Cyber tem acesso restrito pelo programa Fairwind.

O Grok 4.7 já foi lançado?

Não, até 13 de setembro de 2026. Musk anunciou em 2 de setembro que sairia em dez dias, com 2,1 trilhões de parâmetros e treino em dados de engenharia da SpaceX. Em 11 de setembro disse que o modelo precisava de "mais uns dias". A xAI não publicou preço, benchmark ou página de modelo.

Por que a OpenAI pausou o ChatGPT Pro de US$ 200?

Por demanda acima da capacidade após o lançamento do GPT-6 Astra. O plano 20x vende cada unidade de uso pela metade do preço do Plus, o que o torna o mais caro de servir, e Sam Altman já havia dito em 2025 que a empresa perdia dinheiro nele. Assinantes atuais não são afetados; o Pro 5x, a R$ 525 no Brasil, segue disponível.

Qual IA usar para escrever textos?

Não o GPT-6 Astra, que caiu para o décimo primeiro lugar em escrita nos rankings de lançamento. O Claude segue como a escolha de quem escreve texto longo para leitor. Para texto curto em volume, o Gemini 3.8 Flash resolve com custo baixo.

Todos os fatos foram verificados nos anúncios oficiais e na cobertura de lançamento de cada empresa, com datas conferidas. Os custos por carga de agente são simulação com premissas declaradas no texto. Comparações de benchmark usam os números divulgados pelos próprios laboratórios e por índices independentes, que não são diretamente comparáveis entre si. As apostas sobre as próximas semanas são minhas. Última atualização: 13 de setembro de 2026.

Quer mais conteúdo desse?

Receba toda semana o que escrevo sobre stack, IA aplicada e negócios solo. Zero spam, descadastro num clique.