
A OpenAI liberou em 13 de agosto de 2026 o preview do Ultrafast, que roda o GPT-5.6 Sol a até 750 tokens por segundo, cerca de 14 vezes o processamento Standard, e o detalhe que quase toda manchete erra é que não se trata de um modelo novo, e sim do mesmo modelo servido em hardware Cerebras. A velocidade vem de atacar movimentação de dados em vez de poder de cálculo, com 44 GB de SRAM em cada chip do tamanho de um wafer mantendo os pesos dentro do chip, mas o anúncio chega sem preço, sem data de disponibilidade geral e com todos os múltiplos comparativos vindos dos próprios fornecedores. O ganho real não está no chat, onde o leitor humano já é o gargalo, e sim em voz e em agentes de muitos passos, onde um fluxo de 10 etapas cai de cerca de 100 segundos para perto de 7, lembrando que quem chama a API do Brasil carrega de 110 a 160 milissegundos de rede que nenhum chip elimina.










