A LLM de 2021 não é o sistema de 2026
O decoder ainda amostra. O sistema de 2026 já não é só isso.
A frase que circula desde 2021 é curta demais para o objeto de agora: modelo de linguagem é papagaio estocástico, só prevê o próximo token, logo não entende nada, e o resto do software ao redor não muda o diagnóstico.
A primeira metade descrevia bem o GPT-3. A segunda metade, aplicada a Astra, Codex ou Claude com sandbox, descreve o objeto errado.
No desktop, os dois desenhos se alternam. No celular, ficam um embaixo do outro: em cima o caminho de 2021, embaixo o de 2026. O ponto verde que corre no fio é o token. Em 2026 ele para nas portas verdes. Se a porta recusa, não há próximo parágrafo. Há nova tentativa, ou pare.
O que a metáfora era, e o que virou meme
On the Dangers of Stochastic Parrots (Bender, Gebru, McMillan-Major, Mitchell, 2021) falava de modelos de linguagem gerando texto sintético por correlação, sem grounding, sem ferramenta, sem verificador. Emily Bender tem repetido o limite: a metáfora é da LLM que produz texto, não de chess engine, compilador, AlphaFold, nem de tudo que o mercado passou a chamar de IA. Margaret Mitchell, coautora, escreveu em setembro de 2026 a mesma distinção: LLM pode ser papagaio estocástico; um sistema que junta LLM, regra escrita e programa determinístico não é só isso.
GPT-3 era, de fato, um decoder-only Transformer: uma passada pelas camadas, um token, softmax, sample. Sem function calling nativo. Sem schema no decode. Sem loop de execução. Sem pós-treino longo com recompensa verificável. Esse objeto existiu. Continua existindo em wrappers baratos. Não é o que um sistema de fronteira faz quando escreve código, roda teste, abre o browser e só então devolve o resultado.
Yann LeCun, em 20 de setembro de 2026, manteve a crítica que importa e descartou a que não importa: modelos autorregressivos, em si, não levam a inteligência de nível humano. O raciocínio dos sistemas atuais, disse ele, já é busca não autorregressiva. É exatamente a separação: o decoder amostra; a busca, a ferramenta e o oráculo não precisam amostrar.
Gary Marcus, no X, em agosto de 2026, foi na mesma direção: LLM pura ainda parece papagaio; Astra, se usa harness e ferramenta simbólica, não é LLM pura. A conjectura dele sempre foi essa. LLM é parte da solução, não a solução inteira.
O núcleo ainda amostra. O contrato do sistema não precisa amostrar.
Ninguém sério precisa negar sampling. O logit ainda é uma distribuição. Temperature, batch e kernel de GPU ainda introduzem variação no serving hospedado. Isso é fato de infra, não de filosofia. Mesmo com semente fixa, API hospedada não promete replay bit a bit.
O que mudou é onde o sampling pode atuar.
Em 2021 o caminho era:
prompt → LLM → texto
Em 2026 o caminho típico de um sistema fronteira é:
intenção
→ modelo (proposta)
→ máscara determinística (gramática / JSON Schema / DFA)
→ ferramenta (compilador, teste, SQL, Lean, browser, ERP)
→ oráculo (passou / falhou)
→ se falhou, volta; se passou, commita
A bola de neve clássica assume que cada passo seguinte consome o texto errado como verdade. Isso descreve um chat sem harness. Não descreve um loop com oráculo. Teste vermelho, tipo que não fecha, NF-e inválida, JSON que quebra o schema: o 0,01% não vira 10% em silêncio. Bate na parede e o sistema é obrigado a gerar de novo ou parar.
Humanos também erram com confiança. A diferença operacional não é “máquina mente, humano hesita”. É quem tem checagem barata e repetível.
O determinismo já entra no decode, não só depois, num script à parte
Isso não é teoria de blog. Está no código aberto que os serving stacks usam.
- llguidance, Outlines, XGrammar e Guidance: compilam JSON Schema, regex ou gramática Lark num bitmask por token. Tokens ilegais recebem logit −∞. A amostra só ocorre no suporte permitido. Um JSON malformado deixa de ser um evento possível; vira um evento de probabilidade zero naquele passo.
- Decode-time grammars (2026): a gramática não é só sintaxe fixa. Ela é instanciada no decode a partir do ambiente vivo: colunas do schema, funções da biblioteca, flags da linha de comando. Referência fantasma some por construção, não por sorte do prompt.
- Compiled AI: o modelo roda uma vez na compilação; o runtime é código estático. Orquestração, retry e branch não passam mais por token. Qualquer LLM residual vira ferramenta limitada, com schema fixo.
Isso é determinismo interno ao pipeline de geração, não um script clássico grudado depois. Separar regra rígida de sampling continua sendo a disciplina certa. Essa separação já está dentro da pilha, não só como conselho futuro.
Astra não é GPT-3 com marketing
A OpenAI descreve o GPT-6 Astra como sistema: pré-treino, reforço, alinhamento, ferramentas, monitoramento de trajetória e revisão automática no Codex. O resumo de segurança trata monitoramento de uso de ferramenta como camada da inferência, não como enfeite. Esforço extra, no uso real, compra mais iterações, verificação no browser e execução de código, não um parágrafo mais longo.
Sobre arquitetura interna, o cuidado importa. A imprensa reportou “recurrent depth”: o estado escondido passaria mais de uma vez pelo mesmo bloco antes do próximo token. A OpenAI não confirmou o desenho. Jakub Pachocki disse que a profundidade do grafo de computação de Astra está a no máximo o dobro da do GPT-4, e que a empresa continua monitorando a cadeia de pensamento. Tratar rumor como ficha técnica seria inflar o objeto do outro lado.
O que não é rumor:
- o produto exposto não é um forward pass e um parágrafo;
- o modelo escreve e executa código (sandbox, testes, browser);
- há monitoramento de uso de ferramenta na inferência;
- em avaliações com harness permissivo, o próprio modelo escreveu verificadores, comparando predição com observação.
Um preditor de token puro não constrói o próprio oráculo. Um sistema com loop constrói.
Erro composto descreve processo sem porta
O diagrama que assusta é este:
prompt → spec 0,01% torta → arquitetura torta → código em cima do erro → 10%
É verdadeiro para o fluxo “gerar e aprovar no olho”. É o mesmo risco de um júnior rápido sem integração contínua. Não é uma lei da estatística do Transformer.
Com porta, o diagrama vira:
proposta --schema--> candidato válido
--teste--> candidato que roda
--humano--> candidato que entra
Cada seta pode recusar. Recusa é determinística. A parte probabilística fica confinada à proposta.
A analogia da calculadora ainda vale, e fica incompleta se parar em “a máquina só faz conta”. A calculadora também devolve absurdo se a conta pedida for absurda. O matemático não some. Some a soma na mão. No software, o equivalente honesto não é trocar o engenheiro por uma API. É: o modelo propõe, o compilador e o teste julgam, o humano decide o que vira produção.
O que continua certo na crítica
- Substituir pessoa por chamada de API, sem redesenhar o fluxo, é o jeito mais caro de falhar.
- Caminho feliz de prompt não é produto: carga, falha de rede, fila, nota fiscal, regra da empresa.
- Time que não sabe auditar transforma lente de aumento em acelerador de muro.
- Regra que exige precisão estrita (saldo, imposto, autorização) deve viver em código clássico, não em sampling.
- LLM pura, sem porta, continua sendo um gerador de forma. Bender tem razão sobre esse objeto. LeCun tem razão quando diz que autorregressão sozinha não é inteligência de nível humano.
Nada disso exige a tese “a base ainda é só predição de token, portanto o sistema inteiro é papagaio”. Essa tese mistura o mecanismo do decoder com o contrato do produto. Em 2021 os dois coincidiam. Em 2026, não.
A frase que substitui o meme
Não: “IA continua sendo um modelo probabilístico, independente do que se põe ao redor.”
Sim: o decoder ainda amostra. O sistema de fronteira já embute portas determinísticas no decode, na ferramenta e no oráculo. Quem ignora as portas herda o risco de 2021. Quem as usa não está substituindo o engenheiro por uma LLM. Está compilando proposta estatística em artefato checável.
Tratar Astra como GPT-3 é o espantalho certo: um argumento válido contra o objeto antigo, apontado para o objeto novo.
Referências
- Emily M. Bender, Timnit Gebru, Angelina McMillan-Major e Margaret Mitchell. On the Dangers of Stochastic Parrots. FAccT, 2021.
- Eliza Strickland. What Emily Bender Really Meant by Stochastic Parrots. IEEE Spectrum, 30 jun 2026.
- Margaret Mitchell. No, AI is not a Stochastic Parrot. 20 set 2026.
- Yann LeCun. LLMs autorregressivas, em si, não levam a inteligência humana. X, 20 set 2026.
- Gary Marcus. Astra não é uma LLM pura. X, 1 ago 2026.
- OpenAI. GPT-6 Astra e Safety overview. Set 2026.
- Jakub Pachocki. Profundidade do grafo de Astra. X, 2 set 2026.
- Guidance AI. llguidance e guidance.
- Dottxt. Outlines. MLC. XGrammar.
- Shuoming Zhang et al. Decode-Time Grammars. arXiv:2607.18357, 2026.
- Compiled AI. arXiv:2604.05150, 2026.
- Romain Pellerin. Yes, LLMs can be deterministic. But most hosted stacks are not. Lemma Ventures, set 2026.