← TODOS OS ARTIGOS
Artigo

A LLM de 2021 não é o sistema de 2026

O decoder ainda amostra. O sistema de 2026 já não é só isso.

Genesis Innovation  ·  9 min de leitura
Placa de circuito em close, verde e dourada
O objeto de 2021 era um circuito de texto: uma passada, um token, uma amostra. Foto: Unsplash.

A frase que circula desde 2021 é curta demais para o objeto de agora: modelo de linguagem é papagaio estocástico, só prevê o próximo token, logo não entende nada, e o resto do software ao redor não muda o diagnóstico.

A primeira metade descrevia bem o GPT-3. A segunda metade, aplicada a Astra, Codex ou Claude com sandbox, descreve o objeto errado.

Arquitetura2021 → 2026
Intençãopedido
Modeloproposta
Máscaraschema
Ferramentateste
Oráculopassa

No desktop, os dois desenhos se alternam. No celular, ficam um embaixo do outro: em cima o caminho de 2021, embaixo o de 2026. O ponto verde que corre no fio é o token. Em 2026 ele para nas portas verdes. Se a porta recusa, não há próximo parágrafo. Há nova tentativa, ou pare.

O que a metáfora era, e o que virou meme

Terra à noite, rede de luzes vista do espaço
A metáfora nasceu para um gerador de texto. O meme passou a cobrir qualquer sistema ligado nessa rede. Foto: Unsplash.

On the Dangers of Stochastic Parrots (Bender, Gebru, McMillan-Major, Mitchell, 2021) falava de modelos de linguagem gerando texto sintético por correlação, sem grounding, sem ferramenta, sem verificador. Emily Bender tem repetido o limite: a metáfora é da LLM que produz texto, não de chess engine, compilador, AlphaFold, nem de tudo que o mercado passou a chamar de IA. Margaret Mitchell, coautora, escreveu em setembro de 2026 a mesma distinção: LLM pode ser papagaio estocástico; um sistema que junta LLM, regra escrita e programa determinístico não é só isso.

GPT-3 era, de fato, um decoder-only Transformer: uma passada pelas camadas, um token, softmax, sample. Sem function calling nativo. Sem schema no decode. Sem loop de execução. Sem pós-treino longo com recompensa verificável. Esse objeto existiu. Continua existindo em wrappers baratos. Não é o que um sistema de fronteira faz quando escreve código, roda teste, abre o browser e só então devolve o resultado.

Yann LeCun, em 20 de setembro de 2026, manteve a crítica que importa e descartou a que não importa: modelos autorregressivos, em si, não levam a inteligência de nível humano. O raciocínio dos sistemas atuais, disse ele, já é busca não autorregressiva. É exatamente a separação: o decoder amostra; a busca, a ferramenta e o oráculo não precisam amostrar.

Gary Marcus, no X, em agosto de 2026, foi na mesma direção: LLM pura ainda parece papagaio; Astra, se usa harness e ferramenta simbólica, não é LLM pura. A conjectura dele sempre foi essa. LLM é parte da solução, não a solução inteira.

O núcleo ainda amostra. O contrato do sistema não precisa amostrar.

Código em um editor escuro
O logit continua uma distribuição. O contrato do sistema pode ser um teste que só aceita verde. Foto: Unsplash.

Ninguém sério precisa negar sampling. O logit ainda é uma distribuição. Temperature, batch e kernel de GPU ainda introduzem variação no serving hospedado. Isso é fato de infra, não de filosofia. Mesmo com semente fixa, API hospedada não promete replay bit a bit.

O que mudou é onde o sampling pode atuar.

Em 2021 o caminho era:

prompt → LLM → texto

Em 2026 o caminho típico de um sistema fronteira é:

intenção
  → modelo (proposta)
  → máscara determinística (gramática / JSON Schema / DFA)
  → ferramenta (compilador, teste, SQL, Lean, browser, ERP)
  → oráculo (passou / falhou)
  → se falhou, volta; se passou, commita

A bola de neve clássica assume que cada passo seguinte consome o texto errado como verdade. Isso descreve um chat sem harness. Não descreve um loop com oráculo. Teste vermelho, tipo que não fecha, NF-e inválida, JSON que quebra o schema: o 0,01% não vira 10% em silêncio. Bate na parede e o sistema é obrigado a gerar de novo ou parar.

Humanos também erram com confiança. A diferença operacional não é “máquina mente, humano hesita”. É quem tem checagem barata e repetível.

O determinismo já entra no decode, não só depois, num script à parte

Sala escura com várias telas de código
A máscara de tokens não é um conselho. É um bitmask aplicado antes da amostra. Foto: Unsplash.

Isso não é teoria de blog. Está no código aberto que os serving stacks usam.

  • llguidance, Outlines, XGrammar e Guidance: compilam JSON Schema, regex ou gramática Lark num bitmask por token. Tokens ilegais recebem logit −∞. A amostra só ocorre no suporte permitido. Um JSON malformado deixa de ser um evento possível; vira um evento de probabilidade zero naquele passo.
  • Decode-time grammars (2026): a gramática não é só sintaxe fixa. Ela é instanciada no decode a partir do ambiente vivo: colunas do schema, funções da biblioteca, flags da linha de comando. Referência fantasma some por construção, não por sorte do prompt.
  • Compiled AI: o modelo roda uma vez na compilação; o runtime é código estático. Orquestração, retry e branch não passam mais por token. Qualquer LLM residual vira ferramenta limitada, com schema fixo.

Isso é determinismo interno ao pipeline de geração, não um script clássico grudado depois. Separar regra rígida de sampling continua sendo a disciplina certa. Essa separação já está dentro da pilha, não só como conselho futuro.

Astra não é GPT-3 com marketing

Formas abstratas de luz, azul e branco, sugerindo um modelo
O produto de fronteira é modelo mais ferramenta mais loop. A arquitetura interna fechada continua rumor até a ficha técnica. Foto: Unsplash.

A OpenAI descreve o GPT-6 Astra como sistema: pré-treino, reforço, alinhamento, ferramentas, monitoramento de trajetória e revisão automática no Codex. O resumo de segurança trata monitoramento de uso de ferramenta como camada da inferência, não como enfeite. Esforço extra, no uso real, compra mais iterações, verificação no browser e execução de código, não um parágrafo mais longo.

Sobre arquitetura interna, o cuidado importa. A imprensa reportou “recurrent depth”: o estado escondido passaria mais de uma vez pelo mesmo bloco antes do próximo token. A OpenAI não confirmou o desenho. Jakub Pachocki disse que a profundidade do grafo de computação de Astra está a no máximo o dobro da do GPT-4, e que a empresa continua monitorando a cadeia de pensamento. Tratar rumor como ficha técnica seria inflar o objeto do outro lado.

O que não é rumor:

  • o produto exposto não é um forward pass e um parágrafo;
  • o modelo escreve e executa código (sandbox, testes, browser);
  • há monitoramento de uso de ferramenta na inferência;
  • em avaliações com harness permissivo, o próprio modelo escreveu verificadores, comparando predição com observação.

Um preditor de token puro não constrói o próprio oráculo. Um sistema com loop constrói.

Erro composto descreve processo sem porta

O diagrama que assusta é este:

prompt → spec 0,01% torta → arquitetura torta → código em cima do erro → 10%

É verdadeiro para o fluxo “gerar e aprovar no olho”. É o mesmo risco de um júnior rápido sem integração contínua. Não é uma lei da estatística do Transformer.

Com porta, o diagrama vira:

proposta  --schema-->  candidato válido
         --teste-->    candidato que roda
         --humano-->   candidato que entra

Cada seta pode recusar. Recusa é determinística. A parte probabilística fica confinada à proposta.

A analogia da calculadora ainda vale, e fica incompleta se parar em “a máquina só faz conta”. A calculadora também devolve absurdo se a conta pedida for absurda. O matemático não some. Some a soma na mão. No software, o equivalente honesto não é trocar o engenheiro por uma API. É: o modelo propõe, o compilador e o teste julgam, o humano decide o que vira produção.

O que continua certo na crítica

  • Substituir pessoa por chamada de API, sem redesenhar o fluxo, é o jeito mais caro de falhar.
  • Caminho feliz de prompt não é produto: carga, falha de rede, fila, nota fiscal, regra da empresa.
  • Time que não sabe auditar transforma lente de aumento em acelerador de muro.
  • Regra que exige precisão estrita (saldo, imposto, autorização) deve viver em código clássico, não em sampling.
  • LLM pura, sem porta, continua sendo um gerador de forma. Bender tem razão sobre esse objeto. LeCun tem razão quando diz que autorregressão sozinha não é inteligência de nível humano.

Nada disso exige a tese “a base ainda é só predição de token, portanto o sistema inteiro é papagaio”. Essa tese mistura o mecanismo do decoder com o contrato do produto. Em 2021 os dois coincidiam. Em 2026, não.

A frase que substitui o meme

Não: “IA continua sendo um modelo probabilístico, independente do que se põe ao redor.”

Sim: o decoder ainda amostra. O sistema de fronteira já embute portas determinísticas no decode, na ferramenta e no oráculo. Quem ignora as portas herda o risco de 2021. Quem as usa não está substituindo o engenheiro por uma LLM. Está compilando proposta estatística em artefato checável.

Tratar Astra como GPT-3 é o espantalho certo: um argumento válido contra o objeto antigo, apontado para o objeto novo.

Referências

  1. Emily M. Bender, Timnit Gebru, Angelina McMillan-Major e Margaret Mitchell. On the Dangers of Stochastic Parrots. FAccT, 2021.
  2. Eliza Strickland. What Emily Bender Really Meant by Stochastic Parrots. IEEE Spectrum, 30 jun 2026.
  3. Margaret Mitchell. No, AI is not a Stochastic Parrot. 20 set 2026.
  4. Yann LeCun. LLMs autorregressivas, em si, não levam a inteligência humana. X, 20 set 2026.
  5. Gary Marcus. Astra não é uma LLM pura. X, 1 ago 2026.
  6. OpenAI. GPT-6 Astra e Safety overview. Set 2026.
  7. Jakub Pachocki. Profundidade do grafo de Astra. X, 2 set 2026.
  8. Guidance AI. llguidance e guidance.
  9. Dottxt. Outlines. MLC. XGrammar.
  10. Shuoming Zhang et al. Decode-Time Grammars. arXiv:2607.18357, 2026.
  11. Compiled AI. arXiv:2604.05150, 2026.
  12. Romain Pellerin. Yes, LLMs can be deterministic. But most hosted stacks are not. Lemma Ventures, set 2026.