← TODOS OS ARTIGOS
Artigo 4

Até onde as LLMs podem chegar?

De “papagaios probabilísticos” a sistemas com memória, ferramentas, seleção, verificação e capacidade de agir.

Thiago Patzdorf  ·  15 min de leitura

Quando alguém pergunta “até onde uma LLM pode chegar?”, normalmente está misturando três perguntas diferentes:

  1. Existe um limite matemático para esse tipo de máquina?
  2. Existe um limite prático para a arquitetura e o treinamento que usamos hoje?
  3. Mesmo que o modelo isolado tenha limites, um sistema com memória, ferramentas, verificadores e agentes pode ultrapassá-los?

Essas perguntas não têm a mesma resposta.

A resposta curta, em 2026, é:

não conhecemos um teto cognitivo próximo e bem definido para LLMs. Mas conhecemos limites reais de confiabilidade, generalização, memória, dados, compute e execução de tarefas longas. Alguns são fundamentais. Outros parecem apenas fronteiras móveis de engenharia.

Isso é diferente de dizer que “LLMs são ilimitadas”. Elas não são. Nenhum computador é.

Mas também é diferente de dizer que “é só autocomplete e daqui não passa”.

Delta de rio visto do alto, com canais ramificados
Complexidade não precisa nascer pronta. Ela pode emergir por caminhos, feedback e seleção.Foto: Cosmin Andrei Buzamat · Unsplash

1. O modelo não é o sistema

Uma LLM pura recebe tokens e produz uma distribuição sobre o próximo token.

Essa descrição está correta.

Mas ela descreve o núcleo generativo.

Não descreve necessariamente o sistema que usamos.

Hoje, o que chamamos informalmente de “IA” pode ser uma composição de:

  • modelo;
  • memória;
  • busca;
  • ferramentas;
  • navegador;
  • execução de código;
  • banco de dados;
  • políticas;
  • verificadores;
  • retries;
  • subagentes;
  • feedback do mundo real.
Modelo ≠ sistema
LLM puratokens → distribuição → tokens
→
memória
busca
ferramentas
políticas
modelo
verificadores
estado
subagentes
feedback
A geração pode ser probabilística enquanto partes do runtime são determinísticas ou verificáveis.

O modelo pode continuar probabilístico.

O compilador não precisa ser.

O teste unitário não precisa ser.

Uma constraint SQL não precisa ser.

Um checksum não precisa ser.

Uma chamada que consulta o saldo real em uma API não precisa ser.

Uma política que bloqueia deploy depois de um teste falhar não precisa ser.

Então existe uma distinção essencial:

o cérebro generativo pode ser probabilístico sem que todo o organismo computacional precise ser probabilístico.

Essa frase é importante porque muda a unidade de análise.

Se eu quero estudar o limite do modelo, analiso o modelo.

Se eu quero estudar o limite do produto ou do agente, preciso analisar o sistema inteiro.


2. Astra, Opus 5.5 e o limite da metáfora do “papagaio”

A expressão “papagaio estocástico” foi importante para chamar atenção para riscos de escala, linguagem plausível e antropomorfização de modelos.

Fonte: Bender et al. — On the Dangers of Stochastic Parrots

Mas usar essa metáfora como descrição completa dos sistemas de 2026 já produz outro erro.

Project Astra, por exemplo, não é apresentado pelo Google DeepMind apenas como um modelo textual.

É um protótipo de assistente universal com percepção multimodal, memória e capacidade de usar ferramentas como Search, Gmail, Calendar, Maps e controle de interfaces.

Fonte: Google DeepMind — Project Astra

Já Claude Opus 5.5 precisa de uma distinção ainda mais cuidadosa.

Opus 5.5 é o modelo.

Então dizer “Opus 5.5 não é uma LLM” seria tecnicamente impreciso.

Mas os sistemas agentic que o usam não se resumem a uma chamada isolada ao modelo. A própria Anthropic descreve Opus 5.5 em workloads com múltiplas ferramentas, subagentes e memória em sessões longas.

Fonte: Anthropic — Claude Opus 5.5

Isso não prova que existam “módulos determinísticos secretos dentro dos pesos”.

Nem precisamos supor isso.

O ponto observável é outro:

o sistema pode cercar o modelo com componentes cujo comportamento é muito mais restrito, verificável ou determinístico do que a geração de linguagem.

Chamar tudo isso de “papagaio” é parecido com olhar para um avião moderno, apontar para a turbina e dizer:

“É só combustão.”

É verdade sobre uma parte.

É insuficiente para explicar a máquina.


3. Da evolução biológica à engenharia de agentes

Aqui aparece uma analogia que eu considero mais útil.

A evolução biológica não “pensa” antes de produzir uma forma.

Ela trabalha com algo parecido com:

variação → seleção → retenção

Em sistemas agentic, podemos construir um ciclo análogo:

geração → teste → seleção → persistência

Cogumelos e micélio em uma floresta
Na natureza, redes persistem porque carregam informação e estrutura adiante.Foto: Rohit Tandon · Unsplash
Analogia evolutiva
01
Variaçãoo modelo produz alternativas
02
Seleçãotestes e ambiente eliminam falhas
03
Retençãoa solução vira memória, código ou regra
04
Nova capacidadeo próximo ciclo parte de uma base melhor
Analogia de arquitetura — não afirma evolução biológica literal nem alteração automática dos pesos.

O modelo gera cinco hipóteses.

O ambiente elimina quatro.

A quinta passa nos testes.

Depois a solução pode ser retida como:

  • código;
  • regra;
  • cache;
  • memória;
  • índice;
  • pipeline;
  • teste;
  • ferramenta.

Na próxima execução, o sistema talvez nem precise “pensar” novamente naquela parte.

A descoberta cara virou estrutura barata.

Isso não é evolução darwiniana literal.

Não existe necessariamente reprodução diferencial de organismos, mutação genética ou mudança autônoma dos pesos.

É uma analogia de arquitetura.

Mas ela captura uma propriedade interessante:

um sistema pode converter exploração probabilística em estrutura persistente.

E, quando faz isso repetidamente, o comportamento global começa a parecer menos com “gerar texto” e mais com adaptação operacional.


4. Entropia: inteligência como produção local de ordem

A palavra entropia precisa ser usada com cuidado.

Entropia termodinâmica e entropia de informação são conceitos relacionados historicamente e matematicamente, mas não são a mesma coisa.

Também não existe nenhuma violação da segunda lei da termodinâmica quando a vida ou uma máquina cria ordem local.

Sistemas vivos são sistemas abertos: mantêm organização consumindo energia e exportando entropia para o ambiente.

Schrödinger explorou essa ideia em What Is Life?, ao perguntar como organismos conseguem permanecer organizados longe do equilíbrio.

Fonte: Schrödinger e a questão da organização da vida

Dunas com padrões formados pelo vento
Ordem local pode emergir de fluxo, energia e restrições — sem violar a termodinâmica.Foto: Rafael Peier · Unsplash
Incerteza → computação → estrutura
→
Esquema conceitual. “Entropia” aqui é usada como metáfora operacional de incerteza/organização, não como equivalência literal entre informação e termodinâmica.

Como metáfora de engenharia, isso é poderoso.

Um sistema de IA recebe:

  • dados dispersos;
  • ambiguidade;
  • possibilidades;
  • ruído;
  • hipóteses incompatíveis.

E gasta:

  • energia;
  • compute;
  • tokens;
  • tempo;
  • chamadas de ferramentas.

Para produzir:

  • compressão;
  • estrutura;
  • decisão;
  • código;
  • plano;
  • automação.

Não é correto dizer que a LLM “reduz a entropia do universo”.

Mas é útil dizer que ela pode reduzir incerteza operacional local ao custo de computação.

Essa é uma forma mais interessante de pensar inteligência do que simplesmente contar parâmetros.


5. De von Neumann à máquina que constrói ferramentas para si

Décadas antes de LLMs, John von Neumann estudou formalmente a ideia de autômatos auto-reprodutores: máquinas capazes, em modelos abstratos, de construir outras máquinas a partir de uma descrição.

Sua obra foi publicada postumamente em 1966.

Fonte: John von Neumann — Theory of Self-Reproducing Automata

Isso não significa que um agente de software atual seja um autômato auto-reprodutor de von Neumann.

Não é.

Mas existe uma ligação conceitual fascinante.

Uma máquina que:

  1. escreve uma ferramenta;
  2. testa a ferramenta;
  3. adiciona a ferramenta ao próprio ambiente;
  4. usa essa ferramenta em tarefas futuras;

mudou a própria superfície operacional.

Autoextensão fraca
modelo propõe ferramenta
→
teste + gate validam
→
ambiente ganha nova capacidade
Isso não é autorreprodução de von Neumann nem recursive self-improvement ilimitado. É mudança persistente da superfície operacional.

Se ela também cria testes, índices, documentação, memória e automações, parte do raciocínio de hoje pode virar infraestrutura de amanhã.

Essa é uma forma fraca de autoextensão.

Não é uma explosão de inteligência automática.

Não é recursive self-improvement ilimitado.

Mas também não é apenas “responder perguntas”.


6. Os limites absolutos existem

Agora podemos separar o que realmente não dá para escapar.

LLMs são executadas em computadores.

Logo, estão sujeitas aos mesmos limites fundamentais da computação.

Existem problemas indecidíveis. O exemplo clássico é o problema da parada: não existe algoritmo geral capaz de determinar corretamente, para todo programa possível, se ele terminará ou rodará para sempre.

Isso não é um defeito de Transformers.

É um limite de qualquer sistema computacional geral.

Também existem problemas computáveis cujo custo pode crescer rápido demais para ser útil.

Tempo, memória, energia e informação continuam importando.

Esses são limites reais.

Mas são limites muito mais amplos do que “LLMs não conseguem raciocinar”.


7. Transformers não parecem ter um teto computacional simples

Existem resultados teóricos mostrando que variantes de Transformers com Chain-of-Thought e memória ou contexto suficiente podem simular computação geral.

Um trabalho de 2025, Constant Bit-size Transformers Are Turing Complete, apresenta uma construção teórica em que um Transformer de tamanho constante pode simular uma máquina de Turing quando dispõe de contexto suficientemente longo.

Fonte: Li & Wang — Constant Bit-size Transformers Are Turing Complete

Outro trabalho de 2025 estende resultados de completude de Turing para Transformers com softmax em determinadas construções de Chain-of-Thought.

Fonte: Softmax Transformers are Turing-Complete

Isso precisa ser interpretado com cuidado.

Turing-complete não significa inteligente.

Não significa que um modelo treinado vai aprender qualquer algoritmo.

Não significa eficiência.

Não significa generalização.

Não significa confiabilidade.

Um notebook comum também é computacionalmente universal e nem por isso descobre sozinho uma nova teoria física.

O que esses resultados impedem é uma conclusão simplista:

não existe um teto computacional trivial conhecido que reduza Transformer a “autocomplete superficial”.

A distância entre poder representar um algoritmo e aprender e executar esse algoritmo de forma robusta continua gigantesca.

É provavelmente nessa distância que moram muitos dos limites reais.


8. O grande limite atual: confiabilidade em cadeias longas

Uma LLM pode acertar algo extremamente difícil e errar algo aparentemente trivial cinco minutos depois.

Uma revisão de 2026 sobre falhas de raciocínio organiza essas falhas em limitações fundamentais, específicas de domínio e de robustez.

Fonte: Song, Han & Goodman — Large Language Model Reasoning Failures

Em tarefas de muitos passos, pequenos erros importam muito.

Como ilustração matemática, imagine que cada passo tivesse sucesso independente com probabilidade p.

Depois de n passos, a chance de uma cadeia inteira perfeita seria aproximadamente p elevado a n.

Exemplo matemático: p elevado a n
10 passos
95%/passo → 59,9%
99%/passo → 90,4%
50 passos
7,7%
60,5%
100 passos
0,59%
36,6%
Ilustração sob hipótese simplificadora de erros independentes. Agentes reais podem ter correlação de erro, retries e verificadores.

Isso não é um modelo realista completo dos agentes — os erros não são independentes.

Mas mostra por que uma diferença aparentemente pequena entre 95% e 99% por etapa pode explodir quando a tarefa fica longa.

Um trabalho sobre execução de longo horizonte observou ainda um efeito de self-conditioning: erros anteriores no contexto podem aumentar a chance de novos erros.

Fonte: Sinha et al. — The Illusion of Diminishing Returns

Então existe um limite atual muito concreto:

saber executar cada passo não implica conseguir encadear milhares de passos com confiabilidade suficiente.


9. Só que o horizonte das tarefas está aumentando

A METR mede o chamado task-completion time horizon: o comprimento das tarefas, medido pelo tempo que um profissional humano levaria, que agentes conseguem concluir com determinado nível de sucesso.

No estudo publicado em 2025, a tendência histórica de seis anos mostrou uma duplicação do horizonte em aproximadamente sete meses.

Fonte: METR — Measuring AI Ability to Complete Long Software Tasks

METR · horizonte de tarefas
≈7meses por duplicação na tendência histórica de 6 anos publicada em 2025
Curva ilustrativa da tendência, não reprodução dos pontos individuais da METR.

A própria METR alerta que isso não significa literalmente “quantas horas a IA fica funcionando sozinha”.

É uma métrica calibrada à dificuldade e ao tempo humano das tarefas.

Mas ela mostra algo importante:

a fronteira de execução de longo horizonte não está estacionada.


10. “Scaling acabou” ainda é uma afirmação prematura

Existe evidência de retornos decrescentes.

Um estudo da ACL 2025 analisou mais de 400 modelos e encontrou regimes de sub-scaling, especialmente quando qualidade e diversidade de dados não acompanham o aumento de recursos.

Fonte: Chen et al. — Revisiting Scaling Laws for Language Models

Mas retorno marginal menor em uma métrica curta não significa necessariamente retorno marginal pequeno no sistema inteiro.

Se uma melhoria pequena aumenta a confiabilidade por passo, ela pode multiplicar o comprimento de uma tarefa executável.

Então duas coisas podem ser verdade ao mesmo tempo:

há retornos decrescentes em certos eixos de escala;

e

pequenos ganhos locais podem gerar grandes ganhos sistêmicos.


11. Mais “pensamento” ajuda — mas não infinitamente

Outra dimensão é o compute durante a inferência.

Podemos dar ao sistema:

  • mais tokens;
  • múltiplas tentativas;
  • busca paralela;
  • feedback externo;
  • compactação de contexto;
  • verificadores;
  • oportunidade de revisar uma solução.

Um estudo de 2026 encontrou melhorias substanciais em benchmarks difíceis quando aumentava ou reorganizava compute durante a inferência.

Fonte: How Inference Compute Shapes Frontier LLM Evaluation

Mas “pensar mais” não é uma função monotônica perfeita.

Em alguns regimes, cadeias maiores pioram resultado e estratégias paralelas funcionam melhor.

Fonte: Zeng et al. — Revisiting the Test-Time Scaling of o1-like Models

O problema não é apenas quanto compute.

É como alocá-lo.


12. Alucinação continua sendo um limite real

Modelos de linguagem ainda inventam fatos.

E isso não desaparece simplesmente porque o modelo ficou maior.

Em 2025, a OpenAI publicou uma análise argumentando que parte da persistência de alucinações vem dos incentivos do treinamento e da avaliação: muitas vezes é melhor, para o score, chutar do que admitir incerteza.

Fonte: OpenAI — Why language models hallucinate

Um modelo pode aprender a se abster.

Pode consultar fontes.

Pode usar ferramentas.

Pode pedir evidência.

Mas existe uma diferença entre:

gerar a resposta mais plausível

e

provar que ela corresponde ao estado real do mundo.

É por isso que sistemas confiáveis empurram tarefas para fora do modelo:

  • saldo → banco;
  • código → compilador;
  • comportamento → teste;
  • identidade → autenticação;
  • estado → API;
  • prova → verificador;
  • realidade física → sensor.

Quanto mais o mundo consegue responder de volta, menos o modelo precisa imaginar o mundo.


13. Generalização: a fronteira é irregular, não inexistente

Ainda existem evidências de fragilidade fora da distribuição.

Experimentos com matemática mostram aumento de erros quando valores saem dos regimes mais familiares.

Fonte: Shrestha, Kim & Ross — Mathematical Reasoning in Large Language Models

Ao mesmo tempo, estudos recentes em raciocínio sobre código encontram generalização significativamente mais forte em modelos novos do que em gerações anteriores.

Fonte: Yang et al. — Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning

Portanto, “LLMs não generalizam” é forte demais.

A afirmação mais defensável é:

LLMs generalizam em vários regimes, mas essa generalização ainda é irregular, difícil de prever e vulnerável a mudanças que humanos podem considerar pequenas.

Isso é um limite sério.

Mas não sabemos se é um teto.


14. Memória e aprendizado contínuo ainda são problemas

Um humano não precisa ser retreinado do zero para incorporar um fato novo.

Modelos ainda têm uma separação desconfortável entre:

  • o que está nos pesos;
  • o que está no contexto;
  • o que está numa memória externa.

Continual learning continua sendo uma área aberta, inclusive por causa de catastrophic forgetting.

Fonte: Shi et al. — Continual Learning of Large Language Models

Hoje contornamos isso com arquitetura:

LLM + banco vetorial + banco relacional + arquivos + histórico + ferramentas + retrieval.

Funciona.

Mas é diferente de um organismo que incorpora experiência continuamente aos próprios modelos internos sem degradar o passado.


15. Contexto grande não é memória perfeita

“Se o contexto tiver milhões de tokens, memória está resolvida.”

Não necessariamente.

O trabalho Lost in the Middle mostrou que caber no contexto não significa usar todas as informações com a mesma qualidade.

Fonte: Liu et al. — Lost in the Middle

Modelos novos melhoraram muito.

Mas a distinção continua:

armazenar tokens não é o mesmo que recuperar e raciocinar perfeitamente sobre todos eles.


16. Dados e compute encontram paredes

A Epoch AI estimou que o estoque efetivo de texto público humano de alta qualidade pode se tornar um gargalo relevante conforme o consumo de dados de treinamento cresce.

Fonte: Epoch AI — Will we run out of data?

Isso não significa “acabou a IA”.

Existem dados sintéticos, multimodalidade, ambientes, self-play, dados privados e interação com o mundo.

O gargalo pode migrar de quantidade para qualidade e experiência nova.

Compute também encontra paredes.

Treinamento distribuído extremo esbarra em memória, largura de banda, latência, sincronização, energia e movimentação de dados.

Fonte: Epoch AI — Data movement bottlenecks to large-scale model training

Esses são limites reais.

Mas muitos são limites tecnológicos da implementação dominante — não provas de um teto da inteligência possível.


17. Três tipos de limite

Talvez a melhor forma de organizar tudo seja esta.

Onde o teto pode estar
Fundamental

computabilidade, física, energia, informação, complexidade

Arquitetural

memória, generalização, horizonte, aprendizado contínuo

Sistêmico

ferramentas, verificadores, agentes e runtime podem deslocar este limite

Limites fundamentais

Não desaparecem com engenharia melhor:

  • indecidibilidade;
  • recursos físicos finitos;
  • energia;
  • velocidade de comunicação;
  • informação disponível;
  • complexidade computacional.

Limites da arquitetura e do treinamento atuais

Podem ou não exigir outro paradigma:

  • generalização irregular;
  • aprendizado contínuo;
  • erros em cadeias longas;
  • calibração de incerteza;
  • uso imperfeito de contexto;
  • planejamento de horizonte muito longo.

Limites do produto “LLM puro”

Esses já estão sendo atacados por sistemas:

  • fato atual → busca;
  • memória → banco;
  • cálculo → interpretador;
  • código → compilador;
  • ação → ferramenta;
  • estado → API;
  • prova → verificador;
  • tarefa longa → agente, checkpoints e subagentes.

Talvez perguntar “qual é o limite da LLM?” esteja ficando parecido com perguntar:

qual é o limite da CPU?

A CPU importa.

Mas o computador é mais do que a CPU.


18. O que provaria que chegamos perto do teto?

Eu começaria a acreditar num teto próximo se observássemos simultaneamente:

  1. scaling de treinamento parando de melhorar capacidade real mesmo com dados e alocação otimizados;
  2. test-time compute deixando de ampliar a fronteira;
  3. novos sistemas deixando de aumentar o horizonte de tarefas;
  4. generalização fora da distribuição estacionando por várias gerações;
  5. memória, ferramentas e feedback deixando de corrigir falhas persistentes;
  6. resultados teóricos explicando por que esses bloqueios não são apenas de otimização ou engenharia.

Não temos esse conjunto de evidências hoje.

Temos retornos decrescentes.

Temos limites de hardware.

Temos alucinação.

Temos fragilidade.

Temos problemas de memória.

Mas também vemos progresso nesses mesmos eixos.


19. Até onde elas podem chegar?

A resposta mais precisa que consigo dar hoje é:

mais longe do que um chatbot.

menos longe do que uma máquina onisciente.

E provavelmente o objeto que chegar mais longe nem será uma “LLM” isolada.

Será um sistema.

Um núcleo probabilístico cercado por memória, ferramentas, estado, feedback, seleção, verificação e capacidade de agir.

A biologia oferece uma metáfora útil:

variação sem seleção é ruído.

seleção sem memória não acumula.

memória sem energia não opera.

Em sistemas de IA:

geração sem verificação é fragilidade.

verificação sem persistência repete trabalho.

persistência transforma descoberta em capacidade.

Talvez Transformers continuem sendo o núcleo.

Talvez sejam substituídos.

Talvez sobrevivam como uma camada entre várias.

Ainda não sabemos.

A posição intelectualmente segura não é dizer que LLMs não têm limite.

Também não é escolher um limite atual e tratá-lo como lei da natureza.

É medir.

E continuar separando:

impossível

de

ainda não sabemos fazer.

Essa diferença pode ser uma das perguntas mais importantes da computação nas próximas décadas.