Glossário

As palavras do sistema, não do anúncio.

Token, encoding, Transformer, decoding, harness. O que cada um é, e o que não é. Definição curta, para ler no meio de um artigo sem perder o fio.

Texto

Token

Pedaço de texto que o modelo lê e escreve. Não é uma palavra. "encoding" pode ser um token; "transformador" pode ser três. O vocabulário é fixo: tudo o que o modelo diz é uma sequência desses pedaços.

Tokenização

O corte do texto cru em tokens, antes de qualquer rede. É determinístico: o mesmo texto, o mesmo tokenizador, a mesma lista de ids.

Ver também TokenEncoding

Encoding

Transformar a entrada numa representação numérica que a rede consome. Não é criptografia. O primeiro encoding é o id do token virando um embedding. Num Transformer com encoder, encoding também é o trabalho do encoder: ler a sequência inteira e devolver um estado.

Embedding

Vetor de números que representa um token. Tokens parecidos no treino ficam próximos nesse espaço. É uma tabela aprendida: id entra, vetor sai.

Ver também EncodingToken

Arquitetura

Encoder

Bloco que lê a entrada inteira e devolve representações. A tradução clássica usava encoder mais decoder. A LLM de chat, no estilo GPT, não tem encoder: é só decoder.

Transformer

Arquitetura de 2017 baseada em atenção, sem recorrência obrigatória. Quase toda LLM atual é um Transformer só de decoder: uma pilha de camadas que, a cada passo, prevê o próximo token.

Atenção

Cada token olha os outros e mistura a informação com pesos. Self-attention é a sequência olhando para si mesma. O peso não é fixo: depende do que está escrito agora.

Camada

Um bloco repetido, em geral atenção e uma rede pequena. Profundidade é quantas vezes esse bloco empilha. Mais camadas não são, sozinhas, mais entendimento.

Ver também TransformerPesos

Decoder

Bloco que produz o próximo token. Numa LLM autorregressiva ele só olha o que já foi escrito, nunca o futuro da frase.

Autorregressivo

O modelo gera um token, cola esse token na entrada e gera o seguinte. A saída de agora vira contexto de depois. É por isso que um erro no meio contamina o resto, se ninguém checa.

Contexto

Tudo o que o modelo enxerga antes de escolher o próximo token: pedido, histórico, trechos de ferramenta, regras coladas no prompt.

Janela de contexto

O máximo de tokens que cabem de uma vez. O que fica de fora não existe para aquele passo. Memória de longo prazo, quando existe, é um sistema ao redor, não a janela.

Ver também ContextoKV cache

KV cache

Memória dos cálculos de atenção dos tokens já vistos. Evita refazer a sequência inteira a cada token novo. É otimização de inferência, não um novo tipo de raciocínio.

Geração

Logit

Pontuação crua de cada token do vocabulário, antes de virar probabilidade. Ainda não soma 1. Uma máscara determinística zera o logit dos tokens ilegais.

Softmax

Função que transforma logits em probabilidades que somam 1. É aqui que a pontuação vira sorteio possível.

Ver também LogitTemperature

Decoding

A escolha do próximo token a partir das probabilidades. Pode ser gulosa (sempre o maior) ou amostrada. Não confundir com o bloco decoder: decoding é o passo de decidir, decoder é a rede.

Sampling

Sorteio do próximo token segundo a distribuição. É a parte probabilística. Com porta (teste, schema, compilador), o sorteio fica só na proposta.

Temperature

Controle que afina ou achata a distribuição antes do sorteio. Perto de zero, sai quase sempre o token mais provável. Alta, a cauda entra. Zero não torna uma API hospedada bit a bit reprodutível.

Ver também SamplingSoftmax

Treino

Pré-treino

Treino longo para prever o próximo token em muito texto. Nasce o modelo base: pesos que comprimem padrões da língua e do código.

Ver também Pós-treinoPesos

Pós-treino

O que vem depois do base: instrução, preferência, reforço. Muda o que o modelo prefere fazer com um pedido. Não apaga o fato de que a geração ainda é token a token.

Ver também Pré-treinoPesos

Pesos

Os números aprendidos. Eles são o modelo. Um prompt não altera peso. Só um treino, ou um ajuste, altera.

Inferência

Usar o modelo já treinado para gerar. Não é treino. É aqui que entram cache, máscara, ferramenta e oráculo.

Ver também PesosHarness

Sistema

Prompt

O texto do pedido, mais o que o sistema colou junto: regras, histórico, saída de ferramenta. É contexto, não um programa. Regra que precisa ser exata não deveria viver só aqui.

Ver também ContextoHarness

Harness

O programa ao redor do modelo: ferramentas, loop, permissão, memória, quando parar. Astra com sandbox não é o Transformer nu. O harness é essa diferença.

Máscara

Restrição aplicada no decode. Um schema, uma gramática ou uma lista de funções vira um conjunto de tokens permitidos. O que está fora recebe probabilidade zero.

Schema

Contrato da forma da saída: campos, tipos, enums. Com decoding restrito, JSON inválido deixa de ser um acidente e passa a ser impossível naquele passo.

Ver também MáscaraOráculo

Oráculo

Checagem que diz passou ou falhou sem opinar: teste, compilador, prova, saldo, schema. É a porta. Sem ela, o próximo token trata o erro anterior como verdade.