Três coisas diferentes que a NVIDIA chama de "IA", e por que confundir elas custou uma madrugada
Essa noite (2026-08-23) tentamos usar uma chave de API da NVIDIA pra
gerar código e analisar imagem. Deu 401 Unauthorized em toda chamada
de verdade, mas /v1/models (só listar o catálogo) funcionava normal.
Chave nova, mesmo erro. Isso não era bug de configuração — era a gente
confundindo três produtos diferentes que a NVIDIA embrulha sob o mesmo
guarda-chuva de marketing.
As três coisas
1. build.nvidia.com (API hospedada, "playground") — você chama
integrate.api.nvidia.com/v1/chat/completions com uma chave, igual
chamaria a OpenAI. Isso é o que a gente assumiu que estava usando.
Só que essa API hospedada tem entitlement próprio (créditos/billing) que
uma chave "solta" nem sempre carrega — daí o 401 só na chamada real, não
na listagem (listar é metadado público, gastar é o que exige
permissão).
2. NIM (NVIDIA Inference Microservices) — containers que você baixa e roda na sua própria GPU (via Docker/NGC), não uma API na nuvem da NVIDIA. A chave de API aqui serve pra puxar o container, não pra inferir remotamente. É o caminho certo pros modelos de "Visual GenAI" que a gente queria usar pra imagem — mas exige VRAM real, e a Coruscant (RTX 2070, 8GB) provavelmente não cabe na maioria desses containers sem checar modelo por modelo antes.
3. "Skills" (build.nvidia.com/skills, NVIDIA/skills no GitHub) —
nem API nem container. É um catálogo de 344 pacotes de instrução
(estilo Skill do Claude Code) que ensinam um agente a operar as
ferramentas reais da NVIDIA: DeepStream (vídeo/vigilância em
datacenter), DOCA (rede de placa BlueField), NeMo (treino de modelo em
cluster), TAO (treino de classificador de imagem), Jetson (dispositivo
embarcado). É documentação executável pra ferramenta de infraestrutura
pesada — não é "chame essa API e receba uma resposta".
O padrão, generalizado
Isso não é picuinha de nomenclatura — é o mesmo tipo de confusão que aparece toda vez que uma empresa grande usa "IA" como guarda-chuva pra produtos com modelo de acesso completamente diferente:
- API hospedada = você paga por token, zero infra sua, mas dependente do provedor e sujeito a rate limit/billing.
- Container self-host = você paga em hardware/energia, roda offline, mas precisa da VRAM/CPU real e da operação de manter isso no ar.
- Catálogo de instrução (Skills) = não é modelo nenhum, é conhecimento estruturado sobre como usar as duas coisas acima direito -- só ajuda se você já resolveu qual das duas vai usar.
Confundir as três leva a exatamente o que aconteceu hoje: gastar tempo configurando a coisa errada (opencode + API hospedada) pro problema errado (precisava de container self-host), e só descobrir isso depois de duas chaves e vários 401.
O que isso muda pro nosso caminho
A gente não vai rodar um container NIM datacenter numa RTX 2070 de
notebook sem antes checar se ele cabe — isso é o mesmo tipo de
honestidade de escala que já apareceu no Artigo 2 sobre não treinar
671B de parâmetros numa GPU doméstica. O catálogo de Skills da NVIDIA
(as 344 instruções) é real e bem documentado, mas é ferramental de
datacenter/robótica/rede -- não é a peça que faltava pro problema de
imagem de hoje (recortar fundo branco de foto de mochila, classificar
qualidade de imagem). Pra isso, as ferramentas certas já estão
catalogadas no repo python (rembg/u2net offline, ou Cloudflare
Workers AI, que já roda sem infra própria) -- não precisava da NVIDIA
pra esse problema específico, e é bom ter isso separado com clareza em
vez de assumir "NVIDIA tem tudo, vamos usar NVIDIA pra tudo".
A lição real de engenharia, no espírito do James
(compute → descoberta → conhecimento → compressão → automação → menos
compute): antes de gastar computação (tempo, chamadas de API, tentativa
e erro) tentando fazer algo funcionar, vale a pergunta de 30 segundos
"isso é API hospedada, container self-host, ou só documentação sobre
como usar as duas?" -- é conhecimento barato que evita computação cara
depois.