Guia de IA Local

Rode IA de ponta no seu próprio hardware.

Privacidade total, zero custo por token. Do notebook zerado a um LLM rodando em cerca de 15 minutos.

Por que rodar IA localmente?

Privacidade
Seus prompts nunca saem da sua máquina.
Custo zero
Sem cobrança de API. Sem limites de uso.
Offline
Funciona no avião. Funciona sem internet.
Controle total
Escolha modelo, pesos e prompt de sistema.

Hardware necessário

TamanhoRAM mínimaGPU recomendadaVelocidade
3B – 8B8 GBNenhuma / integrada20-50 tok/s CPU
13B – 27B16 GB8 GB VRAM (RTX 3060)15-30 tok/s
70B (quantizado)32-48 GB24 GB VRAM (RTX 4090 / M3 Max)10-20 tok/s
405B64+ GB unificadaM3 Ultra ou 2x A1005-10 tok/s

Apple Silicon entrega muito acima da categoria por causa da memória unificada. Um M3 Max de 64 GB roda Llama 3.3 70B melhor que muitas GPUs gamer caras.

Quantização e GGUF

Um modelo 70B bruto tem cerca de 140 GB. Quantização reduz esse tamanho ao guardar pesos com menor precisão (4-bit, 5-bit, 8-bit), quase sem perda de qualidade na maioria das tarefas. O formato .gguf é o padrão da comunidade para modelos quantizados.

Uma boa opção padrão: Q4_K_M. Reduz o tamanho em ~4x preservando 98%+ da qualidade.

Escolha sua ferramenta de execução

Ollama
Instalação de uma linha. CLI + API. O padrão para hackers.
ollama.com
LM Studio
GUI bonita. Melhor opção para iniciantes.
lmstudio.ai
Open WebUI
Clone autohospedado do ChatGPT. Multiusuário.
openwebui.com
AnythingLLM
RAG + documentos em cima de modelos locais.
anythingllm.com

Início rápido de 15 minutos com Ollama

  1. 1Instale o Ollama em ollama.com. Há versões para macOS, Linux e Windows.
  2. 2Abra um terminal.
  3. 3Rode: ollama pull llama3.3 — isso baixa um modelo quantizado de cerca de 40 GB.
  4. 4Rode: ollama run llama3.3 — comece a conversar.
  5. 5Para uma UI tipo ChatGPT, instale o Open WebUI e aponte para localhost:11434.

Melhores modelos locais agora