Guia de IA Local
Rode IA de ponta no seu próprio hardware.
Privacidade total, zero custo por token. Do notebook zerado a um LLM rodando em cerca de 15 minutos.
Por que rodar IA localmente?
Privacidade
Seus prompts nunca saem da sua máquina.
Custo zero
Sem cobrança de API. Sem limites de uso.
Offline
Funciona no avião. Funciona sem internet.
Controle total
Escolha modelo, pesos e prompt de sistema.
Hardware necessário
| Tamanho | RAM mínima | GPU recomendada | Velocidade |
|---|---|---|---|
| 3B – 8B | 8 GB | Nenhuma / integrada | 20-50 tok/s CPU |
| 13B – 27B | 16 GB | 8 GB VRAM (RTX 3060) | 15-30 tok/s |
| 70B (quantizado) | 32-48 GB | 24 GB VRAM (RTX 4090 / M3 Max) | 10-20 tok/s |
| 405B | 64+ GB unificada | M3 Ultra ou 2x A100 | 5-10 tok/s |
Apple Silicon entrega muito acima da categoria por causa da memória unificada. Um M3 Max de 64 GB roda Llama 3.3 70B melhor que muitas GPUs gamer caras.
Quantização e GGUF
Um modelo 70B bruto tem cerca de 140 GB. Quantização reduz esse tamanho ao guardar pesos com menor precisão (4-bit, 5-bit, 8-bit), quase sem perda de qualidade na maioria das tarefas. O formato .gguf é o padrão da comunidade para modelos quantizados.
Uma boa opção padrão: Q4_K_M. Reduz o tamanho em ~4x preservando 98%+ da qualidade.
Escolha sua ferramenta de execução
Ollama
Instalação de uma linha. CLI + API. O padrão para hackers.
ollama.com
LM Studio
GUI bonita. Melhor opção para iniciantes.
lmstudio.ai
Open WebUI
Clone autohospedado do ChatGPT. Multiusuário.
openwebui.com
AnythingLLM
RAG + documentos em cima de modelos locais.
anythingllm.com
Início rápido de 15 minutos com Ollama
- 1Instale o Ollama em ollama.com. Há versões para macOS, Linux e Windows.
- 2Abra um terminal.
- 3Rode: ollama pull llama3.3 — isso baixa um modelo quantizado de cerca de 40 GB.
- 4Rode: ollama run llama3.3 — comece a conversar.
- 5Para uma UI tipo ChatGPT, instale o Open WebUI e aponte para localhost:11434.
Melhores modelos locais agora
DeepSeek: DeepSeek V3
Modelo de IA de DeepSeek disponível via OpenRouter.
DeepSeek: DeepSeek V3 0324
Modelo de IA de DeepSeek disponível via OpenRouter.
DeepSeek: DeepSeek V3.1
Modelo de IA de DeepSeek disponível via OpenRouter.
DeepSeek: R1
Modelo de IA de DeepSeek disponível via OpenRouter.
DeepSeek: R1 0528
Modelo de IA de DeepSeek disponível via OpenRouter.
DeepSeek: R1 Distill Llama 70B
Modelo de IA de DeepSeek disponível via OpenRouter.