Como montar uma IA local com Llama em CPU (sem GPU)
Opa, tudo bem? Aqui é a Sensei da GeHost 😊. Você quer rodar uma IA poderosa dentro do seu computador, sem gastar com a nuvem e sem precisar de uma placa de vídeo cara? Ótimo! Vou te ensinar a instalar o Llama — um modelo de IA aberto e rápido — rodando só na CPU. É mais tranquilo do que parece.
O que você vai conseguir fazer
Depois deste guia, você terá:
- Uma IA rodando 100% local no seu PC — nada sai para a nuvem.
- Poder fazer perguntas, gerar textos, brainstorm de ideias — tudo offline.
- Um sistema que respeita sua privacidade (seus dados não saem do seu computador).
Pré-requisitos: O que você precisa ter
Antes de começar, vamos checar se tudo está pronto:
- Computador com processador OK: Qualquer CPU moderna (Intel/AMD dos últimos 5 anos) funciona. Quanto mais núcleos, melhor — mas o seu provavelmente já é bom.
- RAM: Mínimo 8 GB (recomendado 16 GB ou mais). Quanto mais RAM, mais rápido o Llama roda.
- Espaço em disco: ~10 GB livres para o modelo e as ferramentas.
- Windows, Mac ou Linux: O Llama roda em todos. Aqui vou mostrar pra Windows e Mac (Linux tem variações, mas o padrão é semelhante).
💡 Dica: Se seu computador tem menos de 8 GB de RAM, ainda dá pra tentar, mas vai ficar mais lento. Considere fechar outros programas enquanto usa a IA.
Passo 1: Instale o Ollama (o "gerenciador" do Llama)
O Ollama é a ferramenta que torna tudo fácil — ele baixa, instala e roda o Llama pra você, sem precisar digitar comandos chatos.
No Windows:
- Abra o navegador e vá em ollama.ai (ou ollama.com).
- Clique em "Download" e baixe a versão Windows.
- Abra o instalador (arquivo .exe) e clique em "Next" / "Instalar".
- Deixe tudo como está e finalize — o Ollama vai se instalar no seu PC.
- Abra o "Prompt de Comando" (aperte Windows + R, digite cmd e clique OK).
No Mac:
- Vá em ollama.ai e baixe a versão macOS.
- Abra o arquivo .dmg (vai aparecer uma janela) e arraste o ícone do Ollama pra "Applications".
- Abra o "Terminal" (procure em "Applications > Utilities > Terminal").
Passo 2: Baixe e rode o Llama
Agora vem o mais legal — com uma única linha, o Ollama vai baixar e rodar o Llama:
No Prompt de Comando (Windows) ou Terminal (Mac/Linux), digite:
ollama run llama2
Aperte Enter e espere. Vai aparecer algo assim:
- Mensagem dizendo que está baixando o modelo (pode levar 5-15 min, dependendo da sua internet).
- Depois, uma linha começando com
>>>— é ali que você digita suas perguntas!
⏳ Paciência: Na primeira vez, o download do modelo é grande. Deixa rodar. Depois que termina, fica tudo rápido e offline.
Passo 3: Teste a IA — faça sua primeira pergunta
Quando aparecer o >>>, você está pronto para conversar com a IA! Digite uma pergunta simples:
>>> Qual é a capital da França?
Aperte Enter e espere a IA responder. Ela vai levar alguns segundos (em CPU é normal ser mais lenta que em GPU), mas vai responder.
Pronto! Você já está rodando uma IA local. Tipo assim:
- "Escreve um poema sobre café" — a IA escreve.
- "Como faço um bolo de chocolate?" — a IA ensina.
- "Resuma este texto" — você cola um texto e ela resume.
Passo 4 (Opcional): Use a IA via interface gráfica
Se você preferir não digitar no terminal, tem ferramentas visuais (com botões e caixas de texto) que funcionam com o Ollama:
- LM Studio: Interface linda e fácil. Baixa em lmstudio.ai — baixa o Ollama junto, coloca o Llama e já roda visual.
- Herd (também chamado Herd): Aplicativo desktop simples.
Se for usar uma dessas interfaces, o processo é parecido: você instala, aponta para o Ollama (ou ela já vem com tudo pronto) e é só clicar no modelo e começar a conversar.
Dicas de Ouro para não travar e rodar rápido
🚀 Otimize a performance:
- Feche programas pesados (navegador com 50 abas abertas, Photoshop, tudo) — quanto menos rodar junto, mais RAM o Llama tem.
- Use modelos menores se ficar lento:
ollama run mistralouollama run neural-chatsão mais rápidos que o llama2. Se ainda ficar lento, tenteollama run orca-mini(bem mais leve).- Aumente o contexto devagar: No começo, não tente conversas de 100 mensagens de volta — quanto mais você conversa, mais memória ela usa. Deixa ela "esquecer" (saia e comece de novo) quando a conversa fica muito longa.
- Se tiver SSD, melhor: O Ollama usa disco pra cache; SSD é muito mais rápido que HD tradicional.
Troubleshooting: E se não funcionar?
Problema: "Comando ollama não encontrado" ou "ollama: command not found"
- Solução: O Ollama não está no PATH. Tente reiniciar o terminal ou o PC. Se ainda não funcionar, vá até a pasta de instalação do Ollama e procure o arquivo executável (em Windows é algo como
C:\Users\seu_usuario\AppData\Local\Programs\Ollama).
Problema: "Não consigo baixar o modelo" ou "conexão lenta"
- Solução: A internet está fraca ou o servidor do Ollama está congestionado. Espera mais um pouco ou tenta em outro horário. Se estiver realmente demorando (mais de 30 min pra download de 4 GB), reinicia o comando.
Problema: "A IA está MUITO lenta" ou "trava"**
- Solução (1): Seu PC não tem RAM suficiente. Fecha programas. Se estiver com ~4 GB livres, tente um modelo menor:
ollama run orca-mini. - Solução (2): CPU está no limite. É normal em processadores antigos. Tenta usar em horários onde outros programas não estão rodando.
- Solução (3): Aumenta o tamanho da memória alocada. (Avançado — procura "OLLAMA_NUM_THREAD" na web se quiser tunar.)
Problema: "Reinstalei o Ollama e perdeu o modelo"
- Solução: O Ollama não perdeu — só precisa baixar de novo. Digita
ollama run llama2de novo; se o modelo estiver em cache, entra rápido.
Próximos passos: Levando mais adiante
Agora que você tem a IA local rodando, aqui tem algumas ideias legais:
- Integre em seus scripts: A IA via Ollama tem uma API local (porta 11434 por padrão) — você pode chamar dela por código Python, Node, etc.
- Brinque com outros modelos:
ollama run neural-chat,ollama run falcon— cada um é bom pra uma coisa. - Crie prompts personalizados: Use a IA pra tarefas específicas — resumir relatórios, gerar ideias de post, revisar texto, etc.
🎓 Aprofunde-se: Se ficar curioso sobre como a IA funciona por baixo (transformer, tokens, fine-tuning), tem material gratuito online — mas por agora, já é sucesso ter a IA rodando!
Resumindo: Você fez isso!
Parabéns — você acabou de montar uma IA profissional rodando 100% local no seu PC. Sem cloud, sem assinatura, sem pagar por API. É poderoso, é seu, e é offline.
Se tiver dúvida, trava em algo ou quer ajuda pra integrar em um projeto maior (tipo um site hospedado na GeHost que chama a IA local), entre em contato com nosso suporte — a gente ajuda a conectar tudo.
Boa sorte e divirta-se explorando! 🚀