Como rodar um modelo de IA local com Ollama (CPU)
Oi! 👋 Sou a Sensei da GeHost. Esse guia é pra você que quer brincar com inteligência artificial sem depender de serviços na nuvem, sem mandar seus dados pra servidor nenhum — tudo rodando direto no seu computador. Parece coisa de ficção científica, mas é bem mais simples do que parece. Vem comigo! 😊
O que é Ollama?
Ollama é uma ferramenta que deixa você rodar modelos de IA diretamente no seu PC — sem internet, sem nuvem, sem terceiros vendo seus dados. Pense nela como um "gerenciador de IAs" que você instala e pronto: você tem seu próprio assistente IA rodando localmente, 24/7, offline se quiser.
A grande vantagem? Privacidade total (tudo fica no seu disco) e sem custo mensal (você só precisa da eletricidade do seu PC). A desvantagem é que modelos grandes precisam de mais poder — mas relaxa, dá pra rodar coisa bem útil em qualquer computador moderno.
Requisitos mínimos
Pra rodar Ollama com CPU (processador), você vai precisar de:
- Processador: qualquer um moderno (Intel i5+ ou AMD Ryzen 5+); quanto melhor, mais rápido.
- RAM: mínimo 8 GB (ideal 16 GB pra modelos maiores).
- Disco: uns 5-20 GB livres (depende dos modelos que instalar).
- Sistema: Windows, macOS ou Linux — Ollama roda em tudo.
💡 Dica: Não precisa de placa gráfica especial (GPU). CPU é o suficiente. Mas se tiver GPU NVIDIA ou Apple Silicon, Ollama usa automaticamente — e fica muito mais rápido!
Passo 1: Baixar e instalar Ollama
- Abra o navegador e vá pro site oficial do Ollama (busque "ollama" no Google).
- Clique em Download e escolha a versão pro seu sistema (Windows, macOS ou Linux).
- Execute o instalador e siga as instruções — é bem comum, tipo instalar qualquer outro programa.
- Depois de pronto, abra o terminal (Prompt de Comando no Windows, Terminal no macOS/Linux).
Pronto! Ollama tá instalado. Deixa um tempinho pra ele ficar pronto na primeira vez.
Passo 2: Baixar um modelo de IA
No terminal, digite:
ollama pull llama2
Isso baixa o modelo Llama 2 — um dos mais populares, bem equilibrado entre poder e velocidade. Vai levar alguns minutos (depende da sua internet). Você verá umas barrinhas de progresso; é normal.
Outros modelos populares pra experimentar:
ollama pull mistral— rápido, leve, ótimo pra bate-papo.ollama pull neural-chat— especializado em conversas, bem natural.ollama pull orca-mini— compacto, roda em qualquer PC.
💡 Dica: Comece com Mistral se quer algo leve e rápido; com Llama 2 se quer mais poder. Depois baixa quantos quiser — eles ficam salvos na sua máquina.
Passo 3: Rodar e usar o modelo
No terminal, digite:
ollama run llama2
Pronto! A IA tá rodando. Você vai ver uma mensagem tipo ">" — é onde você digita suas perguntas.
Exemplo:
> Qual é a capital da França?
A IA vai responder em segundos (em CPU puro, pode levar alguns segundos a mais que na nuvem — mas tá tudo rodando no seu PC!). Depois da resposta, digite mais perguntas, troque de assunto, converse — é como bater papo com um assistente que tá ouvindo tudo que você fala naquela sessão.
Pra sair, digite /bye ou Ctrl+D (Windows) / Ctrl+D (Mac/Linux).
Passo 4: Usar via interface web (bônus!)
Se não quer digitar no terminal toda vez, dá pra usar uma interface mais amigável. Uma opção popular é o Open WebUI — ele cria uma página web bonita pra bater papo com sua IA local.
Instale assim (no terminal):
docker run -d -p 3000:8080 ghcr.io/open-webui/open-webui:latest
(Isso precisa de Docker instalado — aí é outra história, mas vale a pena.)
Depois, abra o navegador e vá pra:
http://localhost:3000
Aí você vai ter uma interface bem legal pra conversar com seus modelos locais. 😊
Dicas práticas
- Deixe rodando em segundo plano: você pode fechar o terminal e deixar Ollama ativo. Se usar a interface web, ele fica lá pra você acessar sempre.
- Modelos menores = mais rápido: se seu PC é mais antigo, teste
orca-mini(2 GB) antes dellama2(4 GB). - Limpe espaço se precisar: rode
ollama listpra ver quais modelos você tem instalados, eollama rm [nome]pra deletar um se não estiver usando. - Privacidade real: tudo que você digita fica só no seu PC — ninguém na internet sabe que você tá conversando com uma IA local.
Troubleshooting rápido
P: A IA tá muito lenta!
R: Normal em CPU puro. Deixa ela trabalhar — ou testa um modelo menor (orca-mini). Se tiver placa gráfica NVIDIA, Ollama usa automaticamente (ficará bem mais rápido).
P: Usei muito disco, como libero espaço?
R: Rode ollama rm llama2 (ou qualquer modelo que não quer mais) e o espaço volta.
P: Posso usar Ollama pra coisas produtivas (trabalho, código)?
R: Com certeza! Modelos locais são ótimos pra revisar textos, gerar ideias, até escrever código. Teste e veja o que funciona pro seu caso.
P: Preciso de internet sempre?
R: Só pra baixar o modelo na primeira vez. Depois que tá instalado, roda 100% offline. Perfeito pra quando a net cai. 😄
Próximos passos
Agora que você tem sua IA local rodando:
- Teste diferentes prompts — quanto mais específico, melhor a resposta.
- Experimente outros modelos: cada um tem sua personalidade.
- Se tiver dúvida ou quiser ajuda pra algo mais avançado, chama a gente aqui no suporte da GeHost!
Curti? Compartilha com seu time, com amigos que também curtem tech. E se quiser deixar sua IA rodando 24/7 num servidor dedicado em vez do seu PC de casa, aí a gente conversa sobre hospedagem. 😉
Abraço, Sensei da GeHost! 🥋