Como rodar um modelo de IA local com Ollama (CPU) Print

  • 0

Como rodar um modelo de IA local com Ollama (CPU)

Oi! 👋 Sou a Sensei da GeHost. Esse guia é pra você que quer brincar com inteligência artificial sem depender de serviços na nuvem, sem mandar seus dados pra servidor nenhum — tudo rodando direto no seu computador. Parece coisa de ficção científica, mas é bem mais simples do que parece. Vem comigo! 😊

O que é Ollama?

Ollama é uma ferramenta que deixa você rodar modelos de IA diretamente no seu PC — sem internet, sem nuvem, sem terceiros vendo seus dados. Pense nela como um "gerenciador de IAs" que você instala e pronto: você tem seu próprio assistente IA rodando localmente, 24/7, offline se quiser.

A grande vantagem? Privacidade total (tudo fica no seu disco) e sem custo mensal (você só precisa da eletricidade do seu PC). A desvantagem é que modelos grandes precisam de mais poder — mas relaxa, dá pra rodar coisa bem útil em qualquer computador moderno.

Requisitos mínimos

Pra rodar Ollama com CPU (processador), você vai precisar de:

  • Processador: qualquer um moderno (Intel i5+ ou AMD Ryzen 5+); quanto melhor, mais rápido.
  • RAM: mínimo 8 GB (ideal 16 GB pra modelos maiores).
  • Disco: uns 5-20 GB livres (depende dos modelos que instalar).
  • Sistema: Windows, macOS ou Linux — Ollama roda em tudo.
💡 Dica: Não precisa de placa gráfica especial (GPU). CPU é o suficiente. Mas se tiver GPU NVIDIA ou Apple Silicon, Ollama usa automaticamente — e fica muito mais rápido!

Passo 1: Baixar e instalar Ollama

  1. Abra o navegador e vá pro site oficial do Ollama (busque "ollama" no Google).
  2. Clique em Download e escolha a versão pro seu sistema (Windows, macOS ou Linux).
  3. Execute o instalador e siga as instruções — é bem comum, tipo instalar qualquer outro programa.
  4. Depois de pronto, abra o terminal (Prompt de Comando no Windows, Terminal no macOS/Linux).

Pronto! Ollama tá instalado. Deixa um tempinho pra ele ficar pronto na primeira vez.

Passo 2: Baixar um modelo de IA

No terminal, digite:

ollama pull llama2

Isso baixa o modelo Llama 2 — um dos mais populares, bem equilibrado entre poder e velocidade. Vai levar alguns minutos (depende da sua internet). Você verá umas barrinhas de progresso; é normal.

Outros modelos populares pra experimentar:

  • ollama pull mistral — rápido, leve, ótimo pra bate-papo.
  • ollama pull neural-chat — especializado em conversas, bem natural.
  • ollama pull orca-mini — compacto, roda em qualquer PC.
💡 Dica: Comece com Mistral se quer algo leve e rápido; com Llama 2 se quer mais poder. Depois baixa quantos quiser — eles ficam salvos na sua máquina.

Passo 3: Rodar e usar o modelo

No terminal, digite:

ollama run llama2

Pronto! A IA tá rodando. Você vai ver uma mensagem tipo ">" — é onde você digita suas perguntas.

Exemplo:

> Qual é a capital da França?

A IA vai responder em segundos (em CPU puro, pode levar alguns segundos a mais que na nuvem — mas tá tudo rodando no seu PC!). Depois da resposta, digite mais perguntas, troque de assunto, converse — é como bater papo com um assistente que tá ouvindo tudo que você fala naquela sessão.

Pra sair, digite /bye ou Ctrl+D (Windows) / Ctrl+D (Mac/Linux).

Passo 4: Usar via interface web (bônus!)

Se não quer digitar no terminal toda vez, dá pra usar uma interface mais amigável. Uma opção popular é o Open WebUI — ele cria uma página web bonita pra bater papo com sua IA local.

Instale assim (no terminal):

docker run -d -p 3000:8080 ghcr.io/open-webui/open-webui:latest

(Isso precisa de Docker instalado — aí é outra história, mas vale a pena.)

Depois, abra o navegador e vá pra:

http://localhost:3000

Aí você vai ter uma interface bem legal pra conversar com seus modelos locais. 😊

Dicas práticas

  • Deixe rodando em segundo plano: você pode fechar o terminal e deixar Ollama ativo. Se usar a interface web, ele fica lá pra você acessar sempre.
  • Modelos menores = mais rápido: se seu PC é mais antigo, teste orca-mini (2 GB) antes de llama2 (4 GB).
  • Limpe espaço se precisar: rode ollama list pra ver quais modelos você tem instalados, e ollama rm [nome] pra deletar um se não estiver usando.
  • Privacidade real: tudo que você digita fica só no seu PC — ninguém na internet sabe que você tá conversando com uma IA local.

Troubleshooting rápido

P: A IA tá muito lenta!
R: Normal em CPU puro. Deixa ela trabalhar — ou testa um modelo menor (orca-mini). Se tiver placa gráfica NVIDIA, Ollama usa automaticamente (ficará bem mais rápido).

P: Usei muito disco, como libero espaço?
R: Rode ollama rm llama2 (ou qualquer modelo que não quer mais) e o espaço volta.

P: Posso usar Ollama pra coisas produtivas (trabalho, código)?
R: Com certeza! Modelos locais são ótimos pra revisar textos, gerar ideias, até escrever código. Teste e veja o que funciona pro seu caso.

P: Preciso de internet sempre?
R: Só pra baixar o modelo na primeira vez. Depois que tá instalado, roda 100% offline. Perfeito pra quando a net cai. 😄

Próximos passos

Agora que você tem sua IA local rodando:

  • Teste diferentes prompts — quanto mais específico, melhor a resposta.
  • Experimente outros modelos: cada um tem sua personalidade.
  • Se tiver dúvida ou quiser ajuda pra algo mais avançado, chama a gente aqui no suporte da GeHost!

Curti? Compartilha com seu time, com amigos que também curtem tech. E se quiser deixar sua IA rodando 24/7 num servidor dedicado em vez do seu PC de casa, aí a gente conversa sobre hospedagem. 😉

Abraço, Sensei da GeHost! 🥋

Was this answer helpful?

« Back