Ollama
Praktický přehled provozu velkých jazykových modelů lokálně pomocí Ollamy: instalace, embedding modely, REST/Python/JS API a Docker Compose s podporou GPU.
Co tato dovednost pokrývá
Provoz velkých jazykových modelů lokálně pomocí Ollamy kvůli soukromí a kontrole: instalace, stahování a spouštění modelů, generování embeddingů přes REST/Python/JavaScript a nasazení Ollamy pomocí Docker Compose (včetně podpory GPU). Pro širší koncepty vývoje AI (RAG, teorie embeddingů, základy ML) viz Vývoj AI.
Kdy ji použít
- Při nastavování nebo konfiguraci Ollamy pro lokální provoz LLM, včetně nasazení přes Docker Compose
- Při výběru embedding modelu pro lokální, offline sémantické vyhledávání
- Při rozhodování mezi lokálním (Ollama) a cloudovým nasazením modelu kvůli soukromí nebo nákladům
- Při předběžném stahování pevné sady modelů do kontejneru při startu
Instalace a základní příkazy
# Pull models
ollama pull llama3.2:1b
ollama run deepseek-r1:8b
# Start Ollama server
ollama serve
Embedding modely
Embeddingy převádí text na vektory pro sémantické vyhledávání.
| Model | Velikost | Popis |
|---|---|---|
mxbai-embed-large | 334M | Kvalitní obecné embeddingy |
nomic-embed-text | 137M | Vyvážený výkon a efektivita |
all-minilm | 23M | Odlehčený model s nízkými nároky na zdroje |
Generování embeddingů:
REST API:
curl http://localhost:11434/api/embed -d '{
"model": "mxbai-embed-large",
"input": "Llamas are members of the camelid family"
}'
Python:
import ollama
result = ollama.embed(model='mxbai-embed-large', input='Llamas are members of the camelid family')
JavaScript:
import ollama from 'ollama';
const result = await ollama.embed({model: 'mxbai-embed-large', input: 'Llamas are members of the camelid family'});
Provoz Ollamy přes Docker Compose
Základní nastavení:
version: '3.8'
services:
ollama:
image: ollama/ollama:latest
ports:
- "11434:11434"
volumes:
- ollama_data:/root/.ollama
restart: unless-stopped
environment:
- OLLAMA_HOST=0.0.0.0
volumes:
ollama_data:
Příklad podpory GPU:
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: 1
capabilities: [gpu]
Příkazy pro použití:
docker-compose up -d # Start Ollama
docker-compose exec ollama bash # Access container
docker-compose down # Stop Ollama
Předběžné stažení modelů:
#!/bin/bash
ollama pull llama3.2:1b
ollama pull deepseek-r1:8b
ollama pull mxbai-embed-large