EN

Ollama

Praktický přehled provozu velkých jazykových modelů lokálně pomocí Ollamy: instalace, embedding modely, REST/Python/JS API a Docker Compose s podporou GPU.

Co tato dovednost pokrývá

Provoz velkých jazykových modelů lokálně pomocí Ollamy kvůli soukromí a kontrole: instalace, stahování a spouštění modelů, generování embeddingů přes REST/Python/JavaScript a nasazení Ollamy pomocí Docker Compose (včetně podpory GPU). Pro širší koncepty vývoje AI (RAG, teorie embeddingů, základy ML) viz Vývoj AI.

Kdy ji použít

  • Při nastavování nebo konfiguraci Ollamy pro lokální provoz LLM, včetně nasazení přes Docker Compose
  • Při výběru embedding modelu pro lokální, offline sémantické vyhledávání
  • Při rozhodování mezi lokálním (Ollama) a cloudovým nasazením modelu kvůli soukromí nebo nákladům
  • Při předběžném stahování pevné sady modelů do kontejneru při startu

Instalace a základní příkazy

# Pull models
ollama pull llama3.2:1b
ollama run deepseek-r1:8b

# Start Ollama server
ollama serve

Embedding modely

Embeddingy převádí text na vektory pro sémantické vyhledávání.

ModelVelikostPopis
mxbai-embed-large334MKvalitní obecné embeddingy
nomic-embed-text137MVyvážený výkon a efektivita
all-minilm23MOdlehčený model s nízkými nároky na zdroje

Generování embeddingů:

REST API:

curl http://localhost:11434/api/embed -d '{
  "model": "mxbai-embed-large",
  "input": "Llamas are members of the camelid family"
}'

Python:

import ollama
result = ollama.embed(model='mxbai-embed-large', input='Llamas are members of the camelid family')

JavaScript:

import ollama from 'ollama';
const result = await ollama.embed({model: 'mxbai-embed-large', input: 'Llamas are members of the camelid family'});

Provoz Ollamy přes Docker Compose

Základní nastavení:

version: '3.8'
services:
  ollama:
    image: ollama/ollama:latest
    ports:
      - "11434:11434"
    volumes:
      - ollama_data:/root/.ollama
    restart: unless-stopped
    environment:
      - OLLAMA_HOST=0.0.0.0

volumes:
  ollama_data:

Příklad podpory GPU:

deploy:
  resources:
    reservations:
      devices:
        - driver: nvidia
          count: 1
          capabilities: [gpu]

Příkazy pro použití:

docker-compose up -d         # Start Ollama
docker-compose exec ollama bash  # Access container
docker-compose down          # Stop Ollama

Předběžné stažení modelů:

#!/bin/bash
ollama pull llama3.2:1b
ollama pull deepseek-r1:8b
ollama pull mxbai-embed-large