Colibri Kompletter Leitfaden — 744B-Parameter-Modell mit nur 25 GB RAM

TL;DR: Colibri ist eine revolutionäre MoE-Inferenz-Engine (Mixture of Experts) in reinem C. Sie benötigt keine GPU und läuft mit nur 25 GB RAM flüssig auf Consumer-Hardware — selbst für ultragroße Modelle wie GLM-5.2 (744B Parameter). Durch innovatives „Expert Streaming" behandelt Colibri VRAM, RAM und Festplatte als einheitliche Speicherhierarchie und erreicht so eine perfekte Balance zwischen Leistung und Ressourcenverbrauch.

Was ist Colibri?

Colibri (Kolibri) ist ein Open-Source-Projekt von JustVugg. Es beantwortet die ultimative Frage beim Einsatz großer Sprachmodelle (LLM): Wie kann man ultragroße Modelle auf begrenzter Hardware betreiben?

Herkömmlicherweise braucht man für ein 744B-Parameter-Modell mehrere TB VRAM und teure A100/H100-Cluster. Colibri schlägt einen völlig neuen Weg vor:

  • Tiny Engine, Immense Model (kleine Engine, riesiges Modell): Die gesamte Engine besteht aus einer einzigen C-Datei (c/glm.c, ca. 2400 Zeilen), ohne externe Abhängigkeiten (kein BLAS, kein Python zur Laufzeit).
  • Expert Streaming: Die 21.504 Routing-Experten des Modells (jeweils ca. 19 MB) werden nicht komplett in den Speicher geladen, sondern bei Bedarf von der Festplatte nachgestromt — optimiert durch LRU-Cache und den OS-Page-Cache.
  • Memory Hierarchy (Speicherhierarchie): VRAM (falls vorhanden), RAM und SSD-Festplatte werden als einheitlicher, verwaltbarer Speicherpool behandelt. Das Modell degradiert bei Ressourcenknappheit automatisch, ohne jemals Genauigkeit oder Korrektheit zu opfern.

Technische Kernmerkmale

Technik Beschreibung Vorteil
MLA-Attention Nutzt die native MLA-Architektur (Multi-Layer Attention) von GLM-5.2 mit komprimiertem KV-Cache (576 Floats/Token vs. 32.768). KV-Cache um Faktor 57 reduziert, enorme Speichereinsparung.
DeepSeek-V3-ähnlicher Router Verwendet denselben Sigmoid-Router wie DeepSeek-V3, mit Support für Shared Experts und die ersten 3 dichten Schichten. Präziseres Expert-Routing, bessere Modellergebnisse.
MTP-Spekulatives Dekodieren Nutzt die Multi-Token-Prediction-(MTP-)Heads von GLM-5.2 für spekulative Dekodierung.Gemessene Akzeptanzrate 39–59 %, durchschnittlich 2,2–2,8 Tokens/Forward. Deutlich höhere Generierungsgeschwindigkeit.
Grammar-Forced Speculation GBNF-Grammatik-Erzwingung ermöglicht bei strukturierten Ausgaben wie JSON oder Function-Calling nahezu 100 % Vorhersage-Akzeptanzrate. Maximale Effizienz bei speziellen Aufgaben.
Integer-Dot-Product-Kernel Implementiert int8- und gepackte-int4-Matrixmultiplikations-Kernel (AVX2 maddubs), 1,4–2,5× schneller als Gleitkommaoperationen. Volle CPU-Rechenleistung genutzt, schnellere Inferenz.
DSA-Sparse-Attention Vollständige Implementierung des DSA-Indexers (Dynamic Sparse Attention) von GLM-5.2, wählt pro Schicht nur Top-2048 kausale Keys. Rechenkomplexität massiv reduziert bei gleichbleibender Modellqualität.

Schnellstart: Drei Schritte zur Bereitstellung

1. Umgebung vorbereiten

Colibri hat extrem geringe Anforderungen — ein modernes Linux/macOS-System und ein GCC-Compiler genügen.

BASH
# Ubuntu/Debian
sudo apt update && sudo apt install -y build-essential curl git

# macOS (Homebrew)
brew install gcc git

2. Herunterladen und Kompilieren

BASH
# Repository klonen
git clone https://github.com/JustVugg/colibri
cd colibri

# Kompilieren (Standard: CPU-Version)
make

# Oder, falls eine NVIDIA-GPU vorhanden ist und CUDA-Beschleunigung gewünscht ist (optional)
# make COLI_CUDA=1

3. Modell ausführen

BASH
# Interaktiven Chat starten
./coli chat

# Oder Batch-Inferenz ausführen
./coli batch --prompt "请用中文写一首关于春天的诗。"

💡 Hinweis: Beim ersten Start müssen die Modellgewichte heruntergeladen werden (~370 GB). Am besten im Voraus vorbereiten. Danach läuft alles blitzschnell.

4. Modellgewichte herunterladen

Colibri nutzt vor-konvertierte int4-quantisierte Modelle, direkt von Hugging Face:

BASH
# Empfohlene Version (int8 MTP-Head, unterstützt spekulative Dekodierung)
# https://huggingface.co/mateogrgic/GLM-5.2-colibri-int4-with-int8-mtp

# Download mit huggingface-cli
pip install huggingface_hub
huggingface-cli download mateogrgic/GLM-5.2-colibri-int4-with-int8-mtp \
  --local-dir ./glm52-int4

⚠️ Wichtige Warnung: MTP-Head MUSS die int8-Version sein!

Das häufigste Community-Problem „Warum ist die MTP-Akzeptanzrate 0 %?" kommt vom Herunterladen der falschen Modellversion. Die Originalversion (jlnsrk/GLM-5.2-colibri-int4) hat int4-quantisierte MTP-Heads — das macht spekulative Dekodierung komplett unbrauchbar (0 % Akzeptanzrate) und kostet etwa die Hälfte der Leistungssteigerung.

Überprüfung: out-mtp-*-Dateigrößen prüfen - int8 (richtig): 3527131672 / 5366238584 / 1065950496 - int4 (falsch): 1765523544 / 2686077736 / 536747200

Tiefenanalyse: Wie funktioniert Colibri?

Colibris Magie liegt in seinem eleganten Speichermanagement und Algorithmus-Design. Zerlegen wir den Kern-Workflow:

  1. Start & Initialisierung: Beim Start berechnet die Engine anhand von MemAvailable automatisch die Expert-Cache-Größe — so wird garantiert kein OOM-Killer ausgelöst.
  2. Expert-Laden: Wenn das Modell einen Experten benötigt, liest die Engine dessen Gewichte von der Festplatte. Um I/O-Wartezeiten zu minimieren, nutzt sie den WILLNEED-Systemaufruf für asynchrones Vorauslesen (async expert readahead).
  3. Berechnung: Geladene Expert-Gewichte werden in den hochoptimierten Integer-Dot-Product-Kernel eingespeist. Für einzelnes Token-Decode wird mit f32 gerechnet; für batched Prefill kommt der schnellere int4-Kernel zum Einsatz.
  4. KV-Cache-Persistenz: Der KV-Cache eines Gesprächs wird komprimiert in einer .coli_kv-Datei gespeichert. Das bedeutet: Nach dem Neustart ist der Gesprächskontext immer noch „warm" — kein erneutes Prefilling der Historie nötig.

Dieses Design sorgt dafür, dass Colibri bei Ressourcenknappheit sanft langsamer wird, aber niemals abstürzt oder falsche Ergebnisse produziert.

KV-Cache-Persistenz: Gespräche gehen nicht verloren

Ein Killer-Feature von Colibri ist die KV-Cache-Persistenz. Nach jedem Gespräch wird der komprimierte MLA-KV-Cache an die .coli_kv-Datei angehängt (ca. 182 KB/Token, crash-sicher). Beim nächsten Start wird er automatisch wiederhergestellt.

BASH
# KV-Cache-Persistenz ist standardmäßig aktiviert
./coli chat

# Deaktivieren falls gewünscht
KVSAVE=0 ./coli chat

Router-Lookahead-Prefetching (experimentell)

Colibri implementiert eine clevere Optimierung: Das Expert-Routing der nächsten Schicht ist zu 71,6 % vorhersagbar (basierend auf dem Post-Attention-Status der aktuellen Schicht). Mit PILOT=1 aktiviert ein dedizierter I/O-Thread das Vorausladen der nächsten Schicht parallel zur aktuellen Berechnung.

BASH
# Router-Lookahead-Prefetching aktivieren
PILOT=1 ./coli chat

Konfigurationsparameter – Schnellreferenz

Umgebungsvariable Standardwert Beschreibung
DRAFT 1 MTP-spekulative Dekodierung an/aus (0=deaktiviert)
DSA 1 DSA-Sparse-Attention an/aus (0=deaktiviert, Dense-Attention)
DSA_TOPK 2048 Anzahl Top-K kausaler Keys pro Schicht bei DSA
PILOT 0 Router-Lookahead-Prefetching an/aus
KVSAVE 1 KV-Cache-Persistenz an/aus
IDOT 1 Integer-Dot-Product-Kernel an/aus
COLI_CUDA 0 CUDA-Beschleunigung an/aus (muss beim Kompilieren aktiviert werden)
GRAMMAR - GBNF-Grammatik-Dateipfad (für strukturierte Ausgaben)
GRAMMAR_DRAFT 24 Max. Grammar-Forcing-Span pro Forward

Leistungsbenchmarks: Daten aus der Praxis

Offizielle Tests auf WSL2 (12 Kerne, 25 GB RAM, NVMe):

  • Kaltstartzeit: ca. 32 Sekunden (Modell laden, Cache initialisieren).
  • Speicherbelegung: Dauerhaft ca. 9,9 GB (int4-Dichtteil).
  • Maximale Festplattenbelegung: ca. 370 GB (alle Expert-Gewichte).
  • Generierungsgeschwindigkeit: Mit aktiviertem MTP und vorgewärmtem Cache: 2,2–2,8 Tokens/Forward.

📊 Vergleich: Das entspricht der Geschwindigkeit eines 7B-Modells auf High-End-GPUs — nur dass Colibri ein 100× größeres 744B-Modell ausführt!

GPU-Beschleunigung im Praxistest: 6× RTX 5090

Laut offiziellem Experiment-Bericht vom 12.07.2026 erreicht Colibri auf 6× RTX 5090 mit full expert residency (VRAM+RAM) eine Decode-Geschwindigkeit von 6,84 Tok/s. Das beweist die elastische Architektur — derselbe Code skaliert nahtlos von reiner CPU bis Multi-GPU.

Kaltstart vs. warmer Cache

Szenario Festplattenlesevorgang/Token Beschreibung
Kalter Cache ~11 GB (75 Schichten × 8 Experten) Erste Inferenz, alle Experten müssen von Festplatte gelesen werden
Warmer Cache Deutlich reduziert Häufig genutzte Experten bereits im RAM gecacht
Vollständig in GPU ~0 Alle Experten im VRAM, kein Festplatten-I/O

💡 SSD-Hinweis: Colibris Streaming-Laden ist ein reiner Lesevorgang und nutzt die SSD nicht nennenswert ab. Worauf man achten sollte: (1) Swap-Verkehr bei Speicherknappheit (Schreibvorgänge nutzen die SSD ab); (2) SSD-Temperatur bei langer hoher Leselast. Colibris automatisches Memory-Budgeting vermeidet Swap von Haus aus.

Vergleich mit anderen Inferenz-Engines

Merkmal Colibri llama.cpp Ollama
Sprache Rein C (~2400 Zeilen) C/C++ Go + llama.cpp
Zielmodell GLM-5.2 (744B MoE) Universal (v. a. LLaMA-Reihe) Universal
GPU-Anforderung Keine (CUDA optional) Empfohlen Empfohlen
Speicherbedarf 25 GB RAM Abhängig vom Modell Abhängig vom Modell
Expert Streaming ✅ Kernfeature ❌ ❌
KV-Cache-Persistenz ✅ ❌ ❌
MTP-spekulative Dekodierung ✅ Nativ unterstützt Teilweise Teilweise
DSA-Sparse-Attention ✅ ❌ ❌
Externe Abhängigkeiten Keine BLAS u. a. Mehrere

🔍 Positionierung: Colibri ist kein Ersatz für llama.cpp, sondern eine spezialisierte Lösung für bestimmte Szenarien. Wer ultragroße MoE-Modelle auf Consumer-Hardware betreiben will, findet mit Colibri derzeit die einzige praktikable Option.

Praxis-Szenarien

Szenario 1: Lokaler AI-Assistent (reine CPU)

Ideal für Entwickler ohne GPU, die einen leistungsstarken lokalen AI-Assistenten auf Laptop oder Desktop betreiben wollen:

BASH
# Interaktiven Chat starten
./coli chat

# JSON-Ausgabe mit Grammatik-Constraint
./coli chat --grammar schemas/response.gbnf

Szenario 2: Strukturierte Datenextraktion

Nutze Grammar-Forced Speculation für extreme Performance bei JSON/Function-Calling:

BASH
# GBNF-Grammatikdatei definieren
cat > schema.gbnf << 'EOF'
root ::= "{" ws "\"name\"" ws ":" ws string "," ws "\"age\"" ws ":" ws number ws "}"
string ::= "\"" [^"]* "\""
number ::= [0-9]+
ws ::= [ \t\n]*
EOF

# Inferenz mit Grammatik-Constraint starten
GRAMMAR=schema.gbnf ./coli batch \
  --prompt "从以下文本提取信息:张三,28岁,软件工程师"

Szenario 3: Multi-GPU-Cluster-Inferenz

Für Nutzer mit GPU-Ressourcen unterstützt Colibri Hybrid-Deployments:

BASH
# CUDA-Version kompilieren
make COLI_CUDA=1

# Ausführen (pinnt automatisch populäre Experten an GPU-VRAM)
COLI_CUDA=1 ./coli chat

Häufige Fragen (FAQ)

F: Mein Rechner hat nur 16 GB RAM — läuft das trotzdem? A: Ja, aber die Erfahrung wird eingeschränkt. Colibris Minimum muss den Dichtteil aufnehmen (~9,9 GB int4), plus KV-Cache und Arbeitspuffer. 16 GB reichen zum Laufen, aber der Expert-Cache ist kleiner — Kaltstarts treten häufiger auf.

F: Wie groß muss die SSD sein? A: Die Modellgewichte sind ca. 370 GB (int4-quantisiert). Zusammen mit KV-Cache und temporären Dateien empfiehlt sich mindestens 500 GB freier Speicherplatz. NVMe-SSDs sind dringend empfohlen; SATA-SSDs funktionieren auch, sind aber langsamer.

F: Wird Windows unterstützt? A: Offiziell wird WSL2 (Windows Subsystem for Linux) unterstützt. Native Windows-Kompilierung ist noch nicht verfügbar, aber der C-Code sollte theoretisch unter MSVC/MinGW kompilierbar sein.

F: Ist das GGUF-Format von llama.cpp kompatibel? A: Nein. Colibri verwendet ein eigenes int4-Container-Format, optimiert für MoE-Expert-Streaming. Das offizielle FP8→int4-Konvertierungstool muss verwendet werden.

Fazit: Ein Meilenstein für die Demokratisierung von KI

Colibri ist nicht nur ein technisches Spielzeug. Es repräsentiert eine wichtige Richtung der KI-Entwicklung: Dezentralisierung und Demokratisierung. Es beweist, dass modernste KI-Fähigkeiten nicht mehr einer Handvoll Tech-Giganten und teurer Hardware vorbehalten sind. Ein normaler Entwickler kann mit nur einem Laptop die fortschrittlichsten Großmodelle erforschen und nutzen.

Colibris Erfolg ist die perfekte Verschmelzung von Ingenieursästhetik und algorithmischer Klugheit. Es strebt nicht nach „größer", sondern nach „cleverer". Es erinnert uns daran, dass echte Innovation oft aus dem Respekt vor Ressourcen und dem Streben nach maximaler Effizienz entsteht.



Dieser Artikel basiert auf Colibri v1.0 (2026-07-01), Apache License 2.0.