Das lernst du
Gemma 4 ist die Modellfamilie von Google DeepMind, öffentlich vorgestellt am 2. April 2026. Die Gewichte lagen schon am 31. März. Es ist nicht Gemini. Gemini bleibt in der Cloud. Gemma 4 liegt bei dir: Open Weights, Apache-2.0-Lizenz, kommerziell nutzbar.
Die Modelle schreiben Texte, beantworten Fragen, generieren Code und verstehen Bilder. Die kleineren Varianten können zusätzlich Audio. Kontextfenster: 128K bei den Edge-Modellen, 256K bei 12B, 26B und 31B. Über 140 Sprachen sind trainiert.
Die großen Varianten schlagen auf öffentlichen Leaderboards Modelle, die ein Vielfaches der Parameter haben. Das Default-Laptop-Modell gemma4 (E4B) ist das nicht. Es schlägt aber Gemma 3 27B auf mehreren Benchmarks — bei einem Bruchteil der Größe. Für Alltagsmails und Zusammenfassungen reicht das. Für langes Coding oder tiefe Analysen bleiben Claude und ChatGPT vorne.
Welche Version für deinen Rechner
Fünf Größen. Eine reicht. Ollama lädt standardmäßig 4-Bit-Versionen — du brauchst nicht die volle GPU eines Rechenzentrums.
Edge, 2,3 Milliarden effektive Parameter. Download rund 7,2 GB, Kontext 128K, Text, Bild und Audio. Für schwächere Laptops und als Einstieg, wenn 16 GB knapp sind.
Das ist E4B. Download rund 9,6 GB, Kontext 128K, Text, Bild und Audio. 8 GB RAM Minimum, 16 GB empfohlen. Für die meisten Alltagsaufgaben die richtige Wahl.
Seit Juni 2026. Download rund 7,6 GB, Kontext 256K, Text, Bild und Audio. Mehr Qualität als E4B, ohne 26B in den Speicher zu zwingen. Der Sweet Spot, wenn 16 GB da sind und der Default zu dünn wirkt.
Mixture of Experts: 25 Milliarden Parameter geladen, nur rund 4 Milliarden aktiv. Download rund 18 GB, Kontext 256K, Text und Bild. Schneller als 31B bei ähnlicher Alltagsqualität. 16 GB reichen dafür nicht.
Dichtes 31B-Modell, Download rund 20 GB, Kontext 256K. Beste Qualität der Familie. Braucht unified Memory oder eine starke GPU mit Luft für den Kontext-Cache.
gemma4:cloud und gemma4:31b-cloud laufen auf Ollamas Servern. Dann verlassen Prompts dein Gerät. Für den lokalen, privaten Pfad bleiben die Tags ohne cloud.
Guide zum Mitnehmen
Hol dir den vollständigen Guide als PDF.
Der ganze Artikel zum Mitnehmen — inkl. Checkliste, Befehlen und Ablauf. Damit du ihn nicht noch einmal suchen musst.
Schritt 1 — Ollama installieren
Ollama bringt das Modell auf den Rechner. Auf Mac und Windows hat die App seit 2025 eine eigene Chat-Oberfläche. Du brauchst dafür kein Terminal.
- Geh auf ollama.com
- Klick auf Download
- Wähl dein System
Mac: Zip entpacken, Ollama in den Ordner Programme ziehen, App einmal öffnen. Spotlight reicht danach.
Windows: Die .exe ausführen und den Anweisungen folgen, bis Ollama in der Taskleiste hängt.
Linux: Es gibt keine offizielle Chat-App. Im Terminal:
curl -fsSL https://ollama.com/install.sh | sh
Danach läuft Ollama als Dienst. Prüfen mit ollama --version.
Ab Ollama 0.31 ist Multi-Token-Prediction für Gemma 4 auf MLX standardmäßig an — spürbar schneller, gleiche Qualität. Hast du Gemma 4 vor dem Update geladen, neu ziehen: ollama pull gemma4:e4b-mlx (oder die Variante, die du nutzt, mit -mlx).
Schritt 2 — Modell laden und chatten
Die Installation ist der kurze Teil. Der Download nicht: 7 bis 20 GB, je nach Variante. WLAN und etwas Zeit einplanen.
In der Ollama-App (Mac und Windows)
- Ollama öffnen
- Gemma 4 wählen — ohne Zusatz ist das E4B, rund 9,6 GB
- Warten, bis der Balken durch ist
- Losschreiben, wie in ChatGPT
Bilder und PDFs kannst du in den Chat ziehen. Gemma 4 ist multimodal: ein Screenshot einer Rechnung, ein Foto einer Tafel, eine Folie. Audio verstehen die Edge-Varianten und das 12B.
Chatverlauf bleibt lokal in der App. Kein Konto, kein Abo.
Im Terminal (alle Systeme, Pflicht auf Linux)
Terminal öffnen (Mac: Spotlight → Terminal, Windows: Eingabeaufforderung oder PowerShell):
ollama pull gemma4
Warten, bis der Download steht. Dann starten:
ollama run gemma4
Eine andere Größe hängt du als Tag an:
ollama run gemma4:e2b ollama run gemma4:12b ollama run gemma4:26b ollama run gemma4:31b
Du tippst, drückst Enter, bekommst die Antwort. Beenden mit /bye.
ollama list zeigt, was schon auf der Platte liegt. ollama rm gemma4:31b löscht eine Variante, wenn der Speicher eng wird.
Schritt 3 — So benutzt du es sinnvoll
Gemma 4 denkt mit, wenn Thinking aktiv ist — Ollama setzt das Chat-Template dafür. Du siehst dann erst die Überlegung, danach die Antwort. Für eine schnelle Umformulierung brauchst du das nicht. Für eine knifflige Rechnung oder einen Bug lohnt es.
Zahlen, Zitate und Rechtsfragen ungeprüft übernehmen. Lokal heißt privat, nicht unfehlbar. Derselbe Safety-Check wie bei ChatGPT: unsicher markieren, Quelle selbst prüfen.
Optional — Open WebUI im Browser
Die Ollama-App reicht für den Alltag. Open WebUI lohnt, wenn du unter Linux eine ChatGPT-ähnliche Oberfläche willst oder Verlauf, Benutzer und Modellwahl im Browser brauchst.
Voraussetzung: Docker Desktop (Mac/Windows) oder Docker unter Linux, und Ollama läuft bereits auf dem Rechner.
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
--add-host lässt den Container Ollama auf deinem Rechner erreichen. -v hält Chats und Einstellungen über Updates hinweg. Ohne die beiden Flags startet die Oberfläche, sieht aber keine Modelle — oder vergisst den Verlauf.
Dann im Browser: http://localhost:3000. Der erste Account wird Admin. Gemma 4 erscheint in der Modell-Liste, sobald Ollama es geladen hat.
Auf dem Handy
Die Google AI Edge Gallery läuft on-device: Play Store (Android 12+) und App Store (iOS 17+). Kein Sideloading nötig.
In der App AI Chat öffnen, Gemma 4 laden. Auf dem Handy bleiben E2B oder E4B. 26B und 31B gehören auf den Rechner.
Danach: kein Netz nötig, Kamera und Galerie für Bilder, Thinking-Modus bei unterstützten Modellen. Die Inferenz bleibt auf dem Gerät.
Häufige Fragen
Brauche ich Internet?
Nur für Installation und Download. Danach läuft der lokale Tag offline. Cloud-Tags brauchen Netz — und schicken Daten weg.
Ist das wirklich kostenlos?
Ja. Apache 2.0, kein Abo, keine Token-Rechnung. Strom und Speicher zahlst du selbst.
Ist das so gut wie ChatGPT?
Für viele Alltagsaufgaben ja, vor allem privat und ohne Wartezeit auf ein Abo. Für langes Coding, tiefe Recherche mit Quellen und Texte, die jemand anderes unterschreiben soll, bleiben Claude und ChatGPT klarer. Gemma 4 ist der lokale Default, nicht der Ersatz für jedes Fenster.
Sind meine Daten sicher?
Beim lokalen Tag: der Prompt bleibt auf der Maschine. Keine Google-Cloud, kein Ollama-Cloud. Sobald cloud im Modellnamen steht oder Open WebUI an einen Remote-Ollama hängt, gilt das nicht mehr.
Kann ich das auf dem Handy nutzen?
Ja, über die Google AI Edge Gallery. Android und iPhone. Die großen Workstation-Modelle nicht.
Es hängt oder ist extrem langsam.
Fast immer das falsche Modell für den RAM. 26B auf 16 GB wird zur Warteschlange. Eine Stufe kleiner ziehen, Chat neu starten. Auf dem Mac nach einem Ollama-Update die MLX-Variante neu pullen.
Der empfohlene Ablauf
Hak ab, was du erledigt hast:
Deine 2-Minuten-Aufgabe
Welche eine Aufgabe schickst du heute durch Gemma 4 — nicht den Benchmark?
Dieselbe Aufgabe wie sonst. Danach weißt du, ob der lokale Default sitzt — oder ob du eine Stufe größer oder kleiner brauchst.
Dein nächster Schritt
Installier heute Ollama, zieh gemma4 und schick eine echte Aufgabe durch — nicht den nächsten Vergleich.
Solche praxisnahen Systeme schicke ich jede Woche per Newsletter — ein System, ein Tool, ein Prompt. Kurz, konkret, sofort anwendbar.
Passt dazu

Christopher Thanisch
Ich übersetze KI in brauchbare Systeme für den Arbeitsalltag — Systeme statt Hypes.