Christopher Thanisch
← Wissen
GUIDE12 Minuten Lesezeit·Zuletzt aktualisiert AUG 2026

Gemma 4 einrichten — Googles kostenlose KI lokal, ohne Abo.

Gemma 4 von Google DeepMind läuft auf deinem Laptop — kostenlos, Open Source, ohne Cloud. Welche Variante zu deinem RAM passt, wie du Ollama installierst und wie du im Chat, im Terminal und auf dem Handy startest.

Du kommst von Instagram? Hier ist die Anleitung aus dem Reel.

Das lernst du

Was Gemma 4 kann — und wo ChatGPT oder Claude klar besser bleiben
Welche der fünf Varianten zu deinem RAM und Speicher passt
Ollama per App oder Terminal installieren und das Modell laden
Den ersten echten Job lokal erledigen — Mail, Screenshot oder Notiz

Gemma 4 ist die Modellfamilie von Google DeepMind, öffentlich vorgestellt am 2. April 2026. Die Gewichte lagen schon am 31. März. Es ist nicht Gemini. Gemini bleibt in der Cloud. Gemma 4 liegt bei dir: Open Weights, Apache-2.0-Lizenz, kommerziell nutzbar.

Die Modelle schreiben Texte, beantworten Fragen, generieren Code und verstehen Bilder. Die kleineren Varianten können zusätzlich Audio. Kontextfenster: 128K bei den Edge-Modellen, 256K bei 12B, 26B und 31B. Über 140 Sprachen sind trainiert.

Die großen Varianten schlagen auf öffentlichen Leaderboards Modelle, die ein Vielfaches der Parameter haben. Das Default-Laptop-Modell gemma4 (E4B) ist das nicht. Es schlägt aber Gemma 3 27B auf mehreren Benchmarks — bei einem Bruchteil der Größe. Für Alltagsmails und Zusammenfassungen reicht das. Für langes Coding oder tiefe Analysen bleiben Claude und ChatGPT vorne.

Das größte Modell ziehen, obwohl der Rechner 16 GB hat
gemma4:cloud nutzen und denken, es bleibe privat
Die erste Antwort ungeprüft weiterreichen
Open WebUI installieren, bevor die Ollama-App läuft

Welche Version für deinen Rechner

Fünf Größen. Eine reicht. Ollama lädt standardmäßig 4-Bit-Versionen — du brauchst nicht die volle GPU eines Rechenzentrums.

1gemma4:e2b — 8 GB RAM

Edge, 2,3 Milliarden effektive Parameter. Download rund 7,2 GB, Kontext 128K, Text, Bild und Audio. Für schwächere Laptops und als Einstieg, wenn 16 GB knapp sind.

2gemma4 — der Default

Das ist E4B. Download rund 9,6 GB, Kontext 128K, Text, Bild und Audio. 8 GB RAM Minimum, 16 GB empfohlen. Für die meisten Alltagsaufgaben die richtige Wahl.

3gemma4:12b — 16 GB+

Seit Juni 2026. Download rund 7,6 GB, Kontext 256K, Text, Bild und Audio. Mehr Qualität als E4B, ohne 26B in den Speicher zu zwingen. Der Sweet Spot, wenn 16 GB da sind und der Default zu dünn wirkt.

4gemma4:26b — 24 GB+

Mixture of Experts: 25 Milliarden Parameter geladen, nur rund 4 Milliarden aktiv. Download rund 18 GB, Kontext 256K, Text und Bild. Schneller als 31B bei ähnlicher Alltagsqualität. 16 GB reichen dafür nicht.

5gemma4:31b — 32 GB+

Dichtes 31B-Modell, Download rund 20 GB, Kontext 256K. Beste Qualität der Familie. Braucht unified Memory oder eine starke GPU mit Luft für den Kontext-Cache.

Wichtig:

gemma4:cloud und gemma4:31b-cloud laufen auf Ollamas Servern. Dann verlassen Prompts dein Gerät. Für den lokalen, privaten Pfad bleiben die Tags ohne cloud.

Guide zum Mitnehmen

Hol dir den vollständigen Guide als PDF.

Der ganze Artikel zum Mitnehmen — inkl. Checkliste, Befehlen und Ablauf. Damit du ihn nicht noch einmal suchen musst.

Schritt 1 — Ollama installieren

Ollama bringt das Modell auf den Rechner. Auf Mac und Windows hat die App seit 2025 eine eigene Chat-Oberfläche. Du brauchst dafür kein Terminal.

  1. Geh auf ollama.com
  2. Klick auf Download
  3. Wähl dein System

Mac: Zip entpacken, Ollama in den Ordner Programme ziehen, App einmal öffnen. Spotlight reicht danach.

Windows: Die .exe ausführen und den Anweisungen folgen, bis Ollama in der Taskleiste hängt.

Linux: Es gibt keine offizielle Chat-App. Im Terminal:

Linux
curl -fsSL https://ollama.com/install.sh | sh

Danach läuft Ollama als Dienst. Prüfen mit ollama --version.

Mac, Apple Silicon:

Ab Ollama 0.31 ist Multi-Token-Prediction für Gemma 4 auf MLX standardmäßig an — spürbar schneller, gleiche Qualität. Hast du Gemma 4 vor dem Update geladen, neu ziehen: ollama pull gemma4:e4b-mlx (oder die Variante, die du nutzt, mit -mlx).

Schritt 2 — Modell laden und chatten

Die Installation ist der kurze Teil. Der Download nicht: 7 bis 20 GB, je nach Variante. WLAN und etwas Zeit einplanen.

In der Ollama-App (Mac und Windows)

  1. Ollama öffnen
  2. Gemma 4 wählen — ohne Zusatz ist das E4B, rund 9,6 GB
  3. Warten, bis der Balken durch ist
  4. Losschreiben, wie in ChatGPT

Bilder und PDFs kannst du in den Chat ziehen. Gemma 4 ist multimodal: ein Screenshot einer Rechnung, ein Foto einer Tafel, eine Folie. Audio verstehen die Edge-Varianten und das 12B.

Chatverlauf bleibt lokal in der App. Kein Konto, kein Abo.

Im Terminal (alle Systeme, Pflicht auf Linux)

Terminal öffnen (Mac: Spotlight → Terminal, Windows: Eingabeaufforderung oder PowerShell):

Terminal
ollama pull gemma4

Warten, bis der Download steht. Dann starten:

Terminal
ollama run gemma4

Eine andere Größe hängt du als Tag an:

Terminal
ollama run gemma4:e2b
ollama run gemma4:12b
ollama run gemma4:26b
ollama run gemma4:31b

Du tippst, drückst Enter, bekommst die Antwort. Beenden mit /bye.

ollama list zeigt, was schon auf der Platte liegt. ollama rm gemma4:31b löscht eine Variante, wenn der Speicher eng wird.

Schritt 3 — So benutzt du es sinnvoll

Gemma 4 denkt mit, wenn Thinking aktiv ist — Ollama setzt das Chat-Template dafür. Du siehst dann erst die Überlegung, danach die Antwort. Für eine schnelle Umformulierung brauchst du das nicht. Für eine knifflige Rechnung oder einen Bug lohnt es.

Mails und Antworten formulieren, du redigierst den Ton
Notizen, PDFs und lange Threads zusammenfassen
Ideen sammeln, ohne den Cloud-Chat zu füttern
Code-Skizzen und Fehlermeldungen lokal erklären lassen
Screenshots, Belege und Tafelfotos beschreiben oder abtippen
Entwürfe, die nicht auf einen US-Server sollen
Häufiger Fehler:

Zahlen, Zitate und Rechtsfragen ungeprüft übernehmen. Lokal heißt privat, nicht unfehlbar. Derselbe Safety-Check wie bei ChatGPT: unsicher markieren, Quelle selbst prüfen.

Optional — Open WebUI im Browser

Die Ollama-App reicht für den Alltag. Open WebUI lohnt, wenn du unter Linux eine ChatGPT-ähnliche Oberfläche willst oder Verlauf, Benutzer und Modellwahl im Browser brauchst.

Voraussetzung: Docker Desktop (Mac/Windows) oder Docker unter Linux, und Ollama läuft bereits auf dem Rechner.

Docker
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

--add-host lässt den Container Ollama auf deinem Rechner erreichen. -v hält Chats und Einstellungen über Updates hinweg. Ohne die beiden Flags startet die Oberfläche, sieht aber keine Modelle — oder vergisst den Verlauf.

Dann im Browser: http://localhost:3000. Der erste Account wird Admin. Gemma 4 erscheint in der Modell-Liste, sobald Ollama es geladen hat.

Auf dem Handy

Die Google AI Edge Gallery läuft on-device: Play Store (Android 12+) und App Store (iOS 17+). Kein Sideloading nötig.

In der App AI Chat öffnen, Gemma 4 laden. Auf dem Handy bleiben E2B oder E4B. 26B und 31B gehören auf den Rechner.

Danach: kein Netz nötig, Kamera und Galerie für Bilder, Thinking-Modus bei unterstützten Modellen. Die Inferenz bleibt auf dem Gerät.

Häufige Fragen

Brauche ich Internet?

Nur für Installation und Download. Danach läuft der lokale Tag offline. Cloud-Tags brauchen Netz — und schicken Daten weg.

Ist das wirklich kostenlos?

Ja. Apache 2.0, kein Abo, keine Token-Rechnung. Strom und Speicher zahlst du selbst.

Ist das so gut wie ChatGPT?

Für viele Alltagsaufgaben ja, vor allem privat und ohne Wartezeit auf ein Abo. Für langes Coding, tiefe Recherche mit Quellen und Texte, die jemand anderes unterschreiben soll, bleiben Claude und ChatGPT klarer. Gemma 4 ist der lokale Default, nicht der Ersatz für jedes Fenster.

Sind meine Daten sicher?

Beim lokalen Tag: der Prompt bleibt auf der Maschine. Keine Google-Cloud, kein Ollama-Cloud. Sobald cloud im Modellnamen steht oder Open WebUI an einen Remote-Ollama hängt, gilt das nicht mehr.

Kann ich das auf dem Handy nutzen?

Ja, über die Google AI Edge Gallery. Android und iPhone. Die großen Workstation-Modelle nicht.

Es hängt oder ist extrem langsam.

Fast immer das falsche Modell für den RAM. 26B auf 16 GB wird zur Warteschlange. Eine Stufe kleiner ziehen, Chat neu starten. Auf dem Mac nach einem Ollama-Update die MLX-Variante neu pullen.

Der empfohlene Ablauf

Hak ab, was du erledigt hast:

Deine 2-Minuten-Aufgabe

Welche eine Aufgabe schickst du heute durch Gemma 4 — nicht den Benchmark?

Dieselbe Aufgabe wie sonst. Danach weißt du, ob der lokale Default sitzt — oder ob du eine Stufe größer oder kleiner brauchst.

Dein nächster Schritt

Installier heute Ollama, zieh gemma4 und schick eine echte Aufgabe durch — nicht den nächsten Vergleich.

Solche praxisnahen Systeme schicke ich jede Woche per Newsletter — ein System, ein Tool, ein Prompt. Kurz, konkret, sofort anwendbar.

Passt dazu

Christopher Thanisch

Christopher Thanisch

Ich übersetze KI in brauchbare Systeme für den Arbeitsalltag — Systeme statt Hypes.