---
title: "Gemma 4 einrichten — Googles kostenlose KI lokal, ohne Abo."
description: "Gemma 4 von Google DeepMind läuft auf deinem Laptop — kostenlos, Open Source, ohne Cloud. Welche Variante zu deinem RAM passt, wie du Ollama installierst und wie du im Chat, im Terminal und auf dem Handy startest."
category: guides
date: 2026-08-18
canonical: https://thanisch.co/wissen/guides/gemma-4
url: https://thanisch.co/wissen/guides/gemma-4
---

# Gemma 4 einrichten — Googles kostenlose KI lokal, ohne Abo.

- Was Gemma 4 kann — und wo ChatGPT oder Claude klar besser bleiben

- Welche der fünf Varianten zu deinem RAM und Speicher passt

- Ollama per App oder Terminal installieren und das Modell laden

- Den ersten echten Job lokal erledigen — Mail, Screenshot oder Notiz

> **Kurz gesagt**
> Gemma 4 ist Googles Open-Source-Modell für den eigenen Rechner. Nach dem Download läuft es offline, ohne Abo und ohne dass Texte die Festplatte verlassen. Der Default für die meisten Laptops ist *gemma4* — nicht das größte Modell.

Gemma 4 ist die Modellfamilie von Google DeepMind, öffentlich vorgestellt am **2. April 2026**. Die Gewichte lagen schon am 31. März. Es ist nicht Gemini. Gemini bleibt in der Cloud. Gemma 4 liegt bei dir: Open Weights, **Apache-2.0-Lizenz**, kommerziell nutzbar.

Die Modelle schreiben Texte, beantworten Fragen, generieren Code und verstehen Bilder. Die kleineren Varianten können zusätzlich Audio. Kontextfenster: 128K bei den Edge-Modellen, 256K bei 12B, 26B und 31B. Über 140 Sprachen sind trainiert.

Die großen Varianten schlagen auf öffentlichen Leaderboards Modelle, die ein Vielfaches der Parameter haben. Das Default-Laptop-Modell `gemma4` (E4B) ist das nicht. Es schlägt aber Gemma 3 27B auf mehreren Benchmarks — bei einem Bruchteil der Größe. Für Alltagsmails und Zusammenfassungen reicht das. Für langes Coding oder tiefe Analysen bleiben Claude und ChatGPT vorne.

- Das größte Modell ziehen, obwohl der Rechner 16 GB hat

- gemma4:cloud nutzen und denken, es bleibe privat

- Die erste Antwort ungeprüft weiterreichen

- Open WebUI installieren, bevor die Ollama-App läuft

## Welche Version für deinen Rechner

Fünf Größen. Eine reicht. Ollama lädt standardmäßig 4-Bit-Versionen — du brauchst nicht die volle GPU eines Rechenzentrums.

### 1. gemma4:e2b — 8 GB RAM

Edge, 2,3 Milliarden effektive Parameter. Download rund **7,2 GB**, Kontext 128K, Text, Bild und Audio. Für schwächere Laptops und als Einstieg, wenn 16 GB knapp sind.

### 2. gemma4 — der Default

Das ist E4B. Download rund **9,6 GB**, Kontext 128K, Text, Bild und Audio. **8 GB RAM Minimum, 16 GB empfohlen.** Für die meisten Alltagsaufgaben die richtige Wahl.

### 3. gemma4:12b — 16 GB+

Seit Juni 2026. Download rund **7,6 GB**, Kontext 256K, Text, Bild und Audio. Mehr Qualität als E4B, ohne 26B in den Speicher zu zwingen. Der Sweet Spot, wenn 16 GB da sind und der Default zu dünn wirkt.

### 4. gemma4:26b — 24 GB+

Mixture of Experts: 25 Milliarden Parameter geladen, nur rund 4 Milliarden aktiv. Download rund **18 GB**, Kontext 256K, Text und Bild. Schneller als 31B bei ähnlicher Alltagsqualität. 16 GB reichen dafür nicht.

### 5. gemma4:31b — 32 GB+

Dichtes 31B-Modell, Download rund **20 GB**, Kontext 256K. Beste Qualität der Familie. Braucht unified Memory oder eine starke GPU mit Luft für den Kontext-Cache.

> **Wichtig**
> `gemma4:cloud` und `gemma4:31b-cloud` laufen auf Ollamas Servern. Dann verlassen Prompts dein Gerät. Für den lokalen, privaten Pfad bleiben die Tags ohne `cloud`.

> **Merke**
> Unsicher? Nimm `gemma4`. Zu langsam oder voller Speicher? Eine Stufe kleiner. Der Download ist der teure Teil — nicht das Ausprobieren im Chat.

## Schritt 1 — Ollama installieren

Ollama bringt das Modell auf den Rechner. Auf Mac und Windows hat die App seit 2025 eine eigene Chat-Oberfläche. Du brauchst dafür kein Terminal.

1. Geh auf [ollama.com](https://ollama.com)
2. Klick auf **Download**
3. Wähl dein System

**Mac:** Zip entpacken, Ollama in den Ordner Programme ziehen, App einmal öffnen. Spotlight reicht danach.

**Windows:** Die `.exe` ausführen und den Anweisungen folgen, bis Ollama in der Taskleiste hängt.

**Linux:** Es gibt keine offizielle Chat-App. Im Terminal:

**Linux**

```
curl -fsSL https://ollama.com/install.sh | sh
```

Danach läuft Ollama als Dienst. Prüfen mit `ollama --version`.

> **Mac, Apple Silicon**
> Ab Ollama 0.31 ist Multi-Token-Prediction für Gemma 4 auf MLX standardmäßig an — spürbar schneller, gleiche Qualität. Hast du Gemma 4 vor dem Update geladen, neu ziehen: `ollama pull gemma4:e4b-mlx` (oder die Variante, die du nutzt, mit `-mlx`).

## Schritt 2 — Modell laden und chatten

Die Installation ist der kurze Teil. Der Download nicht: 7 bis 20 GB, je nach Variante. WLAN und etwas Zeit einplanen.

### In der Ollama-App (Mac und Windows)

1. Ollama öffnen
2. Gemma 4 wählen — ohne Zusatz ist das E4B, rund 9,6 GB
3. Warten, bis der Balken durch ist
4. Losschreiben, wie in ChatGPT

Bilder und PDFs kannst du in den Chat ziehen. Gemma 4 ist multimodal: ein Screenshot einer Rechnung, ein Foto einer Tafel, eine Folie. Audio verstehen die Edge-Varianten und das 12B.

Chatverlauf bleibt lokal in der App. Kein Konto, kein Abo.

### Im Terminal (alle Systeme, Pflicht auf Linux)

Terminal öffnen (Mac: Spotlight → Terminal, Windows: Eingabeaufforderung oder PowerShell):

```
ollama pull gemma4
```

Warten, bis der Download steht. Dann starten:

```
ollama run gemma4
```

Eine andere Größe hängt du als Tag an:

```
ollama run gemma4:e2b
ollama run gemma4:12b
ollama run gemma4:26b
ollama run gemma4:31b
```

Du tippst, drückst Enter, bekommst die Antwort. Beenden mit `/bye`.

`ollama list` zeigt, was schon auf der Platte liegt. `ollama rm gemma4:31b` löscht eine Variante, wenn der Speicher eng wird.

## Schritt 3 — So benutzt du es sinnvoll

Gemma 4 denkt mit, wenn Thinking aktiv ist — Ollama setzt das Chat-Template dafür. Du siehst dann erst die Überlegung, danach die Antwort. Für eine schnelle Umformulierung brauchst du das nicht. Für eine knifflige Rechnung oder einen Bug lohnt es.

- Mails und Antworten formulieren, du redigierst den Ton

- Notizen, PDFs und lange Threads zusammenfassen

- Ideen sammeln, ohne den Cloud-Chat zu füttern

- Code-Skizzen und Fehlermeldungen lokal erklären lassen

- Screenshots, Belege und Tafelfotos beschreiben oder abtippen

- Entwürfe, die nicht auf einen US-Server sollen

> **Häufiger Fehler**
> Zahlen, Zitate und Rechtsfragen ungeprüft übernehmen. Lokal heißt privat, nicht unfehlbar. Derselbe Safety-Check wie bei ChatGPT: unsicher markieren, Quelle selbst prüfen.

## Optional — Open WebUI im Browser

Die Ollama-App reicht für den Alltag. Open WebUI lohnt, wenn du unter Linux eine ChatGPT-ähnliche Oberfläche willst oder Verlauf, Benutzer und Modellwahl im Browser brauchst.

Voraussetzung: [Docker Desktop](https://www.docker.com/products/docker-desktop/) (Mac/Windows) oder Docker unter Linux, und Ollama läuft bereits auf dem Rechner.

**Docker**

```
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
```

`--add-host` lässt den Container Ollama auf deinem Rechner erreichen. `-v` hält Chats und Einstellungen über Updates hinweg. Ohne die beiden Flags startet die Oberfläche, sieht aber keine Modelle — oder vergisst den Verlauf.

Dann im Browser: [http://localhost:3000](http://localhost:3000). Der erste Account wird Admin. Gemma 4 erscheint in der Modell-Liste, sobald Ollama es geladen hat.

## Auf dem Handy

Die [Google AI Edge Gallery](https://github.com/google-ai-edge/gallery) läuft on-device: Play Store (Android 12+) und App Store (iOS 17+). Kein Sideloading nötig.

In der App **AI Chat** öffnen, Gemma 4 laden. Auf dem Handy bleiben E2B oder E4B. 26B und 31B gehören auf den Rechner.

Danach: kein Netz nötig, Kamera und Galerie für Bilder, Thinking-Modus bei unterstützten Modellen. Die Inferenz bleibt auf dem Gerät.

## Häufige Fragen

### Brauche ich Internet?

Nur für Installation und Download. Danach läuft der lokale Tag offline. Cloud-Tags brauchen Netz — und schicken Daten weg.

### Ist das wirklich kostenlos?

Ja. Apache 2.0, kein Abo, keine Token-Rechnung. Strom und Speicher zahlst du selbst.

### Ist das so gut wie ChatGPT?

Für viele Alltagsaufgaben ja, vor allem privat und ohne Wartezeit auf ein Abo. Für langes Coding, tiefe Recherche mit Quellen und Texte, die jemand anderes unterschreiben soll, bleiben Claude und ChatGPT klarer. Gemma 4 ist der lokale Default, nicht der Ersatz für jedes Fenster.

### Sind meine Daten sicher?

Beim lokalen Tag: der Prompt bleibt auf der Maschine. Keine Google-Cloud, kein Ollama-Cloud. Sobald `cloud` im Modellnamen steht oder Open WebUI an einen Remote-Ollama hängt, gilt das nicht mehr.

### Kann ich das auf dem Handy nutzen?

Ja, über die Google AI Edge Gallery. Android und iPhone. Die großen Workstation-Modelle nicht.

### Es hängt oder ist extrem langsam.

Fast immer das falsche Modell für den RAM. 26B auf 16 GB wird zur Warteschlange. Eine Stufe kleiner ziehen, Chat neu starten. Auf dem Mac nach einem Ollama-Update die MLX-Variante neu pullen.

## Der empfohlene Ablauf

Hak ab, was du erledigt hast:

- [ ] RAM und freien Speicher prüfen — Default ist gemma4, nicht 31b

- [ ] Ollama installieren (App auf Mac/Windows, Install-Skript auf Linux)

- [ ] gemma4 laden und eine echte Aufgabe durchschicken

- [ ] Antwort redigieren, bevor sie rausgeht

- [ ] Cloud-Tags nur bewusst nutzen

- [ ] Open WebUI nur, wenn die App nicht reicht

- [ ] Auf dem Handy Edge Gallery mit E2B oder E4B, nicht 26B

### Welche eine Aufgabe schickst du heute durch Gemma 4 — nicht den Benchmark?

Dieselbe Aufgabe wie sonst. Danach weißt du, ob der lokale Default sitzt — oder ob du eine Stufe größer oder kleiner brauchst.
