Diesmal kein Geschäftsmodell, sondern eine Behauptung — gemessen auf der eigenen Hardware.
Die Behauptung und ihr Anlass
Geprüft wurde der Satz „Für brauchbare KI braucht man die Cloud.“ Er fällt in fast jedem unserer Beratungsgespräche. Anlass der Messung war der Aufbau unseres eigenen lokalen KI-Arbeitsplatzes — wir wollten es nicht glauben oder bestreiten, sondern wissen.
Der Messaufbau
Drei offene Sprachmodelle auf einem Rechner der 1.500-Euro-Klasse (12-GB-Grafikkarte), dieselbe Büro-Frage, gemessen: Schreibtempo, Ladezeit, Speicher. Kaltstart inklusive — die unfreundlichste Betrachtung.
Gemessen
Eigene Messung, Stand 19.07.2026:
- Mistral NeMo 12B: 11,6 Tokens/s — flüssiges Arbeitstempo
- Qwen3 14B (dicht): 6,3 Tokens/s — zäh
- Qwen3 30B (Mixture of Experts): 18,9 Tokens/s — das schnellste Modell im Test, obwohl es mit 18 GB rechnerisch gar nicht in die Karte passt
Verdikt: Die Behauptung hielt in unserer Messung nicht
— für das, was wir tatsächlich geprüft haben: eine Sachfrage beantworten und Aufgaben aus einem Besprechungstext ziehen.
Die Begründung in einem Satz: Den Ausschlag gab die Architektur, nicht die Größe — und die geprüften Aufgaben erledigte das größte Modell in unserer Probe fehlerfrei, ohne Cloud.
Die Überraschung
Das schnellste Modell war eine Mixture-of-Experts-Architektur: 30 Milliarden Parameter im Gepäck, aber nur ~3 Milliarden pro Wort aktiv — es rechnet wie ein kleines Modell mit dem Wissen eines großen. Die Faustregel „größer = braucht mehr Karte = langsamer“ hat in unserer Messung nicht gehalten.
Nachtrag Qualität (Blindtest)
Gleicher Büro-Auftrag — Aufgaben samt Zuständigen und Fristen aus einem Besprechungstext ziehen — an das 30B- und das 12B-Modell:
- 30B: die sauberste Arbeit — alle fünf Aufgaben korrekt mit Verantwortlichem und Frist, inklusive selbst abgeleiteter Termine
- 12B: schneller fertig, ließ aber Zuordnungen aus und verdrehte ein Detail — brauchbar, mit menschlichem Blick drüber
- Eine Beobachtung am Rande: Das große Modell denkt per Werkseinstellung erst sichtbar nach, bevor es antwortet — pro Token das schnellste, bis zur fertigen Antwort nicht immer
Unsere Gedanken
Ob lokale KI für einen Betrieb reicht, ist keine Glaubensfrage, sondern eine Nachmittags-Messung. Und: Lokal ersetzt nicht die Cloud — lokal macht den Copy-Paste-Moment überflüssig, in dem Vertrauliches in ein fremdes Chat-Fenster wandert.
Der ausführliche Messbericht mit allen Zahlen und der MoE-Erklärung: Lokale KI im Betrieb — der Messbericht. Wann lokale KI ins Haus gehört: KI lokal betreiben.