Lokale KI ohne GPU: Was mit reinem RAM und CPU 2026 wirklich geht
Lesezeit: ca. 11 Minuten
Grafikkarten sind 2026 teuer, schwer lieferbar und in vielen Rechnern schlicht nicht vorhanden. Trotzdem läuft lokale KI längst nicht nur auf GPUs: Wer einen Rechner mit ordentlich Arbeitsspeicher hat, kann Sprachmodelle vollständig auf der CPU betreiben. Die Frage ist nicht ob, sondern wie schnell — und dafür ist ein Wert entscheidender als alle anderen.
Dieser Ratgeber für aimageddon.de sortiert die Faktenlage August 2026: warum Speicherbandbreite und nicht Rechenleistung das Tempo bestimmt, welche Modellgrößen auf 16, 32 und 64 GB realistisch laufen, warum die aktuellen MoE-Modelle die Rechnung zugunsten der CPU verschieben und wo der Ansatz an harte Grenzen stößt.
Warum CPU-Inferenz überhaupt funktioniert
Der Flaschenhals heißt Bandbreite, nicht Rechenleistung
Der wichtigste Satz für alles Weitere: Textgenerierung ist speicherbandbreitenlimitiert, nicht rechenlimitiert. Für jedes einzelne Token muss das Modell einen großen Teil seiner Gewichte durch den Prozessor schieben. Nicht das Rechnen dauert, sondern das Heranschaffen der Daten.
Genau hier liegt der Vorsprung der GPU. Eine Consumer-Grafikkarte der Oberklasse erreicht Bandbreiten jenseits von 1.000 GB/s, ein typisches Dual-Channel-DDR5-System kommt grob auf 60 bis 100 GB/s. Das ist ungefähr Faktor zehn — und dieser Faktor landet ziemlich direkt in deiner Tokens-pro-Sekunde-Rate.
Dazwischen liegen inzwischen ein paar interessante Zwischenstufen, die den Blick lohnen. Apple Silicon mit Unified Memory erreicht in der Ultra-Ausbaustufe rund 800 GB/s. Die GB10-basierten Desktop-Systeme liegen bei etwa 273 GB/s — deutlich über Consumer-DDR5, deutlich unter einer schnellen Grafikkarte. Server-Plattformen mit acht oder zwölf Speicherkanälen kommen ebenfalls in den Bereich von 200 GB/s und darüber.
Für dein Setup heißt das: Mehr Speicherkanäle und schnellerer RAM helfen mehr als mehr Kerne. Ein Prozessor mit vielen Kernen bringt wenig, wenn er auf Daten wartet. Wie sich das auf die Kaufentscheidung auswirkt, haben wir im Vergleich von Mini-PC und Desktop-GPU durchgerechnet.
Quantisierung macht den Unterschied
Ohne Quantisierung wäre CPU-Inferenz kein Thema. Statt jedes Gewicht mit 16 Bit zu speichern, verdichten moderne Verfahren auf 8, 5 oder 4 Bit. Das schrumpft nicht nur die Datei, sondern reduziert auch die Datenmenge, die pro Token durch den Speicher muss — und damit direkt die Wartezeit.
Als Faustregel für 4-Bit-Quantisierung: Parameterzahl in Milliarden mal 0,5 ergibt grob die Gigabyte an Gewichten, plus etwa 20 Prozent Reserve für Kontext und Laufzeit. Ein 8B-Modell landet damit bei rund 5 GB, ein 30B-Modell bei etwa 18 GB.
Eine wichtige Einschränkung dazu: Bei quantisierungsbewusst trainierten Modellen — mehrere aktuelle Releases nutzen nativ 4-Bit-artige Formate für ihre Gewichte — führt diese Faustregel in die Irre. Dort steht die tatsächliche Dateigröße im jeweiligen Repository, und sie kann um den Faktor zwei von der Überschlagsrechnung abweichen. Prüf im Zweifel die echte Dateigröße statt zu rechnen.
Welche Modelle laufen auf welcher Hardware?
Die Speichergrenze ist hart: Passt ein Modell nicht in den RAM, wird von der SSD nachgeladen, und das Tempo bricht zusammen. Die folgende Einordnung geht von 4-Bit-Quantisierung aus und lässt bewusst Puffer fürs Betriebssystem.
| Arbeitsspeicher | Realistische Modellgröße | Typischer Einsatz | Wo es eng wird |
|---|---|---|---|
| 8 GB | bis etwa 3B | Zusammenfassen, einfache Textaufgaben | Kaum Kontext, kein Coding |
| 16 GB | 7B bis 8B | Chat, Textarbeit, einfache Code-Fragen | Langer Kontext wird knapp |
| 32 GB | 13B bis 14B, MoE-Modelle um 30B | Coding-Hilfe, längere Dokumente | Dichte Modelle über 14B |
| 64 GB | 30B dicht, größere MoE-Modelle | anspruchsvolleres Reasoning | Tempo sinkt mit der Modellgröße spürbar |
| 128 GB und mehr | sehr große MoE-Modelle mit Einschränkungen | Machbarkeitsnachweis | Ohne hohe Bandbreite zäh |
Der praktische Rat dahinter ist unspektakulär: Nimm das Modell, das komplett in deinen RAM passt, und lass Reserve für den Kontext. Ein kleineres Modell mit flüssiger Ausgabe ist im Alltag mehr wert als ein größeres, das alle zehn Sekunden ein Wort ausspuckt. Welche Fehler bei der Speicherplanung am meisten Leistung kosten, steht in unserem Beitrag zu den fünf RAM-Fehlern bei lokalen KI-Modellen.
MoE-Modelle: der eigentliche Gamechanger für CPUs
Die interessanteste Entwicklung für CPU-Inferenz sind Mixture-of-Experts-Architekturen. Der Trick: Das Modell hält viele spezialisierte Teilnetze vor, aktiviert pro Token aber nur einen Bruchteil davon.
Das entkoppelt zwei Größen, die vorher zusammenhingen. Der Speicherbedarf richtet sich nach den Gesamtparametern — alle Experten müssen verfügbar sein. Die Bandbreitenlast richtet sich nach den aktiven Parametern — und nur die müssen pro Token durch den Speicher.
Genau diese Trennung spielt der CPU in die Hände. Ein Modell mit 30 Milliarden Gesamtparametern, von denen nur rund 3 Milliarden aktiv sind, fühlt sich beim Schreiben eher wie ein 3B-Modell an — bei der Qualität eines deutlich größeren. Bei den aktuellen Frontier-Modellen ist dieses Verhältnis noch extremer: Größenordnungen wie 284 Milliarden gesamt zu 13 Milliarden aktiv sind inzwischen üblich.
Für dich heißt das konkret: Wenn du ohne GPU arbeitest, such gezielt nach MoE-Modellen. Sie sind der Grund, warum CPU-Inferenz 2026 deutlich besser dasteht als noch vor zwei Jahren. Die Einschränkung bleibt der Speicher — die 284 Milliarden Parameter musst du trotzdem irgendwo unterbringen.
Die richtige Software: llama.cpp, Ollama und LM Studio
Alle drei gängigen Werkzeuge laufen CPU-only, ohne dass du etwas Besonderes einstellen musst:
- llama.cpp ist der Unterbau, auf dem die meisten anderen aufsetzen. Es nutzt die Vektorbefehle moderner Prozessoren und lädt Modelle per Memory-Mapping direkt von der SSD in den Adressraum. Wer selbst kompiliert, holt oft noch etwas Tempo heraus.
- Ollama ist der bequemste Weg über die Kommandozeile: ein Befehl lädt ein Modell und startet einen lokalen Server mit OpenAI-kompatibler Schnittstelle.
- LM Studio bietet eine grafische Oberfläche mit Modell-Browser und eingebautem Chat — der einfachste Einstieg ohne Terminal.
Zwei Einstellungen bringen erfahrungsgemäß am meisten. Erstens die Thread-Anzahl: Setze sie auf die Zahl deiner physischen Kerne, nicht der logischen. Mehr Threads als Kerne bremsen häufig, statt zu beschleunigen. Zweitens die Kontextlänge: Sie kostet zusätzlichen Speicher und Rechenzeit. Für die meisten Aufgaben reichen ein paar Tausend Token; das Maximum aufzureißen, nur weil es geht, ist der häufigste Selbstschuss.
Was realistisch geht — und was nicht
Wo CPU-Inferenz gut funktioniert
Für alles, was asynchron läuft, ist die CPU völlig ausreichend: Texte zusammenfassen, Dokumente durchsuchen, Übersetzungen, Klassifizierung, nächtliche Batch-Jobs. Auch für Chat mit kleineren Modellen reicht das Tempo, wenn du nicht auf sofortige Antwort bestehst. Der Charme liegt woanders — Datenschutz, keine API-Kosten, keine Rate-Limits.
Wo es weh tut: das Prompt-Processing
Hier liegt die Grenze, die in Anleitungen oft untergeht. Für die Textgenerierung braucht die CPU vor allem Bandbreite. Für das Verarbeiten des Eingabe-Prompts braucht sie Rechenleistung — und genau dort ist die GPU in einer anderen Liga.
Praktisch heißt das: Ein kurzer Chat-Prompt ist schnell verarbeitet. Wirfst du dem Modell aber ein langes Dokument oder eine ganze Codebasis hin, wartest du erst einmal, bevor überhaupt das erste Token erscheint. Für RAG-Setups über große Dokumentenmengen oder für Code-Analyse über ein komplettes Repository ist CPU-only deshalb der schmerzhafteste Anwendungsfall — auch wenn die anschließende Generierung dann flüssig läuft.
Ebenfalls unrealistisch: Bild- und Videogenerierung sowie das Training oder Feintuning eigener Modelle. Beides ist rechenlastig und gehört auf eine GPU.
Der ehrliche Vergleich zur Cloud
Wer lokal betreibt, um Geld zu sparen, sollte einmal nachrechnen. Die API-Preise sind bei mehreren aktuellen Modellen so niedrig, dass sich Hardware für sehr viel RAM bei moderater Nutzung kaum amortisiert. Die überzeugenden Gründe für lokal sind andere: Deine Daten verlassen das Haus nicht, du bist offline arbeitsfähig, und niemand kann dir das Modell abschalten oder verteuern. Was ein eigener Aufbau insgesamt kostet, rechnet unser Vergleich Homelab-KI-Server bauen oder kaufen durch.
RAM aufrüsten: Worauf du achtest
Wenn du für lokale KI aufrüstest, gilt eine andere Prioritätenliste als beim Gaming-PC:
- Kapazität zuerst. Sie entscheidet, welches Modell überhaupt läuft. 32 GB sind ein guter Einstieg, 64 GB der Punkt, ab dem es entspannt wird.
- Alle Speicherkanäle bestücken. Zwei Module auf einem Dual-Channel-Board bringen deutlich mehr als ein einzelnes großes Modul. Das ist der billigste Bandbreitengewinn überhaupt.
- Takt und Timings danach. Schnellerer RAM hilft, aber weniger als der Sprung von einem auf zwei Kanäle.
- Kompatibilität prüfen. Nicht jedes Board läuft mit voll bestückten Slots auf dem beworbenen Takt — die Speicherliste des Herstellers ist hier keine Formalie.
Ein Preishinweis für 2026: Die Speicherpreise sind durch die anhaltende Nachfrage deutlich gestiegen. Prüf Tagespreise, statt dich auf Zahlen aus älteren Ratgebern zu verlassen — und miss beworbene Rabatte am 30-Tage-Tiefstpreis nach § 11 PAngV, nicht am durchgestrichenen Wunschpreis.
Häufige Fehler bei CPU-Inferenz
| Fehler | Warum er dich trifft |
|---|---|
| In mehr Kerne statt mehr Bandbreite investieren | Die CPU wartet auf Daten — zusätzliche Kerne warten mit |
| Nur ein Speichermodul verbauen | Halbierte Bandbreite bei gleicher Kapazität, direkt spürbar |
| Modell größer als der freie RAM starten | Auslagerung auf die SSD, das Tempo bricht um Größenordnungen ein |
| Kontextfenster aufs Maximum stellen | Kostet Speicher und Rechenzeit, ohne dass du es brauchst |
| Threads auf die Zahl der logischen Kerne setzen | Mehr Threads als physische Kerne bremsen häufig |
| Speicherbedarf per Faustregel schätzen | Bei quantisierungsbewusst trainierten Modellen liegt sie deutlich daneben |
| Dichtes Modell wählen, wo ein MoE-Modell passt | Du verschenkst genau den Vorteil, der CPU-Inferenz erträglich macht |
| RAG über große Dokumente auf CPU planen | Das Prompt-Processing ist der Teil, bei dem die GPU uneinholbar ist |
| Lokal betreiben, um Geld zu sparen | Bei moderater Nutzung ist die API billiger — der echte Grund ist Datenhoheit |
Praktische Handlungsempfehlungen August 2026
- Erst messen, dann kaufen. Starte ein 7B- oder 8B-Modell auf deiner vorhandenen Hardware und schau, ob dir das Tempo reicht. Diese halbe Stunde ersetzt jede Kaufberatung.
- Bei einer Aufrüstung: alle Kanäle bestücken. Zwei Module statt einem ist der günstigste Tempogewinn, den es gibt.
- Gezielt nach MoE-Modellen suchen. Ein hohes Verhältnis von Gesamt- zu aktiven Parametern ist auf der CPU genau das, was du willst.
- Modellgröße an den freien RAM anpassen, nicht an den verbauten. Betriebssystem und Anwendungen brauchen ihren Teil, und der Kontext kommt oben drauf.
- Dateigröße im Repository prüfen statt zu rechnen. Die Faustregel taugt als Orientierung, nicht als Grundlage für einen 90-GB-Download.
- Threads auf physische Kerne setzen und die Kontextlänge bewusst klein halten.
- Bei langen Eingaben mit Wartezeit rechnen. Wenn dein Hauptanwendungsfall große Dokumente sind, ist das der Punkt, an dem sich eine GPU doch lohnt.
Fazit
Lokale KI ohne Grafikkarte ist 2026 kein Notbehelf mehr, sondern für einen guten Teil der Alltagsaufgaben eine tragfähige Lösung — vor allem dank der MoE-Modelle, die den Bandbreitenbedarf von der Modellgröße entkoppeln. Was du dafür brauchst, ist weniger ein schneller Prozessor als genug Arbeitsspeicher, sinnvoll über alle Kanäle verteilt.
Zwei Erwartungen solltest du trotzdem korrigieren. Erstens ist die Antwortgeschwindigkeit nicht mit einer GPU vergleichbar — das ist Physik, nicht Konfiguration. Zweitens ist das Prompt-Processing bei langen Eingaben der Punkt, an dem CPU-only wirklich weh tut, während die reine Textausgabe erstaunlich gut mithält.
Wenn du herausfinden willst, ob das für dich reicht, brauchst du keine Kaufberatung: Lade heute Abend ein 8B-Modell auf den Rechner, der ohnehin dasteht, und schreib zwei Absätze damit. Die Antwort auf die Frage siehst du dann selbst.
Quellen und weiterführende Informationen
- llama.cpp (github.com/ggml-org/llama.cpp) — Projektdokumentation zu CPU-Backends, Quantisierungsformaten, Memory-Mapping und Thread-Einstellungen.
- Ollama (ollama.com) und LM Studio (lmstudio.ai) — offizielle Dokumentation zu Systemanforderungen und lokalem API-Betrieb.
- Hugging Face (huggingface.co) — Modellkarten mit den tatsächlichen Dateigrößen je Quantisierungsstufe; maßgeblich statt Überschlagsrechnungen.
- heise online / c’t (heise.de) — Fachberichterstattung zu lokaler KI, Speicherbandbreiten und aktueller Hardwarelage.
- Hersteller-Dokumentation von Intel, AMD, Apple und NVIDIA — Angaben zu Speicherkanälen, Bandbreiten und unterstützten Vektorbefehlen.
- Preisangabenverordnung § 11 (gesetze-im-internet.de) — Pflicht zur Angabe des niedrigsten Preises der letzten 30 Tage bei Rabattwerbung.
Haftungsausschluss
Allgemeiner Hinweis: Dieser Artikel auf aimageddon.de dient der allgemeinen Information und ersetzt keine individuelle technische oder kaufmännische Beratung. Wir prüfen die beschriebenen Setups nicht in einem eigenen Labor, sondern werten Projektdokumentationen, Modellkarten und Herstellerangaben aus. Der Bereich lokaler KI entwickelt sich schnell — Modellversionen, Frameworks und Systemanforderungen können kurz nach Veröffentlichung überholt sein.
Zu Leistung und Betrieb: Die genannten Modellgrößen und Speicherangaben sind Orientierungswerte; die tatsächlich erreichbare Geschwindigkeit hängt von Prozessorarchitektur, Speicherbandbreite, Quantisierungsstufe, Kontextlänge und Framework ab und lässt sich nicht garantieren. Dauerlast erhöht Stromaufnahme und thermische Belastung spürbar — ausreichende Kühlung ist Voraussetzung für stabilen Betrieb, besonders bei Notebooks. KI-generierte Ausgaben sind fehleranfällig und sollten ohne kritische Prüfung nicht für sicherheitsrelevante, medizinische, juristische oder finanzielle Entscheidungen herangezogen werden. Modelle und Community-Quantisierungen können unter unterschiedlichen Lizenzen stehen; bei kommerzieller Nutzung prüfst du beide im Original.
Verbraucherrechte beim Hardwarekauf: Kaufst du Arbeitsspeicher oder andere Komponenten im Fernabsatz, steht dir nach § 312g BGB ein vierzehntägiges Widerrufsrecht zu; seit dem 19. Juni 2026 müssen Unternehmen dafür nach § 356a BGB eine elektronische Widerrufsfunktion bereitstellen. Bei Sachmängeln greifen §§ 437 und 438 BGB mit zweijähriger Frist, § 477 BGB kehrt in den ersten zwölf Monaten die Beweislast zu deinen Gunsten um, und die Verbrauchsgüterkauf-Richtlinie (EU) 2019/771 harmonisiert diese Rechte unionsweit. Für beworbene Preissenkungen gilt § 11 PAngV mit dem 30-Tage-Tiefstpreis, für Werbeaussagen und Bewertungen gelten §§ 5, 5a und 5b UWG.
Affiliate und Marken: Einige Verlinkungen in diesem Artikel können Affiliate-Links im Rahmen des Amazon-Partnerprogramms oder des Awin-Netzwerks sein und sind als solche gekennzeichnet. Kaufst du darüber ein, erhält aimageddon.de eine kleine Provision, ohne dass dir zusätzliche Kosten entstehen; die inhaltliche Einordnung bleibt davon unberührt. Alle genannten Markennamen sind eingetragene Warenzeichen der jeweiligen Inhaber und werden ausschließlich zur sachlichen Information verwendet.
👉 13B-Modell auf Amazon ansehen
👉 Gaming-Headset auf Amazon ansehen
👉 mechanische Tastatur auf Amazon ansehen
👉 27-Zoll-Monitor auf Amazon ansehen
👉 Mainboard auf Amazon ansehen
👉 Gaming-Maus auf Amazon ansehen
👉 Gaming-Tastatur auf Amazon ansehen
👉 LED-Strips auf Amazon ansehen
👉 Gaming-Chair auf Amazon ansehen
👉 Gaming-Tisch auf Amazon ansehen
👉 Balkonkraftwerk auf Amazon ansehen
👉 Solarmodule auf Amazon ansehen
👉 Wechselrichter auf Amazon ansehen
👉 Batteriespeicher auf Amazon ansehen
👉 Speicherkarte auf Amazon ansehen
👉 Küchenmaschine auf Amazon ansehen
👉 Thermomix auf Amazon ansehen
* Produktlinks sind Affiliate-Links. Bei einem Kauf über diese Links erhalten wir eine kleine Provision – für dich entstehen keine Mehrkosten.
Affiliate-Hinweis: Dieser Beitrag enthält Affiliate-Links (mit * oder als Amazon-Partnerlink gekennzeichnet). Bei einem Kauf über diese Links erhalten wir eine kleine Provision – für dich entstehen dabei keine zusätzlichen Kosten. Wir empfehlen nur Produkte, die wir für sinnvoll halten.