Anleitungen & Tipps

Lokale KI ohne GPU: Modelle mit CPU & RAM 2026

Lokale KI ohne GPU: Was mit reinem RAM und CPU 2026 wirklich geht

Lesezeit: ca. 11 Minuten

Grafikkarten sind 2026 teuer, schwer lieferbar und in vielen Rechnern schlicht nicht vorhanden. Trotzdem läuft lokale KI längst nicht nur auf GPUs: Wer einen Rechner mit ordentlich Arbeitsspeicher hat, kann Sprachmodelle vollständig auf der CPU betreiben. Die Frage ist nicht ob, sondern wie schnell — und dafür ist ein Wert entscheidender als alle anderen.

Dieser Ratgeber für aimageddon.de sortiert die Faktenlage August 2026: warum Speicherbandbreite und nicht Rechenleistung das Tempo bestimmt, welche Modellgrößen auf 16, 32 und 64 GB realistisch laufen, warum die aktuellen MoE-Modelle die Rechnung zugunsten der CPU verschieben und wo der Ansatz an harte Grenzen stößt.

Warum CPU-Inferenz überhaupt funktioniert

Der Flaschenhals heißt Bandbreite, nicht Rechenleistung

Der wichtigste Satz für alles Weitere: Textgenerierung ist speicherbandbreitenlimitiert, nicht rechenlimitiert. Für jedes einzelne Token muss das Modell einen großen Teil seiner Gewichte durch den Prozessor schieben. Nicht das Rechnen dauert, sondern das Heranschaffen der Daten.

Genau hier liegt der Vorsprung der GPU. Eine Consumer-Grafikkarte der Oberklasse erreicht Bandbreiten jenseits von 1.000 GB/s, ein typisches Dual-Channel-DDR5-System kommt grob auf 60 bis 100 GB/s. Das ist ungefähr Faktor zehn — und dieser Faktor landet ziemlich direkt in deiner Tokens-pro-Sekunde-Rate.

Dazwischen liegen inzwischen ein paar interessante Zwischenstufen, die den Blick lohnen. Apple Silicon mit Unified Memory erreicht in der Ultra-Ausbaustufe rund 800 GB/s. Die GB10-basierten Desktop-Systeme liegen bei etwa 273 GB/s — deutlich über Consumer-DDR5, deutlich unter einer schnellen Grafikkarte. Server-Plattformen mit acht oder zwölf Speicherkanälen kommen ebenfalls in den Bereich von 200 GB/s und darüber.

Für dein Setup heißt das: Mehr Speicherkanäle und schnellerer RAM helfen mehr als mehr Kerne. Ein Prozessor mit vielen Kernen bringt wenig, wenn er auf Daten wartet. Wie sich das auf die Kaufentscheidung auswirkt, haben wir im Vergleich von Mini-PC und Desktop-GPU durchgerechnet.

Quantisierung macht den Unterschied

Ohne Quantisierung wäre CPU-Inferenz kein Thema. Statt jedes Gewicht mit 16 Bit zu speichern, verdichten moderne Verfahren auf 8, 5 oder 4 Bit. Das schrumpft nicht nur die Datei, sondern reduziert auch die Datenmenge, die pro Token durch den Speicher muss — und damit direkt die Wartezeit.

Als Faustregel für 4-Bit-Quantisierung: Parameterzahl in Milliarden mal 0,5 ergibt grob die Gigabyte an Gewichten, plus etwa 20 Prozent Reserve für Kontext und Laufzeit. Ein 8B-Modell landet damit bei rund 5 GB, ein 30B-Modell bei etwa 18 GB.

Eine wichtige Einschränkung dazu: Bei quantisierungsbewusst trainierten Modellen — mehrere aktuelle Releases nutzen nativ 4-Bit-artige Formate für ihre Gewichte — führt diese Faustregel in die Irre. Dort steht die tatsächliche Dateigröße im jeweiligen Repository, und sie kann um den Faktor zwei von der Überschlagsrechnung abweichen. Prüf im Zweifel die echte Dateigröße statt zu rechnen.

Welche Modelle laufen auf welcher Hardware?

Die Speichergrenze ist hart: Passt ein Modell nicht in den RAM, wird von der SSD nachgeladen, und das Tempo bricht zusammen. Die folgende Einordnung geht von 4-Bit-Quantisierung aus und lässt bewusst Puffer fürs Betriebssystem.

ArbeitsspeicherRealistische ModellgrößeTypischer EinsatzWo es eng wird
8 GBbis etwa 3BZusammenfassen, einfache TextaufgabenKaum Kontext, kein Coding
16 GB7B bis 8BChat, Textarbeit, einfache Code-FragenLanger Kontext wird knapp
32 GB13B bis 14B, MoE-Modelle um 30BCoding-Hilfe, längere DokumenteDichte Modelle über 14B
64 GB30B dicht, größere MoE-Modelleanspruchsvolleres ReasoningTempo sinkt mit der Modellgröße spürbar
128 GB und mehrsehr große MoE-Modelle mit EinschränkungenMachbarkeitsnachweisOhne hohe Bandbreite zäh

Der praktische Rat dahinter ist unspektakulär: Nimm das Modell, das komplett in deinen RAM passt, und lass Reserve für den Kontext. Ein kleineres Modell mit flüssiger Ausgabe ist im Alltag mehr wert als ein größeres, das alle zehn Sekunden ein Wort ausspuckt. Welche Fehler bei der Speicherplanung am meisten Leistung kosten, steht in unserem Beitrag zu den fünf RAM-Fehlern bei lokalen KI-Modellen.

MoE-Modelle: der eigentliche Gamechanger für CPUs

Die interessanteste Entwicklung für CPU-Inferenz sind Mixture-of-Experts-Architekturen. Der Trick: Das Modell hält viele spezialisierte Teilnetze vor, aktiviert pro Token aber nur einen Bruchteil davon.

Das entkoppelt zwei Größen, die vorher zusammenhingen. Der Speicherbedarf richtet sich nach den Gesamtparametern — alle Experten müssen verfügbar sein. Die Bandbreitenlast richtet sich nach den aktiven Parametern — und nur die müssen pro Token durch den Speicher.

Genau diese Trennung spielt der CPU in die Hände. Ein Modell mit 30 Milliarden Gesamtparametern, von denen nur rund 3 Milliarden aktiv sind, fühlt sich beim Schreiben eher wie ein 3B-Modell an — bei der Qualität eines deutlich größeren. Bei den aktuellen Frontier-Modellen ist dieses Verhältnis noch extremer: Größenordnungen wie 284 Milliarden gesamt zu 13 Milliarden aktiv sind inzwischen üblich.

Für dich heißt das konkret: Wenn du ohne GPU arbeitest, such gezielt nach MoE-Modellen. Sie sind der Grund, warum CPU-Inferenz 2026 deutlich besser dasteht als noch vor zwei Jahren. Die Einschränkung bleibt der Speicher — die 284 Milliarden Parameter musst du trotzdem irgendwo unterbringen.

Die richtige Software: llama.cpp, Ollama und LM Studio

Alle drei gängigen Werkzeuge laufen CPU-only, ohne dass du etwas Besonderes einstellen musst:

    • llama.cpp ist der Unterbau, auf dem die meisten anderen aufsetzen. Es nutzt die Vektorbefehle moderner Prozessoren und lädt Modelle per Memory-Mapping direkt von der SSD in den Adressraum. Wer selbst kompiliert, holt oft noch etwas Tempo heraus.
    • Ollama ist der bequemste Weg über die Kommandozeile: ein Befehl lädt ein Modell und startet einen lokalen Server mit OpenAI-kompatibler Schnittstelle.
    • LM Studio bietet eine grafische Oberfläche mit Modell-Browser und eingebautem Chat — der einfachste Einstieg ohne Terminal.

Zwei Einstellungen bringen erfahrungsgemäß am meisten. Erstens die Thread-Anzahl: Setze sie auf die Zahl deiner physischen Kerne, nicht der logischen. Mehr Threads als Kerne bremsen häufig, statt zu beschleunigen. Zweitens die Kontextlänge: Sie kostet zusätzlichen Speicher und Rechenzeit. Für die meisten Aufgaben reichen ein paar Tausend Token; das Maximum aufzureißen, nur weil es geht, ist der häufigste Selbstschuss.

Was realistisch geht — und was nicht

Wo CPU-Inferenz gut funktioniert

Für alles, was asynchron läuft, ist die CPU völlig ausreichend: Texte zusammenfassen, Dokumente durchsuchen, Übersetzungen, Klassifizierung, nächtliche Batch-Jobs. Auch für Chat mit kleineren Modellen reicht das Tempo, wenn du nicht auf sofortige Antwort bestehst. Der Charme liegt woanders — Datenschutz, keine API-Kosten, keine Rate-Limits.

Wo es weh tut: das Prompt-Processing

Hier liegt die Grenze, die in Anleitungen oft untergeht. Für die Textgenerierung braucht die CPU vor allem Bandbreite. Für das Verarbeiten des Eingabe-Prompts braucht sie Rechenleistung — und genau dort ist die GPU in einer anderen Liga.

Praktisch heißt das: Ein kurzer Chat-Prompt ist schnell verarbeitet. Wirfst du dem Modell aber ein langes Dokument oder eine ganze Codebasis hin, wartest du erst einmal, bevor überhaupt das erste Token erscheint. Für RAG-Setups über große Dokumentenmengen oder für Code-Analyse über ein komplettes Repository ist CPU-only deshalb der schmerzhafteste Anwendungsfall — auch wenn die anschließende Generierung dann flüssig läuft.

Ebenfalls unrealistisch: Bild- und Videogenerierung sowie das Training oder Feintuning eigener Modelle. Beides ist rechenlastig und gehört auf eine GPU.

Der ehrliche Vergleich zur Cloud

Wer lokal betreibt, um Geld zu sparen, sollte einmal nachrechnen. Die API-Preise sind bei mehreren aktuellen Modellen so niedrig, dass sich Hardware für sehr viel RAM bei moderater Nutzung kaum amortisiert. Die überzeugenden Gründe für lokal sind andere: Deine Daten verlassen das Haus nicht, du bist offline arbeitsfähig, und niemand kann dir das Modell abschalten oder verteuern. Was ein eigener Aufbau insgesamt kostet, rechnet unser Vergleich Homelab-KI-Server bauen oder kaufen durch.

RAM aufrüsten: Worauf du achtest

Wenn du für lokale KI aufrüstest, gilt eine andere Prioritätenliste als beim Gaming-PC:

    • Kapazität zuerst. Sie entscheidet, welches Modell überhaupt läuft. 32 GB sind ein guter Einstieg, 64 GB der Punkt, ab dem es entspannt wird.
    • Alle Speicherkanäle bestücken. Zwei Module auf einem Dual-Channel-Board bringen deutlich mehr als ein einzelnes großes Modul. Das ist der billigste Bandbreitengewinn überhaupt.
    • Takt und Timings danach. Schnellerer RAM hilft, aber weniger als der Sprung von einem auf zwei Kanäle.
    • Kompatibilität prüfen. Nicht jedes Board läuft mit voll bestückten Slots auf dem beworbenen Takt — die Speicherliste des Herstellers ist hier keine Formalie.

Ein Preishinweis für 2026: Die Speicherpreise sind durch die anhaltende Nachfrage deutlich gestiegen. Prüf Tagespreise, statt dich auf Zahlen aus älteren Ratgebern zu verlassen — und miss beworbene Rabatte am 30-Tage-Tiefstpreis nach § 11 PAngV, nicht am durchgestrichenen Wunschpreis.

Häufige Fehler bei CPU-Inferenz

FehlerWarum er dich trifft
In mehr Kerne statt mehr Bandbreite investierenDie CPU wartet auf Daten — zusätzliche Kerne warten mit
Nur ein Speichermodul verbauenHalbierte Bandbreite bei gleicher Kapazität, direkt spürbar
Modell größer als der freie RAM startenAuslagerung auf die SSD, das Tempo bricht um Größenordnungen ein
Kontextfenster aufs Maximum stellenKostet Speicher und Rechenzeit, ohne dass du es brauchst
Threads auf die Zahl der logischen Kerne setzenMehr Threads als physische Kerne bremsen häufig
Speicherbedarf per Faustregel schätzenBei quantisierungsbewusst trainierten Modellen liegt sie deutlich daneben
Dichtes Modell wählen, wo ein MoE-Modell passtDu verschenkst genau den Vorteil, der CPU-Inferenz erträglich macht
RAG über große Dokumente auf CPU planenDas Prompt-Processing ist der Teil, bei dem die GPU uneinholbar ist
Lokal betreiben, um Geld zu sparenBei moderater Nutzung ist die API billiger — der echte Grund ist Datenhoheit

Praktische Handlungsempfehlungen August 2026

    • Erst messen, dann kaufen. Starte ein 7B- oder 8B-Modell auf deiner vorhandenen Hardware und schau, ob dir das Tempo reicht. Diese halbe Stunde ersetzt jede Kaufberatung.
    • Bei einer Aufrüstung: alle Kanäle bestücken. Zwei Module statt einem ist der günstigste Tempogewinn, den es gibt.
    • Gezielt nach MoE-Modellen suchen. Ein hohes Verhältnis von Gesamt- zu aktiven Parametern ist auf der CPU genau das, was du willst.
    • Modellgröße an den freien RAM anpassen, nicht an den verbauten. Betriebssystem und Anwendungen brauchen ihren Teil, und der Kontext kommt oben drauf.
    • Dateigröße im Repository prüfen statt zu rechnen. Die Faustregel taugt als Orientierung, nicht als Grundlage für einen 90-GB-Download.
    • Threads auf physische Kerne setzen und die Kontextlänge bewusst klein halten.
    • Bei langen Eingaben mit Wartezeit rechnen. Wenn dein Hauptanwendungsfall große Dokumente sind, ist das der Punkt, an dem sich eine GPU doch lohnt.

Fazit

Lokale KI ohne Grafikkarte ist 2026 kein Notbehelf mehr, sondern für einen guten Teil der Alltagsaufgaben eine tragfähige Lösung — vor allem dank der MoE-Modelle, die den Bandbreitenbedarf von der Modellgröße entkoppeln. Was du dafür brauchst, ist weniger ein schneller Prozessor als genug Arbeitsspeicher, sinnvoll über alle Kanäle verteilt.

Zwei Erwartungen solltest du trotzdem korrigieren. Erstens ist die Antwortgeschwindigkeit nicht mit einer GPU vergleichbar — das ist Physik, nicht Konfiguration. Zweitens ist das Prompt-Processing bei langen Eingaben der Punkt, an dem CPU-only wirklich weh tut, während die reine Textausgabe erstaunlich gut mithält.

Wenn du herausfinden willst, ob das für dich reicht, brauchst du keine Kaufberatung: Lade heute Abend ein 8B-Modell auf den Rechner, der ohnehin dasteht, und schreib zwei Absätze damit. Die Antwort auf die Frage siehst du dann selbst.

Quellen und weiterführende Informationen

    • llama.cpp (github.com/ggml-org/llama.cpp) — Projektdokumentation zu CPU-Backends, Quantisierungsformaten, Memory-Mapping und Thread-Einstellungen.
    • Ollama (ollama.com) und LM Studio (lmstudio.ai) — offizielle Dokumentation zu Systemanforderungen und lokalem API-Betrieb.
    • Hugging Face (huggingface.co) — Modellkarten mit den tatsächlichen Dateigrößen je Quantisierungsstufe; maßgeblich statt Überschlagsrechnungen.
    • heise online / c’t (heise.de) — Fachberichterstattung zu lokaler KI, Speicherbandbreiten und aktueller Hardwarelage.
    • Hersteller-Dokumentation von Intel, AMD, Apple und NVIDIA — Angaben zu Speicherkanälen, Bandbreiten und unterstützten Vektorbefehlen.
    • Preisangabenverordnung § 11 (gesetze-im-internet.de) — Pflicht zur Angabe des niedrigsten Preises der letzten 30 Tage bei Rabattwerbung.

Haftungsausschluss

Allgemeiner Hinweis: Dieser Artikel auf aimageddon.de dient der allgemeinen Information und ersetzt keine individuelle technische oder kaufmännische Beratung. Wir prüfen die beschriebenen Setups nicht in einem eigenen Labor, sondern werten Projektdokumentationen, Modellkarten und Herstellerangaben aus. Der Bereich lokaler KI entwickelt sich schnell — Modellversionen, Frameworks und Systemanforderungen können kurz nach Veröffentlichung überholt sein.

Zu Leistung und Betrieb: Die genannten Modellgrößen und Speicherangaben sind Orientierungswerte; die tatsächlich erreichbare Geschwindigkeit hängt von Prozessorarchitektur, Speicherbandbreite, Quantisierungsstufe, Kontextlänge und Framework ab und lässt sich nicht garantieren. Dauerlast erhöht Stromaufnahme und thermische Belastung spürbar — ausreichende Kühlung ist Voraussetzung für stabilen Betrieb, besonders bei Notebooks. KI-generierte Ausgaben sind fehleranfällig und sollten ohne kritische Prüfung nicht für sicherheitsrelevante, medizinische, juristische oder finanzielle Entscheidungen herangezogen werden. Modelle und Community-Quantisierungen können unter unterschiedlichen Lizenzen stehen; bei kommerzieller Nutzung prüfst du beide im Original.

Verbraucherrechte beim Hardwarekauf: Kaufst du Arbeitsspeicher oder andere Komponenten im Fernabsatz, steht dir nach § 312g BGB ein vierzehntägiges Widerrufsrecht zu; seit dem 19. Juni 2026 müssen Unternehmen dafür nach § 356a BGB eine elektronische Widerrufsfunktion bereitstellen. Bei Sachmängeln greifen §§ 437 und 438 BGB mit zweijähriger Frist, § 477 BGB kehrt in den ersten zwölf Monaten die Beweislast zu deinen Gunsten um, und die Verbrauchsgüterkauf-Richtlinie (EU) 2019/771 harmonisiert diese Rechte unionsweit. Für beworbene Preissenkungen gilt § 11 PAngV mit dem 30-Tage-Tiefstpreis, für Werbeaussagen und Bewertungen gelten §§ 5, 5a und 5b UWG.

Affiliate und Marken: Einige Verlinkungen in diesem Artikel können Affiliate-Links im Rahmen des Amazon-Partnerprogramms oder des Awin-Netzwerks sein und sind als solche gekennzeichnet. Kaufst du darüber ein, erhält aimageddon.de eine kleine Provision, ohne dass dir zusätzliche Kosten entstehen; die inhaltliche Einordnung bleibt davon unberührt. Alle genannten Markennamen sind eingetragene Warenzeichen der jeweiligen Inhaber und werden ausschließlich zur sachlichen Information verwendet.

👉 13B-Modell auf Amazon ansehen

👉 Gaming-Headset auf Amazon ansehen

👉 mechanische Tastatur auf Amazon ansehen

👉 27-Zoll-Monitor auf Amazon ansehen

👉 Netzteil auf Amazon ansehen

👉 Mainboard auf Amazon ansehen

👉 Gehäuse auf Amazon ansehen

👉 Kühler auf Amazon ansehen

👉 Gaming-Maus auf Amazon ansehen

👉 Gaming-Tastatur auf Amazon ansehen

👉 Webcam auf Amazon ansehen

👉 Mikrofon auf Amazon ansehen

👉 Mousepad auf Amazon ansehen

👉 LED-Strips auf Amazon ansehen

👉 Gaming-Chair auf Amazon ansehen

👉 Gaming-Tisch auf Amazon ansehen

👉 Balkonkraftwerk auf Amazon ansehen

👉 Solarmodule auf Amazon ansehen

👉 Wechselrichter auf Amazon ansehen

👉 Batteriespeicher auf Amazon ansehen

👉 Wallbox auf Amazon ansehen

👉 Kamera auf Amazon ansehen

👉 Objektiv auf Amazon ansehen

👉 Drohne auf Amazon ansehen

👉 Gimbal auf Amazon ansehen

👉 Stativ auf Amazon ansehen

👉 Speicherkarte auf Amazon ansehen

👉 Küchenmaschine auf Amazon ansehen

👉 Thermomix auf Amazon ansehen

👉 Airfryer auf Amazon ansehen

👉 Mixer auf Amazon ansehen

👉 Pfanne auf Amazon ansehen

👉 Messer auf Amazon ansehen

👉 Bücher auf Amazon ansehen

👉 Möbel auf Amazon ansehen

👉 Kleidung auf Amazon ansehen

👉 Werkzeug auf Amazon ansehen

👉 Kabel auf Amazon ansehen

👉 Adapter auf Amazon ansehen

👉 Taschen auf Amazon ansehen

* Produktlinks sind Affiliate-Links. Bei einem Kauf über diese Links erhalten wir eine kleine Provision – für dich entstehen keine Mehrkosten.

Hinweis: Dieser Artikel gibt unsere persönliche Einschätzung und Recherche wieder. Technische Daten, Preise und Verfügbarkeit können sich jederzeit ändern. Wir bemühen uns um korrekte Angaben, übernehmen jedoch keine Gewähr für Vollständigkeit und Aktualität.

Affiliate-Hinweis: Dieser Beitrag enthält Affiliate-Links (mit * oder als Amazon-Partnerlink gekennzeichnet). Bei einem Kauf über diese Links erhalten wir eine kleine Provision – für dich entstehen dabei keine zusätzlichen Kosten. Wir empfehlen nur Produkte, die wir für sinnvoll halten.
Ghost Writer

Über den Autor

Ghost Writer