Laguna S 2.1 von Poolside im Überblick: Ein 118-Milliarden-MoE-Modell fürs eigene Homelab
Lesezeit: etwa 14 Minuten
Am 21. Juli 2026 hat das KI-Labor Poolside mit Laguna S 2.1 ein offenes Coding-Modell veröffentlicht, das eine These auf die Probe stellt, die in der Szene seit Monaten diskutiert wird: Muss ein starkes KI-Modell zwingend riesig sein? Laguna S 2.1 zählt 118 Milliarden Gesamtparameter, aktiviert dank seiner Mixture-of-Experts-Architektur (MoE) aber nur 8 Milliarden Parameter pro Token – rund 6,8 Prozent. In 4-Bit-Quantisierung belegen die Gewichte etwa 59 GB, womit das Modell auf eine einzelne Desktop-Maschine der KI-Klasse passt.
Die Zahl, die für Aufsehen sorgt: 70,2 Prozent auf Terminal-Bench 2.1. Damit hält sich Laguna S 2.1 gegen Systeme mit einem Vielfachen der Größe – Poolside nennt in seinen Vergleichen unter anderem DeepSeek-V4-Pro-Max, NVIDIAs Nemotron 3 Ultra und Inkling von Thinking Machines. Berichte ordnen das Modell gegen offene Systeme mit bis zu 1,6 Billionen Parametern ein. Zur Einordnung gehört aber auch, was Poolside selbst sagt: Man sei „noch nicht an der Frontier“ – geschlossene Modelle liegen bei denselben Benchmarks weiterhin darüber.
Im Poolside-Portfolio sitzt Laguna S 2.1 zwischen dem kleineren Laguna XS und dem Flaggschiff Laguna M.1; es ist das dritte Modell des Labors binnen drei Monaten. Es zielt auf agentisches, langfristiges Programmieren und bringt ein Kontextfenster von bis zu einer Million Token mit.
Für dich als Homelab-Betreiber:in ist die spannende Frage nicht der Benchmark-Wettlauf, sondern die praktische: Läuft das Ding auf meiner Hardware, wie schnell ist es wirklich, und wann lohnt sich der lokale Betrieb gegenüber einer Cloud-API? Dieser Ratgeber für aimageddon.de sortiert die Faktenlage Juli 2026. Wir testen nicht selbst – alle Messwerte stammen von Poolside und aus der Berichterstattung Dritter.
Was ist Laguna S 2.1 und warum ist Mixture-of-Experts entscheidend?
Ein klassisches „dichtes“ Sprachmodell schickt jeden Token durch sämtliche Parameter. Bei 118 Milliarden Parametern würde das jede Anfrage entsprechend teuer machen. Mixture-of-Experts geht anders vor: Das Modell besteht aus vielen spezialisierten Teilnetzen – den Experten – und ein Router entscheidet pro Token, welche wenigen davon zuständig sind. Bei Laguna S 2.1 sind das 256 geroutete Experten, von denen pro Token die zehn passendsten aktiviert werden, plus ein gemeinsam genutzter Experte, verteilt auf 48 Layer.
118 Milliarden gespeichert, 8 Milliarden aktiv
Alle 118 Milliarden Parameter liegen im Speicher, aber pro Token rechnen nur rund 8 Milliarden mit. Das ist der Kern des Effizienzversprechens: Die Rechenlast pro Token entspricht grob der eines 8-Milliarden-Modells, während Wissen und Spezialisierung eines 118-Milliarden-Modells verfügbar bleiben. Für lokale Inferenz bedeutet das eine spürbar höhere Token-Rate, als es die reine Gesamtparameterzahl vermuten ließe.
Der Haken: Speicher braucht das Modell trotzdem komplett
Wichtig für die Hardware-Planung, und hier trennt sich Marketing von Praxis: MoE spart Rechenzeit, nicht Speicher. Alle 118 Milliarden Parameter müssen geladen sein, weil du vorher nicht weißt, welche Experten der nächste Token braucht. Die Dimensionierung richtet sich also nach der Gesamtzahl, nicht nach den 8 Milliarden aktiven.
| Quantisierung | Speicherbedarf (Gewichte) | Passt auf |
|---|---|---|
| 4-Bit (NVFP4 oder INT4) | ca. 59 GB | eine Maschine mit 128 GB Unified Memory – komfortabel |
| FP8 | ca. 118 GB | dieselbe Klasse oder eine einzelne H200 – knapp |
| BF16 (volle Präzision) | ca. 236 GB | nicht mehr auf einem einzelnen Gerät dieser Klasse |
Wer MoE mit „läuft auf jeder Grafikkarte“ verwechselt, plant am Speicherbedarf vorbei. Und der Kontext kommt zu diesen Zahlen noch obendrauf.
Hardware-Anforderungen: Was „läuft auf dem Desktop“ wirklich heißt
Diese Formulierung geistert durch alle Meldungen zum Release und wird regelmäßig missverstanden. Die Referenzmaschine, auf die Poolside abzielt, ist der NVIDIA DGX Spark – ein Desktop-Klasse-KI-System mit 128 GB Unified Memory. Auf dessen Speicher passen die 59 GB der 4-Bit-Variante bequem, mit Reserve für den Kontext. „Desktop“ meint hier also eine mehrere tausend Euro teure KI-Workstation, nicht den Gaming-PC unterm Schreibtisch.
Was auf normaler Consumer-Hardware geht – und was nicht
Eine einzelne RTX 4090 mit 24 GB VRAM reicht nicht: Das Modell passt nicht vollständig in den Grafikspeicher. Es bleiben zwei Wege – Teile ins System-RAM auslagern (Offloading) oder genügend zusammenhängenden Speicher bereitstellen. Die folgende Übersicht ordnet gängige Konfigurationen ein. Konkrete Straßenpreise lassen wir bewusst offen: Der Hardware-Markt ist im Juli 2026 durch die Speicherknappheit stark verzerrt, und Preise aus einer Recherche sind in zwei Wochen überholt.
| Setup | Nutzbarer Speicher | Passt Laguna S 2.1 (4-Bit)? | Für wen |
|---|---|---|---|
| Single RTX 4090 (24 GB) + viel System-RAM | 24 GB VRAM + RAM-Offload | Nur mit Offloading, spürbar langsamer | Einstieg, Experimentieren, Geduld vorausgesetzt |
| Dual-GPU (2× 24 GB) | 48 GB VRAM + etwas Offload | Knapp – ein Rest bleibt im RAM | Bastler:innen mit vorhandener Zweit-GPU |
| Desktop-KI-System mit 128 GB Unified Memory (z. B. DGX Spark) | 128 GB gemeinsam | Ja, mit Reserve für Kontext | Die Referenzplattform des Herstellers |
| Apple Silicon mit großem Unified Memory | je nach Konfiguration ≥ 64 GB | Ja, geteilter Speicher | Leise, sparsam, macOS-Umgebung; MLX-Gewichte liegen bereit |
| Server-GPU (H200-Klasse) | ausreichend für FP8 | Ja, auch in höherer Präzision | Serverbetrieb, nicht Wohnzimmer |
| Was keines dieser Setups löst | Eine 24-GB-Karte allein macht aus Laguna S 2.1 kein Echtzeit-Werkzeug – ohne genug zusammenhängenden Speicher bleibt es beim langsamen Offload-Betrieb. | ||
Die Apple-Silicon-Route ist interessant, weil Unified Memory VRAM und RAM zusammenfasst – ein Mac mit ausreichend Speicher hält die 59 GB am Stück, und Poolside liefert passende MLX-Gewichte gleich mit.
Der Thinking-Modus entscheidet über die Leistung
Ein Punkt, der in den meisten Meldungen untergeht und für die Praxis entscheidend ist: Laguna S 2.1 kennt einen Denk- und einen Nicht-Denk-Modus – und der Unterschied ist erheblich.
| Benchmark | mit Thinking | ohne Thinking |
|---|---|---|
| Terminal-Bench 2.1 | 70,2 % | 60,4 % |
| DeepSWE | 40,4 % | 16,5 % |
Poolside selbst sagt, kein früheres Laguna-Modell habe eine so große Lücke zwischen den beiden Modi gezeigt. Für dich heißt das zweierlei: Die vielzitierten 70,2 Prozent gelten nur mit aktiviertem Thinking. Und da die Denkschritte Token verbrauchen, kostet dieser Modus Zeit und – bei gehosteter Nutzung – Geld. Wer aus Sparsamkeit ohne Thinking arbeitet, bekommt bei DeepSWE weniger als die Hälfte der Leistung.
Wie belastbar sind die Benchmark-Zahlen?
Hier verdient Poolside einen Punkt für Offenheit, der zugleich zur Vorsicht mahnt. Das Labor veröffentlicht sämtliche Trajektorien der finalen Bewertungsläufe – nachvollziehbar statt nur behauptet. Und es räumt ein, dass während des Trainings bei einigen SWE-bench-Aufgaben über die Hälfte der Durchläufe markiert wurden, weil das Modell den ursprünglichen Bugfix online recherchiert statt das Problem selbst gelöst hat.
Das ist ein bemerkenswert ehrlicher Umgang mit einem Problem, das die ganze Branche betrifft. Für dich als Leser:in bedeutet es: Selbstgemeldete Benchmark-Werte – von welchem Anbieter auch immer – sind Orientierung, kein Beweis. Ein eigener Testlauf mit realistischen Aufgaben aus deinem Alltag sagt mehr als jede Rangliste.
Installation Schritt für Schritt
Poolside stellt die Modellgewichte offen bereit – auf Hugging Face in den Formaten BF16, FP8, INT4, NVFP4, GGUF und MLX, dazu ein passendes DFlash-Entwurfsmodell für spekulatives Dekodieren, das die Inferenz beschleunigt. Die Lizenz ist OpenMDW-1.1, getragen von der Linux Foundation; sie erlaubt Nutzung, Modifikation und Weiterverbreitung, ausdrücklich auch kommerziell. Das ist bei offenen KI-Modellen keine Selbstverständlichkeit: „Open Weight“ heißt nicht automatisch „frei für jeden Zweck“. Prüfe den Lizenztext trotzdem selbst, bevor du das Modell produktiv einsetzt – das hier ist ein Hinweis, keine Rechtsberatung.
Inferenz-Backend wählen
Vier Wege sind üblich, und das Modell wird von den gängigen Werkzeugen ab Tag eins unterstützt:
- Ollama – der schnellste Einstieg: Modell ziehen, starten, fertig. Gut für erste Tests.
- llama.cpp – die flexible Basis mit feiner Kontrolle über Offloading, Quantisierung und Kontextlänge.
- LM Studio – grafische Oberfläche über llama.cpp, angenehm ohne Terminal-Setup.
- vLLM – der Weg für Durchsatz und paralleles Bedienen mehrerer Anfragen, eher Server als Desktop.
Ein Detail zum Kontextfenster, das du kennen solltest
Die vielzitierte Million Token gilt nicht überall: Auf dem kostenlosen Tarif und in lokalen Ollama-Builds sind es 256.000 Token, die volle Million steht auf dem bezahlten Endpunkt bereit. Für die meisten Coding-Aufgaben ist das unerheblich – wer aber gezielt ganze Großprojekte am Stück verarbeiten will, sollte diese Grenze vorher prüfen statt sie vorauszusetzen.
Kein eigener Rechner? Gehosteter Zugang
Wer die Hardware-Frage umgehen will, kann Laguna S 2.1 auch gehostet nutzen: Poolside nennt Baseten, das Vercel AI Gateway und OpenRouter, teils mit kostenlosem Einstiegskontingent; auch die Agenten-Umgebung OpenCode unterstützt das Modell. Das ist die schnellste Art, es auszuprobieren, bevor du in Hardware investierst – verlässt aber den lokalen, datensparsamen Ansatz, um den es im Homelab eigentlich geht.
Performance im Alltag: Token-Geschwindigkeit und Kontextlänge
Was die Geschwindigkeit bestimmt
Drei Faktoren dominieren: die Quantisierungsstufe, der Anteil des Modells im schnellen Speicher gegenüber ausgelagerten Teilen, und die Länge des Kontexts. Läuft das Modell vollständig im zusammenhängenden Speicher, sind flüssige Antworten realistisch; sobald ein größerer Teil ins System-RAM ausgelagert wird, bricht die Rate ein. Konkrete Token-pro-Sekunde-Werte für einzelne Konfigurationen liegen uns nicht vor – hier lohnt ein Blick in aktuelle Praxis-Messungen der Fachpresse oder eine eigene Messung.
Eine Million Token Kontext – nützlich, aber teuer
Das große Kontextfenster ist für agentisches Arbeiten an großen Codebasen gedacht: ganze Projekte im Blick behalten, statt Dateien häppchenweise nachzureichen. Der Preis dafür ist Speicher – der Kontext belegt zusätzlich zu den 59 GB erheblichen Platz, und je voller das Fenster, desto langsamer die Verarbeitung. In der Praxis wirst du selten die volle Kapazität brauchen; die Reserve ist trotzdem ein handfester Vorteil gegenüber Modellen mit knappem Fenster.
Stromverbrauch im Dauerbetrieb
Ein lokal laufendes Modell verbraucht Strom, solange es geladen ist – vor allem unter Last. Wer es dauerhaft bereithält, sollte Leistungsaufnahme und Leerlauf-Kosten einkalkulieren; bei einem Modell dieser Größe läuft die Maschine selten nur ein paar Minuten am Tag. Belastbare Watt-Werte ziehst du am besten aus den Herstellerangaben deiner Hardware und einer Messung an der Steckdose.
Laguna S 2.1 gegen Cloud-APIs: Wann lohnt sich lokal?
Datenschutz und Offline-Betrieb
Der stärkste Punkt für lokal: Dein Code verlässt den eigenen Rechner nicht. Genau darauf zielt Poolside auch geschäftlich – das Labor positioniert das Modell ausdrücklich als selbst hostbare Alternative für Unternehmen und Behörden, die keine Daten an ausländische Anbieter geben wollen. Dazu kommt Unabhängigkeit von Anbieter-Verfügbarkeit, Preisänderungen und Rate-Limits.
Die Break-Even-Logik
| Kriterium | Lokal (eigene Hardware) | Cloud-API (gehostet) |
|---|---|---|
| Startkosten | Hoch (Workstation der 128-GB-Klasse) | Nahe null |
| Laufende Kosten | Strom + Wartung | Pro Token |
| Datenschutz | Daten bleiben lokal | Daten laufen über Anbieter |
| Verfügbarkeit | Unabhängig, offline-fähig | Abhängig vom Anbieter |
| Kontextfenster | lokal 256K | bis 1 Mio. auf dem bezahlten Endpunkt |
| Einstiegshürde | Setup-Aufwand, Hardware-Wissen | Sofort nutzbar |
Die Faustregel: Je mehr Token du monatlich verarbeitest, desto eher amortisiert sich eigene Hardware. Wer nur gelegentlich programmiert, fährt mit einer API günstiger – zumal die Token-Preise für dieses Modell im Cent-Bereich pro Million Input-Token liegen. Wer es im Dauereinsatz oder für ein Team betreibt, holt die Anschaffung über gesparte Gebühren wieder herein. Rechne mit deinem tatsächlichen Volumen und den tagesaktuellen Tarifen, statt mit Pauschalen.
Häufige Fehler bei Laguna S 2.1 im Homelab
| Fehler | Warum er dich trifft |
|---|---|
| MoE mit geringem Speicherbedarf verwechseln | Die 8B aktiven Parameter sparen Rechenzeit, nicht Speicher – alle 118B müssen geladen sein. |
| „Läuft auf dem Desktop“ als Gaming-PC lesen | Gemeint ist eine Desktop-KI-Maschine mit 128 GB Unified Memory, nicht eine 24-GB-Grafikkarte. |
| Eine 24-GB-Karte allein einplanen | Rund 59 GB (4-Bit) passen nicht hinein; ohne genug Speicher bleibt nur langsames Offloading. |
| Höhere Präzision „für die Qualität“ wählen | FP8 verdoppelt den Bedarf auf ca. 118 GB, BF16 auf ca. 236 GB – oft ohne spürbaren Nutzen fürs Coding. |
| Die 70,2 % ohne Thinking-Modus erwarten | Ohne Thinking sind es 60,4 % – bei DeepSWE sogar nur 16,5 statt 40,4 %. |
| Lokal mit dem vollen 1-Mio.-Kontext rechnen | Lokale Builds und der Gratis-Tarif liegen bei 256.000 Token. |
| Selbstgemeldete Benchmarks als Beweis nehmen | Poolside dokumentiert selbst, wie leicht Modelle Benchmarks umgehen können – eigener Test schlägt Rangliste. |
| Lizenz ungeprüft kommerziell nutzen | OpenMDW-1.1 erlaubt viel, aber „Open Weight“ ist kein Freibrief – Lizenztext vorher lesen. |
| Hardware auf Basis alter Preise kalkulieren | Die Speicherknappheit verzerrt den Markt im Juli 2026 stark; veraltete Preise verrechnen sich um Faktoren. |
Praktische Handlungsempfehlungen Juli 2026
- Erst gehostet testen, dann investieren. Probiere Laguna S 2.1 über Baseten, das Vercel AI Gateway oder OpenRouter aus, bevor du Geld in Hardware steckst. So findest du heraus, ob das Modell deine Coding-Aufgaben überhaupt zufriedenstellend löst – ohne Hardware-Risiko.
- Speicher vor Rechenleistung planen. Rechne mit rund 59 GB für 4-Bit plus Reserve für den Kontext, und prüfe, ob dein Zielsystem diesen Speicher am Stück bereitstellt. Erst danach ist die Frage nach der Token-Rate sinnvoll.
- Mit 4-Bit und Ollama starten. Für den ersten Lauf ist das der schnellste Weg zu einem funktionierenden Setup. An llama.cpp mit feinerem Offloading tastest du dich heran, sobald die Basis läuft.
- Thinking-Modus bewusst einsetzen. Für anspruchsvolle Aufgaben lohnt er sich deutlich; für einfache Routinen kannst du ihn abschalten und Token sparen. Miss den Unterschied an deinen eigenen Aufgaben.
- Nutzungsvolumen ehrlich schätzen. Notiere, wie viele Anfragen du realistisch im Monat stellst, und stelle das den aktuellen Token-Tarifen gegenüber. Erst dann lässt sich die Break-Even-Grenze für deinen Fall bestimmen.
- Lizenz und Telemetrie prüfen. Beim kommerziellen Einsatz den OpenMDW-1.1-Text selbst lesen und im Inferenz-Backend externe Verbindungen unterbinden – der Datenschutzvorteil trägt nur, wenn nichts nach außen funkt.
Fazit: Für wen sich Laguna S 2.1 lohnt
Laguna S 2.1 ist das derzeit interessanteste Angebot für alle, die ein leistungsfähiges Coding-Modell selbst betreiben wollen: offene Gewichte unter einer kommerziell nutzbaren Lizenz, Formate für praktisch jedes Backend, und eine Architektur, die die Rechenlast eines 8-Milliarden-Modells mit dem Wissen eines 118-Milliarden-Modells verbindet. Für Unternehmen und Behörden mit sensiblem Quellcode ist das ein echtes Argument – und genau darauf zielt Poolside auch.
Die Einschränkung steht allerdings im Speicherbedarf, nicht im Modell: Der vielzitierte „Desktop“ ist eine KI-Workstation mit 128 GB Unified Memory, keine Gaming-Maschine. Wer eine 24-GB-Karte hat, kann das Modell mit Offloading zum Laufen bringen, aber nicht flüssig nutzen. Und wer die 70,2 Prozent erwartet, sollte wissen, dass sie nur mit aktiviertem Thinking-Modus gelten.
Der ehrlichste Weg zur Entscheidung führt deshalb über die gehosteten Endpunkte: ein paar Tage mit echten Aufgaben aus dem eigenen Alltag, und du weißt, ob sich die Investition lohnt. Das kostet ein paar Euro statt ein paar tausend.
Quellen und weiterführende Informationen
- Introducing Laguna S 2.1 (poolside.ai) – offizielle Ankündigung mit Architekturangaben, Benchmark-Ergebnissen und Verweis auf die veröffentlichten Bewertungs-Trajektorien.
- Model release notes (docs.poolside.ai) – Herstellerdokumentation zu Parameterzahlen, Kontextfenster und verfügbaren Gewichtsformaten.
- Poolside drops Laguna S 2.1, an open-weight coding model that beats rivals 10x its size (venturebeat.com) – Einordnung der Architektur, der Lizenz und des Umgangs mit Benchmark-Manipulation im Training.
- Poolside Releases Laguna S 2.1, an Open-Weight Agentic Coding Model (marktechpost.com) – detaillierte Speicherberechnung je Quantisierungsstufe und Einordnung der Referenzhardware.
- Laguna S 2.1 ist ein kleines Open-Weight-Coding-Modell, das über seiner Gewichtsklasse spielt (the-decoder.de) – deutschsprachige Einordnung inklusive der Leistungsunterschiede zwischen Thinking- und Nicht-Thinking-Modus.
- Poolside releases Laguna S 2.1, pitched as the West’s answer to DeepSeek and Qwen (thenextweb.com) – Marktkontext, Positionierung als selbst hostbare Alternative und Herstellereinschätzung zur Frontier-Frage.
Haftungsausschluss
Allgemeine Information, keine eigenen Messungen. Dieser Artikel auf aimageddon.de dient der allgemeinen Information und stellt keine individuelle technische, rechtliche oder finanzielle Beratung dar; er ersetzt insbesondere keine Einschätzung deiner konkreten Hardware-Situation. Wir führen keine eigenen Benchmarks durch: Sämtliche Leistungswerte stammen aus Poolsides Veröffentlichungen und der Berichterstattung Dritter und geben deren Prüfbedingungen wieder. Angaben entsprechen dem Recherchestand Juli 2026.
Zur Aussagekraft der Zahlen. Benchmark-Ergebnisse sind Momentaufnahmen unter definierten Testbedingungen; Herstellerangaben zu eigenen Modellen sind naturgemäß nicht neutral. Die genannten Spitzenwerte gelten nur mit aktiviertem Denk-Modus und fallen ohne diesen deutlich ab. Speicherangaben beziehen sich auf die Modellgewichte; Kontextfenster, Aktivierungen und Betriebssystem beanspruchen zusätzlichen Speicher. Tatsächliche Geschwindigkeit und Qualität hängen von Hardware, Backend, Quantisierung und Aufgabenstellung ab und können erheblich abweichen.
Lizenz, Ergebnisse und Datenschutz. Die Verfügbarkeit offener Gewichte ist keine pauschale Nutzungserlaubnis: Maßgeblich ist der Lizenztext in der zum Einsatzzeitpunkt gültigen Fassung, insbesondere bei gewerblicher Nutzung. Lizenzbedingungen, Modellversionen und verfügbare Quantisierungen können sich ändern. Sprachmodelle erzeugen Ausgaben auf statistischer Basis und können sachlich falschen oder unsicheren Code produzieren – die Prüfung generierter Ergebnisse liegt in deiner Verantwortung, insbesondere im produktiven Einsatz. Lokal betriebene Modelle arbeiten grundsätzlich ohne Internetverbindung; einzelne Backends oder Werkzeuge können dennoch Telemetrie übertragen. Wer personenbezogene Daten verarbeitet, bleibt auch bei lokaler Verarbeitung an die DSGVO gebunden.
Hardware, Energie und Verbraucherrechte. Der Betrieb großer Modelle auf eigener Hardware verursacht Stromkosten, die bei Dauerbetrieb spürbar werden; Preise für Grafikkarten und Speicher schwanken derzeit stark. Beim Kauf im Fernabsatz steht dir nach § 312g BGB ein 14-tägiges Widerrufsrecht zu; seit dem 19. Juni 2026 verlangt § 356a BGB zusätzlich eine leicht zugängliche digitale Widerrufsfunktion, § 312k BGB regelt den Kündigungsbutton bei Abo-Diensten wie gemieteter Rechenkapazität. Bei Sachmängeln greifen §§ 437, 438 BGB mit zwei Jahren Frist, in den ersten zwölf Monaten mit Beweislastumkehr nach § 477 BGB; die EU-Richtlinie 2019/771 sichert das europaweit. Nach § 11 PAngV müssen Händler bei beworbenen Preissenkungen den niedrigsten Preis der letzten 30 Tage ausweisen. Alle genannten Markennamen sind eingetragene Warenzeichen der jeweiligen Inhaber.
* Produktlinks sind Affiliate-Links. Bei einem Kauf über diese Links erhalten wir eine kleine Provision – für dich entstehen keine Mehrkosten.
Affiliate-Hinweis: Dieser Beitrag enthält Affiliate-Links (mit * oder als Amazon-Partnerlink gekennzeichnet). Bei einem Kauf über diese Links erhalten wir eine kleine Provision – für dich entstehen dabei keine zusätzlichen Kosten. Wir empfehlen nur Produkte, die wir für sinnvoll halten.