Mini-PC für lokale KI – frachtfrei und kurzfristig aus Deutschland
Bild: KI-generiert
Geschrieben von Michael Radtke · Zuletzt aktualisiert: 25. August 2026

Mini-PC für lokale KI: Hardware und Modelle 2026

Mini-PC für lokale KI ist 2026 eine interessante Möglichkeit, Sprachmodelle und andere KI-Anwendungen direkt auf dem eigenen Rechner auszuführen. Winzige Rechner, die auf den Schreibtisch passen, sind dafür gut geeignet. Der Grund: Offene Sprachmodelle sind gut genug für echte Arbeit – und laufen auf einem Mini-PC, wobei keine nutzungsabhängigen Gebühren anfallen und der Betrieb offline möglich ist. Bei rein lokal konfigurierter Verarbeitung können Eingaben und Dokumente auf dem eigenen Gerät bleiben; Updates, Modelldownloads und zugeschaltete Online-Funktionen können weiterhin Netzwerkverkehr erzeugen. Genau deshalb sind die interessantesten Modelle regelmäßig vergriffen. Wenn beim konkreten Angebot Versand aus Deutschland und kostenloser Versand ausgewiesen sind, entfallen Zoll, zusätzliche Frachtkosten und lange Wartezeiten. Prüfe Lagerort, Versandkosten und Lieferzeit vor der Bestellung. Diese Seite erklärt, worauf es beim Kauf wirklich ankommt und welcher Mini-PC welches KI-Modell stemmt.

Kurz gesagt: Bei einem Mini-PC für lokale KI entscheidet zuerst der gemeinsam genutzte Speicher darüber, welche Modellgröße überhaupt läuft. Als grobe Orientierung:

  • 16 GB: grobe 4-Bit-Orientierung: kleine Modelle bis etwa 8 Milliarden Parameter
  • 32 GB: grobe 4-Bit-Orientierung: Modelle im Bereich 13 bis 30 Milliarden Parameter, größere nur mit wenig Reserve
  • 64 GB: grobe 4-Bit-Orientierung: Modelle im Bereich 30 bis 70 Milliarden Parameter – je nach Modell, Quantisierung und Kontext
  • 128 GB: große Modelle mit mehr Spielraum bei Kontextlänge und parallelen Programmen

Wie schnell das Ganze antwortet, hängt zusätzlich von Speicherbandbreite, Recheneinheit und verwendeter Software ab. Verbreitete Plattform ist derzeit AMDs Ryzen AI Max+ 395.

Kurz beantwortet: Der verfügbare Speicher setzt häufig die harte Grenze dafür, welche Modellgröße überhaupt geladen werden kann; wie schnell das Modell anschließend läuft, hängt zusätzlich stark von Speicherbandbreite, GPU- und CPU-Leistung sowie der Software ab. Auf Systemen mit gemeinsam genutztem Speicher wird ein Teil des RAM der Grafikeinheit zugeordnet. Je mehr Modell, KV-Cache und Laufzeitdaten in dem von der GPU nutzbaren Speicher verbleiben können, desto günstiger ist das für die Geschwindigkeit. Reicht dieser nicht, können manche Laufzeitumgebungen teilweise auf CPU beziehungsweise Systemspeicher ausweichen – meist mit Leistungseinbußen. Wer heute kauft, sollte den Speicher deshalb großzügiger wählen als nötig – nachrüsten ist bei kompakten Geräten oft nicht möglich. Anschlüsse wie USB4 oder OCuLink halten den Weg zu einer externen Grafikkarte offen.

Warum ausgerechnet Mini-PCs für KI?

Lokale KI hat drei praktische Vorteile: Die Eingaben werden auf dem eigenen Gerät verarbeitet, es fallen keine nutzungsabhängigen Gebühren pro Anfrage an, und der Betrieb funktioniert auch ohne Internetverbindung. Netzwerkverkehr kann trotzdem entstehen – etwa durch Updates oder Modelldownloads. Früher brauchte man dafür eine teure Grafikkarte mit viel Videospeicher – und selbst die stieß schnell an Grenzen. Der Durchbruch kam mit dem „unified memory“: In modernen Mini-PCs teilen sich Prozessor und Grafikeinheit einen gemeinsamen, großen Speicherpool. Dein Arbeitsspeicher wird damit praktisch zum Grafikspeicher – und du kannst deutlich größere Modelle laden als auf einer klassischen Grafikkarte mit fest verbautem, kleinem VRAM. In einem Gehäuse, das kaum größer ist als ein Buch.

Die eine Spec, auf die es ankommt: der Speicher

Bei lokaler KI gilt eine einfache Regel: Modellgewichte, Zwischenspeicher und Laufzeitbedarf müssen zusammen in den verfügbaren Speicher passen. Je nach Software lassen sich Grafik- und Arbeitsspeicher kombinieren; vollständig auf der Grafikeinheit ist es am schnellsten. Deshalb ist die Menge an unified Memory die wichtigste Kennzahl – wichtiger als Taktfrequenz oder Kern-Zahl. Die folgende Tabelle zeigt, welches Modell auf wie viel Speicher läuft:

Arbeitsspeicher (unified)Was damit lokal läuftTypische Nutzung
16 GBkleine LLMs bis ~7–8B (quantisiert), Bildgenerierung SD 1.5Einstieg, Chat-Assistent, Ausprobieren
32 GB4-Bit-Orientierung: Modelle im Bereich 13–30B, SDXL-BildgenerierungAlltag, Coding-Assistent, mittlere Modelle
64 GB4-Bit-Orientierung: Modelle im Bereich 30–70B, je nach Modell, Quantisierung und Kontexternsthafte lokale KI, größere Kontexte
128 GB70B komfortabel, bis ~120B möglich – je nach Modell, Quantisierung und KontextProfi/Homelab, große Modelle offline

← Tabelle seitlich scrollen →

Ein Detail zur Einordnung: Der gemeinsame Speicher der Mini-PCs ist groß, aber nicht so schnell angebunden wie der Speicher einer High-End-Grafikkarte. Das heißt: Du kannst sehr große Modelle laden (der entscheidende Vorteil), zahlst dafür aber mit etwas weniger Tempo pro Wort. Für die allermeisten Anwendungen ist das ein hervorragender Kompromiss.

In fünf Minuten ausrechnen, welcher Rechner dein Wunschmodell packt – wer statt einer Faustregel eine konkrete Zahl will, findet dort die Rechnung Schritt für Schritt: Parameterzahl, Quantisierungsstufe und der Aufschlag für den Kontext ergeben zusammen den benötigten Speicher.

Wichtig zur Einordnung: Diese Angaben sind eine grobe Orientierung für 4-Bit-quantisierte Modelle. Was tatsächlich läuft, hängt von Quantisierung, Modellarchitektur, Kontextlänge, KV-Cache und Laufzeitumgebung ab. Auf Plattformen mit gemeinsamem Speicher lässt sich zudem oft einstellen, wie viel davon der Grafikeinheit zugeordnet wird.

Welcher Chip? Vom Einstieg bis zum Kraftpaket

Bei den KI-Mini-PCs hat sich 2026 vor allem eine Plattform durchgesetzt:

  • AMD Ryzen AI Max+ 395 („Strix Halo“): Der Ryzen AI Max+ 395 kombiniert bis zu 128 GB gemeinsamen Speicher mit Radeon-8060S-Grafik und einer NPU mit bis zu 50 TOPS. Für lokale LLMs sind insbesondere der große gemeinsame Speicher, dessen Bandbreite, die GPU und die verwendete Laufzeitumgebung relevant; die NPU-TOPS allein sagen nicht aus, welche LLM-Größe sinnvoll läuft. Zu finden in Boxen wie GMKtec EVO-X2, MINISFORUM MS-S1 MAX oder Beelink GTR9 Pro.
  • Ryzen AI 9 HX 370 (Strix Point) / HX 470 (Gorgon Point): die Mittelklasse mit meist 32 GB – günstiger und trotzdem alltagstauglich für kleinere bis mittlere Modelle.
  • Einsteiger (Intel N100 / N150): sparsam und günstig, aber eher für Office, Mediacenter und Homelab – für ernsthafte KI zu schwach.
  • Spitzenklasse (NVIDIA GB10 / DGX-Klasse): eigene KI-Appliances mit sehr viel Rechenleistung und der ausgereiftesten Software – dafür deutlich teurer und kein normaler PC.

Wenn die integrierte Grafik irgendwann nicht mehr reicht, hilft ein Anschluss für eine externe Grafikkarte. Viele der neueren Geräte bieten USB4 oder einen OCuLink-Port, über den sich eine eGPU nachrüsten lässt. OCuLink bindet eine eGPU typischerweise direkter über PCIe an; die tatsächlich verfügbare Bandbreite hängt jedoch von der jeweiligen OCuLink- beziehungsweise USB4-Implementierung ab. Ein Modell mit solchem Anschluss zu wählen, hält dir die Tür für später offen – ohne den ganzen Rechner ersetzen zu müssen.

GMKtec EVO-X2 mit bis zu 128 GB gemeinsamem Speicher – eines der Geräte mit dem größten Speicherausbau dieser Klasse, im Einzelnen betrachtet: was 128 GB für lokale Sprachmodelle bedeuten und warum das mehr zählt als jede TOPS-Zahl.

KI-Mini-PC kaufen: welche Modelle infrage kommen – die Geräte nebeneinander, sortiert nach Speicherausbau und Anschlüssen statt nach Werbeangaben.

So kommst du zum ersten lokalen Modell

Der Einstieg ist unspektakulärer, als viele erwarten. Wer die Reihenfolge einhält, hat in einem Nachmittag ein laufendes System – und weiß danach, ob die gewählte Ausstattung passt.

  1. Speicher prüfen, bevor du bestellst. Wie viel RAM ist verbaut, wie viel lässt sich der Grafikeinheit zuweisen, und ist der Speicher überhaupt tauschbar? Diese drei Antworten entscheiden alles Weitere.
  2. Betriebssystem einrichten. Windows oder Linux – beides funktioniert. Wichtiger als die Wahl ist, dass die Treiber der Grafikeinheit aktuell sind.
  3. Eine Laufzeitumgebung installieren. Verbreitet sind schlanke Werkzeuge, die Modelle herunterladen, verwalten und über eine Oberfläche oder eine lokale Schnittstelle bereitstellen.
  4. Mit einem kleinen Modell starten. Erst prüfen, ob alles läuft, dann größer werden. So merkst du schnell, wo die Speichergrenze deines Geräts liegt.
  5. Quantisierte Varianten testen. Dieselbe Modellfamilie gibt es in mehreren Genauigkeitsstufen. Die kleinere passt in weniger Speicher und läuft flüssiger.
  6. Erst dann urteilen. Beobachte Speicherbelegung und Tokens pro Sekunde bei langen Prompts. Zu wenig Reserve für KV-Cache und Betriebssystem macht sich dabei schneller bemerkbar als bei kurzen Testfragen.

Wie du die Ausstattung realistisch prüfst: Beobachte Speicherbelegung und Tokens pro Sekunde bei realistischen, langen Prompts – nicht bei kurzen Testfragen. Lass dabei ausreichend Reserve für KV-Cache, Betriebssystem und parallel laufende Anwendungen. Kontextlänge, KV-Cache, thermische Limits und die Laufzeitumgebung beeinflussen das Ergebnis mit.

Warum die guten Modelle ständig ausverkauft sind

2026 traf ein Speicher-Engpass auf eine explodierende Nachfrage nach lokaler KI. Der knappe und teurere Arbeitsspeicher hat gerade die begehrten 64- und 128-GB-Geräte verknappt – genau die, die man für große Modelle braucht. Die Folge: Beliebte Mini-PCs sind oft nur in kleinen Chargen verfügbar und schnell vergriffen. Wer ein bestimmtes Modell im Blick hat, sollte den Bestand beobachten und bei Verfügbarkeit zugreifen, statt zu warten – und Alternativen mit gleichem Chip parat haben.

Welche Hardware ein Mini-PC für lokale Sprachmodelle wirklich braucht – der ausführliche Ratgeber dazu: Speichermenge, Bandbreite und Rechenleistung im Zusammenspiel, dazu die Software und die rechtliche Seite.

Welche Grafikkarte zu lokaler KI passt – der andere Weg: Wer einen Desktop hat, kommt mit einer Grafikkarte bei mittleren Modellen schneller ans Ziel, stößt dafür beim Speicher früher an Grenzen.

Was lokale KI wirklich kostet

Die Leistungsaufnahme hängt stark vom Gerät und vom eingestellten Leistungsprofil ab. Der Ryzen AI Max+ 395 selbst lässt sich laut AMD mit 45 bis 120 Watt konfigurieren; leistungsstarke Mini-Workstations können unter hoher Last darüber liegen. Für die tatsächlichen Stromkosten ist deshalb die gemessene Leistungsaufnahme des konkreten Geräts entscheidend. Ein Rechenbeispiel: Wer ein Gerät mit durchschnittlich 80 Watt drei Stunden täglich nutzt, kommt bei 30 Cent je Kilowattstunde auf gut zwei Euro im Monat. Ob das gegenüber einem Cloud-Abo günstiger ist, hängt vom Nutzungsumfang ab. Dazu kommt: Der Rechner bleibt ein vollwertiger x86-PC, den du auch für alles andere nutzen kannst. Als Software haben sich Ollama, LM Studio und llama.cpp etabliert; damit laufen offene Modelle wie Llama, Gemma, Mistral, Qwen oder DeepSeek direkt auf dem Gerät.

Versand aus Deutschland – worauf du achten solltest: Wenn beim konkreten Angebot Versand aus Deutschland und kostenloser Versand ausgewiesen sind, entfallen Zoll, zusätzliche Frachtkosten und lange Wartezeiten. Prüfe Lagerort, Versandkosten und Lieferzeit vor der Bestellung. Ob eine Reklamation einfacher läuft, hängt vom jeweiligen Verkäufer und dessen Rücksendebedingungen ab. Achte beim Kauf trotzdem auf die EU-/DE-Version mit passendem Netzteil, eine echte Windows-Lizenz oder bewusst Linux, klare Garantie- und Rücksendebedingungen sowie den genauen Speicherausbau. Bei AMD-Systemen solltest du zusätzlich die ROCm-Kompatibilität prüfen. Ist der Speicher verlötet, sollte er von Anfang an groß genug gewählt werden.

Typische Fehler beim Kauf

Auf diese fünf Punkte solltest du besonders achten:

  • Nach Rechenleistung statt nach Speicher entscheiden. Ein starker Chip mit zu wenig Speicher läuft langsamer als ein schwächerer mit ausreichend Speicher – weil das Modell sonst gar nicht erst hineinpasst.
  • Auf Nachrüsten setzen. Bei kompakten Geräten ist der Speicher häufig fest verlötet. Was beim Kauf fehlt, fehlt dauerhaft.
  • Anschlüsse ignorieren. Ohne USB4 oder OCuLink ist der Weg zu einer externen Grafikkarte später versperrt.
  • Nur auf den Preis schauen. Netzteil, Kühlung und Lautstärke entscheiden darüber, ob das Gerät im Dauerbetrieb erträglich ist.
  • Die Bestände unterschätzen. Gut ausgestattete Varianten sind schnell vergriffen; Nachschub braucht Zeit. Wer wartet, zahlt später oft mehr oder bekommt nur die kleinere Ausbaustufe.

So sieht der Alltag damit aus

Das Gerät steht meist unauffällig neben dem Monitor oder im Regal und läuft leise vor sich hin. Du öffnest eine Oberfläche im Browser, tippst eine Frage, bekommst eine Antwort. Bei rein lokal konfigurierter Verarbeitung bleiben Prompts und Dokumente auf dem eigenen Gerät; Online-Funktionen, Updates oder Modelldownloads können weiterhin Netzwerkverkehr erzeugen.

Der spürbarste Unterschied zum Dienst aus der Cloud ist nicht die Qualität, sondern die Hemmschwelle. Wer nicht pro Anfrage zahlt und bei rein lokaler Nutzung keine Prompts oder Dokumente an einen externen KI-Dienst überträgt, probiert mehr aus: lange Texte zusammenfassen, eigene Notizen durchsuchen, Code erklären lassen, Entwürfe umschreiben. Genau diese Alltäglichkeit ist der eigentliche Gewinn.

Und irgendwann kommt der Moment, in dem ein größeres Modell reizt. Dann entscheidet sich, ob beim Kauf großzügig geplant wurde – oder ob das Gerät an einer Grenze steht, die sich nicht mehr verschieben lässt.

Glossar: die wichtigsten Begriffe

Unified Memory

Gemeinsam genutzter Speicher: Prozessor und Grafikeinheit greifen auf denselben Speicherpool zu. Das erlaubt große Modelle, ist aber langsamer angebunden als der eigene Speicher einer Grafikkarte.

Quantisierung

Verfahren, das ein Modell mit geringerer Rechengenauigkeit speichert. Es passt dadurch in deutlich weniger Speicher, auf Kosten von etwas Antwortqualität.

OCuLink

OCuLink bindet eine eGPU typischerweise direkter über PCIe an; die tatsächlich verfügbare Bandbreite hängt jedoch von der jeweiligen OCuLink- beziehungsweise USB4-Implementierung ab. Ob er vorhanden ist, unterscheidet sich je nach Gerät und Variante.

TOPS

Rechenoperationen pro Sekunde. Hersteller unterscheiden dabei zwischen NPU-TOPS und Gesamtplattform-TOPS aus Prozessor, Grafikeinheit und NPU. Für Sprachmodelle allein wenig aussagekräftig, weil die Software diese Einheiten nicht automatisch gemeinsam nutzt.

Parameter

Die Zahl der einstellbaren Größen eines Sprachmodells, meist in Milliarden angegeben – der Ausgangspunkt für die Speicherrechnung.

x86

Die verbreitete Prozessorarchitektur normaler PCs. Ein Mini-PC dieser Bauart bleibt neben der KI-Nutzung ein vollwertiger Rechner für alles andere.

Häufige Fragen zu Mini-PCs für KI

Reicht ein Mini-PC überhaupt für ernsthafte Arbeit?

Für Textarbeit, Zusammenfassungen, Übersetzungen und Codehilfe reicht die Leistung heutiger Geräte in vielen Fällen aus. Grenzen zeigen sich bei sehr großen Modellen und bei Aufgaben, die auf hohe Durchsatzraten angewiesen sind.

Windows oder Linux?

Beides funktioniert. Entscheidend sind aktuelle Treiber für die Grafikeinheit und dass die gewünschte Laufzeitumgebung unterstützt wird. Wer sich auskennt, fährt mit Linux oft ressourcenschonender.

Wie viel Strom verbraucht so ein Gerät?

Deutlich weniger als ein Desktop mit dedizierter Grafikkarte, aber im Dauerbetrieb ist es kein Nulltarif. Für die Rechnung zählt vor allem, wie oft und wie lange tatsächlich Modelle laufen.

Kann ich später eine externe Grafikkarte anschließen?

Nur wenn das Gerät die passenden Anschlüsse mitbringt – USB4 oder OCuLink. Ob sie vorhanden sind, unterscheidet sich je nach Modell und Ausstattungsvariante und sollte vor dem Kauf geprüft werden.

Warum ist das Gerät bei größeren Modellen plötzlich zäh?

Meist, weil das Modell nicht mehr vollständig in den zugewiesenen Speicher passt. Dann wird ausgelagert, und die Antwortgeschwindigkeit bricht ein. Abhilfe schafft eine kleiner quantisierte Variante oder mehr Speicher.

Welcher Mini-PC eignet sich für lokale KI?

Der verfügbare Speicher setzt häufig die harte Grenze dafür, welche Modellgröße überhaupt geladen werden kann; wie schnell das Modell anschließend läuft, hängt zusätzlich stark von Speicherbandbreite, GPU- und CPU-Leistung sowie der Software ab. Boxen mit AMD Ryzen AI Max+ 395 („Strix Halo“) und 64–128 GB gemeinsamem Speicher sind 2026 eine verbreitete Wahl – als grobe 4-Bit-Orientierung für Modelle von 30B bis über 70B, je nach Quantisierung und Kontext. Für den Einstieg genügen 32-GB-Geräte mit Ryzen AI 9 HX.

Welche Rolle spielt der Arbeitsspeicher?

Der verfügbare Speicher setzt häufig die harte Grenze dafür, welche Modellgröße überhaupt geladen werden kann; wie schnell das Modell anschließend läuft, hängt zusätzlich stark von Speicherbandbreite, GPU- und CPU-Leistung sowie der Software ab. Modellgewichte, Zwischenspeicher und Laufzeitbedarf müssen zusammen in den verfügbaren Speicher passen; je nach Software lassen sich Grafik- und Arbeitsspeicher kombinieren. Bei Mini-PCs teilen sich CPU und Grafik einen gemeinsamen Speicherpool (unified memory) – dein RAM wird praktisch zum „VRAM“ und erlaubt größere Modelle als eine Grafikkarte mit fest verbautem, kleinem VRAM.

Wie viel RAM brauche ich für welches Modell?

Als grobe Orientierung für 4-Bit-quantisierte Modelle: 16 GB für kleine Modelle bis etwa 8B, 32 GB für 13–30B, 64 GB für 30–70B und 128 GB für 70B bis rund 120B. Der tatsächliche Speicherbedarf hängt von Modellarchitektur, Quantisierung, Kontextlänge, KV-Cache und Laufzeitumgebung ab.

Warum sind gute KI-Mini-PCs oft ausverkauft?

2026 hat ein Speicher-Engpass die Preise getrieben und die Verfügbarkeit verknappt. Gleichzeitig ist die Nachfrage nach lokaler KI stark gestiegen. Beliebte Modelle sind daher schnell vergriffen – es lohnt, den Bestand im Blick zu behalten und bei Verfügbarkeit zuzugreifen.

Lohnt sich lokale KI gegenüber der Cloud?

Für viele ja: Es fallen keine nutzungsabhängigen Gebühren pro Anfrage an, Offline-Betrieb ist möglich, und bei rein lokal konfigurierter Verarbeitung können Prompts und Dokumente im eigenen Netz bleiben. Für Updates, Modelldownloads oder zugeschaltete Webfunktionen kann trotzdem Netzwerkverkehr entstehen. Die Stromkosten hängen vom konkreten Gerät und Leistungsprofil ab; ob lokale KI günstiger als ein Cloud-Abo ist, hängt deshalb vom Nutzungsumfang ab.

Welche Software nutze ich für lokale Modelle?

Verbreitet sind Ollama, LM Studio und llama.cpp; für Server-Setups vLLM. Damit läuft eine ganze Reihe offener Modelle wie Llama, Gemma, Mistral, Qwen oder DeepSeek direkt auf dem Gerät.

Was bringt Versand aus Deutschland statt Direktversand aus China?

Bei Versand aus einem deutschen Lager muss das Gerät nicht erst als einzelne Sendung aus China eingeführt werden, und die Lieferzeit kann deutlich kürzer sein. Beim Direktversand aus Übersee drohen dagegen lange Lieferzeiten und mögliche Einfuhrkosten. Ob Versandkosten anfallen und wie Rücksendungen oder Reklamationen abgewickelt werden, hängt vom konkreten Angebot und Verkäufer ab.

Worauf sollte ich sonst achten?

Auf die EU-/DE-Version mit passendem Netzteil, eine echte Windows-Lizenz (oder bewusst Linux), klare Garantie-Bedingungen und den Speicher-Ausbau – gerade bei verlötetem Speicher, der sich nicht nachrüsten lässt.

Dieser Beitrag ist eine redaktionelle Kaufhilfe. Technische Angaben und Verfügbarkeiten ändern sich laufend; maßgeblich sind die Angaben des jeweiligen Anbieters zum Zeitpunkt des Kaufs.
Haben Sie eine Meinung zu diesem Artikel? Hier können Sie uns schreiben →
Haben Sie Fehler entdeckt? Dann weisen Sie uns gern darauf hin →