KI lokal betreiben: Welche Hardware ein Mini-PC für lokale LLM-Modelle wirklich braucht
Jede Frage, die du in ein Cloud-Modell tippst, verlässt dein Haus. Jeder Vertrag, den du zusammenfassen lässt, jede Patientenakte, jede Kalkulation, jede Zeile Quelltext. Bei einer Rezeptidee ist das gleichgültig. Bei allem anderen nicht – und genau deshalb wollen immer mehr Nutzer ihre KI lokal betreiben, auf eigener Hardware, ohne Internetverbindung, ohne Anbieter dazwischen.
Kurz beantwortet: Ob ein Sprachmodell lokal läuft, entscheidet die Speichermenge. Wie schnell es antwortet, wird stark von der Speicherbandbreite beeinflusst. Die kombinierte TOPS-Zahl auf dem Datenblatt sagt für sich allein wenig darüber aus, wie schnell ein lokales Sprachmodell tatsächlich läuft. Wer das versteht, kauft die richtige Hardware – und spart sich einen teuren Fehlkauf.
Dieser Ratgeber zeigt dir Schritt für Schritt, welche Hardware ein LLM lokal wirklich verlangt, welche Modellgrößen auf welcher Ausstattung laufen und wann ein kompakter Mini-PC für KI die bessere Wahl ist als eine teure Grafikkarte. Als konkretes Beispiel dient die neue Mini-PC-Linie von GPD, weil sie einen Anschluss mitbringt, den es in dieser Geräteklasse bisher nicht gab. Es geht dabei ausdrücklich nicht um Gaming, sondern um lokale KI, Datenschutz und den eigenen KI-Server im Heimnetz.
Kurz gesagt: Welche Modellgröße du lokal betreiben kannst, hängt zuerst vom verfügbaren Speicher ab. Wie schnell das Modell läuft, bestimmen zusätzlich Speicherbandbreite, Rechenleistung und Software-Backend. Modellgewichte, Zwischenspeicher und Laufzeitbedarf müssen zusammen in den nutzbaren Speicher passen. Videospeicher und Arbeitsspeicher lassen sich dabei je nach Software kombinieren – läuft alles auf der Grafikkarte, ist es am schnellsten. Als grobe Orientierung:
- 8 bis 16 GB: kleine Modelle bis etwa 8 Milliarden Parameter, quantisiert – für Textarbeit und Zusammenfassungen
- 32 GB: komfortabel für Modelle mit 7 bis 14 Milliarden Parametern; quantisierte 30-B-Modelle laufen je nach Quantisierung und Kontextlänge ebenfalls, aber mit wenig Reserve
- 64 GB und mehr: macht Modelle um 70 Milliarden Parameter in geeigneter Quantisierung realistisch – eine hohe Geschwindigkeit ist damit aber nicht automatisch gesichert
Zwei Wege führen dorthin: ein Mini-PC mit gemeinsam genutztem Speicher oder ein Rechner mit Grafikkarte. Die dedizierte Grafikkarte ist in der Regel schneller, während Mini-PCs mit gemeinsam genutztem Speicher je nach Konfiguration deutlich mehr für das Modell nutzbaren Speicher bieten können.
- Warum KI lokal betreiben statt in der Cloud?
- Was ein lokales Sprachmodell wirklich verlangt: drei Größen
- Welches Modell braucht wie viel Speicher?
- Der Denkfehler mit den TOPS
- Zwei Wege zur lokalen KI: geteilter Speicher oder Grafikkarte
- Wie dein eigener KI-Server im Alltag aussieht
- GPD BOX: Was die Mini-PC-Linie für lokale KI mitbringt
- Die MCIO-Falle: Der wichtige Anschluss sitzt auf der kleineren CPU
- GPD G2: Wann eine externe Grafikkarte für KI wirklich etwas bringt
- Die Software: Womit du lokale Sprachmodelle startest
- Datenschutz und DSGVO: der eigentliche Grund für lokale KI
- In vier Schritten zur eigenen lokalen KI
- Welche Konfiguration passt zu welchem Vorhaben?
- Ehrliche Grenzen: Was du vor der Bestellung wissen solltest
- Glossar: die wichtigsten Begriffe
- Häufige Fragen zu lokaler KI und Mini-PC-Hardware
- Weiterlesen
Warum KI lokal betreiben statt in der Cloud?
Ein Cloud-Dienst ist bequem: Abo zahlen, Frage eintippen, Antwort bekommen. Der Preis dafür ist nicht nur das Abo, sondern die Verarbeitung auf fremden Servern, oft außerhalb der EU. Eine lokale KI kehrt das Verhältnis um. Das Sprachmodell liegt als Datei auf deiner Festplatte, und die Berechnung passiert in deinem Gerät. Die Eingaben selbst verlassen den Rechner damit nicht. Das hat vier praktische Folgen:
- Datenhoheit: Die Eingaben werden lokal verarbeitet und gehen nicht an einen KI-Anbieter. Netzwerkverkehr kann trotzdem entstehen – etwa durch Software-Updates, Modelldownloads oder zugeschaltete Webfunktionen.
- Keine nutzungsabhängigen Gebühren: Nach dem Hardwarekauf fallen keine Token-Gebühren an. Wer viel verarbeitet, rechnet das schneller herein, als es zunächst wirkt.
- Unabhängigkeit: Niemand kann dir den Zugang sperren, Preise erhöhen oder ein Modell abkündigen. Ein einmal heruntergeladenes Modell kann unabhängig vom ursprünglichen Cloud-Anbieter weiter betrieben werden, solange Hardware und Software kompatibel bleiben.
- Offline-Fähigkeit: Die KI arbeitet ohne Internet – im Zug, in der Werkstatt, im abgeschotteten Firmennetz.
Der ehrliche Gegenpunkt: Die größten Cloud-Modelle sind weiterhin stärker als das, was auf einem Schreibtischgerät läuft. Wer die absolut beste Antwortqualität braucht und keine sensiblen Daten verarbeitet, fährt mit der Cloud besser. Lokale KI lohnt sich dort, wo Vertraulichkeit, Dauerbetrieb oder Unabhängigkeit den Ausschlag geben.
Was ein lokales Sprachmodell wirklich verlangt: drei Größen
1. Speichermenge – entscheidet, OB das Modell läuft
Modellgewichte, Zwischenspeicher und weiterer Laufzeitbedarf müssen zusammen in den verfügbaren Speicher passen. Je nach Software lassen sich Grafikspeicher und Arbeitsspeicher kombinieren: Ein Teil der Modellschichten läuft dann auf der Grafikeinheit, der Rest auf dem Prozessor. Vollständiges Auslagern auf die Grafikeinheit ist in der Regel schneller, aber nicht zwingend erforderlich. Die Speichermenge ist die harte Grenze: Sie entscheidet, welche Modellklasse überhaupt in Frage kommt.
2. Speicherbandbreite – entscheidet, WIE SCHNELL es antwortet
Für jedes einzelne Wort muss ein Sprachmodell rechnerisch einmal komplett durch den Speicher geschickt werden. Deshalb hängt die Ausgabegeschwindigkeit – gemessen in Token pro Sekunde – bei vielen lokal ausgeführten Modellen wesentlich an der Speicherbandbreite; wie stark sie limitiert, hängt von Modellarchitektur, Quantisierung, Recheneinheit und Software-Backend ab. Das ist der Punkt, den Datenblätter am liebsten verschweigen, und der über „angenehm nutzbar“ und „Wort für Wort zusehen“ entscheidet.
3. Rechenleistung – entscheidet über lange Eingaben
Reine Rechenleistung wirkt vor allem beim Prompt Processing: Wenn du ein 40-seitiges PDF einwirfst, muss die Eingabe erst verarbeitet werden, bevor das erste Wort der Antwort erscheint. Beim Prompt Processing gewinnt die Rechenleistung stärker an Bedeutung. Die kombinierte TOPS-Werbezahl bleibt trotzdem nur eingeschränkt vergleichbar, weil Prozessor, Grafikeinheit und NPU nicht automatisch gemeinsam von der verwendeten Software genutzt werden.
Welches Modell braucht wie viel Speicher?
Sprachmodelle werden für den lokalen Betrieb quantisiert: Die Gewichte werden von hoher auf niedrigere Genauigkeit heruntergerechnet, meist auf vier Bit. Das schrumpft den Speicherbedarf drastisch, bei erstaunlich geringem Qualitätsverlust. Die folgenden Richtwerte gelten für gängige 4-Bit-Quantisierungen, noch ohne Puffer für lange Eingaben.
| Modellklasse | Speicherbedarf (4 Bit, Richtwert) | Wofür es in der Praxis taugt |
|---|---|---|
| 3B (klein) | rund 2–3 GB | Zusammenfassen, Umformulieren, Klassifizieren. Läuft praktisch überall. |
| 7B bis 8B (Einstieg) | rund 4–6 GB | Der Alltagsstandard: E-Mails, Texte, einfache Codehilfe, Fragen an eigene Dokumente. |
| 13B bis 14B (Mittelklasse) | rund 8–10 GB | Merklich bessere Antwortqualität, längere Argumentationsketten, brauchbare Übersetzungen. |
| 30B bis 32B (gehoben) | rund 18–22 GB | Anspruchsvolle Analyse, Code-Refactoring, fachliche Texte. Sprengt die meisten Grafikkarten. |
| 70B (groß) | rund 38–45 GB | Nahe an der Qualität kleinerer Cloud-Modelle. Nur mit sehr viel Speicher realistisch. |
| 100B und mehr | 60 GB aufwärts | Auf Schreibtischhardware nur mit Einschränkungen oder in Mixture-of-Experts-Bauart sinnvoll. |
An dieser Tabelle wird der eigentliche Konflikt sichtbar. Aktuelle Consumer-Grafikkarten bieten je nach Modell 8, 10, 12, 16, 24 oder bis zu 32 GB eigenen Videospeicher. Modelle mit 30 bis 32 Milliarden Parametern lassen sich je nach Quantisierung und Kontextlänge auf Karten mit 24 bis 32 GB vollständig unterbringen; größere Modelle können teilweise in den Systemspeicher ausgelagert werden, laufen dann aber deutlich langsamer. Ein Mini-PC mit 64 GB geteiltem Arbeitsspeicher kommt umgekehrt an Modelle heran, die auf keiner bezahlbaren Grafikkarte laufen. Dafür langsamer.
In fünf Minuten ausrechnen, welcher Rechner dein Wunschmodell packt – wer eine konkrete Zahl statt einer Faustregel will, findet dort die Rechnung Schritt für Schritt: Parameterzahl, Quantisierungsstufe und der Aufschlag für den Zusammenhang ergeben zusammen den benötigten Speicher.
Der Denkfehler mit den TOPS
Nahezu jeder aktuelle Prozessor wird mit einer TOPS-Angabe beworben, also mit Billionen Rechenoperationen pro Sekunde. Bei den neuen Mini-PCs stehen dort dreistellige Werte. Diese Zahl ist die Summe aus Prozessor, integrierter Grafik und NPU.
Warum die Zahl in die Irre führt: Bei der laufenden Token-Ausgabe ist Rechenleistung häufig nicht der einzige oder wichtigste Engpass; Speicherbandbreite, Modell, Quantisierung und Backend spielen zusammen. Intel-NPUs können inzwischen über OpenVINO GenAI auch Sprachmodelle direkt ausführen, werden von den verbreiteten Werkzeugen für lokale Sprachmodelle bislang kaum genutzt. Ollama, llama.cpp und LM Studio rechnen typischerweise auf Grafikeinheit oder Prozessor. NPU-Unterstützung ist bei Intel-Systemen über Zusatzpfade wie OpenVINO möglich, aber weder Standardweg noch für jedes Modell verfügbar.
Die NPU spielt ihre Stärke woanders aus: bei Bildanalyse, Rauschunterdrückung in Videokonferenzen, Spracherkennung und ähnlichen Daueraufgaben, die sie sehr stromsparend erledigt. Ein echter Vorteil für einen Rechner im Dauerbetrieb – nur eben kein Versprechen für schnelle Chat-Antworten.
Zwei Wege zur lokalen KI: geteilter Speicher oder Grafikkarte
| Kriterium | Mini-PC mit geteiltem Speicher | Desktop mit dedizierter Grafikkarte |
|---|---|---|
| Maximale Modellgröße | Sehr hoch – ein großer Teil des gemeinsam genutzten Arbeitsspeichers kann für das Modell zur Verfügung stehen | Für vollständige Ausführung auf der Karte durch deren Videospeicher begrenzt; größere Modelle können teilweise in den Systemspeicher ausgelagert werden, dann langsamer |
| Ausgabegeschwindigkeit | Niedriger, weil Systemspeicher langsamer ist | Sehr hoch, solange das Modell hineinpasst |
| Stromaufnahme | Niedrig, für Dauerbetrieb geeignet | Hoch, besonders unter Last |
| Lautstärke und Platz | Sehr kompakt, leise | Großes Gehäuse, hörbar |
| Eigenes Feintuning | Nur eingeschränkt sinnvoll | Die klar bessere Wahl |
| Erweiterbarkeit | Speicher meist verlötet – beim Kauf festlegen | Karte später austauschbar |
Daraus folgt eine einfache Faustregel: Wer viele kleine bis mittlere Modelle schnell braucht, nimmt die Grafikkarte. Wer ein möglichst großes Modell überhaupt zum Laufen bringen will, nimmt den geteilten Speicher. Und wer beides will, braucht ein Gerät, das sich um eine externe Grafikkarte erweitern lässt.
GMKtec EVO-X2 mit bis zu 128 GB gemeinsamem Speicher – das Gegenbeispiel zur Grafikkarte: Wo viele Consumer-Grafikkarten bei 16 oder 24 GB und aktuelle Spitzenmodelle bei bis zu 32 GB Videospeicher enden, stellt ein Gerät mit großem gemeinsamem Speicher auch sehr große Modelle bereit – langsamer, aber überhaupt lauffähig. Der Beitrag erklärt, warum das für lokale Sprachmodelle mehr zählt als jede TOPS-Zahl.
Wie dein eigener KI-Server im Alltag aussieht
Stell dir vor, auf deinem Schreibtisch steht ein Gerät von der Größe eines Buches. Es ist leise, es zieht wenig Strom, und es läuft durch. Darauf liegt ein Sprachmodell, das du über den Browser ansprichst – vom Notebook aus, vom Tablet, vom Telefon, alles über dein eigenes Netz. Du wirfst einen Mandantenschriftsatz hinein und bekommst eine Zusammenfassung. Du lässt dir eine Angebotsvorlage umschreiben. Du fragst deine eigenen Unterlagen ab.
Bei konsequent lokal konfiguriertem Betrieb können Prompts, Dokumente und Modellausgaben im eigenen Netz bleiben. Für Modelldownloads, Updates oder bewusst zugeschaltete Webfunktionen kann trotzdem eine Internetverbindung genutzt werden. Keine Abrechnung nach Token, kein Anbieterwechsel, keine Frage, in welchem Rechtsraum die Verarbeitung stattfindet. Genau dieses Szenario ist heute mit Hardware möglich, die unter einem Kilogramm wiegt – und die neue Mini-PC-Generation ist der Grund dafür.
GPD BOX: Was die Mini-PC-Linie für lokale KI mitbringt
GPD ist vielen als Hersteller von Handheld-Geräten bekannt. Die BOX ist etwas anderes: ein stationärer Mini-PC im Aluminium-Magnesium-Gehäuse, laut Hersteller 175 × 134 × 39,5 mm groß, 940 g schwer, 0,926 Liter Volumen. Für lokale KI zählen diese Punkte:
| Merkmal | Angabe des Herstellers | Bedeutung für lokale KI |
|---|---|---|
| Prozessor | Intel Core Ultra X7 358H oder Core Ultra 7 356H (Panther Lake), 25 bis 80 W TDP, 15 W Minimum Guaranteed | Der weite Leistungsbereich erlaubt sparsamen Dauerbetrieb und kurze Lastspitzen. |
| Arbeitsspeicher | 32 oder 64 GB LPDDR5x mit 8533 MT/s | Die 64-GB-Variante ist der eigentliche Grund, dieses Gerät für KI anzusehen. |
| Grafikeinheit | 358H: Intel Arc B390 mit 12 Xe-Kernen · 356H: Intel Graphics mit 4 Xe-Kernen | Der große Unterschied zwischen den Varianten. Nur der 358H bringt die starke integrierte Grafik mit. |
| KI-Rechenleistung | 358H: bis zu 180 TOPS · 356H: bis zu 100 TOPS (Herstellerangaben) | Summe aus CPU, GPU und NPU. Aussagekräftig für Bild- und Audio-KI, weniger für Textausgabe. |
| MCIO-8i-Anschluss | laut Hersteller ausschließlich beim Modell 356H | Der Anschluss für ein externes Grafikkarten-Dock. Wichtigster Punkt vor dem Kauf. |
| Massenspeicher | Zwei M.2-Steckplätze, einer davon PCIe Gen 5 × 4 | Modelldateien sind groß. Schneller Speicher verkürzt die Ladezeit spürbar. |
| Netzwerk | Zwei 2,5-Gigabit-Anschlüsse, Wi-Fi 6E | Erlaubt den Betrieb als KI-Server im eigenen Netz, den andere Geräte mitnutzen. |
| Sicherheit | dTPM-2.0-Chip | Hardwaregestützte Schlüsselverwaltung – passend für vertrauliche Daten. |
| Stromversorgung | 160-W-GaN-Netzteil im Gehäuse verbaut | Kein externes Netzteil, ein Kaltgerätekabel genügt. |
Zwei Details verdienen einen zweiten Blick. Erstens die 64-GB-Ausbaustufe: Weil Prozessor und Grafikeinheit sich denselben Speicher teilen, steht dieser Speicher grundsätzlich auch für Modellgewichte zur Verfügung. Damit rückt die 70B-Klasse in Reichweite. Zweitens die zwei Netzwerkanschlüsse: Sie machen aus dem Mini-PC den kleinen Heimserver aus dem Abschnitt oben.
Die MCIO-Falle: Der wichtige Anschluss sitzt auf der kleineren CPU
Wichtig vor dem Kauf: Der MCIO-8i-Anschluss, über den sich eine externe Grafikkarte anbinden lässt, ist laut Hersteller dem Modell mit dem Core Ultra 7 356H vorbehalten. Auf dem stärkeren Core Ultra X7 358H fehlt er. Wer den Ausbau mit externer Grafikkarte plant, muss also die kleinere Prozessorvariante wählen. Der Hersteller schreibt das sowohl auf der Produktseite als auch im Produktbanner – aber an einer Stelle, die man beim Konfigurieren leicht überliest.
Das ist keine Kleinigkeit, sondern die zentrale Weichenstellung. Wer die stärkere CPU nimmt, hat ein in sich geschlossenes Gerät: schnell, sparsam, kompakt – aber ohne Ausbaupfad in Richtung Grafikkarte. Der Anschluss lässt sich nicht nachrüsten. Wer die kleinere CPU nimmt, verzichtet vor allem auf integrierte Grafikleistung: Der 356H hat Intel Graphics mit vier Xe-Kernen, der 358H die deutlich stärkere Arc B390 mit zwölf. Daraus folgt eine klare Aufteilung: Der 358H ist die Wahl, wenn die lokale KI über die integrierte Grafik laufen soll. Der 356H ergibt Sinn, wenn ohnehin eine externe Grafikkarte über MCIO geplant ist – dann übernimmt diese die Rechenarbeit, und die schwächere integrierte Einheit fällt kaum ins Gewicht.
Zur Einordnung: Die Angaben zum MCIO-Anschluss weichen zwischen den beiden Produktseiten des Herstellers voneinander ab. Auf der Mini-PC-Seite ist von PCIe 5.0 mit acht Bahnen die Rede, in der technischen Tabelle des Grafikdocks dagegen von PCIe Gen 4 mit acht Bahnen und rund 31,5 GB/s effektiv. Beide nennen 256 Gbit/s theoretisch. Wer auf die genaue Anbindung angewiesen ist, sollte vor der Bestellung beim Hersteller nachfragen.
GPD G2: Wann eine externe Grafikkarte für KI wirklich etwas bringt
Das G2 ist ein externes Grafikkarten-Gehäuse, oft eGPU oder Grafikdock genannt. Laut Hersteller nimmt es eine Karte über einen PCIe-Gen-5-×16-Steckplatz auf, bringt ein eingebautes 800-W-Netzteil nach ATX-3.1-Standard mit Gold-Zertifizierung und einen 12V-2x6-Stromanschluss mit. Angebunden wird es über MCIO 8i oder über USB4 v2.0 – letzteres funktioniert damit auch an Notebooks mit Thunderbolt. Als Betriebssysteme nennt der Hersteller Windows 11 und Linux ab Kernel 6.17. Ob eine bestimmte Karte läuft, hängt zusätzlich von Host-Schnittstelle, Firmware und Betriebssystem ab.
Jetzt die ehrliche Einordnung, die auf keiner Herstellerseite steht: Für das reine Ausführen eines Sprachmodells ist die Anbindungsart weniger wichtig, als die Werbung nahelegt. Liegt das Modell erst im Speicher der Grafikkarte, läuft die Rechenarbeit dort ab, und über die Verbindung fließt wenig hin und her. Ein Grafikdock über Thunderbolt kommt in diesem Betriebsfall einer intern verbauten Karte sehr nahe.
Richtig wichtig wird die schnelle Anbindung in drei Fällen:
- Beim Laden großer Modelle: Eine mehrere Dutzend Gigabyte große Datei muss bei jedem Start über die Verbindung. Wie lange das dauert, hängt neben der Anbindung auch von der SSD und dem verwendeten Protokoll ab.
- Beim Layer-Offloading: Passt ein Modell nur teilweise in den Videospeicher, laufen bestimmte Schichten auf der Grafikkarte und die übrigen auf dem Prozessor. Zwischen beiden Teilen müssen laufend Zwischenergebnisse übertragen werden – die Geschwindigkeit der Verbindung beeinflusst das Tempo spürbar.
- Beim Feintuning und LoRA-Training: Hier fließen ständig große Datenmengen zwischen Hauptsystem und Karte. Die Bandbreite ist dabei wichtig, Videospeicher und Rechenleistung der Karte bleiben es mindestens ebenso.
Die Software: Womit du lokale Sprachmodelle startest
Die gute Nachricht: Der Einstieg ist erheblich einfacher geworden. Du brauchst weder Programmierkenntnisse noch eine Kommandozeile, wenn du nicht möchtest.
Für den bequemen Einstieg
LM Studio ist eine Anwendung mit Oberfläche, die Modelle auf Knopfdruck herunterlädt, verwaltet und startet. Du wählst ein Modell aus einer Liste, das Programm prüft, ob es auf deine Hardware passt, und danach kannst du sofort chatten.
Für den Dauerbetrieb
Ollama läuft als Dienst im Hintergrund und stellt lokal eine Schnittstelle bereit. Soll der KI-Server auch von anderen Geräten im Heimnetz erreichbar sein, muss der Netzwerkzugriff ausdrücklich konfiguriert werden. Zusammen mit einer Weboberfläche wie Open WebUI entsteht daraus eine Chat-Umgebung, die sich anfühlt wie ein bekannter Cloud-Dienst – nur dass alles im eigenen Netz bleibt.
Für maximale Kontrolle
llama.cpp ist der Unterbau, auf dem viele dieser Werkzeuge aufsetzen. Wer selbst an Quantisierung, Kontextlänge und Speicherverteilung schrauben will, arbeitet direkt damit. Auf Intel-Grafik läuft die Berechnung üblicherweise über Vulkan oder SYCL.
Linux-Hinweis: Der Hersteller nennt für das Grafikdock ausdrücklich Kernel 6.17 als Mindestanforderung. Wer eine Distribution mit langem Unterstützungszeitraum und älterem Kernel einsetzt, muss einen neueren Kernel nachziehen oder die Distribution wechseln. Gerade im KI-Umfeld ist das ein häufiger Stolperstein, weil dort viele auf stabile Serverdistributionen setzen.
Datenschutz und DSGVO: der eigentliche Grund für lokale KI
Für Selbstständige, Kanzleien, Praxen, Steuerberatungen und kleine Unternehmen ist lokale KI keine Spielerei, sondern häufig der einfachere Weg. Sobald personenbezogene Daten in ein KI-System fließen, greift die Datenschutz-Grundverordnung. Eine Verarbeitung in der Cloud ist damit nicht ausgeschlossen, sie bringt aber zusätzliche Schritte mit sich: Wird ein externer Dienstleister als Auftragsverarbeiter tätig, ist ein Auftragsverarbeitungsvertrag nötig; bei Übermittlung in ein Drittland kommt dessen Prüfung hinzu. Bei rein lokaler Verarbeitung entfallen genau diese Punkte für diesen Verarbeitungsschritt.
Der entscheidende Unterschied: Findet die Verarbeitung ausschließlich auf einem Gerät in deinen Räumen statt, entfällt der gesamte Themenblock rund um die Übermittlung an einen Dienstleister. Es gibt keinen Auftragsverarbeiter, weil niemand in deinem Auftrag verarbeitet. Das ist rechtlich der deutlich kürzere Weg – und einer der Gründe, warum sich lokale KI-Hardware für berufliche Nutzer schneller rechnet als für Privatanwender.
Dazu kommt die Berufsverschwiegenheit. Wer als Anwalt, Arzt oder Steuerberater arbeitet, unterliegt Pflichten, die über die DSGVO hinausgehen. Ein Sprachmodell, das Mandantenschriftsätze auf dem eigenen Rechner zusammenfasst, ist etwas fundamental anderes als eines, das dieselben Schriftsätze an einen Server in einem anderen Rechtsraum schickt.
In vier Schritten zur eigenen lokalen KI
- Schutzbedarf klären. Prüfe, ob personenbezogene, vertrauliche oder besonders geschützte Daten verarbeitet werden und welche rechtlichen Anforderungen daraus folgen.
- Modellgröße festlegen. Schau in die Speichertabelle oben und bestimme, welche Modellklasse deine Aufgaben abdeckt. Daraus ergibt sich die nötige Speichermenge – nicht umgekehrt.
- Ausbauweg entscheiden. Reicht dir die integrierte Grafik, oder willst du später eine externe Karte anbinden? Diese Entscheidung fällt beim Kauf und legt die Prozessorvariante fest.
- Software aufsetzen. Mit LM Studio in einer Stunde zum ersten Ergebnis, danach bei Bedarf auf Ollama plus Open WebUI umsteigen und das Modell im Heimnetz freigeben.
Welche Konfiguration passt zu welchem Vorhaben?
| Dein Vorhaben | Sinnvolle Variante | Begründung |
|---|---|---|
| Erst einmal ausprobieren, Modelle bis 8B | 358H, 32 GB, ohne Grafikdock | Für diese Modellklasse reicht die integrierte Grafik vollkommen aus. |
| Täglich arbeiten, Modelle bis 32B | 358H, 64 GB, ohne Grafikdock | Der Speicher trägt die Modellgröße, das Tempo bleibt für Textarbeit angemessen. |
| Sehr große Modelle bis 70B testen | 358H, 64 GB, ohne Grafikdock | Läuft, aber langsam. Für Stapelverarbeitung besser geeignet als für den Dialog. |
| Schnelle Antworten bei mittleren Modellen | 356H mit MCIO plus Grafikdock | Der Videospeicher der Karte liefert das Tempo, das geteilter Speicher nicht erreicht. |
| Eigene Modelle feintunen, LoRA trainieren | 356H mit MCIO plus Grafikdock | Nur hier trägt die schnelle Anbindung ihren Aufpreis wirklich. |
| KI-Server im Netz für mehrere Geräte | 358H, 64 GB, Dauerbetrieb, beide LAN-Anschlüsse | Niedrige Leistungsaufnahme und leiser Betrieb zahlen sich im Dauerlauf aus. |
Ehrliche Grenzen: Was du vor der Bestellung wissen solltest
Diese Seite soll dir eine Entscheidung ermöglichen, keine Kaufeuphorie erzeugen. Deshalb die Punkte, die gegen einen schnellen Zugriff sprechen:
- Vorverkaufsphase. Beide Geräte werden als Vorbestellung angeboten. Der Hersteller nennt Ende August als geschätzten Liefertermin und weist ausdrücklich darauf hin, dass es später werden kann. Vorbestellungen lassen sich laut Anbieter bis zum Versand stornieren.
- Netzstecker. Der Hersteller liefert standardmäßig mit US-Stecker aus. Wer in Deutschland bestellt, sollte den benötigten Steckertyp bei der Bestellung ausdrücklich angeben oder einen Adapter einplanen.
- Speicher nicht erweiterbar. Der Arbeitsspeicher moderner Kompaktsysteme ist verlötet. Die Entscheidung zwischen 32 und 64 GB fällt einmalig und lässt sich später nicht korrigieren.
- Der Anschluss lässt sich nicht nachrüsten. MCIO gibt es nur auf einer der beiden Prozessorvarianten.
- Garantie und Rückabwicklung. Bei einem Direktkauf beim Hersteller können Abwicklung, Rücksendung und Gewährleistung aufwendiger sein als beim Händler vor Ort. Prüfe die Bedingungen vor der Bestellung.
- Erwartungsmanagement. Ein lokal betriebenes Modell ersetzt kein aktuelles Spitzenmodell aus der Cloud. Es ersetzt die Notwendigkeit, vertrauliche Daten dorthin zu schicken.
KI-Mini-PC kaufen: welche Modelle infrage kommen – wer sich für den Weg über einen Mini-PC entscheidet, findet dort die Geräte nebeneinander, sortiert nach Speicherausbau und Anschlüssen statt nach Werbeangaben.
Frachtfrei und kurzfristig aus Deutschland – ein oft übersehener Punkt: Lieferzeit, Versandweg und Zollfragen unterscheiden sich je nach Anbieter erheblich. Der Beitrag zeigt, welche Geräte aus deutschem Lager kommen.
Glossar: die wichtigsten Begriffe
Parameter
Die Zahl der einstellbaren Größen in einem Sprachmodell, meist in Milliarden angegeben. Sie ist ein grobes Maß für Umfang und Fähigkeiten – und der Ausgangspunkt für die Speicherrechnung.
Quantisierung
Verfahren, das ein Modell mit geringerer Rechengenauigkeit speichert. Dadurch passt es in deutlich weniger Speicher, auf Kosten von etwas Antwortqualität. Ohne Quantisierung liefe kaum ein größeres Modell auf einem normalen Rechner.
Gemeinsamer Speicher
Bei vielen Mini-PCs teilen sich Prozessor und Grafikeinheit denselben Arbeitsspeicher. Das erlaubt große Modelle, ist aber langsamer angebunden als der eigene Speicher einer Grafikkarte.
Kontextfenster
Die Textmenge, die ein Modell gleichzeitig berücksichtigen kann. Ein großes Kontextfenster braucht zusätzlichen Speicher – unabhängig von der Modellgröße.
Token pro Sekunde
Das gebräuchliche Tempomaß bei Sprachmodellen. Grob: Alles ab etwa zehn Token je Sekunde wirkt beim Lesen flüssig, darunter wird es zäh.
Inferenz
Der laufende Betrieb eines fertig trainierten Modells – also das, was zu Hause passiert. Das Training selbst findet auf ganz anderer Hardware statt.
Häufige Fragen zu lokaler KI und Mini-PC-Hardware
Kann ich ein LLM lokal auf einem normalen Notebook betreiben?
Kleine Modelle bis etwa 8 Milliarden Parameter laufen auf vielen aktuellen Notebooks mit 16 GB Arbeitsspeicher brauchbar. Ab der Mittelklasse wird der Speicher zum Engpass, und im Akkubetrieb drosseln die meisten Geräte deutlich. Für gelegentliches Ausprobieren reicht ein Notebook, für regelmäßige Arbeit ist ein stationäres Gerät die stabilere Grundlage.
Wie viel Arbeitsspeicher brauche ich für lokale KI wirklich?
32 GB sind komfortabel für Modelle mit 7 bis 14 Milliarden Parametern; quantisierte 30-B-Modelle laufen je nach Quantisierung, Kontextlänge und verbleibendem Arbeitsspeicher ebenfalls, dann aber mit wenig Reserve. 64 GB machen Modelle um 70 Milliarden Parameter in geeigneter Quantisierung realistisch und lassen Luft für lange Eingaben und parallel laufende Programme; eine hohe Geschwindigkeit ist damit nicht automatisch gesichert. Da verlöteter Speicher nicht nachrüstbar ist, gilt im Zweifel die größere Variante.
Ist eine NPU für Sprachmodelle wichtig?
Weniger, als die Werbung suggeriert. Die gängigen Werkzeuge für lokale Sprachmodelle nutzen überwiegend Grafikeinheit oder Prozessor. Ihre Stärke spielt die NPU bei Bild-, Audio- und Videoaufgaben aus sowie überall dort, wo Effizienz im Dauerbetrieb zählt.
Was bringt eine externe Grafikkarte für lokale KI?
Sehr viel Tempo, solange das Modell in den Videospeicher der Karte passt. Für reines Ausführen genügt oft schon eine Anbindung über Thunderbolt oder USB4. Erst beim Feintuning, beim Aufteilen sehr großer Modelle und beim häufigen Modellwechsel zahlt sich eine besonders schnelle Anbindung wie MCIO messbar aus.
Warum hat nur eine der beiden Prozessorvarianten den MCIO-Anschluss?
Der Hersteller nennt dafür keinen Grund, gibt die Einschränkung aber selbst an: Der MCIO-8i-Anschluss ist dem Modell mit dem Core Ultra 7 356H vorbehalten. Wer den Ausbau mit externer Grafikkarte plant, muss deshalb bewusst die kleinere Prozessorvariante wählen.
Läuft lokale KI auch unter Linux?
Ja, und für viele ist Linux sogar der bessere Weg, weil Treiber und Werkzeuge dort schnell aktuell sind. Für das Grafikdock nennt der Hersteller allerdings Kernel 6.17 als Mindestanforderung, Distributionen, deren Standardkernel älter ist, erfüllen diese Herstelleranforderung ohne Kernel-Update zunächst nicht.
Ist lokale KI automatisch DSGVO-konform?
Nicht automatisch, aber der Weg wird deutlich kürzer. Findet die Verarbeitung ausschließlich auf eigener Hardware statt und erhält kein externer Dienstleister Zugriff auf die Daten, entfallen für diesen Verarbeitungsschritt externe Auftragsverarbeitung und ein damit verbundener Drittlandtransfer. Andere DSGVO-Pflichten – etwa Rechtsgrundlage und angemessene technische und organisatorische Maßnahmen sowie, soweit gesetzlich erforderlich, ein Verzeichnis der Verarbeitungstätigkeiten – bleiben bestehen.
Lohnt sich der Aufwand gegenüber einem Cloud-Abo?
Das hängt vom Schutzbedarf ab, nicht vom Rechenexempel. Wer unkritische Texte verarbeitet, fährt mit einem Abo einfacher und in der Antwortqualität meist besser. Wer vertrauliche Daten verarbeitet, dauerhaft unabhängig bleiben will oder sehr große Textmengen durchlaufen lässt, findet in lokaler Hardware die tragfähigere Lösung.
Weiterlesen
Welche Grafikkarte zu Full HD, WQHD, 4K und lokaler KI passt – der zweite Weg neben dem Mini-PC. Wer einen Desktop hat, kommt mit einer Grafikkarte bei großen Modellen weiter, weil der Grafikspeicher schneller angebunden ist als gemeinsam genutzter Arbeitsspeicher. Der Beitrag geht alle regulär erhältlichen Karten der aktuellen Generation durch und rechnet vor, welches Modell in welche VRAM-Klasse bis 32 GB passt.
Datenhoheit statt Daten-Abgabe – Hardware ist nur die halbe Antwort. Bevor du dich für ein Gerät entscheidest, lohnt die Frage, welche Stufe der Datenhoheit dein Anwendungsfall überhaupt verlangt. Nicht jede Aufgabe braucht ein lokales Modell; für viele reicht ein Anbieter mit europäischer Verarbeitung und klaren Zusagen. Dieser Beitrag ordnet die drei Stufen von bewussten Regeln über die DSGVO-konforme Cloud bis zur vollständig lokalen KI ein und hilft dir, deinen tatsächlichen Schutzbedarf zu bestimmen, bevor du Geld in Hardware steckst.
KI sicher nutzen als Selbstständiger – Große Unternehmen betreiben KI längst mit klaren Regeln, dokumentierten Zuständigkeiten und abgesicherten Zugängen, während Einzelunternehmer Werkzeuge oft ungeprüft einsetzen. Wer ein lokales Sprachmodell aufsetzt, hat den technischen Teil erledigt, aber noch keine Nutzungsregeln. Dieser Beitrag zeigt, welche organisatorischen Punkte du auch mit kleinem Betrieb abdecken solltest, damit aus einem Datenschutzvorteil kein Datenschutzproblem an anderer Stelle wird.
EU AI Act, NIS2 und DORA – Wer KI beruflich einsetzt, bewegt sich inzwischen in einem dichteren Regelwerk als noch vor zwei Jahren. Der lokale Betrieb löst dabei einige Fragen, andere ausdrücklich nicht: Transparenzpflichten, Kennzeichnung KI-erzeugter Inhalte und Risikoeinstufung gelten unabhängig davon, wo das Modell rechnet. Dieser Überblick sortiert, welche der neuen Vorschriften dich als kleines Unternehmen tatsächlich betreffen und welche nicht.
Windows-Telemetrie abschalten – Es wäre widersprüchlich, ein Sprachmodell lokal zu betreiben und gleichzeitig dem Betriebssystem freie Hand bei der Datenübermittlung zu lassen. Genau das passiert häufiger, als vielen bewusst ist, weil einmal gesetzte Datenschutzeinstellungen nach großen Systemaktualisierungen wieder zurückspringen. Dieser Beitrag erklärt, welche Einstellungen betroffen sind und wie du sie so absicherst, dass sie dauerhaft halten.
Ein Systemabbild erstellen – Eine lokal aufgesetzte KI-Umgebung besteht aus vielen Einzelteilen: Treiber, Laufzeitumgebungen, heruntergeladene Modelldateien und mühsam abgestimmte Einstellungen. Geht das Systemlaufwerk verloren, ist all das weg, und der Wiederaufbau kostet einen kompletten Arbeitstag. Dieser Beitrag zeigt, wie ein Abbild aussieht, das im Ernstfall wirklich zurückspielbar ist, und welche verbreiteten Fehler genau das verhindern.
Lokale KI in Überwachungskameras – Dasselbe Prinzip wie bei Sprachmodellen findet sich auch bei Kameras: Die Analyse geschieht entweder im Gerät oder beim Hersteller, und diese Entscheidung bestimmt Datenschutz und Folgekosten gleichermaßen. Wer den Unterschied bei Kameras einmal verstanden hat, erkennt ihn bei jedem anderen KI-Produkt sofort wieder. Der Beitrag zeigt zusätzlich, wie Abo-Modelle die vermeintlich günstige Cloud-Variante über Jahre teurer machen.
Hinweis: Dieser Beitrag ist eine allgemeine technische Orientierung und ersetzt keine individuelle Kaufberatung und keine Rechtsberatung. Herstellerangaben zu Ausstattung, Anschlüssen und Lieferterminen können sich ändern – prüfe die Angaben vor einer Bestellung immer direkt beim Anbieter. Als Anzeige gekennzeichnete Links sind Partnerlinks: Bei einem Kauf erhalten wir eine Provision, für dich ändert sich am Preis nichts.