Fachwissen für digitale Entscheidungen
Welche Hardware braucht ein LLM-Server?
Kurzantwort
Die entscheidende Grösse: Grafikspeicher
Ein Sprachmodell muss vollständig in den Speicher der Grafikkarte passen, sonst wird es unbrauchbar langsam. Grobe Orientierung bei 4-Bit-Quantisierung:
| Modellgrösse | Speicherbedarf | Realistisch damit |
|---|---|---|
| 7–8 Mrd. Parameter | rund 6–10 GB | Klassifikation, Zusammenfassung, einfache Antworten |
| 13–14 Mrd. | rund 10–16 GB | Bessere Textqualität |
| 30–34 Mrd. | rund 20–28 GB | Anspruchsvollere Aufgaben |
| 70 Mrd. | rund 40–48 GB | Mehrere Karten oder eine grosse Karte |
Dazu kommt Speicher für den Kontext – je länger die Dokumente, desto mehr.
Was Quantisierung bedeutet
Die Gewichte des Modells werden mit geringerer Genauigkeit gespeichert, meist 4 oder 8 Bit statt 16. Das senkt den Speicherbedarf deutlich bei nur geringem Qualitätsverlust. Ohne Quantisierung vervielfacht sich der Bedarf.
Was oft übersehen wird
- Gleichzeitige Nutzung. Eine Karte bedient nicht zwanzig Personen parallel. Ab mehreren gleichzeitigen Anfragen braucht es mehr Hardware oder eine Warteschlange.
- Strom und Kühlung. Server mit mehreren Grafikkarten brauchen einen passenden Raum, keine Abstellkammer.
- Erstantwortzeit. Wer nach einer Sekunde Antwort erwartet, braucht mehr Reserve als für einen Stapelverarbeitungslauf über Nacht.
Mieten statt kaufen
Für den Anfang oft die vernünftigere Wahl: ein gemieteter Server mit Grafikkarte in einem europäischen Rechenzentrum. Datenschutzrechtlich fast so gut wie eigene Hardware, ohne Anschaffung – und der Bedarf lässt sich messen, bevor investiert wird.
Kernfakten
- Entscheidend
- Grafikspeicher, nicht Rechenleistung
- Näherung
- Etwa 1 GB je Milliarde Parameter bei 4-Bit-Quantisierung
- Empfehlung zum Start
- Mieten statt kaufen, bis der Bedarf gemessen ist