GPU für die ML-Forschung · Krypto-Zahlung ohne KYC
IteraGPU
Methode / Präzision und Kompromisse

Eine Quantisierung nach ihren Ergebnissen wählen, nicht nach ihren Bits.

Eine Quantisierung ist nützlich, wenn sie Ihre Qualität beibehält und zugleich eine reale Einschränkung verbessert: Speicher, Latenz oder gebundenes Budget. Vergleichen Sie sie mit einer Referenz bei gleichen Eingaben und erfassen Sie dann das Format der Gewichte, die Rechenpräzision und den Cache getrennt. Eine Datei, die mit vier Bits angekündigt wird, bedeutet nicht, dass die gesamte Ausführung vier Bits verwendet oder dass sie schneller sein wird. Die Entscheidung muss an eine gemessene Last gebunden bleiben.

01 /

Die Variante über ihre Bit-Anzahl hinaus beschreiben

Benennen Sie die Methode, ihre Implementierung, ihre Version und die genaue Revision des Artefakts. Zwei Varianten in vier Bits können unterschiedliche Darstellungen, Gruppen, Metadaten und Kernel verwenden. Trennen Sie das Speicherformat der Gewichte von dem der Rechenoperationen. Notieren Sie außerdem die Module, die in einer anderen Präzision beibehalten werden, sowie jede Verlagerung auf die CPU.

In bitsandbytes ersetzen quantisierte lineare Schichten bestimmte gewöhnliche Schichten; die übrigen Module folgen ihrem konfigurierten dtype. Dieses Verhalten beschreibt daher für sich genommen nicht die Spitze des Prozesses. Lesen Sie die effektive Konfiguration nach dem Laden und prüfen Sie dann, ob die Variante tatsächlich die erwartete Verarbeitung durchführt und nicht auf einen anderen Software-Fallback zurückgreift.

Minimales Manifest zum Vergleich zweier quantisierter Artefakte
FeldWas beibehalten werden mussVermiedene Verwechslung
HerkunftModell, Revision, Tokenizer, Methode und VersionenZwei verschiedene Modelle unter demselben Namen vergleichen
GewichteFormat, Bits, Gruppen und ausgeschlossene ModuleVier Bits mit einem einzigen Rezept gleichsetzen
BerechnungTatsächlich verwendete Dtypes, Kernel und GeräteSpeicher und Ausführung verwechseln
GenerierungCache, Kontext, Ausgabegrenzen und NebenläufigkeitDem Gewicht einen Effekt zuschreiben, der aus dem Cache stammt
HerstellungEventuelle Kalibrierung und Überarbeitung der DatenVergessen, wie das Artefakt erzeugt wurde

Technische Quellen: Hugging Face Transformers 5.17 — quantisierte Schichten und andere dtypes

02 /

Kalibrierung und Evaluierung trennen

Einige Methoden verwenden Beispiele, um die Quantisierung vorzubereiten. Das in Transformers dokumentierte GPTQ-Verfahren erfordert insbesondere ein Kalibrierungsset und einen Tokenizer. Dieses Set trägt zur Erstellung des Artefakts bei: Es ist kein unabhängiger Qualitätsnachweis. Andere Methoden folgen einem anderen Weg; gehen Sie nicht davon aus, dass dasselbe Kalibrierungsprotokoll für alle Formate gilt.

Bewahren Sie die Kalibrierungsbeispiele in den zulässigen Daten auf, um das Modell vorzubereiten, und dokumentieren Sie anschließend Bezeichner, Herkunft, Längen und die angewandte Transformation. Behalten Sie die Validierung für die Wahl der Einstellungen und den finalen Test für die Bestätigung. Wenn Sie mehrere Kalibrierungssets auswählen, nachdem Sie ihre Ergebnisse verglichen haben, ist diese Suche Teil der Entwicklung und muss in der Bilanz aufgeführt werden.

Technische Quellen: Hugging Face Transformers 5.17 — Kalibrierung einer GPTQ-Quantisierung · Partitionen nach ihrer Rolle aufbauen

03 /

Eine Gewichtsgröße berechnen, ohne sie als Spitzenwert zu verkaufen

Nehmen wir ein fiktives Modell mit drei Milliarden Parametern, alle mit derselben Bitanzahl gespeichert. Das Bruttovolumen berechnet sich aus Parametern × Bits / 8. Bei 16 Bits erhält man 6 Milliarden Bytes; bei 8 Bits 3 Milliarden; bei 4 Bits 1,5 Milliarden. Diese Zahlen sind eine illustrative Arithmetik, nicht die beobachteten Größen eines Artefakts noch der Bedarf eines ausgeführten Modells.

Der Bruttounterschied zwischen 16 und 4 Bits beträgt 4,5 GB, also etwa 4,191 GiB. Er schließt Skalen, Metadaten, nicht quantisierte Module, Cache und Temporärdateien aus. Er erlaubt es, eine zu überprüfende Speicherhypothese zu formulieren, ohne eine Viertelung des Spitzenwerts vorherzusagen. Die Speicherdokumentation erklärt, wie man die Phasen trennt und die Zähler interpretiert.

Bruttovolumen in Bytes = Parameter × Bits / 8. Volumen in GiB = Bytes / 2³⁰.
Veranschaulichende Berechnung für 3 Milliarden einheitlich gespeicherter Parameter – ohne Zusatzkosten
Angenommenes FormatBrutto-BytesDezimale GBUngefähre GiB
16 Bit6 000 000 00065,588
8 Bit3 000 000 00032,794
4 Bit1 500 000 0001,51,397

Technische Quellen: NIST — binäre und dezimale Präfixe · IteraGPU — Schätzungen und Speicherspitzen

04 /

Gewichte ändern, bevor der Cache geändert wird

Beginnen Sie mit einer Referenz, deren Verhalten Sie kennen. Vergleichen Sie anschließend die Gewichtsvarianten mit demselben Cache, denselben Längen, demselben Batch oder derselben Parallelität. Wenn Sie auch diese Parameter ändern, vergleichen Sie vollständige Konfigurationen: Sagen Sie es und schreiben Sie nicht die gesamte Abweichung der Quantisierung der Gewichte zu.

Der KV-Cache kann selbst quantifiziert werden, wenn Modell und Engine dies zulassen. Dies ist eine separate Entscheidung. Die Transformers-Dokumentation weist insbesondere darauf hin, dass ein quantifizierter Cache die Latenz bei kurzen Kontexten beeinträchtigen kann, wenn noch genügend Speicher vorhanden ist. Testen Sie diese zweite Änderung in einer separaten Reihe; mehr eingesparter Speicher garantiert keine bessere Latenz.

Technische Quellen: Hugging Face Transformers 5.17 — quantifizierter KV-Cache und Latenz-Kompromisse

05 /

Beispiel einer Qualitätsregel: ein kleiner Rückgang kann dennoch inakzeptabel sein

Hier eine Entscheidungsillustration, ohne Modellausführung. Ein Projekt bewertet 200 Dokumente und legt vor den Tests einen maximalen Verlust von einem Prozentpunkt gegenüber der Referenz fest. Es verlangt außerdem mindestens 90 % Erfolg bei 20 kritischen Dokumenten, die in diesen 200 enthalten sind. Ein Dokument wird nur akzeptiert, wenn alle seine erforderlichen Felder korrekt sind.

Die folgenden fiktiven Werte machen A gemäß diesen beiden Regeln akzeptabel: 94 % statt 95 % und 18/20 in der kritischen Gruppe. B scheitert an beiden. Man kann A noch nicht als Sieger erklären: weder Spitzenspeicher noch Dauer sind angegeben. Zudem zeigen die Gesamtwerte nicht, welche Dokumente sich geändert haben; prüfen Sie die gepaarten Fehler, um neue erhebliche Regressionen zu erkennen.

Verlust von A = 95 − 94 = 1 Punkt; Verlust von B = 95 − 92 = 3 Punkte. Ein Prozentpunkt ist kein relativer Rückgang von 1 %.
Fiktive Qualitätswerte zur Erläuterung der Schwellen; keine GPU-Leistung gemessen
VarianteAkzeptierte DokumenteGesamtquoteAkzeptierte kritische FälleUrteil nach diesen Regeln
Referenz190 / 20095 %19 / 20 = 95 %Vergleichspunkt
A188 / 20094 %18 / 20 = 90 %Qualitativ akzeptabel
B184 / 20092 %16 / 20 = 80 %Abgelehnt

Technische Quellen: Fehler statt nur der Gesamtsumme prüfen

06 /

Einen Vergleich durchführen, dessen Abweichungen erklärbar sind

Bereiten Sie zuerst den Vergleichsvertrag vor, dann die Ergebnisdateien. Das folgende Protokoll ist auf Ihrer Last durchzuführen; die vorherigen Zahlen ersetzen es nicht. Wenn eine Variante nicht lädt oder die erforderlichen Operatoren nicht besitzt, behalten Sie diesen Fehler als Kompatibilitätsinformation bei.

  • Fixieren Sie Korpus, Referenzen, Modell, Tokenizer, Prompt und Ausgaberegeln; halten Sie lange und schwierige Fälle identifizierbar.
  • Halten Sie Kalibrierung, exportiertes Artefakt und effektive Konfiguration fest. Prüfen Sie die verwendeten Geräte und eventuelle CPU/GPU-Transfers.
  • Trennen Sie Erstellung, Laden, Aufwärmen und stabilisierte Verarbeitung. Verwenden Sie dieselben Messgrenzen und behalten Sie die Rohwiederholungen bei.
  • Erfassen Sie den Spitzenwert pro Gerät und pro Phase; halten Sie allocated und reserved getrennt. Summieren Sie diese Zähler nicht und subtrahieren Sie nicht ihre unabhängigen Maxima.
  • Bewerten Sie Format, Inhalt und die vereinbarten Untergruppen und gleichen Sie dann die Fehler anhand der Kennung ab.
  • Laden Sie das gewählte Artefakt in einem neuen Prozess und wiederholen Sie eine definierte Kontrolle. Ein vor dem Export erzieltes Ergebnis validiert das erneute Laden nicht automatisch.

Technische Quellen: Den Speicher korrekt messen · Wiederholungen und Zeitmessung festlegen

07 /

Den Kompromiss mit den entstandenen Kosten verknüpfen

Eine Speichereinsparung kann die möglichen Konfigurationen erweitern, mehr Parallelität ermöglichen oder einfach Spielraum lassen. Sie senkt nicht automatisch die Ausgaben. Wenn Zeitraum, reservierte Lose und akzeptierte Lieferergebnisse identisch bleiben, bleiben die Kosten des Pakets identisch, selbst wenn ein Durchlauf schneller ist.

Nehmen Sie in den Zeitplan die eventuelle Kalibrierung, die Quantifizierung, die Evaluierung, die abgelehnten Versuche und das erneute Laden auf. Vergleichen Sie anschließend die vollständigen Pakete von 3, 7 oder 30 Tagen zwischen den Optionen, die Ihre Kriterien erfüllen. Das Verhältnis pro nutzbarem Korpus lässt sich nur mit tatsächlich abgeschlossenen und akzeptierten Korpora berechnen; Zeitmessungs-Wiederholungen erzeugen keine neuen Lieferergebnisse.

Wenn eine einzige Miete zum Vergleich mehrerer Varianten dient, ist ihr Betrag eine gemeinsame Kampagnenausgabe. Rechnen Sie das gesamte Paket nicht gedanklich jeder Variante zu und addieren Sie diese Beträge dann nicht als tatsächlich getrennte Ausgaben. Um einen analytischen Anteil zuzuweisen, geben Sie eine Konvention an; sie ändert die insgesamt entstandenen Kosten nicht.

Technische Quellen: IteraGPU — vollständiges Paket und Kosten eines Experiments

08 /

Mit einer Konfiguration und ihren Grenzen abschließen

Die endgültige Entscheidung benennt das Artefakt, die Umgebung, die abgedeckte Last, das erfüllte Qualitätskriterium und die verbesserte Einschränkung. Wenn die Varianten nahe beieinanderliegen, behalten Sie diese Unsicherheit bei und bevorzugen Sie eine Wahl, die Sie erneut laden und erklären können. Die Anzahl der Bits ist für sich genommen keine Rangfolge.

Eine Schlussfolgerung aus einem kurzen Korpus lässt sich nicht automatisch auf lange Kontexte, eine andere Sprache oder mehr gleichzeitige Anfragen übertragen. Eine für die Inferenz gewählte Quantisierung legt auch nicht die trainierbaren Parameter eines Fine-Tunings fest. Halten Sie diese Fragen getrennt und bestätigen Sie die gewählte Variante am zurückgehaltenen Test.

Praktische Fragen

Verbrauchen vier Bit immer viermal weniger Speicher als sechzehn Bit?

Das Rohvolumen der gleichmäßig gespeicherten Gewichte folgt diesem Verhältnis. Die Gesamtspitze umfasst außerdem Metadaten, Module in anderen Formaten, Cache und Temporärdateien. Messen Sie die tatsächliche Ausführung, bevor Sie einen Gesamtgewinn ankündigen.

Kann ich die Quantisierung mit meinem finalen Test kalibrieren?

Dieser Test würde dann zur Herstellung des Artefakts beitragen und wäre keine unabhängige Bewertung mehr. Bereiten Sie die Kalibrierung mit einem für die Entwicklung zulässigen Satz vor und behalten Sie eine zurückgehaltene Bestätigung.

Ist eine kleinere Variante zwangsläufig günstiger im Betrieb?

Nein. Das Budget hängt vom Zeitraum und den eingesetzten Chargen, der Vorbereitung und den akzeptierten nutzbaren Ergebnissen ab. Eine Speicherreduzierung ohne Änderung dieser Elemente kann die Marge verbessern, ohne den Mietbetrag zu senken.