Die Variante über ihre Bit-Anzahl hinaus beschreiben
Benennen Sie die Methode, ihre Implementierung, ihre Version und die genaue Revision des Artefakts. Zwei Varianten in vier Bits können unterschiedliche Darstellungen, Gruppen, Metadaten und Kernel verwenden. Trennen Sie das Speicherformat der Gewichte von dem der Rechenoperationen. Notieren Sie außerdem die Module, die in einer anderen Präzision beibehalten werden, sowie jede Verlagerung auf die CPU.
In bitsandbytes ersetzen quantisierte lineare Schichten bestimmte gewöhnliche Schichten; die übrigen Module folgen ihrem konfigurierten dtype. Dieses Verhalten beschreibt daher für sich genommen nicht die Spitze des Prozesses. Lesen Sie die effektive Konfiguration nach dem Laden und prüfen Sie dann, ob die Variante tatsächlich die erwartete Verarbeitung durchführt und nicht auf einen anderen Software-Fallback zurückgreift.
| Feld | Was beibehalten werden muss | Vermiedene Verwechslung |
|---|---|---|
| Herkunft | Modell, Revision, Tokenizer, Methode und Versionen | Zwei verschiedene Modelle unter demselben Namen vergleichen |
| Gewichte | Format, Bits, Gruppen und ausgeschlossene Module | Vier Bits mit einem einzigen Rezept gleichsetzen |
| Berechnung | Tatsächlich verwendete Dtypes, Kernel und Geräte | Speicher und Ausführung verwechseln |
| Generierung | Cache, Kontext, Ausgabegrenzen und Nebenläufigkeit | Dem Gewicht einen Effekt zuschreiben, der aus dem Cache stammt |
| Herstellung | Eventuelle Kalibrierung und Überarbeitung der Daten | Vergessen, wie das Artefakt erzeugt wurde |
Technische Quellen: Hugging Face Transformers 5.17 — quantisierte Schichten und andere dtypes
Kalibrierung und Evaluierung trennen
Einige Methoden verwenden Beispiele, um die Quantisierung vorzubereiten. Das in Transformers dokumentierte GPTQ-Verfahren erfordert insbesondere ein Kalibrierungsset und einen Tokenizer. Dieses Set trägt zur Erstellung des Artefakts bei: Es ist kein unabhängiger Qualitätsnachweis. Andere Methoden folgen einem anderen Weg; gehen Sie nicht davon aus, dass dasselbe Kalibrierungsprotokoll für alle Formate gilt.
Bewahren Sie die Kalibrierungsbeispiele in den zulässigen Daten auf, um das Modell vorzubereiten, und dokumentieren Sie anschließend Bezeichner, Herkunft, Längen und die angewandte Transformation. Behalten Sie die Validierung für die Wahl der Einstellungen und den finalen Test für die Bestätigung. Wenn Sie mehrere Kalibrierungssets auswählen, nachdem Sie ihre Ergebnisse verglichen haben, ist diese Suche Teil der Entwicklung und muss in der Bilanz aufgeführt werden.
Technische Quellen: Hugging Face Transformers 5.17 — Kalibrierung einer GPTQ-Quantisierung · Partitionen nach ihrer Rolle aufbauen
Eine Gewichtsgröße berechnen, ohne sie als Spitzenwert zu verkaufen
Nehmen wir ein fiktives Modell mit drei Milliarden Parametern, alle mit derselben Bitanzahl gespeichert. Das Bruttovolumen berechnet sich aus Parametern × Bits / 8. Bei 16 Bits erhält man 6 Milliarden Bytes; bei 8 Bits 3 Milliarden; bei 4 Bits 1,5 Milliarden. Diese Zahlen sind eine illustrative Arithmetik, nicht die beobachteten Größen eines Artefakts noch der Bedarf eines ausgeführten Modells.
Der Bruttounterschied zwischen 16 und 4 Bits beträgt 4,5 GB, also etwa 4,191 GiB. Er schließt Skalen, Metadaten, nicht quantisierte Module, Cache und Temporärdateien aus. Er erlaubt es, eine zu überprüfende Speicherhypothese zu formulieren, ohne eine Viertelung des Spitzenwerts vorherzusagen. Die Speicherdokumentation erklärt, wie man die Phasen trennt und die Zähler interpretiert.
| Angenommenes Format | Brutto-Bytes | Dezimale GB | Ungefähre GiB |
|---|---|---|---|
| 16 Bit | 6 000 000 000 | 6 | 5,588 |
| 8 Bit | 3 000 000 000 | 3 | 2,794 |
| 4 Bit | 1 500 000 000 | 1,5 | 1,397 |
Technische Quellen: NIST — binäre und dezimale Präfixe · IteraGPU — Schätzungen und Speicherspitzen
Gewichte ändern, bevor der Cache geändert wird
Beginnen Sie mit einer Referenz, deren Verhalten Sie kennen. Vergleichen Sie anschließend die Gewichtsvarianten mit demselben Cache, denselben Längen, demselben Batch oder derselben Parallelität. Wenn Sie auch diese Parameter ändern, vergleichen Sie vollständige Konfigurationen: Sagen Sie es und schreiben Sie nicht die gesamte Abweichung der Quantisierung der Gewichte zu.
Der KV-Cache kann selbst quantifiziert werden, wenn Modell und Engine dies zulassen. Dies ist eine separate Entscheidung. Die Transformers-Dokumentation weist insbesondere darauf hin, dass ein quantifizierter Cache die Latenz bei kurzen Kontexten beeinträchtigen kann, wenn noch genügend Speicher vorhanden ist. Testen Sie diese zweite Änderung in einer separaten Reihe; mehr eingesparter Speicher garantiert keine bessere Latenz.
Technische Quellen: Hugging Face Transformers 5.17 — quantifizierter KV-Cache und Latenz-Kompromisse
Beispiel einer Qualitätsregel: ein kleiner Rückgang kann dennoch inakzeptabel sein
Hier eine Entscheidungsillustration, ohne Modellausführung. Ein Projekt bewertet 200 Dokumente und legt vor den Tests einen maximalen Verlust von einem Prozentpunkt gegenüber der Referenz fest. Es verlangt außerdem mindestens 90 % Erfolg bei 20 kritischen Dokumenten, die in diesen 200 enthalten sind. Ein Dokument wird nur akzeptiert, wenn alle seine erforderlichen Felder korrekt sind.
Die folgenden fiktiven Werte machen A gemäß diesen beiden Regeln akzeptabel: 94 % statt 95 % und 18/20 in der kritischen Gruppe. B scheitert an beiden. Man kann A noch nicht als Sieger erklären: weder Spitzenspeicher noch Dauer sind angegeben. Zudem zeigen die Gesamtwerte nicht, welche Dokumente sich geändert haben; prüfen Sie die gepaarten Fehler, um neue erhebliche Regressionen zu erkennen.
| Variante | Akzeptierte Dokumente | Gesamtquote | Akzeptierte kritische Fälle | Urteil nach diesen Regeln |
|---|---|---|---|---|
| Referenz | 190 / 200 | 95 % | 19 / 20 = 95 % | Vergleichspunkt |
| A | 188 / 200 | 94 % | 18 / 20 = 90 % | Qualitativ akzeptabel |
| B | 184 / 200 | 92 % | 16 / 20 = 80 % | Abgelehnt |
Technische Quellen: Fehler statt nur der Gesamtsumme prüfen
Einen Vergleich durchführen, dessen Abweichungen erklärbar sind
Bereiten Sie zuerst den Vergleichsvertrag vor, dann die Ergebnisdateien. Das folgende Protokoll ist auf Ihrer Last durchzuführen; die vorherigen Zahlen ersetzen es nicht. Wenn eine Variante nicht lädt oder die erforderlichen Operatoren nicht besitzt, behalten Sie diesen Fehler als Kompatibilitätsinformation bei.
- Fixieren Sie Korpus, Referenzen, Modell, Tokenizer, Prompt und Ausgaberegeln; halten Sie lange und schwierige Fälle identifizierbar.
- Halten Sie Kalibrierung, exportiertes Artefakt und effektive Konfiguration fest. Prüfen Sie die verwendeten Geräte und eventuelle CPU/GPU-Transfers.
- Trennen Sie Erstellung, Laden, Aufwärmen und stabilisierte Verarbeitung. Verwenden Sie dieselben Messgrenzen und behalten Sie die Rohwiederholungen bei.
- Erfassen Sie den Spitzenwert pro Gerät und pro Phase; halten Sie allocated und reserved getrennt. Summieren Sie diese Zähler nicht und subtrahieren Sie nicht ihre unabhängigen Maxima.
- Bewerten Sie Format, Inhalt und die vereinbarten Untergruppen und gleichen Sie dann die Fehler anhand der Kennung ab.
- Laden Sie das gewählte Artefakt in einem neuen Prozess und wiederholen Sie eine definierte Kontrolle. Ein vor dem Export erzieltes Ergebnis validiert das erneute Laden nicht automatisch.
Technische Quellen: Den Speicher korrekt messen · Wiederholungen und Zeitmessung festlegen
Den Kompromiss mit den entstandenen Kosten verknüpfen
Eine Speichereinsparung kann die möglichen Konfigurationen erweitern, mehr Parallelität ermöglichen oder einfach Spielraum lassen. Sie senkt nicht automatisch die Ausgaben. Wenn Zeitraum, reservierte Lose und akzeptierte Lieferergebnisse identisch bleiben, bleiben die Kosten des Pakets identisch, selbst wenn ein Durchlauf schneller ist.
Nehmen Sie in den Zeitplan die eventuelle Kalibrierung, die Quantifizierung, die Evaluierung, die abgelehnten Versuche und das erneute Laden auf. Vergleichen Sie anschließend die vollständigen Pakete von 3, 7 oder 30 Tagen zwischen den Optionen, die Ihre Kriterien erfüllen. Das Verhältnis pro nutzbarem Korpus lässt sich nur mit tatsächlich abgeschlossenen und akzeptierten Korpora berechnen; Zeitmessungs-Wiederholungen erzeugen keine neuen Lieferergebnisse.
Wenn eine einzige Miete zum Vergleich mehrerer Varianten dient, ist ihr Betrag eine gemeinsame Kampagnenausgabe. Rechnen Sie das gesamte Paket nicht gedanklich jeder Variante zu und addieren Sie diese Beträge dann nicht als tatsächlich getrennte Ausgaben. Um einen analytischen Anteil zuzuweisen, geben Sie eine Konvention an; sie ändert die insgesamt entstandenen Kosten nicht.
Technische Quellen: IteraGPU — vollständiges Paket und Kosten eines Experiments
Mit einer Konfiguration und ihren Grenzen abschließen
Die endgültige Entscheidung benennt das Artefakt, die Umgebung, die abgedeckte Last, das erfüllte Qualitätskriterium und die verbesserte Einschränkung. Wenn die Varianten nahe beieinanderliegen, behalten Sie diese Unsicherheit bei und bevorzugen Sie eine Wahl, die Sie erneut laden und erklären können. Die Anzahl der Bits ist für sich genommen keine Rangfolge.
Eine Schlussfolgerung aus einem kurzen Korpus lässt sich nicht automatisch auf lange Kontexte, eine andere Sprache oder mehr gleichzeitige Anfragen übertragen. Eine für die Inferenz gewählte Quantisierung legt auch nicht die trainierbaren Parameter eines Fine-Tunings fest. Halten Sie diese Fragen getrennt und bestätigen Sie die gewählte Variante am zurückgehaltenen Test.
Praktische Fragen
Verbrauchen vier Bit immer viermal weniger Speicher als sechzehn Bit?
Das Rohvolumen der gleichmäßig gespeicherten Gewichte folgt diesem Verhältnis. Die Gesamtspitze umfasst außerdem Metadaten, Module in anderen Formaten, Cache und Temporärdateien. Messen Sie die tatsächliche Ausführung, bevor Sie einen Gesamtgewinn ankündigen.
Kann ich die Quantisierung mit meinem finalen Test kalibrieren?
Dieser Test würde dann zur Herstellung des Artefakts beitragen und wäre keine unabhängige Bewertung mehr. Bereiten Sie die Kalibrierung mit einem für die Entwicklung zulässigen Satz vor und behalten Sie eine zurückgehaltene Bestätigung.
Ist eine kleinere Variante zwangsläufig günstiger im Betrieb?
Nein. Das Budget hängt vom Zeitraum und den eingesetzten Chargen, der Vorbereitung und den akzeptierten nutzbaren Ergebnissen ab. Eine Speicherreduzierung ohne Änderung dieser Elemente kann die Marge verbessern, ohne den Mietbetrag zu senken.