De variant beschrijven voorbij het aantal bits
Noem de methode, haar implementatie, haar versie en de exacte revisie van het artefact. Twee varianten in vier bits kunnen verschillende representaties, groepen, metadata en kernels gebruiken. Scheid het opslagformaat van de gewichten van dat van de rekenoperaties. Noteer ook de modules die op een andere precisie blijven en elke verplaatsing naar de CPU.
In bitsandbytes vervangen gekwantiseerde lineaire lagen bepaalde gewone lagen; de andere modules volgen hun geconfigureerde dtype. Dat gedrag beschrijft dus op zichzelf niet de piek van het proces. Lees de effectieve configuratie na het laden en controleer of de variant wel de verwachte verwerking uitvoert in plaats van een andere softwarematige terugval.
| Veld | Wat je moet bewaren | Vermeden verwarring |
|---|---|---|
| Herkomst | Model, revisie, tokenizer, methode en versies | Twee verschillende modellen onder dezelfde naam vergelijken |
| Gewichten | Formaat, bits, groepen en uitgesloten modules | Vier bits aanzien voor één enkel recept |
| Berekening | Dtype, kernels en apparaten die werkelijk worden gebruikt | Opslag en uitvoering door elkaar halen |
| Generatie | Cache, context, uitvoerlimieten en gelijktijdigheid | Een effect dat uit de cache komt aan de gewichten toeschrijven |
| Vervaardiging | Eventuele kalibratie en revisie van de gegevens | Vergeten hoe het artefact werd geproduceerd |
Technische bronnen: Hugging Face Transformers 5.17 — gekwantiseerde lagen en andere dtypes
Kalibratie en evaluatie scheiden
Sommige methoden gebruiken voorbeelden om de kwantisatie voor te bereiden. De GPTQ-procedure die in Transformers is gedocumenteerd, vraagt onder meer een kalibratieset en een tokenizer. Die set maakt deel uit van de vervaardiging van het artefact: ze vormt geen onafhankelijk bewijs van kwaliteit. Andere methoden volgen een ander pad; ga er niet van uit dat hetzelfde kalibratieprotocol voor alle formaten geldt.
Houd de kalibratievoorbeelden apart binnen de toegestane gegevens om het model voor te bereiden en noteer daarna identificatiegegevens, herkomst, lengtes en de toegepaste transformatie. Bewaar de validatie om de instellingen te kiezen en de eindtest voor de bevestiging. Als je meerdere kalibratiesets kiest nadat je hun scores hebt vergeleken, maakt die zoektocht deel uit van de ontwikkeling en moet ze in de balans worden opgenomen.
Technische bronnen: Hugging Face Transformers 5.17 — kalibratie van een GPTQ-kwantisatie · Partities opbouwen volgens hun rol
Een gewichtsgrens berekenen zonder die als piek te verkopen
Neem een fictief model van drie miljard parameters, allemaal opgeslagen met hetzelfde aantal bits. Het brutovolume bereken je met parameters × bits / 8. Bij 16 bits krijg je 6 miljard bytes; bij 8 bits 3 miljard; bij 4 bits 1,5 miljard. Deze getallen zijn een illustratieve rekenkunde, niet de waargenomen groottes van een artefact of de behoeften van een uitgevoerd model.
Het ruwe verschil tussen 16 en 4 bits is 4,5 GB, of ongeveer 4,191 GiB. Het laat schalen, metadata, niet-gekwantiseerde modules, cache en tijdelijke bestanden buiten beschouwing. Het laat toe een geheugenhypothese te formuleren die je moet verifiëren, zonder een deling door vier van de piek te voorspellen. Het geheugendossier legt uit hoe je de fasen scheidt en de tellers interpreteert.
| Verondersteld formaat | Ruwe bytes | Decimale GB | Bij benadering GiB |
|---|---|---|---|
| 16 bits | 6 000 000 000 | 6 | 5,588 |
| 8 bits | 3 000 000 000 | 3 | 2,794 |
| 4 bits | 1 500 000 000 | 1,5 | 1,397 |
Technische bronnen: NIST — binaire en decimale prefixen · IteraGPU — schattingen en geheugenpieken
De gewichten wijzigen voordat je de cache wijzigt
Begin met een referentie waarvan je het gedrag kent. Vergelijk daarna de gewichtsvarianten met dezelfde cache, dezelfde lengtes, dezelfde batch of dezelfde gelijktijdigheid. Als je ook die parameters wijzigt, vergelijk je volledige configuraties: meld dat en schrijf niet het hele verschil toe aan de kwantisatie van de gewichten.
De KV-cache kan zelf worden gequantiseerd wanneer het model en de engine dat toelaten. Dat is een aparte keuze. De Transformers-documentatie meldt onder meer dat een gequantiseerde cache de latentie kan verslechteren bij korte contexten wanneer er nog genoeg geheugen over is. Test deze tweede wijziging in een aparte reeks; meer bespaard geheugen garandeert geen betere doorlooptijd.
Technische bronnen: Hugging Face Transformers 5.17 — gequantiseerde KV-cache en latentiecompromis
Voorbeeld van een kwaliteitsregel: een kleine daling kan toch onaanvaardbaar blijven
Hier volgt een beslissingsvoorbeeld, zonder modeluitvoering. Een project beoordeelt 200 documenten en legt vóór de tests een maximaal verlies van één procentpunt ten opzichte van de referentie vast. Het eist ook minstens 90% succes op 20 kritieke documenten die in die 200 zijn opgenomen. Een document wordt alleen geaccepteerd als al zijn vereiste velden correct zijn.
De onderstaande fictieve waarden maken A aanvaardbaar volgens beide regels: 94% in plaats van 95%, en 18/20 op de kritieke groep. B zakt op beide. We kunnen A nog niet tot winnaar uitroepen: noch geheugenpiek noch duur worden gegeven. Bovendien tonen de totalen niet welke documenten zijn veranderd; onderzoek de gepaarde fouten om nieuwe belangrijke regressies op te sporen.
| Variant | Geaccepteerde documenten | Algemeen percentage | Geaccepteerde kritieke gevallen | Verdict volgens deze regels |
|---|---|---|---|---|
| Referentie | 190 / 200 | 95 % | 19 / 20 = 95 % | Vergelijkingspunt |
| A | 188 / 200 | 94 % | 18 / 20 = 90 % | Aanvaardbaar op kwaliteit |
| B | 184 / 200 | 92 % | 16 / 20 = 80 % | Afgewezen |
Technische bronnen: Onderzoek de fouten in plaats van alleen het totaal
Voer een vergelijking uit waarvan de verschillen te verklaren zijn
Stel eerst het vergelijkingscontract op, dan de resultaatbestanden. Het volgende protocol moet op jouw workload worden uitgevoerd; de eerdere cijfers vervangen het niet. Als een variant niet laadt of niet over de vereiste operatoren beschikt, bewaar die mislukking dan als compatibiliteitsinformatie.
- Leg corpus, referenties, model, tokenizer, prompt en uitvoerregels vast; houd lange en moeilijke gevallen identificeerbaar.
- Registreer kalibratie, geëxporteerd artefact en effectieve configuratie. Controleer de gebruikte apparaten en eventuele CPU/GPU-overdrachten.
- Scheid aanmaken, laden, opwarmen en gestabiliseerde verwerking. Gebruik dezelfde meetgrenzen en bewaar de ruwe herhalingen.
- Noteer de piek per apparaat en per fase; houd allocated en reserved gescheiden. Tel deze tellers niet op en trek hun onafhankelijke maxima niet van elkaar af.
- Beoordeel het formaat, de inhoud en de afgesproken subgroepen, en breng de fouten vervolgens per identificatie met elkaar in verband.
- Laad het gekozen artefact opnieuw in een nieuw proces en voer een vastgelegde controle opnieuw uit. Een resultaat dat vóór export is verkregen, valideert het herladen niet automatisch.
Technische bronnen: Het geheugen correct meten · Herhalingen en timing vastleggen
Het compromis koppelen aan de gemaakte kosten
Een geheugenbesparing kan de denkbare configuraties verruimen, meer gelijktijdigheid mogelijk maken of gewoon marge laten. Ze verlaagt de uitgave niet automatisch. Als de periode, de gereserveerde batches en de geaccepteerde deliverables gelijk blijven, blijft de kost van het forfait gelijk, zelfs als een run sneller is.
Neem in de planning de eventuele kalibratie, de quantisatie, de evaluatie, de afgewezen pogingen en het herladen op. Vergelijk daarna de volledige forfaits van 3, 7 of 30 dagen tussen de opties die aan je criteria voldoen. De verhouding per nuttig corpus kun je alleen berekenen met daadwerkelijk afgeronde en geaccepteerde corpora; timingherhalingen leveren geen nieuwe deliverables op.
Als één huur wordt gebruikt om meerdere varianten te vergelijken, is het bedrag een gemeenschappelijke campagnepost. Reken het volledige forfait niet mentaal aan elke variant toe en tel die bedragen dan niet op als afzonderlijke werkelijke kosten. Kondig voor een analytische toerekening een conventie aan; die verandert het totale engagement niet.
Technische bronnen: IteraGPU — volledig forfait en kost van een experiment
Afronden met een configuratie en haar beperkingen
De eindbeslissing noemt het artefact, de omgeving, de gedekte workload, het gehaalde kwaliteitscriterium en de verbeterde beperking. Als de varianten dicht bij elkaar liggen, behoud die onzekerheid dan en geef de voorkeur aan een keuze die je kunt herladen en uitleggen. Het aantal bits is op zichzelf geen voorkeursorde.
Een conclusie over een kort corpus is niet automatisch geldig voor lange contexten, een andere taal of meer gelijktijdige verzoeken. Een kwantisatie die je voor inferentie kiest, bepaalt ook niet de trainbare parameters van een fine-tuning. Houd deze vragen gescheiden en bevestig de gekozen variant op de apart gehouden testset.
Praktische vragen
Verbruiken vier bits altijd vier keer minder geheugen dan zestien bits?
Het ruwe volume van uniform opgeslagen gewichten volgt die verhouding. De totale piek omvat ook metadata, modules in andere formaten, cache en tijdelijke gegevens. Meet de werkelijke uitvoering voordat je een globale winst aankondigt.
Kan ik de kwantisatie kalibreren met mijn finale testset?
Die testset zou dan meewerken aan het vervaardigen van het artefact en zou niet langer een onafhankelijke evaluatie zijn. Bereid de kalibratie voor met een set die voor ontwikkeling is toegestaan en houd daarna een apart gehouden bevestiging achter de hand.
Is een kleinere variant noodzakelijk goedkoper in gebruik?
Nee. Het budget hangt af van de periode en de gebruikte batches, de voorbereiding en de geaccepteerde nuttige resultaten. Een geheugenreductie zonder wijziging van die elementen kan de marge verbeteren zonder het huurbedrag te verlagen.