ML 연구를 위한 GPU · KYC 없는 크립토 결제
IteraGPU
방법 / 정밀도와 트레이드오프

비트가 아닌 결과로 양자화를 선택하세요.

양자화는 메모리, 지연 시간 또는 투입 예산이라는 실제 제약을 개선하면서 품질을 유지할 때 유용합니다. 동일한 입력으로 기준과 비교한 다음, 가중치 형식, 계산 정밀도, 캐시를 각각 따로 기록하세요. 4비트로 표기된 파일이 전체 실행이 4비트를 사용한다거나 더 빠르다는 것을 의미하지는 않습니다. 결정은 측정된 워크로드에 연결되어야 합니다.

01 /

비트 수를 넘어 변형을 설명하기

방법, 그 구현, 버전, 아티팩트의 정확한 리비전을 명시하세요. 두 가지 4비트 변형은 서로 다른 표현, 그룹, 메타데이터, 커널을 사용할 수 있습니다. 가중치 저장 형식과 계산 연산 형식을 구분하세요. 다른 정밀도로 유지되는 모듈과 CPU로의 오프로드도 기록하세요.

bitsandbytes에서는 양자화된 선형 레이어가 일부 일반 레이어를 대체하며, 나머지 모듈은 설정된 dtype을 따릅니다. 따라서 이 동작만으로는 프로세스 피크를 설명할 수 없습니다. 로딩 후 실제 적용된 구성을 확인하고, 해당 변형이 다른 소프트웨어 폴백이 아니라 기대한 처리를 실제로 수행하는지 검증하세요.

양자화된 두 아티팩트를 비교하기 위한 최소 매니페스트
필드유지해야 할 항목피해야 할 혼동
출처모델, 리비전, 토크나이저, 방법 및 버전같은 이름으로 서로 다른 두 모델 비교
가중치형식, 비트, 그룹 및 제외된 모듈4비트를 단일 레시피로 동일시하기
계산실제 사용된 dtype, 커널 및 장치저장과 실행을 혼동
생성캐시, 컨텍스트, 출력 제한 및 동시성캐시에서 비롯된 효과를 가중치에 귀속
제작해당되는 경우의 캘리브레이션 및 데이터 리비전아티팩트가 어떻게 생성되었는지 망각

기술 출처: Hugging Face Transformers 5.17 — 양자화된 레이어와 기타 dtype

02 /

캘리브레이션과 평가 분리하기

일부 방법은 양자화를 준비하기 위해 예시를 사용합니다. Transformers에 문서화된 GPTQ 절차는 특히 캘리브레이션 세트와 토크나이저를 요구합니다. 이 세트는 아티팩트 제작에 관여하므로 독립적인 품질 증거가 아닙니다. 다른 방법은 다른 경로를 따르므로, 동일한 캘리브레이션 프로토콜이 모든 형식에 적용된다고 가정하지 마세요.

캘리브레이션 예시는 허용된 데이터에서 모델 준비용으로 따로 두고, 식별자, 출처, 길이, 적용된 변환을 기록하세요. 검증은 설정 선택에, 최종 테스트는 확정에 사용하세요. 점수를 비교한 뒤 여러 캘리브레이션 세트를 선택한다면, 이 탐색은 개발의 일부이므로 결과 보고에 포함해야 합니다.

기술 출처: Hugging Face Transformers 5.17 — GPTQ 양자화 캘리브레이션 · 역할에 따라 분할 구성하기

03 /

가중치 하한을 피크로 포장하지 않고 계산하기

모두 같은 비트 수로 저장된 30억 개 파라미터의 가상 모델을 가정해 봅시다. 원시 용량은 파라미터 × 비트 / 8로 계산됩니다. 16비트에서는 60억 바이트, 8비트에서는 30억, 4비트에서는 15억이 됩니다. 이 수치는 설명을 위한 산술일 뿐, 관측된 아티팩트 크기나 실행되는 모델의 요구량이 아닙니다.

16비트와 4비트의 총 차이는 4.5GB, 즉 약 4.191GiB입니다. 여기에는 스케일, 메타데이터, 양자화되지 않은 모듈, 캐시, 임시 파일이 제외됩니다. 이는 최고치가 4분의 1로 줄어든다고 예측하지 않고 검증할 메모리 가설을 세울 수 있게 합니다. 메모리 문서는 단계를 구분하고 카운터를 해석하는 방법을 설명합니다.

원시 바이트 용량 = 파라미터 × 비트 / 8. GiB 용량 = 바이트 / 2³⁰.
3억(30억) 개 매개변수를 균일하게 저장한 경우의 예시 계산 — 추가 비용 제외
가정된 형식원시 바이트소수점 GB대략적인 GiB
16비트6 000 000 00065,588
8비트3 000 000 00032,794
4비트1 500 000 0001,51,397

기술 출처: NIST — 이진 및 십진 접두어 · IteraGPU — 메모리 추정 및 피크

04 /

캐시를 바꾸기 전에 가중치부터 바꾸기

먼저 동작을 파악한 기준 모델에서 시작하세요. 그다음 동일한 캐시, 동일한 길이, 동일한 배치 또는 동일한 동시성으로 가중치 변형을 비교하세요. 이 파라미터까지 함께 바꾸면 전체 구성을 비교하는 것이므로 이를 명시하고, 차이 전체를 가중치 양자화 탓으로 돌리지 마세요.

KV 캐시는 모델과 엔진이 허용하는 경우 그 자체로 양자화할 수 있습니다. 이는 별개의 선택입니다. Transformers 문서는 특히 메모리가 충분히 남아 있을 때 양자화된 캐시가 짧은 컨텍스트에서 지연 시간을 악화시킬 수 있다고 지적합니다. 이 두 번째 변경은 별도의 시리즈에서 테스트하세요. 메모리를 더 절약한다고 해서 더 나은 지연 시간이 보장되지는 않습니다.

기술 출처: Hugging Face Transformers 5.17 — 양자화된 KV 캐시와 지연 시간 트레이드오프

05 /

품질 규칙 예시: 작은 하락도 허용할 수 없는 경우가 있습니다

다음은 모델 실행 없이 의사 결정을 예시한 것입니다. 한 프로젝트가 200개 문서를 평가하고 시험 전에 기준 대비 최대 1퍼센트포인트의 손실을 정의합니다. 또한 이 200개에 포함된 20개의 중요한 문서에서 최소 90%의 성공을 요구합니다. 문서는 모든 필수 필드가 정확할 때만 승인됩니다.

아래의 가상 값들은 A를 두 규칙 모두에서 허용 가능하게 만듭니다: 95% 대신 94%, 그리고 핵심 그룹에서 18/20입니다. B는 둘 다 실패합니다. 아직 A가 승자라고 선언할 수는 없습니다: 최대 메모리 사용량도 소요 시간도 제시되지 않았습니다. 게다가 총계는 어떤 문서가 변경되었는지 보여주지 않습니다. 새로운 중요한 회귀를 감지하려면 짝지어진 오류를 살펴보세요.

A의 손실 = 95 − 94 = 1포인트, B의 손실 = 95 − 92 = 3포인트. 1퍼센트포인트는 1%의 상대적 감소가 아닙니다.
임계값을 설명하기 위한 가상 품질이며, 측정된 GPU 성능은 없습니다
변형승인된 문서전체 비율승인된 핵심 사례이 규칙들에 따른 판정
레퍼런스190 / 20095 %19 / 20 = 95 %비교 기준점
A188 / 20094 %18 / 20 = 90 %품질상 허용 가능
B184 / 20092 %16 / 20 = 80 %거부됨

기술 출처: 총계만이 아니라 오류를 살펴보기

06 /

차이가 설명되는 비교를 실행하기

먼저 비교 계약을 준비하고, 그다음 결과 파일을 준비하세요. 다음 프로토콜은 여러분의 워크로드에서 수행해야 하며, 앞선 수치들이 이를 대체하지 않습니다. 변형이 로드되지 않거나 필요한 연산자를 갖추지 못한 경우, 이 실패를 호환성 정보로 보존하세요.

  • 코퍼스, 참조, 모델, 토크나이저, 프롬프트 및 출력 규칙을 고정하고, 길고 어려운 사례를 식별 가능하게 유지하세요.
  • 캘리브레이션, 내보낸 아티팩트 및 실제 구성을 기록하세요. 사용된 장치와 발생할 수 있는 CPU/GPU 전송을 확인하세요.
  • 제작, 로딩, 워밍업 및 안정화된 처리를 분리하세요. 동일한 측정 경계를 사용하고 원시 반복을 보존하세요.
  • 장치별, 단계별 최대치를 기록하고 allocated와 reserved를 분리해 유지하세요. 이 카운터들을 합산하지 말고, 서로 독립적인 최대값들을 빼지 마세요.
  • 합의된 형식, 내용 및 하위 그룹을 평가한 다음, 식별자별로 오류를 대조하세요.
  • 선정된 아티팩트를 새 프로세스에서 다시 로드하고 정의된 검사를 재실행하세요. 내보내기 전에 얻은 결과가 재로딩을 자동으로 검증하지는 않습니다.

기술 출처: 메모리를 올바르게 측정하기 · 반복과 시간 측정 정의하기

07 /

트레이드오프를 지불한 비용과 연결하기

메모리 절약은 고려 가능한 구성을 넓히거나, 더 많은 동시성을 허용하거나, 단순히 여유를 남길 수 있습니다. 그러나 자동으로 지출을 줄이지는 않습니다. 기간, 예약된 배치 및 승인된 산출물이 동일하게 유지된다면, 한 번의 실행이 더 빠르더라도 정액 요금제의 비용은 동일하게 유지됩니다.

일정에 발생할 수 있는 캘리브레이션, 양자화, 평가, 거부된 시도 및 재로딩을 포함하세요. 그런 다음 여러분의 기준을 충족하는 옵션들 사이에서 3일, 7일 또는 30일 전체 정액 요금제를 비교하세요. 유효 코퍼스당 비율은 실제로 완료되고 승인된 코퍼스로만 계산되며, 시간 측정 반복은 새로운 산출물을 만들지 않습니다.

단일 대여가 여러 변형을 비교하는 데 사용된다면, 그 금액은 캠페인의 공통 지출입니다. 전체 정액 요금제를 각 변형에 정신적으로 청구한 다음 이 금액들을 서로 다른 실제 지출로 합산하지 마세요. 분석적 몫을 배분하려면 관례를 명시하세요. 그것은 총 지출을 바꾸지 않습니다.

기술 출처: IteraGPU — 전체 정액 요금제와 실험 비용

08 /

구성과 그 한계로 결론 내리기

최종 결정은 아티팩트, 환경, 커버된 워크로드, 통과한 품질 기준 및 개선된 제약을 명시합니다. 변형들이 비슷하다면 그 불확실성을 유지하고, 다시 로드하고 설명할 수 있는 선택을 우선하세요. 비트 수 자체만으로는 선호 순위가 되지 않습니다.

짧은 코퍼스에 대한 결론이 긴 컨텍스트, 다른 언어 또는 더 많은 동시 요청에 자동으로 확장되지는 않습니다. 추론을 위해 선택한 양자화가 파인튜닝의 학습 가능한 파라미터를 정의하지도 않습니다. 이 질문들은 분리해서 다루고, 선택한 변형을 홀드아웃 테스트에서 확인하세요.

실용적인 질문

4비트는 항상 16비트보다 4배 적은 메모리를 소비하나요?

균일하게 저장된 가중치의 원시 볼륨은 이 비율을 따릅니다. 총 피크에는 메타데이터, 다른 형식의 모듈, 캐시 및 임시 파일도 포함됩니다. 전반적인 이득을 발표하기 전에 실제 실행을 측정하세요.

최종 테스트로 양자화를 캘리브레이션할 수 있나요?

그러면 이 테스트는 아티팩트 생성에 관여하게 되어 더 이상 독립적인 평가가 아니게 됩니다. 개발용으로 허용된 데이터셋으로 캘리브레이션을 준비하고, 별도로 보관한 확인용 세트를 유지하세요.

더 작은 변형이 반드시 운영 비용이 더 저렴한가요?

아니요. 예산은 기간과 투입된 배치, 준비 및 수용된 유효 결과에 따라 달라집니다. 이러한 요소를 변경하지 않은 채 메모리 사용량을 줄이면 임대 금액을 낮추지 않고 마진을 개선할 수 있습니다.