정의된 워크로드에 맞는 구성 선택하기
GPU 목록, 내 모델에 대한 조언, 현재 구성의 대안 모두 같은 출발 명세서를 요구합니다. 모델과 리비전, 추론인지 적응인지, 가중치 형식, 필요한 길이, 동시성 또는 마이크로배치, 품질 기준입니다. 요금제를 비교할 때도 이 요구사항을 유지하세요. 더 적은 컨텍스트를 처리하는 구성이나 단순화된 작업이 자동으로 같은 요구를 충족하지는 않습니다.
각 필수 요건을 분류하세요. 사용 가능한 증빙 자료가 해당 범위 내에서 이를 확인해 주면 적합, 자료가 없으면 확인 필요, 확립된 실패로 인해 부하를 감당할 수 없으면 제외입니다. 모든 요건이 충족된 후보만 선정합니다. 그런 다음 적합한 후보들을 총 패키지 비용, 유효 마진, 문서화된 일정으로 순위를 정합니다. 선호는 탈락 기준을 상쇄하지 못합니다.
각 기준을 증빙 자료와 결정에 연결하기
상업용 자료는 제안된 내용을 입증하고, 여러분의 프로토콜은 해당 부하에서 실제로 작동하는 것을 확립합니다. 주문 시 요청한 환경은 준비 선호도에 불과합니다. 명목 메모리 용량이나 신고된 재고는 소프트웨어 설치나 제공 기간을 입증하지 못합니다.
증빙 자료는 버전과 범위와 함께 보관하세요. 필수 정보가 문서화되지 않았다면 확인해야 할 조건을 정확히 기재하세요. 이 표를 통해 알 수 없는 사항을 보증으로 바꾸지 않고도 예비 선정을 구성할 수 있습니다.
| 필수 기준 | 검증 가능한 증빙 자료 | 적합 | 확인 필요 | 제외 |
|---|---|---|---|---|
| 부하 커버 | 모델, 리비전, 토큰, 배치/동시성 및 실행된 입력 | 필요한 부하 전체가 커버됨 | 실제 규모를 알 수 없음 | 필수적인 일부가 제거됨 |
| 호환성 | 소프트웨어 공식 문서 및 대상 환경 점검 | 필요한 조합이 검증됨 | 희망 사항에 불과한 환경 | 필수 의존성이 호환되지 않음 |
| GPU당 메모리 | 분해된 연산, 사용 가능한 용량 및 유효 단계의 피크 | 정당화된 여유를 두고 전체 사이클이 커버됨 | 가중치만 또는 소규모 테스트만 알려짐 | 요구 부하에서 포화 |
| 품질 | 고정된 코퍼스, 식별된 출력 및 비교 전에 정의된 임계값 | 임계값과 허용 오차 준수 | 평가되지 않은 새 형식 | 허용 오차를 초과한 회귀 |
| 배치 및 서버 | 구성 요소 배치; 필요한 RAM, 스토리지 또는 상호 연결 | 요구 사항이 검증됨 | 필수 사양이 문서화되지 않음 | 필수적인 배치가 불가능함 |
| 예산 및 일정 | 패키지, 로트, 카드, 일수, 총 USD 및 전체 일정 | 상한과 기간 준수 | 아직 가정에 불과한 기간 | 예산 또는 기한 초과 |
기술 출처: 추론용 부하 명세서 · 단계와 카운터 측정하기 · 품질 기준 정하기 · 실험 비용 계획하기
결과가 무엇을 계산하는지 알기
파라미터 수는 덴스 계산에서 여러분이 표현하는 값에 해당합니다. 형식은 값당 비트 수를 나타냅니다. «가중치만» 결과는 이 부피를 Gio로 변환하고, «개략적 범위»는 여러분의 여유분을 추가합니다. 도구에서 훈련 또는 적응을 선택해도 보편적인 숨겨진 승수가 적용되지 않습니다. 빠진 항목을 문서화하도록 안내할 뿐입니다.
이러한 단순함 덕분에 가정을 다시 검토할 수 있습니다. 동시에 계산에서 빠지는 것도 알아야 합니다. 양자화 메타데이터, 다른 형식의 모듈, 작업 메모리, 일시적 로딩, 프로세스 외부 용도 등입니다. 제안된 GPU 명세는 검토할 후보일 뿐, 여러분의 모델이 그곳에서 작동한다는 보증이 아닙니다. 카드의 이름과 명목 메모리는 서버의 나머지 부분을 설명하지 못합니다.
카드를 비교하기 전에 단위 읽기
십진법 1 GB는 10억 바이트이고, 1 GiB는 2³⁰바이트입니다. 카탈로그는 GB 단위의 공칭 용량을 표시합니다. 도구는 십진법 관례를 적용합니다. 구성을 검증하려면 기기가 선언한 바이트 단위 용량도 확인하세요. 프로그램의 카운터는 바이트나 GiB로 표시될 수 있습니다. 크기를 비교하기 전에 같은 정의를 가진 수량을 변환하세요. 공칭 메모리, 여유 메모리, 예약된 피크를 섞지 마세요.
계산 예시: 240억 바이트는 약 22.35 GiB입니다. 이 결과가 24GB 카드의 여유 용량을 의미하지는 않습니다. 시스템, 실행 컨텍스트 및 기타 할당도 영향을 줄 수 있습니다. 시험용 시트의 각 열 이름에 단위와 범위를 유지하세요.
기술 출처: NIST — 이진 및 십진 접두어
예제 풀이: 70억 개 파라미터
16비트의 70억 개 파라미터의 경우, 밀집 용량은 140억 바이트, 즉 약 13.04 GiB입니다. 선택한 6GiB의 여유분을 더하면 총량은 19.04 GiB가 됩니다. 이 계산이 6GiB의 여유분이 귀하의 모델에 적합하다는 것을 증명하지는 않습니다. 이는 바로 입력과 선택한 연산으로 검증해야 할 가정입니다.
표는 가중치 형식의 산술적 효과만을 보여주기 위해 같은 예약을 유지합니다. 실제 실행에서는 다른 할당이 다르게 변할 수 있습니다. 4비트 표현은 종종 추가 정보를 포함하며 일부 레이어를 다른 형식으로 남길 수 있습니다. 그러므로 마지막 행을 보장된 총 피크로 읽지 마세요.
| 가중치 형식 | 밀집 볼륨(바이트) | 가중치(GiB, 반올림) | 가중치 + 예비 공간(GiB) |
|---|---|---|---|
| 32비트 | 28 000 000 000 | 26,08 | 32,08 |
| 16비트 | 14 000 000 000 | 13,04 | 19,04 |
| 8비트 | 7 000 000 000 | 6,52 | 12,52 |
| 이론적 4비트 | 3 500 000 000 | 3,26 | 9,26 |
설명 가능한 예비 공간 구성하기
습관적으로 백분율을 선택하지 말고 예비 공간을 분해하십시오. 자기회귀 추론에서는 아키텍처, 캐시, 유지되는 토큰, 동시 시퀀스를 기록하십시오. 훈련에서는 학습 매개변수, 그래디언트, 옵티마이저, 활성화, 버퍼를 기록하십시오. 입력 길이와 마이크로배치는 매개변수 수가 변하지 않더라도 기록지의 일부입니다.
일부 항목은 동시에 최대치에 도달하지 않습니다. 독립적인 최대 마진을 더하면 보수적인 범위로 사용할 수 있지만, 그렇게 명시한 경우에만 해당하며 관측된 피크는 아닙니다. 추정된 항목, 측정된 항목, 아직 알 수 없는 항목을 기록하십시오. KV 캐시 가이드에서 이러한 계산 중 하나를 자세히 설명하며, 메모리 문서에서는 카운터를 프로그램 단계에 배치합니다.
| 기록할 항목 | 필요한 입력값 | 예상 증거 |
|---|---|---|
| 생성 캐시 | KV 헤드, 레이어, 토큰, 시퀀스, 형식 | 아키텍처에 맞춘 계산 후 측정 |
| 활성화 | 마이크로배치, 길이, 아키텍처, 체크포인팅 | 선택한 입력값에서의 피크 |
| 그래디언트와 옵티마이저 | 학습된 매개변수, 형식, 방법 | 첫 번째 전체 업데이트 |
| 로딩, 검증, 내보내기 | 절차와 출력 크기 | 필요한 각 단계의 점검 |
작업을 조용히 바꾸지 않고 단계별로 검증하기
짧은 입력과 작은 배치로 시작하여 준비 오류를 찾으십시오. 그다음 일반적인 입력으로, 이어서 실제로 필요한 한계로 넘어가십시오. 프로그램이 데이터를 잘라내거나, 토큰을 덜 유지하거나, 코퍼스의 일부를 건너뛴다면, 통과한 사례는 발표된 워크로드를 검증하지 못합니다. 실제로 실행된 차원을 기록하십시오.
단계별, GPU별 피크를 해당 카운터와 함께 기록하십시오. 텐서에 할당된 메모리와 PyTorch 할당자가 예약한 메모리는 서로 더해지지 않습니다. 시스템 판독값은 계측된 프로세스보다 더 많은 범위를 포함할 수 있습니다. 여러 배치를 고려한다면 소프트웨어적 분배를 문서화하십시오. 두 장의 카드가 자동으로 하나의 메모리 공간을 형성하지는 않습니다.
기술 출처: PyTorch — CUDA 메모리 관리
첫 번째 초과 발생 후 결정하기
로딩 실패는 가중치, 형식 또는 일시적 할당을 가리킵니다. 생성 중 실패는 컨텍스트와 동시성을 검토해야 합니다. 역방향 패스 실패는 마이크로배치, 활성화 또는 계산 전략을 가리킬 수 있습니다. 이러한 국소화는 정밀도, 모델, 데이터를 동시에 무작위로 바꾸는 것을 피하게 해줍니다.
각 수정 후에는 품질과 커버 범위를 확인하십시오. 필요한 길이를 줄이는 것은 받아들일 수 없을 수 있으며, 양자화를 바꾸면 출력이 달라질 수 있습니다. 다른 용량이 필요하다면, 관측된 피크, 정당화된 마진, 버전, 한계 입력값을 명시한 기록지를 가지고 카탈로그로 돌아가십시오. 이유 없는 마진은 GB 단위로 반올림한 결과보다 더 신뢰할 수 없습니다.
동일한 요건 아래의 짧은 선별 목록
16비트의 70억 개 파라미터와 6GiB 여유분을 사용한 예시적 추론의 경우, 계산 예시는 19.04 GiB를 제공합니다. 24GB의 RTX 4090 또는 48GB의 RTX 6000 Ada를 검토할 수 있습니다. 3일간 카드 1장 기준으로 각각 47.14 USD와 55.71 USD로 공지되어 있습니다. 이는 서로 다른 용량의 두 후보입니다. 컨텍스트, 경쟁, 실제 사용 가능한 메모리, 호환성 및 품질은 여전히 확인해야 합니다. 이 가격은 속도 순위를 의미하지 않습니다.
파인튜닝을 수행할 때는 동일한 그리드에 학습된 파라미터와 추가 단계(역전파, 첫 업데이트, 검증, 내보내기)를 적용하세요. LoRA 파라미터 수만으로는 전체 메모리를 검증할 수 없습니다. 파인튜닝 과정은 결과를 검증하는 데 도움이 되며, 배치와 누적은 비교 가능한 업데이트를 기록하는 데 사용됩니다.
초과 후 대안을 찾고 있다면 문제가 발생한 단계를 파악하고 출력 요구사항을 유지하세요. 용량, 캐시, 마이크로배치 또는 정밀도 중 한 번에 하나씩만 변경하여 비교하세요. 다른 형식으로 변환하더라도 설정한 최소 품질을 충족해야 합니다. 관리형 애플리케이션, 특정 RAM 또는 검증된 상호 연결이 필요하다면 GPU 사양서만으로는 결정을 확정하기 어렵습니다. 두 장의 카드는 검증된 소프트웨어 배치가 필요하며, 각각의 메모리가 자동으로 하나의 공간을 구성하지는 않습니다.
기술 출처: RTX 4090 — 묶음, 용량 및 요금제 · RTX 6000 Ada — 묶음, 용량 및 요금제 · 양자화 후 품질 · 파인튜닝 준비 · 배치 및 누적 설정
이를 확인해주는 요소와 함께 계산을 유지하세요
초기 가설, 항목 표, 절차와 원시 측정값을 기록하세요. 추정, 측정된 카운터, 비즈니스 결정을 구분하세요. IteraGPU Lab 노트북은 소규모 네트워크에서 이러한 계측을 이해하는 데 도움을 주지만, 여러분의 모델 실험을 대체하지는 않습니다. 이 페이지의 수치 예시는 계산일 뿐이며, 관측된 것으로 주장하는 처리량이나 GPU 소비량이 아닙니다.
좋은 사이징 결과물은 한 장의 문서로 정리됩니다. 모델과 리비전, 작업, 정밀도, 길이, 마이크로배치 또는 동시성, GPU당 메모리와 측정 조건이 그것입니다. 결론을 무효화할 수 있는 요소도 추가하세요. 예를 들어 더 긴 윈도우나 다른 평가 방식입니다. 그러면 각 변형마다 전체 추정을 다시 할 필요 없이 캠페인에 맞는 요금제를 선택할 수 있습니다.
실용적인 질문
도구에서 제안하는 예비량은 제 모델을 기준으로 계산되나요?
아니요. 예비량은 여러분이 선택하는 값입니다. 도구는 여러분의 실행 아키텍처나 입력을 알지 못하므로, 이를 통해 가설을 명시적으로 만든 다음 측정 단계와 대조하세요.
24GB 미만의 용량으로도 여전히 실패할 수 있는 이유는 무엇인가요?
추정이 일부 항목을 누락하거나, 정격 용량이 GB로 표시되는데 GiB를 사용할 수 있습니다. 일시적 피크, 다른 프로세스 또는 다른 입력도 영향을 줄 수 있습니다. 단위와 범위를 비교한 다음, 실패하는 단계를 찾아내세요.
예비량과 두 개의 PyTorch 피크를 더할 수 있나요?
아니요. 할당된 텐서의 피크와 예약된 메모리의 피크는 서로 독립적으로 더할 수 있는 두 항목이 아닙니다. 별개의 피크는 서로 다른 시점에 발생할 수 있습니다. 각각의 이름을 유지하고 메모리 방법으로 해석하세요.
모델을 아직 측정하지 않았어도 목록이나 대안을 요청할 수 있나요?
네, 조건부 후보를 세우는 데는 그렇습니다. 동일하게 유지해야 하는 부하와 제약을 설명하세요. 메모리 계산과 상업적 자료로 1차 선별이 가능합니다. 검증되지 않은 필수 기준은 요금제를 선택하기 전에 확인해야 합니다.