Twórz embeddingi, które pozostają porównywalne
Kampania embeddingów musi ustalać model, tokenizację, regułę obcinania, pooling i normalizację. Te wybory zmieniają uzyskiwane reprezentacje. W przypadku tekstów o zmiennej długości wypróbuj partie grupowane według długości i porównaj je z pierwotną organizacją. Zapisuj liczbę przetworzonych dokumentów i użyteczne tokeny, aby zmiana wypełnienia partii nie wyglądała na niewyjaśniony zysk.
Rozdziel 48 GB między model a pracę użyteczną
Zwiększ batch na próbce zawierającej najdłuższe teksty lub największe obrazy. Pomiar na średniej może przepuścić późne nasycenie w środku korpusu. Eksportuj reprezentacje w trakcie przetwarzania, zamiast niepotrzebnie gromadzić wszystkie wyniki na GPU. Zachowaj stabilny identyfikator, na przykład aby powiązać każde wyjście z jego wejściem i wznowić przerwaną kampanię.
Przy adaptacji stosuj tę samą dyscyplinę wobec checkpointów: model bazowy, trenowane parametry i dane muszą pozostać powiązane. Pojemność 48 GB nie zwalnia z pomiaru aktywacji i stanów optymalizatora.
Ampere czy Ada przy równej pojemności
RTX A6000 i RTX 6000 Ada to dwa różne modele mimo 48 GB. Przed porównaniem sprawdź docelowe kernele CUDA i wersje PyTorch w swoim projekcie. Krótki test może rozstrzygnąć o koszcie całego korpusu, przy tych samych oczekiwanych wyjściach. A40 to inna opcja Ampere o pojemności 48 GB; A100 SXM staje się istotna, gdy wymagana pamięć przekracza ten zakres.
Zamawiaj z planem wznowienia
Trzy dni mogą objąć profilowanie i pierwszą partię embeddingów. Siedem dni pozwala wytworzyć, a następnie sprawdzić korpus. Trzydzieści dni towarzyszy kilku wersjom reprezentacji lub kampanii adaptacji. Przygotuj identyfikatory, katalogi eksportu i listę partii przed wynajmem. Wybierz czas trwania i ilość, podaj żądane środowisko oraz swoje dane kontaktowe, a następnie znajdź rozliczenie krypto i postęp w zamówieniu.