GPU für die ML-Forschung · Krypto-Zahlung ohne KYC
IteraGPU
Methode / Daten und Evaluierung

Bewahren Sie eine Evaluierung, die Sie noch überraschen kann.

Ein nützliches Evaluierungsset repräsentiert die Arbeit, die das Modell leisten muss, ohne zur Wahl seiner Einstellungen gedient zu haben. Definieren Sie die evaluierte Einheit, gruppieren Sie zusammenhängende Beispiele, suchen Sie Duplikate und reservieren Sie einen finalen, zurückgehaltenen Satz. So können Sie einen Qualitätsunterschied interpretieren. Eine zufällige Aufteilung der Zeilen garantiert diese Unabhängigkeit nicht, besonders wenn mehrere Zeilen aus demselben Dokument oder derselben Konversation stammen.

01 /

Definieren, was jedes Beispiel repräsentiert

Beginnen Sie mit einem Entscheidungssatz: die Kategorie eines neuen Tickets erkennen, drei Felder aus einem Dokument extrahieren oder eine Frage mit ihren Anhängen beantworten. Beschreiben Sie die zum Zeitpunkt der Vorhersage verfügbare Eingabe, die erwartete Ausgabe und die Fälle außerhalb des Geltungsbereichs. Eine Information, die nach der Lösung des Tickets hinzugefügt wurde, darf nicht in einer Eingabe erscheinen, die dessen Eingang repräsentieren soll.

Unterscheiden Sie anschließend Zeile und unabhängige Einheit. Fünf Nachrichten einer Konversation teilen einen Kontext; zehn Seiten eines Dossiers teilen ihren Ursprung. Wenn Ihr Ziel neue Dossiers betrifft, halten Sie jedes Dossier in einer einzigen Partition. Eine Trennung nach Nutzer, Dokument, Gerät oder Zeitraum beantwortet unterschiedliche Fragen: Wählen Sie die, die der künftigen Nutzung ähnelt, und halten Sie ihre Begründung im Manifest fest.

Technische Quellen: scikit-learn 1.9 — Validierung mit Gruppen und zeitlichen Abhängigkeiten

02 /

Jedem Satz eine Rolle zuweisen

Der Lern-Satz dient den Anpassungen des Modells. Der Validierungs-Satz leitet die Entwicklungsentscheidungen: Prompt, Schwellenwert, Hyperparameter oder Wahl einer Variante. Der finale Test beantwortet eine bereits festgelegte Frage. Ihn zu konsultieren, um die beste Einstellung zu wählen, verwandelt diesen Test nach und nach in ein Entwicklungswerkzeug, auch wenn darüber kein Gradient berechnet wird.

Trennen Sie ebenso die Daten, die zum Erlernen einer Transformation verwendet werden. Eine Normalisierung, eine Variablenauswahl oder eine auf dem gesamten Korpus angepasste Imputation kann Informationen an das Modell weitergeben. Erlernen Sie diese Transformationen auf der zulässigen Partition und wenden Sie dann die beibehaltene Transformation auf die anderen Sätze an. Eine Pipeline erleichtert diese Kontrolle; sie behebt allein keine falsch getrennten Gruppen.

Rollen, die vor der Erzeugung der ersten Scores benannt werden sollten
SatzZulässige NutzungZu vermeidende Entscheidung
LernenParameter und erlernte Transformationen anpassenDie Antworten des finalen Tests dorthin importieren
ValidierungEinstellungen, Prompts und Schwellenwerte wählenDen besten explorativen Score als unabhängiges Endergebnis präsentieren
Finaler TestDie beibehaltene Konfiguration nach der festgelegten Regel bewertenDie Einstellungen nach der Einsicht ändern und dann denselben Score als Bestätigung wiederverwenden
Eventuelle KalibrierungEine Quantisierungsmethode vorbereiten, die sie benötigtDen finalen Test verwenden, um die bewertete Variante zu erzeugen

Technische Quellen: scikit-learn 1.9 — Datenleck und Transformationen

03 /

Duplikate behandeln, ohne die schwierigen Fälle zu löschen

Bewahren Sie den Rohkorpus auf und erstellen Sie dann ein Arbeitsinventar mit Kennung, Herkunft und Gruppe. Ein Inhaltsfingerabdruck erkennt exakte Kopien gemäß der gewählten Repräsentation. Dokumentieren Sie diese Repräsentation: Das Entfernen jeglicher Interpunktion oder das Umwandeln eines Textes in Kleinbuchstaben kann Einträge zusammenführen, deren Unterschied für die Aufgabe von Bedeutung ist. Behalten Sie die Zuordnung zwischen der verworfenen Kopie und dem beibehaltenen Exemplar bei.

Quasi-Duplikate erfordern eine zusätzliche Prüfung: geänderter Export, umformulierte Antwort, gemeinsamer Abschnitt oder neu herausgegebenes Dokument. Eine hohe Ähnlichkeit ist ein Signal zum Prüfen, kein Beweis dafür, dass zwei Annotationen austauschbar sind. Gruppieren Sie zusammenhängende Varianten, bevor Sie die Daten aufteilen. Wenn zwei Kopien widersprüchliche Referenzen tragen, eröffnen Sie eine Annotationsfrage; wählen Sie nicht automatisch diejenige, die das Modell am besten vorhersagt.

04 /

Ausgearbeitetes Beispiel: 1.200 Zeilen sind nicht 1.200 unabhängige Beobachtungen

Dieses Beispiel ist rein illustrativ: Weder ein Korpus noch ein Modell wurde gemessen. Nehmen wir 240 Konversationen an, die jeweils über fünf Zeilen exportiert wurden. Eine Zeile ist in jeder Konversation eine exakte Kopie; die anderen vier sind verschieden. Entfernt man diese 240 Kopien, bleiben 960 Beispiele, weiterhin in 240 Gruppen organisiert. Die folgende didaktische Wahl reserviert 70 % der Gruppen für das Training, 15 % für die Validierung und 15 % für den Test.

Man erhält 168, 36 und 36 Konversationen, also 672, 144 und 144 Beispiele. Die Gleichheit der Anteile in Zeilen und Gruppen ergibt sich hier aus den vier Beispielen pro Konversation. In einem realen Korpus mit variablen Größen wäre sie nicht automatisch gegeben. Diese Anteile sind keine universelle Regel: Sie müssen genügend Gruppen und wichtige Fälle in jedem Satz belassen.

1.200 − 240 = 960 Beispiele; 168 + 36 + 36 = 240 Gruppen; 672 + 144 + 144 = 960 Beispiele.
Illustrative arithmetische Aufteilung nach Behandlung der Kopien
AufteilungGanze KonversationenBeispieleRolle
Lernen168672Anpassen
Validierung36144Auswählen
Finaler Test36144Auf einem zurückgehaltenen Satz bestätigen

Technische Quellen: scikit-learn 1.9 — GroupShuffleSplit zählt die Gruppen

05 /

Klassen, Längen und Chronologie prüfen

Zählen Sie nach der Aufteilung die Klassen und die Gruppen, die sie tragen. Eine Klasse, die auf vielen Zeilen, aber in nur einer Konversation vorkommt, bietet nicht viele unabhängige Fälle. Untersuchen Sie ebenfalls Längen, tatsächlich abgedeckte Sprachen, unvollständige Dokumente und für die Entscheidung wichtige Kategorien. Ein beruhigender Mittelwert kann eine Aufteilung verbergen, die kein einziges Beispiel eines kritischen Falls enthält.

Eine Stratifizierung mit Gruppen versucht, die Klassenanteile zu wahren, ohne die Gruppen zu zerstreuen. Sie garantiert kein perfektes Gleichgewicht, wenn die Gruppen wenige oder sehr ungleich sind. Wenn die Aufgabe darin besteht, zukünftige Beobachtungen vorherzusagen, kann eine chronologische Trennung relevanter sein als eine zufällige Durchmischung. Prüfen Sie außerdem, dass die Variablen zum Zeitpunkt der Vorhersage verfügbar waren.

Technische Quellen: scikit-learn 1.9 — StratifiedGroupKFold und seine Grenzen · scikit-learn 1.9 — Validierung zeitlicher Daten

06 /

Die Referenz präzise genug machen, um eine Ausgabe zu beurteilen

Schreiben Sie eine Annotationsanweisung mit Beispielen und Grenzfällen. Für eine Extraktion präzisieren Sie die Bedeutung eines fehlenden Felds, das Format der Datumsangaben, die Währung und die akzeptierten Entsprechungen. Für eine Klassifikation beschreiben Sie die Grenzen zwischen den Kategorien. Eine von der Referenz abweichende Antwort ist nicht immer ein Fehler des Modells: Die Referenz kann mehrdeutig oder falsch sein.

Lassen Sie eine vielfältige Auswahl gegenlesen, insbesondere die Uneinigkeiten und die wichtigen Fälle, und halten Sie dann die Entscheidung schriftlich fest. Bewahren Sie die Korrekturen in einer neuen Version des Datensatzes auf. Wenn eine Korrektur das Ergebnis eines Vergleichs ändert, berechnen Sie alle betroffenen Varianten anhand derselben Referenz neu; korrigieren Sie nicht nur die für Ihr bevorzugtes Modell ungünstige Zeile.

07 /

Das Evaluierungspaket vor der GPU-Kampagne erstellen

Das Ergebnis dieser Vorbereitung ist ein identifizierbarer Satz, begleitet von seinen Regeln. Er ermöglicht es, die Datenauswahl zu reproduzieren, ohne von einer Notebook-Erinnerung abhängig zu sein. Dieses Paket vor der Anmietung vorzubereiten vermeidet es, die Rechenzeit damit zu verbrauchen, Unterschiede bei Dateien oder Kriterien zu klären.

  • Legen Sie die Kennungen, die Gruppen, die Aufteilungen und deren Begründung fest; bewahren Sie das Skript oder die Liste auf, die sie erzeugt.
  • Prüfen Sie die Überschneidungen von Identifikatoren, Gruppen und Fingerabdrücken zwischen den Partitionen. Jede unerwartete Überschneidung muss erklärt oder korrigiert werden.
  • Exportieren Sie die Fallzahlen je Partition, Klasse und nutzbarer Untergruppe sowie die Liste der Ausschlüsse mit ihrem Grund.
  • Legen Sie die Referenz, die Normalisierungsregeln, die Hauptmetrik und die Schwellenwerte vor dem Vergleich fest.
  • Bewahren Sie Revision, Fingerabdrücke, Nutzungsrechte und Speicherort der Daten auf. Ein Fingerabdruck gewährleistet eine Identifikation, nicht Anonymität.
  • Halten Sie den Zugang zum finalen Test bis zur geplanten Entscheidung zurück; führen Sie ein Protokoll über Einsichten und Protokolländerungen.
08 /

Wissen, was die Kontrolle belegt

Die Vorbereitung ist annehmbar, wenn die Fallzahlen mit dem Inventar übereinstimmen, die Überschneidungen beherrscht werden und jede Ausgabe nach einer expliziten Regel beurteilt werden kann. Sie belegt nicht, dass das Modell erfolgreich sein wird, noch dass alle künftigen Anwendungen abgedeckt sind. Ein kleines Set kann ein präzises Problem beschreiben und dennoch unzureichend bleiben, um über eine seltene Klasse zu urteilen.

Wenn Sie die Fehler des finalen Tests nutzen, um das System zu verbessern, bewahren Sie diesen Test als Historie auf und bereiten Sie eine neue unabhängige Bestätigung vor. Bei einem vortrainierten Modell, dessen ursprüngliche Daten unbekannt sind, kann Ihre Partition das Fehlen einer früheren Exposition nicht bescheinigen. Dokumentieren Sie diese Grenze, statt das Set als völlig unberührt zu bezeichnen.

Praktische Fragen

Sollten immer 20 % der Daten für den Test reserviert werden?

Nein. Der nutzbare Anteil hängt von der Anzahl unabhängiger Einheiten und den abzudeckenden Fällen ab. Prüfen Sie die Gruppen, die wichtigen Kategorien und die Genauigkeit der erwarteten Schlussfolgerung; ein Prozentwert allein garantiert keinen aussagekräftigen Test.

Reicht ein unterschiedlicher Identifikator aus, um Duplikate auszuschließen?

Nein. Zwei Exporte können unterschiedliche Identifikatoren haben und dennoch denselben Text oder Varianten derselben Akte enthalten. Prüfen Sie Inhalt und Herkunft und behalten Sie zusammengehörige Beispiele in der Partition, die Ihrer Gruppierungsregel entspricht.

Kann ich meinen Test wiederverwenden, nachdem ich das Modell anhand seiner Fehler korrigiert habe?

Sie können ihn zum Nachverfolgen der Historie behalten, aber er war an der Entwicklung beteiligt. Um eine Verbesserung auf zurückgehaltenen Daten zu bestätigen, verwenden Sie ein neues unabhängiges Set und benennen Sie klar die Rolle jedes einzelnen.