GPU cho nghiên cứu ML · Thanh toán crypto không KYC
IteraGPU
Phương pháp / Chất lượng và chẩn đoán

Biến một điểm số thành những quyết định có thể kiểm chứng.

Phân tích lỗi là việc truy tìm những trường hợp giải thích một kết quả, rồi chọn một bản sửa lỗi mà tác động của nó có thể kiểm soát được. Hãy giữ các dự đoán kèm mã định danh và tham chiếu của chúng, tách lỗi định dạng khỏi lỗi nội dung, rồi xem xét các danh mục quan trọng. Một điểm số tổng thể không cho biết trường hợp nào thất bại cũng như vì sao. Thử nghiệm tiếp theo đúng đắn sẽ sửa một cơ chế cụ thể mà không che lấp các hồi quy mới.

01 /

Lưu giữ kết quả đầu ra trước khi tóm tắt chúng

Một phân tích bắt đầu bằng việc nối các đầu vào, tham chiếu và dự đoán. Hãy kiểm tra rằng mỗi mã định danh mong đợi xuất hiện đúng một lần. Phân biệt một câu trả lời sai với một truy vấn chưa hoàn tất, một bản trùng lặp hay một kết quả không đọc được. Những vấn đề này không có cùng cách khắc phục và không nên biến mất khi tính giá trị trung bình.

Hãy giữ kết quả thô bên cạnh phiên bản chuẩn hóa, phiên bản mô hình, prompt, các cài đặt và lý do phán quyết. Một phép chuyển đổi âm thầm biến đổi một ngày tháng mơ hồ có thể tạo ra thành công giả tạo. Hãy bắt đầu khám phá trên tập validation. Nếu tập test cuối cùng được dùng để nghĩ ra bản sửa lỗi tiếp theo, thì sẽ cần một lần xác nhận mới được giữ riêng.

Nguồn kỹ thuật: scikit-learn 1.9 — giữ tập test tách khỏi các lựa chọn mô hình

02 /

Đọc một ma trận nhầm lẫn kèm số lượng mẫu

Với bài toán phân loại một danh mục cho mỗi mục, ma trận đối chiếu lớp tham chiếu với lớp dự đoán. Theo quy ước được dùng ở đây và trong scikit-learn, các hàng mang tham chiếu và các cột mang dự đoán. Hãy giữ số lượng thô trước khi chuẩn hóa: một tỷ lệ phần trăm không kèm số lượng ví dụ có thể phóng đại độ vững chắc của một kết luận.

Ví dụ sau đây là hư cấu và chỉ mang tính số học. Một trăm ticket được phân bổ giữa Hóa đơn, Truy cập và Xóa. Đường chéo chứa 54 + 24 + 5 = 83 câu trả lời đúng, tức 83 %. Tổng này che khuất lớp Xóa: chỉ 5 trong số 10 ticket mong đợi được nhận diện. Không mô hình hay GPU nào tạo ra những con số này.

Ví dụ minh họa — hàng: tham chiếu; cột: dự đoán; đơn vị: ticket
Tham chiếuDự đoán Hóa đơnDự đoán Truy cậpDự đoán XóaTổng thực tế
Hóa đơn545160
Truy cập424230
Xóa41510
Tổng dự đoán62308100

Nguồn kỹ thuật: scikit-learn 1.9 — định nghĩa ma trận nhầm lẫn

03 /

Liên hệ độ chính xác, độ phủ và hậu quả thực tế

Với lớp Xóa, độ chính xác bằng 5/8 = 62,5 %: trong số các ticket được gửi vào danh mục này, năm cái là đúng. Độ phủ bằng 5/10 = 50 %: một nửa số ticket thuộc danh mục này được tìm thấy. F1 bằng 2 × 5 / (2 × 5 + 3 + 5), tức khoảng 55,56 %. Ba dương tính giả và năm âm tính giả mô tả những vấn đề khác nhau.

F1 của các lớp Hóa đơn, Truy cập và Xóa lần lượt là 88,52 %, 80 % và 55,56 %. Trung bình không trọng số của chúng, tức macro-F1, vào khoảng 74,69 %. Nó bổ sung cho con số 83 % câu trả lời đúng, chứ không thay thế số lượng mẫu. Nếu một lớp vắng mặt trong các tham chiếu hoặc dự đoán, một số chỉ số có thể không xác định: hãy công bố quy ước được dùng thay vì giấu trường hợp đó trong một giá trị trung bình.

Độ chính xác = dương tính thật / dự đoán dương tính; độ phủ = dương tính thật / tham chiếu dương tính. Macro-F1 = trung bình các F1 được tính riêng theo từng lớp.

Nguồn kỹ thuật: scikit-learn 1.9 — độ chính xác, độ phủ, F1, các trung bình và phép chia cho không

04 /

Xây dựng một phân loại học ngắn gọn, gắn với các hành động

Một loại lỗi nên giúp quyết định cần xem xét điều gì. Hãy bắt đầu với một vài loại, một định nghĩa và một ví dụ tiêu biểu. Thêm một nhãn chính để đếm các trường hợp mà không đếm trùng, rồi thêm các nhãn phụ nếu nhiều hiện tượng cùng tồn tại. Giữ một loại "cần xem xét" thay vì ép buộc một lời giải thích.

Phân loại này là một đề xuất làm việc, không phải chẩn đoán tự động. Một tài liệu bị cắt ngắn cũng có thể chứa sự mơ hồ về tham chiếu. Tần suất của một nhãn mô tả các trường hợp đã được đọc lại; nó chưa chứng minh được một nguyên nhân. Hãy giữ đoạn đầu vào làm cơ sở cho cách hiểu của bạn và phân biệt nguyên nhân quan sát được, giả thuyết và thông tin còn thiếu.

Phân loại khởi đầu để điều chỉnh theo nhiệm vụ
Lỗi chínhĐiều cần xem xétThí nghiệm tiếp theo có thể thực hiện
Đầu vào không đầy đủCắt ngắn, thiếu phần, lắp ghép saiSửa khâu chuẩn bị rồi chạy lại đúng các trường hợp đó
Định dạng không hợp lệTrường hoặc loại bị cấm, không thể phân tích cú phápSửa hợp đồng đầu ra và kiểm tra cả nội dung
Nội dung saiTrường sai, nhầm lẫn giữa các loạiThử một chỉ dẫn hoặc ví dụ có mục tiêu
Tham chiếu gây tranh cãiChú thích mơ hồ, chỉ dẫn mâu thuẫnPhân xử rồi đánh phiên bản cho tham chiếu trên tất cả các biến thể
Thực thi không đầy đủDừng, hết thời gian chờ, thiếu kết quảXử lý đường ống; giữ lại thất bại trong báo cáo tổng kết
05 /

Đối với trích xuất, đếm các trường và tài liệu

Một định dạng JSON hợp lệ không đảm bảo rằng các giá trị là đúng. Hãy cố định các chuẩn hóa được phép: ngày chuẩn, dấu phân cách thập phân, khoảng trắng hoặc mã loại. Phân biệt trường thiếu, giá trị bịa ra và việc từ chối trả lời được phép. Một giá trị vắng mặt trong tài liệu không được thay bằng một phỏng đoán để cải thiện tỷ lệ điền.

Đây là một phép tính minh họa thứ hai, độc lập với bảng phân loại. Năm mươi tài liệu, mỗi tài liệu có ba trường được mong đợi, tức 150 giá trị. Giả sử 38 tài liệu hoàn toàn đúng, sáu tài liệu có hai trường đúng và sáu tài liệu có một trường đúng. Điều này cho 38 × 3 + 6 × 2 + 6 × 1 = 132 giá trị đúng, tức 88 %. Tuy nhiên, chỉ 38/50 = 76 % tài liệu là hoàn toàn chấp nhận được nếu cả ba trường đều bắt buộc.

18 giá trị sai ảnh hưởng đến mười hai tài liệu. Đừng trình bày chúng như mười tám tài liệu bị lỗi. Tùy theo mục đích sử dụng, đơn vị hữu ích sẽ là một trường đã được kiểm tra hoặc một tài liệu hoàn chỉnh được chấp nhận; hãy định nghĩa nó trước khi so sánh. Giữ kết quả theo từng trường để biết liệu khó khăn đến từ ngày tháng, số tiền hay các loại.

Trích xuất giả định — ba trường bắt buộc trong mỗi tài liệu trong số 50 tài liệu
Loại tài liệuTài liệuSố trường đúng mỗi tài liệuTổng số trường đúng
Hoàn toàn đúng383114
Một lỗi6212
Hai lỗi616
Tổng cộng50—132 trên 150
06 /

Chọn cách sửa trước khi chạy lại một chiến dịch

Hãy ưu tiên theo hậu quả và phạm vi bị ảnh hưởng, không chỉ theo số dòng. Trong ma trận giả định, năm lỗi của Xóa có thể đáng được xem xét trước sáu lỗi của Hóa đơn nếu dự án đã định nghĩa loại này là quan trọng. Mức ưu tiên này thuộc về hợp đồng của dự án; bảng không cho phép bịa ra một mức độ nghiêm trọng nghiệp vụ.

Hãy đặt một giả thuyết có thể kiểm chứng: "Các đầu vào dài làm mất đoạn quyết định trong khâu chuẩn bị". Chọn một thay đổi cho phép xem xét nó, rồi giữ nguyên phần còn lại. Thêm ví dụ, đổi mô hình và tăng ngữ cảnh cùng lúc có thể cải thiện điểm số, nhưng không còn cho phép quy hiệu ứng cho một sửa đổi duy nhất.

  • Đọc lại một vài trường hợp thành công ngoài các lỗi, để kiểm tra rằng tiêu chí được áp dụng nhất quán.
  • So sánh các biến thể trên cùng các mã định danh và tham chiếu; báo cáo riêng mọi thay đổi của kho dữ liệu.
  • Phân biệt lỗi đã sửa, lỗi còn tồn tại, lỗi mới và trường hợp không đổi.
  • Chạy lại cả các ví dụ ngoài loại được nhắm tới để tìm các hồi quy.
07 /

Kiểm soát mức tăng mà không xóa các hồi quy

Một phép tính theo cặp cho thấy điều mà điểm ròng che giấu. Trên một trăm phiếu yêu cầu giả định, hãy tưởng tượng chín lỗi được sửa nhưng bốn trường hợp thành công trước đây trở thành sai. Kết quả chuyển từ 83 thành 83 + 9 − 4 = 88 câu trả lời đúng. Mức tăng là năm điểm, với bốn hồi quy cần xem xét. Điều đó không có nghĩa là chín sửa đổi đã đạt được mà không có đánh đổi.

Biên bản quyết định giữ lại các bảng trước/sau, các trường hợp đã sửa, các lỗi mới, phiên bản của bản vá và các tiêu chí đã đạt. Nếu một quy tắc quan trọng vẫn bị vi phạm, điểm trung bình cao hơn không đủ để chấp nhận biến thể. Chi phí và thời lượng sau đó được so sánh giữa các phương án đủ điều kiện; tăng tốc một kết quả bị loại không giải quyết được vấn đề chất lượng.

08 /

Giới hạn kết luận trong phạm vi đã khảo sát

Một lỗi nổi bật không nhất thiết mang tính đại diện. Nếu bạn chủ yếu đọc lại các mục dài hoặc các thất bại của một danh mục hiếm gặp, hãy nêu rõ cách chọn mẫu đó và đừng trình bày tần suất của chúng như tần suất của toàn bộ tập dữ liệu. Cũng hãy giữ lại các trường hợp chưa được phân xử: chúng xác định một điểm chưa chắc chắn trong đánh giá của bạn.

Phân tích của bạn có thể sử dụng được khi một người đọc khác có thể tìm lại mục đó, hiểu phán quyết và kiểm tra bản sửa được đề xuất. Nó không chứng minh nguyên nhân bên trong của một câu trả lời được tạo ra cũng như không đảm bảo chất lượng trong tương lai. Hãy chuyển sang tập kiểm tra cuối cùng được giữ riêng sau khi chọn bản vá, rồi lưu trữ các giới hạn cùng với kết luận.

Câu hỏi thực tế

Việc điểm tổng tăng có đủ để chấp nhận một biến thể không?

Không. Hãy kiểm tra các danh mục quan trọng, các lỗi mới và các kết quả đầu ra đầy đủ đã được chấp nhận. Điểm trung bình tăng có thể đi kèm với một hồi quy vi phạm tiêu chí của dự án.

Tôi có nên sửa một đáp án tham chiếu khi mô hình phản bác nó không?

Trước tiên hãy kiểm tra đầu vào và hướng dẫn gán nhãn. Nếu đáp án tham chiếu sai, hãy phân xử và đánh phiên bản cho bản sửa, rồi áp dụng nó cho tất cả các biến thể. Chỉ riêng sự bất đồng của mô hình không đủ lý do để thay đổi câu trả lời mong đợi.

Tôi có thể cộng các danh mục trong phân loại của mình không?

Chỉ khi mỗi trường hợp có một danh mục chính duy nhất cho phép đếm đó. Các nhãn phụ có thể chồng lấn; khi đó tổng của chúng đếm số lần xuất hiện của nhãn, chứ không phải các lỗi riêng biệt.