MLOps

Model drift: phát hiện sớm trước khi kinh doanh phát hiện

Mô hình không hỏng đột ngột. Nó suy giảm dần, và nếu không giám sát thì người đầu tiên phát hiện thường là khách hàng.

Đội kỹ sư dữ liệu BigAI
· 1 phút đọc · Cập nhật

1. Phân biệt hai loại drift {#hai-loai-drift}

Độ trôi dữ liệu là khi phân bố dữ liệu đầu vào thay đổi — ví dụ tệp khách hàng mở rộng sang một phân khúc mới. Độ trôi khái niệm là khi mối quan hệ giữa đầu vào và đầu ra thay đổi — ví dụ hành vi mua sắm thay đổi sau một sự kiện lớn.

Cách xử lý khác nhau: loại thứ nhất thường chỉ cần huấn luyện lại, loại thứ hai có thể cần thiết kế lại đặc trưng.

2. Chỉ số nên giám sát {#chi-so}

  • Phân bố từng đặc trưng đầu vào so với tập huấn luyện
  • Phân bố dự đoán đầu ra theo thời gian
  • Độ trễ và tỷ lệ lỗi của dịch vụ suy luận
  • Chất lượng thực tế khi có nhãn về (thường trễ vài ngày tới vài tuần)

3. Đặt ngưỡng cảnh báo hợp lý {#nguong}

Ngưỡng quá nhạy sinh ra cảnh báo giả và đội vận hành sẽ bắt đầu bỏ qua. Kinh nghiệm của BigAI là bắt đầu bằng ngưỡng rộng, quan sát biến động tự nhiên trong 4–6 tuần rồi mới siết dần.

Nội dung liên quan

Tối ưu Spark job: giảm 60% chi phí cluster

Phần lớn chi phí Spark bị lãng phí ở những chỗ dễ sửa: định dạng lưu trữ sai, partition quá nhỏ, shuffle không cần thiết và cluster chạy không tải.

RAG hoạt động thế nào và khi nào nên fine-tune?

Hai hướng tiếp cận thường bị đặt nhầm vị trí. RAG giải bài toán kiến thức, fine-tune giải bài toán hành vi — lẫn lộn hai thứ này là nguyên nhân phổ biến khiến dự án đội chi phí.

Bắt đầu với buổi khảo sát dữ liệu miễn phí 60 phút

Một kỹ sư giải pháp của BigAI sẽ cùng bạn rà soát hiện trạng dữ liệu, xác định bài toán đáng làm nhất và phác thảo lộ trình khả thi. Không ràng buộc.

  • Đánh giá độ trưởng thành dữ liệu
  • Đề xuất 2–3 use case có ROI rõ
  • Ước tính ngân sách và thời gian

Bằng việc gửi thông tin, bạn đồng ý với Chính sách bảo mật của BigAI.

Hotline Tư vấn miễn phí