Gán nhãn dữ liệu là việc con người đánh dấu cho máy biết "cái này là gì": tấm ảnh lá lúa này bị bệnh đạo ôn hay cháy bìa lá, đoạn chat này khách đang phàn nàn hay đang hỏi giá, vùng nào trên tấm ván là vết nứt. AI học từ những ví dụ có nhãn ấy để tự nhận ra ở những ví dụ mới. Đây là kiểu học gọi là học có giám sát, và nó đứng sau rất nhiều ứng dụng AI làm thật.
Nhãn sai hay không nhất quán thì AI học sai, và sai một cách tự tin. Bài này giải thích các kiểu gán nhãn, vì sao chất lượng nhãn quan trọng hơn số lượng, và cách một hợp tác xã, một xưởng hay một phòng khám tổ chức gán nhãn cho đúng, kể cả khi chỉ có vài người làm.
Vì sao máy cần người chỉ "cái này là gì"
Mô hình ngôn ngữ lớn học phần lớn kiến thức bằng cách tự đoán chữ tiếp theo trên khối văn bản khổng lồ, không cần ai gán nhãn từng câu. Nhưng nhiều bài toán thực tế không làm được như vậy. Muốn máy nhìn ảnh lá lúa và nói đó là bệnh gì, phải có người biết bệnh lúa đã nhìn hàng nghìn tấm ảnh và ghi tên bệnh cho từng tấm. Máy học từ chính những tấm ảnh đã ghi tên đó.
Ngay cả mô hình ngôn ngữ lớn cũng cần gán nhãn ở các bước sau. Để nó biết trả lời theo yêu cầu, người ta soạn những cặp câu hỏi và câu trả lời mẫu. Để nó biết câu trả lời nào tốt hơn, người ta cho người chấm, so sánh hai câu trả lời và chọn câu hay hơn. Những người chấm ấy cũng là người gán nhãn, và gu của họ thành gu của mô hình.
Chỗ khó là nhãn chỉ tốt bằng hiểu biết của người gán. Một sinh viên chưa từng ra ruộng có thể nhầm vết cháy bìa lá do vi khuẩn với vết khô do thiếu nước. Một nhân viên mới có thể xếp lời khách "hàng này dùng cũng được" vào nhóm hài lòng, trong khi người bán hàng lâu năm nghe ra ngay đó là lời chê khéo. Gán nhãn trông như việc tay chân, nhưng gán nhãn đúng là việc của người hiểu nghề.
Một chỗ khó nữa là sự nhất quán. Hai người gán cùng một tấm ảnh có khi cho hai nhãn khác nhau, không phải vì ai sai mà vì ranh giới giữa hai nhóm vốn mờ. Nếu không có quy ước chung, dữ liệu sẽ chứa những mâu thuẫn mà máy không thể tự giải, và kết quả là mô hình lưỡng lự đúng ở những ca khó nhất, những ca người dùng cần nó nhất.
Các kiểu gán nhãn hay gặp
Phân loại. Gán một nhãn cho cả mẫu: ảnh này có bệnh hay không, email này là rác hay không.
Đa nhãn. Một mẫu có nhiều nhãn: tin nhắn vừa hỏi giá vừa phàn nàn giao chậm.
Khoanh khung. Vẽ hình chữ nhật quanh vật thể trong ảnh: quả xoài, xe máy, người đội mũ bảo hiểm.
Tô vùng. Tô chính xác từng điểm ảnh thuộc vùng cần nhận diện, như vết nứt trên tấm ván, vùng lá bị bệnh.
Đánh dấu điểm. Chấm các điểm mốc như khớp tay trên ảnh người tập thể dục.
Gán nhãn chữ. Đánh dấu tên người, địa chỉ, số tiền trong văn bản để máy học trích thông tin.
Chép lời âm thanh. Nghe ghi âm và chép đúng từng chữ, kể cả giọng địa phương.
Gán cảm xúc. Đánh giá lời nhận xét là tích cực, tiêu cực hay trung tính.
Xếp hạng câu trả lời. So sánh hai câu trả lời của AI, chọn câu tốt hơn và nói lý do.
Soạn câu trả lời mẫu. Viết câu trả lời chuẩn cho một câu hỏi để mô hình học theo.
Đánh dấu video theo thời gian. Ghi lại đoạn nào trong video có sự kiện cần nhận diện, như người ngã trong xưởng.
Kiểm nhãn. Người thứ hai rà lại nhãn của người thứ nhất; đây cũng là một kiểu gán nhãn, và hay bị bỏ qua.
Một ví dụ ở đồng bằng: ảnh lá lúa để nhận diện bệnh
Hình dung một nhóm kỹ sư nông nghiệp ở Đồng Tháp muốn làm ứng dụng giúp bà con chụp lá lúa để biết lúa đang có dấu hiệu bệnh gì. Việc đầu tiên không phải viết phần mềm, mà là thu thập ảnh và gán nhãn. Họ đi ruộng nhiều vụ, chụp ở nhiều giờ trong ngày, nhiều giai đoạn sinh trưởng, nhiều giống lúa, cả ruộng khoẻ lẫn ruộng bệnh.
Rồi đến quy ước. Nhóm phải thống nhất: bao nhiêu nhóm bệnh, dấu hiệu nào xếp vào nhóm nào, lá bị nhiều bệnh cùng lúc thì gán thế nào, ảnh mờ thì bỏ hay gán "không rõ". Họ chụp những ảnh mẫu cho từng nhóm, ghi chú dấu hiệu phân biệt, và viết thành một tài liệu ngắn mà người gán nào cũng phải đọc trước.
Khi gán, mỗi ảnh được hai người gán độc lập. Ảnh nào hai người cho nhãn khác nhau thì đưa lên kỹ sư có kinh nghiệm nhất quyết định, và nếu thấy quy ước còn mơ hồ ở chỗ đó thì sửa quy ước. Những ảnh tranh cãi thường hoá ra là ảnh quý nhất, vì chúng chỉ đúng vào ranh giới khó.
Họ cũng gặp những cái bẫy quen thuộc. Ảnh lá bệnh phần lớn chụp buổi sáng, ảnh lá khoẻ chụp buổi chiều; máy có nguy cơ học nhận ra ánh sáng buổi sáng thay vì vết bệnh. Phát hiện ra, họ phải chụp bổ sung cho cân. Ảnh chụp trên ruộng thật luôn có bùn, có cỏ, có tay người cầm lá; nếu chỉ dùng ảnh lá đặt trên giấy trắng thì ứng dụng ra ruộng sẽ dở.
Ngay cả khi làm kỹ, ứng dụng cũng chỉ nên nói "có dấu hiệu giống bệnh này, nên hỏi cán bộ khuyến nông hoặc kỹ thuật viên bảo vệ thực vật". Quyết định phun thuốc gì, liều bao nhiêu vẫn là việc của người có chuyên môn và phải đọc kỹ nhãn thuốc. AI giúp phát hiện sớm, không thay người chẩn đoán.
Cách tổ chức gán nhãn cho chuẩn, kể cả khi chỉ có vài người
Viết quy ước trước khi gán. Định nghĩa từng nhãn, kèm ảnh hoặc câu mẫu, kèm cách xử lý ca mơ hồ.
Để người hiểu nghề làm hoặc kiểm. Nhãn bệnh lúa cần kỹ sư nông nghiệp, nhãn phim chụp răng cần nha sĩ.
Gán thử một lô nhỏ rồi họp. Gán vài trăm mẫu, so kết quả giữa các người, sửa quy ước ở chỗ lệch.
Hai người gán độc lập với ca quan trọng. Chỗ hai người lệch nhau là chỗ cần xem lại.
Có nhãn "không chắc". Ép người gán phải chọn khi không chắc là tạo ra nhãn sai.
Cân bằng dữ liệu. Đủ ví dụ cho mỗi nhóm, đủ điều kiện ánh sáng, vùng miền, thiết bị.
Giữ một phần dữ liệu để kiểm tra. Phần này không dùng để dạy, chỉ dùng để đo mô hình làm tốt tới đâu.
Ghi lại ai gán, khi nào. Để lần ra khi một nhóm nhãn có vấn đề.
Che thông tin cá nhân. Ảnh có mặt người, phim chụp có tên bệnh nhân, đoạn chat có số điện thoại phải được che.
Trả công xứng đáng và cho nghỉ. Gán nhãn đơn điệu dễ mệt, người mệt thì gán ẩu.
Cập nhật quy ước khi gặp ca mới. Bệnh mới, sản phẩm mới, kiểu phàn nàn mới đều cần nhãn mới.
Sai lầm hay gặp khi gán nhãn
Chạy theo số lượng. Mười nghìn nhãn ẩu kém hơn hai nghìn nhãn cẩn thận.
Không có quy ước viết ra. Mỗi người hiểu một kiểu, dữ liệu đầy mâu thuẫn.
Giao cho người không hiểu nghề mà không kiểm. Nhãn sai nhất quán là loại sai khó phát hiện nhất.
Dữ liệu lệch điều kiện. Toàn ảnh chụp đẹp trong phòng, mang ra hiện trường thì mô hình bối rối.
Để lọt dấu hiệu "ăn gian". Nhóm ảnh này có logo, nhóm kia không; máy học nhận logo chứ không nhận vật cần nhận.
Không đo độ đồng thuận. Không biết các người gán khớp nhau tới đâu thì không biết dữ liệu đáng tin tới đâu.
Dùng dữ liệu kiểm tra để dạy. Mô hình trông giỏi trên giấy mà dở ngoài đời.
Dùng AI gán nhãn rồi không ai soát. Máy gán nháp giúp nhanh, nhưng nhãn máy sai sẽ dạy lại cho máy chính cái sai đó.
Bỏ qua ca hiếm. Ca hiếm thường là ca nguy hiểm nhất, như vết nứt nhỏ trên chi tiết chịu lực.
Quên quyền riêng tư. Gửi ảnh có mặt người, dữ liệu bệnh nhân cho bên ngoài gán mà không có thoả thuận bảo mật.
Coi gán nhãn là việc làm một lần. Thực tế thay đổi, dữ liệu và nhãn phải được bổ sung theo.
Câu hỏi thường gặp
Nghề gán nhãn dữ liệu có cần biết lập trình không?
Thường không cần. Người gán nhãn cần cẩn thận, đọc kỹ quy ước và với những dự án chuyên ngành thì cần hiểu biết về lĩnh vực đó, như nông nghiệp, y tế hay luật.
AI có tự gán nhãn được không?
Có thể gán nháp để người soát nhanh hơn, và với một số việc đơn giản thì gán khá tốt. Nhưng nhãn máy gán vẫn cần người kiểm, nhất là ở ca khó và ca hiếm.
Cần bao nhiêu dữ liệu có nhãn để làm một ứng dụng AI?
Không có con số chung, tuỳ bài toán khó hay dễ và có dùng mô hình có sẵn để tinh chỉnh hay không. Cách làm thực tế là bắt đầu với một lô vừa phải, đo kết quả trên phần dữ liệu kiểm tra, rồi bổ sung đúng chỗ mô hình còn yếu.
Làm sao biết nhãn dữ liệu đã đủ tốt?
Cho hai người gán độc lập cùng một phần dữ liệu và xem họ khớp nhau tới đâu, đồng thời để người giỏi nhất rà ngẫu nhiên một phần. Chỗ lệch nhiều là chỗ quy ước còn mơ hồ.
Gửi dữ liệu cho bên ngoài gán nhãn cần lưu ý gì?
Che thông tin cá nhân trước khi gửi, có thoả thuận bảo mật bằng văn bản, và giữ quyền kiểm tra chất lượng. Với dữ liệu y tế hay tài chính, hỏi người phụ trách pháp lý về nghĩa vụ bảo vệ dữ liệu.