VietnamAI.orgHiểu đúng AI, đi trước cùng Việt Nam
AI và tiếng Việt

Dữ liệu tiếng Việt cho AI: máy học tiếng Việt từ đâu?

AI học tiếng Việt từ văn bản và ghi âm tiếng Việt có trên mạng, sách, báo, tài liệu công khai và dữ liệu do người gán nhãn. Tiếng Việt ít dữ liệu hơn tiếng Anh, lại lệch về văn báo chí và văn dịch, nên AI giỏi kiểu nói đó và dở kiểu nói đời thường.

Nhóm sinh viên ngồi trên bãi cỏ trường đại học ghi âm giọng đọc

AI học tiếng Việt từ chính chữ và giọng nói tiếng Việt mà con người đã viết, đã ghi lại: trang web, báo chí, sách đã số hoá, diễn đàn, văn bản hành chính công khai, phụ đề, bản ghi âm có lời chép, và dữ liệu do người gán nhãn. Mô hình đọc khối chữ ấy rất nhiều lần để học xem chữ nào hay đi sau chữ nào, câu nào trả lời cho câu hỏi nào.

Vấn đề không chỉ là tiếng Việt ít dữ liệu hơn tiếng Anh. Vấn đề lớn hơn là dữ liệu tiếng Việt lệch: nhiều văn báo chí, văn hành chính, văn dịch; ít văn nói đời thường, ít phương ngữ, ít tri thức nghề được viết ra. AI giỏi đúng thứ nó đọc nhiều, và lỗ hổng của nó là tấm gương phản chiếu những gì người Việt chưa viết ra.

Từ khối chữ trên mạng đến một mô hình biết nói tiếng Việt

Hình dung một người học tiếng Việt chỉ bằng cách đọc, không bao giờ nghe, không bao giờ ra chợ. Người đó đọc hàng triệu trang báo, hàng nghìn cuốn sách, vô số bình luận trên diễn đàn. Người ấy sẽ viết rất giống báo, nói chuyện rất giống bình luận mạng, và lúng túng khi phải nói như bà bán rau ở chợ Bến Thành hay ông chủ vườn sầu riêng ở Cái Mơn. Mô hình ngôn ngữ học tiếng Việt gần giống như thế.

Quá trình học có ba lớp. Lớp đầu là đọc thật nhiều văn bản để học quy luật ngôn ngữ chung, gọi là huấn luyện trước. Lớp sau là dạy cách làm theo yêu cầu, bằng những cặp câu hỏi và câu trả lời mẫu mà con người soạn. Lớp cuối là chỉnh hành vi, cho người chấm câu trả lời nào tốt hơn để mô hình nghiêng về phía đó. Cả ba lớp đều cần dữ liệu tiếng Việt, và lớp sau càng cần người Việt thật sự hiểu nghề soạn ra.

Lớp đầu thường bị thiếu nhất về chất. Văn bản tiếng Việt trên mạng có rất nhiều trang sao chép lẫn nhau, bài viết máy xào lại, bình luận rác, văn bản dịch máy kém chất lượng. Nếu không lọc kỹ, mô hình học luôn những câu sai đó và coi là chuẩn. Đây là lý do có những lỗi "giọng dịch" cứ lặp đi lặp lại: chúng có thật trong dữ liệu, với số lượng lớn.

Lớp sau thì thiếu về lượng. Soạn một cặp hỏi đáp tốt về thuế hộ kinh doanh, về chăm lúa giai đoạn làm đòng, về thủ tục nhập học cho con, cần người có hiểu biết thật. Những người đó bận làm nghề, ít khi viết ra. Tri thức nghề của người Việt phần lớn vẫn nằm trong đầu, trong sổ tay, trong những buổi cầm tay chỉ việc, chưa thành chữ để máy đọc.

Với giọng nói, chuyện còn khó hơn. Muốn máy nhận dạng giọng nói giỏi, cần những bản ghi âm kèm lời chép đúng từng chữ. Chép một giờ ghi âm mất nhiều giờ công, và người chép phải nghe được giọng vùng đó. Thế nên dữ liệu giọng nói tiếng Việt có lời chép chuẩn thường tập trung ở giọng đọc tin tức và sách nói.

Dữ liệu tiếng Việt lệch ở những chỗ nào

Nhiều văn viết, ít văn nói. Báo chí và văn bản chiếm phần lớn; lời nói chợ búa, nói chuyện trong nhà ít được ghi lại thành chữ.

Nhiều giọng chuẩn, ít phương ngữ. Dữ liệu ghi âm nghiêng về giọng đọc rõ ở thành phố lớn.

Nhiều văn dịch. Rất nhiều nội dung tiếng Việt trên mạng là dịch từ tiếng Anh, mang theo cấu trúc câu tiếng Anh.

Nhiều nội dung đô thị. Chuyện văn phòng, mua sắm, công nghệ dày đặc; chuyện ruộng đồng, chài lưới, nghề thủ công ít hơn hẳn.

Ít tri thức nghề viết ra. Kinh nghiệm thợ may, thợ hồ, kỹ thuật viên điện lạnh chủ yếu truyền miệng.

Ít dữ liệu của người lớn tuổi và trẻ nhỏ. Hai nhóm này dùng mạng ít hơn và viết ít hơn, nên mô hình kém hiểu cách họ nói.

Ít tiếng Việt của đồng bào dân tộc thiểu số. Cách nói tiếng Việt pha giọng mẹ đẻ gần như vắng mặt trong dữ liệu.

Lẫn nhiều văn bản máy viết. Bài xào nấu tự động làm dữ liệu nhiễm chính những lỗi của máy, như vòng lặp tự nuôi lỗi.

Lệch thời gian. Dữ liệu tập trung vào giai đoạn có internet phổ biến; văn bản cũ chưa số hoá hầu như không có mặt.

Lẫn bảng mã cũ và lỗi chữ. Văn bản số hoá kém, nhận dạng chữ từ bản scan sai dấu, đi thẳng vào dữ liệu nếu không làm sạch.

Lệch quan điểm. Diễn đàn và mạng xã hội có giọng gay gắt, cực đoan nhiều hơn đời thật; không lọc thì mô hình học luôn giọng đó.

Doanh nghiệp, trường học góp được gì cho dữ liệu tiếng Việt

Không phải ai cũng làm mô hình, nhưng ai làm nghề cũng có thể làm cho dữ liệu tiếng Việt tốt lên bằng một việc rất đơn giản: viết tri thức của mình ra, viết đúng, viết rõ và công khai khi được phép. Một hợp tác xã viết kỹ quy trình trồng bưởi da xanh theo mùa, một trường cấp ba công khai bộ đề ôn luyện có lời giải tử tế, một phòng khám viết bài hướng dẫn chăm sóc sau nhổ răng bằng lời dễ hiểu, đều là những viên gạch tiếng Việt chất lượng.

Với dữ liệu nội bộ, doanh nghiệp không cần công khai mà cần làm sạch để dùng cho chính mình. Một công ty dịch vụ khách hàng có hàng nghìn đoạn chat với khách; nếu xoá thông tin cá nhân, gắn nhãn đâu là câu trả lời tốt, đâu là câu trả lời làm khách phàn nàn, thì đó là kho dữ liệu quý để dạy trợ lý AI nội bộ trả lời đúng giọng công ty.

Với giọng nói, các dự án cộng đồng mời người tình nguyện đọc những câu ngắn để thu thập giọng nhiều vùng. Đóng góp kiểu này có ích nhất khi người đọc đến từ những vùng đang thiếu dữ liệu. Nhưng trước khi tham gia, hãy đọc kỹ dự án dùng giọng của bạn vào việc gì, có cho rút lại không, vì giọng nói là dữ liệu sinh trắc có thể bị lạm dụng.

Trường đại học có vai trò đặc biệt. Sinh viên ngành ngôn ngữ, ngành báo chí, ngành công nghệ có thể cùng nhau xây những bộ dữ liệu nhỏ mà sạch: một bộ câu phương ngữ miền Trung có chú thích, một bộ hỏi đáp về thủ tục hành chính viết bằng lời người dân, một bộ văn bản được biên tập để loại bỏ giọng dịch. Bộ dữ liệu nhỏ mà sạch đôi khi giá trị hơn khối dữ liệu lớn mà bẩn.

Điều cần tránh là đổ dữ liệu rác vào kho chung: viết bài bằng máy rồi đăng hàng loạt cho có nội dung. Mỗi bài như vậy lại thành dữ liệu cho mô hình đời sau học, và lỗi cứ thế nhân lên.

Muốn góp dữ liệu tiếng Việt thì nhớ mấy điều

Xin phép người có dữ liệu. Đoạn chat, ghi âm, ảnh chụp có người thì phải có sự đồng ý rõ ràng.

Xoá thông tin cá nhân. Tên, số điện thoại, địa chỉ, số căn cước, thông tin sức khoẻ phải được che hoặc xoá trước khi dùng.

Ghi rõ nguồn gốc. Dữ liệu ghi rõ vùng miền, lĩnh vực, người soạn thì người dùng sau biết nó tốt cho việc gì.

Chuẩn hoá chữ. Đưa về một bảng mã, một cách bỏ dấu thống nhất.

Ghi rõ phương ngữ. Câu nói giọng Nghệ hay giọng miền Tây nên được ghi chú, đừng sửa thành giọng chuẩn rồi mất đi giá trị.

Không nhân bản bài máy viết. Dữ liệu sinh bằng máy phải được đánh dấu, không trộn lẫn với chữ người viết.

Soát bởi người hiểu nghề. Bộ hỏi đáp về y tế, pháp lý, nông nghiệp phải có người trong nghề soát.

Giữ đa dạng giọng. Đủ nam nữ, già trẻ, thành thị nông thôn trong bộ giọng nói.

Ghi giấy phép sử dụng. Ai được dùng, dùng vào việc gì, có thương mại hay không.

Bắt đầu nhỏ. Một trăm câu sạch có chú thích tốt hơn mười nghìn câu không ai kiểm.

Cập nhật định kỳ. Thủ tục, quy định, tên đơn vị hành chính thay đổi; dữ liệu cũ sai dần theo thời gian.

Dấu hiệu AI đang thiếu dữ liệu tiếng Việt về chủ đề bạn hỏi

Trả lời chung chung. Hỏi kỹ thuật trồng thanh long ruột đỏ mà nhận về lời khuyên dùng được cho mọi loại cây.

Lấy ví dụ nước ngoài. Hỏi chuyện mở quán ở Việt Nam mà ví dụ toàn là thủ tục, thói quen của nơi khác.

Thuật ngữ dịch ngược. Dùng từ dịch sát tiếng Anh thay vì từ người trong nghề ở Việt Nam thật sự dùng.

Tên địa danh sai dấu. Tên xã, tên sông, tên chợ bị đặt sai dấu hoặc đặt nhầm tỉnh.

Lẫn tên đơn vị hành chính cũ và mới. Dữ liệu không theo kịp những lần điều chỉnh địa giới.

Phong tục bị trộn vùng. Gán tục lệ của miền này cho miền khác như thể cả nước giống nhau.

Câu trả lời đổi mỗi lần hỏi. Hỏi lại cùng câu mà nội dung chính khác nhau là dấu hiệu nó đang đoán.

Giải thích từ địa phương sai. Hỏi "mần răng" hay "hổng chịu" thì ra một nghĩa gượng.

Không nói được nguồn. Hỏi "thông tin này lấy ở đâu" mà nó chỉ nói chung chung.

Quá tự tin với chi tiết nhỏ. Số điện thoại, giờ mở cửa, tên người phụ trách đưa ra rất chắc chắn mà không có căn cứ.

Tránh câu hỏi bằng lời khuyên chung. "Bạn nên tham khảo chuyên gia" mà không nói được gì thêm, nghĩa là nó không có gì để nói.

Câu hỏi thường gặp

Vì sao AI biết tiếng Việt mà vẫn không biết chuyện ở quê mình?

Vì chuyện đó chưa được ai viết ra thành chữ trên mạng, hoặc viết rất ít. Mô hình chỉ biết những gì nó từng đọc, nên những vùng ít được viết về thì nó hoặc không biết, hoặc đoán bừa.

Dữ liệu tiếng Việt ít thì AI có kém hẳn không?

Không kém hẳn, vì mô hình học được nhiều quy luật chung từ các ngôn ngữ khác rồi chuyển sang tiếng Việt. Nhưng ở chi tiết văn hoá, phương ngữ, thuật ngữ nghề hẹp thì thiếu dữ liệu lộ rõ.

Bài viết của mình đăng công khai có bị dùng để dạy AI không?

Có thể có, tuỳ chính sách của từng bên thu thập dữ liệu và tuỳ trang web có chặn hay không. Nếu bạn muốn hạn chế, hãy tìm hiểu cách cấu hình trang web và quy định bản quyền, và hỏi luật sư khi có tranh chấp cụ thể.

Có nên tình nguyện đóng góp giọng nói cho dự án AI không?

Có ích cho tiếng Việt nếu dự án minh bạch về mục đích, cách lưu và quyền rút lại. Giọng nói có thể bị dùng để giả giọng, nên hãy chọn dự án uy tín và đọc kỹ điều khoản.

Doanh nghiệp nhỏ có cần lo chuyện dữ liệu tiếng Việt không?

Có, ở mức của mình. Dữ liệu nội bộ sạch như danh mục sản phẩm, câu hỏi khách hay gặp, quy trình làm việc viết rõ là điều kiện để dùng AI nội bộ trả lời đúng.

Cần tư vấn cụ thể cho trường hợp của bạn?

Chúng tôi sẽ liên hệ trong vòng 24 giờ.

Đăng ký tư vấn ngay

Bài viết liên quan

Bạn cần hỗ trợ thêm?

Để lại thông tin, chúng tôi sẽ liên hệ trong 24 giờ.