VietnamAI.orgHiểu đúng AI, đi trước cùng Việt Nam
AI và tiếng Việt

Vì sao AI hay sai tiếng Việt? Dấu, tách từ và thanh điệu

AI hay sai tiếng Việt vì máy cắt chữ có dấu thành mảnh vụn, không biết đâu là ranh giới từ và không nghe được thanh điệu như người. Hiểu ba cơ chế này thì bạn hỏi và kiểm AI tốt hơn hẳn.

Cô giáo ngữ văn chấm bài trong phòng giáo viên, laptop mở bên cạnh

AI hay sai tiếng Việt vì ba lẽ nằm ngay trong cấu tạo của chữ mình: máy cắt chữ có dấu thành những mảnh vụn, máy không biết chỗ nào là ranh giới giữa hai từ, và máy không "nghe" được thanh điệu mà chỉ thấy ký tự. Ba chuyện đó cộng lại sinh ra những lỗi rất quen: bài văn đọc trơn mà dùng từ trật, bài lục bát đếm đủ chữ nhưng sai luật bằng trắc, câu gõ không dấu bị hiểu thành nghĩa khác.

Bài này giải thích từng cơ chế bằng ví dụ đời thường, rồi chỉ những thói quen nhỏ giúp bạn dùng AI bằng tiếng Việt đỡ sai hơn. Mình không bênh AI và cũng không chê cho sướng miệng: có việc AI làm tiếng Việt khá ổn, có việc nó dở thật, và biết vì sao nó dở thì mới biết khi nào nên tin.

Máy không đọc chữ như mình đọc: chuyện "mảnh chữ"

Mô hình ngôn ngữ lớn không đọc từng chữ cái, cũng không đọc từng tiếng như học sinh lớp một đánh vần. Trước khi vào mô hình, câu chữ được cắt thành những mảnh gọi là token, tức đơn vị nhỏ nhất mà mô hình xử lý. Bộ cắt này được dựng chủ yếu từ dữ liệu tiếng Anh, nên một từ tiếng Anh thông dụng thường gọn trong một mảnh, còn một tiếng Việt có dấu như "nghiêng" hay "thưởng" có khi bị chẻ ra hai, ba mảnh.

Hệ quả đầu tiên là tốn chỗ. Mỗi mô hình chỉ ôm được một lượng mảnh nhất định trong một lần trò chuyện, nên cùng một bản hợp đồng, bản tiếng Việt chiếm chỗ nhiều hơn bản tiếng Anh. Dán một tài liệu dài vào, đoạn đầu có thể bị "quên" sớm hơn bạn tưởng, và câu trả lời bắt đầu lạc khỏi nội dung bạn đưa.

Hệ quả thứ hai tinh hơn. Khi "thưởng" bị chẻ thành một mảnh "th" và một mảnh "ưởng", mô hình phải học lại từ đầu rằng hai mảnh ấy đi với nhau. Với từ phổ biến thì nó học được vì gặp nhiều. Với từ hiếm, từ địa phương, tên làng tên xã, nó gặp quá ít lần nên ghép sai, và đó là lúc bạn thấy những chữ trông như tiếng Việt mà không ai nói như thế.

Hệ quả thứ ba giải thích vì sao AI làm thơ lục bát hay trật luật. Luật lục bát dựa trên thanh bằng và thanh trắc ở những vị trí nhất định, và vần nằm ở âm cuối của tiếng. Nhưng mô hình không thấy "tiếng" như một đơn vị, nó thấy mảnh. Nó cũng không có tai để nghe thanh. Nó chỉ bắt chước được hình dáng của những bài thơ đã đọc, nên câu sáu câu tám thường đủ số chữ, đọc lên có vẻ êm, mà soi kỹ thì chữ thứ sáu câu lục không vần với chữ thứ sáu câu bát.

Vì vậy, khi nhờ AI viết câu đối, làm thơ tặng sinh nhật hay đặt khẩu hiệu có vần, hãy coi bản nó đưa là bản nháp để bạn sửa vần. Còn nếu cần đếm chữ chính xác, ví dụ tiêu đề quảng cáo giới hạn số ký tự, đừng tin con số AI tự báo; dán vào công cụ đếm thật.

Những kiểu lỗi tiếng Việt AI hay mắc nhất

Đúng từ, sai chỗ dùng. AI viết "khẩn trương" ở chỗ người ta nói "gấp", "tiến hành" ở chỗ chỉ cần "làm". Câu không sai ngữ pháp nhưng nghe như công văn.

Lẫn từ gần âm. Những cặp như "sát nhập" và "sáp nhập", "chuẩn đoán" và "chẩn đoán" vốn người cũng hay nhầm, nên dữ liệu có cả hai và mô hình có khi chọn bản sai.

Bịa từ ghép. Hai tiếng có thật ghép lại thành một từ không ai dùng, như kiểu ghép bừa hai từ Hán Việt cho có vẻ trang trọng. Đọc lướt rất dễ bỏ qua.

Sai thanh ở từ hiếm. Tên món ăn vùng miền, tên cây thuốc nam, tên địa danh nhỏ hay bị đặt sai dấu, vì mô hình gặp chúng quá ít lần.

Thơ đủ chữ mà trật vần. Như đã nói ở trên, lục bát và song thất lục bát là chỗ AI lộ rõ nhất việc nó không nghe được thanh điệu.

Dịch ngược cấu trúc câu tiếng Anh. "Được thực hiện bởi", "một trong những… nhất", "điều này cho thấy rằng" xuất hiện dày đặc vì mô hình học nhiều văn bản dịch.

Xưng hô lạc giọng. Đang "anh chị" chuyển sang "bạn", đang xưng "em" lại đổi sang xưng hô khác ngay trong một đoạn, vì mô hình không giữ được vai giao tiếp như người.

Hiểu sai chữ không dấu. "Ban dang o dau" có thể là "bạn đang ở đâu" hay "bàn đặng ở đâu"; ngữ cảnh ngắn thì mô hình đoán theo nghĩa phổ biến nhất.

Đếm sai số chữ, số dòng. Mô hình đếm theo mảnh chứ không theo tiếng, nên yêu cầu "viết đúng 20 chữ" thường ra 17 hoặc 24.

Viết hoa lung tung. Viết hoa mọi chữ đầu trong tiêu đề theo kiểu tiếng Anh, hoặc không viết hoa tên riêng tiếng Việt ít gặp.

Đặt dấu thanh không nhất quán. "Hoà" và "hòa", "thuỷ" và "thủy" trộn lẫn trong cùng một bài, vì dữ liệu có cả kiểu bỏ dấu cũ lẫn mới.

Tự tin ở chỗ không chắc. Đây là lỗi đáng sợ nhất: mô hình không nói "mình không biết từ này", mà đưa ra một giải thích nghe rất có lý cho một từ nó vừa đoán.

Ranh giới từ và chữ không dấu: chỗ máy phải đoán

Tiếng Anh có khoảng trắng giữa các từ. Tiếng Việt có khoảng trắng giữa các tiếng, mà một từ có thể gồm một, hai hay nhiều tiếng. "Học sinh học sinh học" là ví dụ quen trong giới làm ngôn ngữ: người đọc tách ngay được "học sinh / học / sinh học", máy thì phải đoán. Những hệ thống xử lý tiếng Việt đời trước phải có hẳn một bước tách từ riêng, và bước đó sai là mọi bước sau sai theo.

Mô hình ngôn ngữ lớn bây giờ không làm bước tách từ tách bạch như thế, nó học ngữ cảnh từ khối lượng văn bản rất lớn nên đoán ranh giới khá tốt với câu bình thường. Nhưng gặp câu ngắn, câu cụt, hay tiêu đề kiểu báo mạng nén chặt chữ, nó vẫn có thể hiểu lệch. Bạn hỏi "cách trị sâu răng sữa" thì ổn; bạn hỏi "trị sâu cây sữa" thì nó phải đoán bạn đang nói chuyện vườn cây hay chuyện răng.

Chữ không dấu làm chuyện đoán nặng thêm nhiều lần. Một chuỗi "ban" có thể là bàn, bán, bạn, bận, bản, bắn. Người Việt nhắn tin không dấu với nhau vẫn hiểu vì biết người kia là ai, đang nói chuyện gì. Mô hình chỉ có câu chữ trước mặt. Thêm teencode, viết tắt kiểu "ko", "dc", "nc", nó càng phải đoán nhiều.

Có một lỗi nằm ngoài mô hình mà ít người biết: bảng mã. Văn bản cũ soạn bằng các bảng mã đời trước, hoặc chữ copy ra từ một số tệp PDF, có thể trông y hệt chữ có dấu bình thường nhưng bên trong là ký tự gốc cộng với dấu rời. Mắt người thấy giống nhau, máy coi là hai chuỗi khác hẳn. Chuyện này làm công cụ tìm kiếm không ra kết quả, làm AI đọc tài liệu nội bộ bỏ sót đoạn, và làm việc so khớp tên khách hàng trong bảng tính thất bại một cách khó hiểu.

Cách xử lý đơn giản nhất là chuẩn hoá trước khi đưa cho máy: mở bằng một trình soạn thảo có chức năng chuyển mã, chuyển về Unicode dựng sẵn, rồi mới dán vào. Ai làm kỹ thuật thì biết đây là bước chuẩn hoá NFC; ai không làm kỹ thuật thì chỉ cần nhớ: văn bản cũ, chữ copy từ PDF, hãy gõ thử lệnh tìm một từ trong đó, tìm không ra thì chữ đang bị lệch mã.

Thói quen giúp AI hiểu tiếng Việt đúng hơn

Luôn gõ có dấu. Mất thêm vài giây nhưng bớt hẳn một tầng đoán. Với câu hỏi về thuốc, pháp lý hay tiền bạc, gõ không dấu là tự rước rủi ro.

Nói rõ vai giao tiếp. Ví dụ: "viết thư cho khách hàng lớn tuổi, xưng em, gọi anh chị". Mô hình giữ xưng hô tốt hơn hẳn khi được dặn từ đầu.

Nêu vùng miền khi cần. "Dùng từ quen ở miền Tây" hay "viết cho người đọc miền Bắc" giúp tránh cảnh dùng "trái thơm" với người gọi là "quả dứa" và ngược lại.

Đưa ví dụ mẫu. Dán một đoạn văn bạn thấy đúng giọng rồi bảo "viết theo giọng này". Một mẫu tốt hơn mười tính từ mô tả.

Tách tài liệu dài. Vì tiếng Việt tốn mảnh hơn, hãy chia tài liệu dài thành từng phần và hỏi từng phần thay vì dán một lần.

Chuẩn hoá chữ trước khi dán. Văn bản cũ hoặc chữ từ PDF nên chuyển về Unicode dựng sẵn để mô hình không đọc lệch.

Hỏi lại nghĩa từ lạ. Thấy một từ ghép nghe lạ, hỏi thẳng "từ này có trong từ điển không, đặt câu ví dụ". Nếu nó lúng túng, khả năng cao là từ bịa.

Tự đếm, đừng nhờ đếm. Giới hạn ký tự, số chữ, số dòng thì đếm bằng công cụ, không tin con số mô hình báo.

Tự soát vần khi làm thơ. Đọc to bài lục bát mà AI viết, gõ nhịp bằng trắc trên ngón tay. Sửa vần là việc của người.

Tra tên riêng ở nguồn gốc. Tên xã, tên món, tên người cần đúng dấu thì tra ở nguồn chính thức hoặc hỏi người địa phương.

Đọc to bản cuối. Câu "giọng dịch" lộ ra ngay khi đọc thành tiếng, mắt đọc lướt thì hay bỏ qua.

Việc tiếng Việt AI làm khá ổn và việc nên để người làm

Khá ổn: tóm tắt văn bản phổ thông. Bài báo, biên bản họp, email dài, AI tóm ý chính khá đúng nếu văn bản gốc rõ ràng.

Khá ổn: viết nháp thư từ thông thường. Thư xin nghỉ, thông báo lịch họp, lời mời khách, có nháp nhanh rồi sửa giọng.

Khá ổn: sửa lỗi chính tả phổ biến. Lỗi gõ sai, thiếu dấu ở từ thông dụng, AI bắt được nhiều.

Khá ổn: giải thích khái niệm phổ thông. Hỏi lãi kép là gì, quang hợp là gì, nó giải thích dễ hiểu.

Khá ổn: đổi giọng văn. Từ trang trọng sang thân mật và ngược lại, nếu bạn cho mẫu.

Để người: thơ có luật. Lục bát, đường luật, câu đối cần người có tai nghe thanh.

Để người: văn bản pháp lý. Một chữ "và" hay "hoặc" đổi cả nghĩa điều khoản, phải người có nghề đọc lại.

Để người: tên riêng và địa danh nhỏ. Sai dấu tên một xã là mất uy tín ngay với người ở đó.

Để người: ngôn ngữ vùng miền sâu. Phương ngữ Nghệ Tĩnh, tiếng lóng miền Tây, mô hình biết sơ sơ và hay bắt chước sai.

Để người: nội dung cảm xúc riêng. Lời chia buồn, thư xin lỗi khách, AI viết trơn nhưng dễ rỗng; người đọc nhận ra ngay.

Để người: kiểm tra thông tin. AI viết tiếng Việt trôi chảy không có nghĩa nội dung đúng; độ trơn tru và độ chính xác là hai chuyện khác nhau.

Câu hỏi thường gặp

AI có học được tiếng Việt giỏi như tiếng Anh không?

Về nguyên tắc là được, nhưng cần nhiều dữ liệu tiếng Việt chất lượng hơn và bộ cắt mảnh hợp với tiếng Việt hơn. Hiện tại khoảng cách đã hẹp lại rất nhiều với câu phổ thông, còn ở thơ, phương ngữ, từ chuyên ngành hẹp thì vẫn rõ.

Gõ tiếng Việt không dấu với chatbot có sao không?

Với câu đơn giản thì thường vẫn hiểu, nhưng bạn đang bắt máy đoán thêm một tầng. Câu hỏi càng ngắn và càng quan trọng thì càng nên gõ có dấu.

Vì sao AI viết đúng chính tả mà đọc vẫn thấy lạ?

Vì nó học nhiều văn bản dịch và văn bản hành chính, nên chọn những cấu trúc câu đúng ngữ pháp mà người Việt ít nói. Cái lạ nằm ở cách đặt câu và chọn từ, không ở chính tả.

Làm sao biết AI đang bịa một từ tiếng Việt?

Hỏi nó đặt ba câu ví dụ với từ đó và cho biết từ đó thường dùng trong lĩnh vực nào, rồi tra từ điển. Từ có thật thì ví dụ tự nhiên và tra ra; từ bịa thì ví dụ gượng và từ điển không có.

Văn bản copy từ PDF đưa vào AI bị lỗi chữ thì làm sao?

Nhiều khả năng chữ đang ở dạng ký tự gốc cộng dấu rời hoặc bảng mã cũ. Chuyển về Unicode dựng sẵn bằng trình soạn thảo có chức năng chuyển mã rồi dán lại; nếu là bản scan thì phải nhận dạng chữ trước.

Có nên dùng AI để soát chính tả luận văn không?

Dùng để bắt lỗi gõ và lỗi phổ biến thì có ích, nhưng đừng để nó tự sửa cả bài, vì nó có thể "sửa" luôn thuật ngữ chuyên ngành đúng thành từ phổ thông. Nhận từng gợi ý và tự quyết.

Cần tư vấn cụ thể cho trường hợp của bạn?

Chúng tôi sẽ liên hệ trong vòng 24 giờ.

Đăng ký tư vấn ngay

Bài viết liên quan

Bạn cần hỗ trợ thêm?

Để lại thông tin, chúng tôi sẽ liên hệ trong 24 giờ.