VietnamAI.orgHiểu đúng AI, đi trước cùng Việt Nam
AI và tiếng Việt

Nhận dạng giọng nói tiếng Việt: vì sao máy nghe nhầm giọng miền?

Máy chép giọng nói tiếng Việt hay nhầm giọng miền vì dữ liệu học nghiêng về giọng chuẩn phát thanh, trong khi mỗi vùng phát âm thanh điệu và phụ âm khác nhau. Ghi âm đúng cách và soát lại số, tên riêng giúp chép đúng hơn nhiều.

Chủ quán cơm tấm nói vào điện thoại ở quầy, khách ngồi ăn phía sau

Máy chép giọng nói tiếng Việt nghe nhầm giọng miền vì nó học chủ yếu từ những giọng đọc rõ, gần với giọng phát thanh, trong khi người Việt ở mỗi vùng phát âm thanh điệu và phụ âm khác nhau. Gặp giọng Nghệ, giọng Quảng hay giọng miền Tây nói nhanh, máy chọn chữ "giống nhất" với những gì nó từng nghe, và chữ đó có khi sai hẳn nghĩa.

Tin tốt là phần lớn lỗi có quy luật: thanh hỏi và ngã, phụ âm đầu dễ lẫn, âm cuối bị nuốt, số và tên riêng. Biết quy luật thì bạn ghi âm khéo hơn, soát nhanh hơn, và biết việc nào giao được cho máy chép, việc nào phải có người nghe lại từ đầu.

Máy nghe tiếng Việt ra chữ bằng cách nào

Khi bạn nói vào điện thoại, máy không nghe "chữ". Nó nhận một dòng sóng âm, cắt thành những khung rất ngắn, mỗi khung biến thành một bức tranh về độ cao, độ mạnh của các tần số. Mô hình nhận dạng giọng nói học từ hàng nghìn giờ ghi âm có kèm lời chép đúng, để biết bức tranh âm thanh nào thường đi với chữ nào.

Tiếng Việt có một thứ tiếng Anh không có: thanh điệu mang nghĩa. "Ma, má, mà, mả, mã, mạ" là sáu từ khác nhau, phân biệt bằng đường đi lên xuống của cao độ giọng. Máy phải bắt được đường cao độ ấy, mà đường cao độ lại bị ảnh hưởng bởi cảm xúc, tốc độ nói, câu hỏi hay câu kể. Người nói "hả" cao giọng vì ngạc nhiên khác hẳn người nói "hả" uể oải.

Sau tầng âm thanh còn một tầng ngôn ngữ. Khi âm thanh mơ hồ, máy chọn chuỗi chữ nào hợp lý nhất theo những câu nó từng thấy. Đây là lý do máy chép "cho mình đặt hai phần cơm" rất chuẩn nhưng chép "cho con hai dĩa bì chả" thành thứ gì đó lạ: câu đầu phổ biến, câu sau đậm chất quán xá miền Nam, ít xuất hiện trong dữ liệu chép lời.

Vấn đề nằm ở dữ liệu. Ghi âm có lời chép chuẩn thường đến từ tin tức, sách nói, bài giảng, người đọc to rõ trong phòng yên tĩnh. Giọng ngoài đời, nói nhanh, nuốt chữ, chen tiếng xe máy và tiếng loa nhà bên, lại ít hơn nhiều. Giọng của người lớn tuổi, của trẻ nhỏ, của người dân tộc thiểu số nói tiếng Việt càng hiếm. Máy giỏi ở cái nó đã nghe nhiều, và dở đúng ở chỗ nó ít nghe.

Hiểu như vậy thì thấy "máy nghe nhầm giọng miền" không phải do giọng nào "chuẩn" hơn giọng nào. Giọng miền nào cũng là tiếng Việt đúng. Chỉ là máy được dạy lệch, và việc của người làm công nghệ là bù dữ liệu cho đủ các vùng.

Những âm máy hay nghe nhầm nhất

Hỏi và ngã. Ở phần lớn miền Nam và miền Trung, hai thanh này phát âm gần như một. Máy nghe xong phải đoán theo ngữ cảnh, nên "sửa xe" và "sữa xe" có lúc lẫn nhau.

V, D, Gi, R. Giọng Bắc đọc "d", "gi", "r" gần như nhau; giọng Nam đọc "v" gần với "d". Tên người như "Vy", "Dy", "Gia" rất dễ bị chép sai.

Tr và Ch, S và X. Nhiều vùng không phân biệt khi nói, nên "trâu" thành "châu", "sinh" thành "xinh" trong bản chép.

L và N. Ở một số địa phương phía Bắc hai âm này lẫn khi nói, máy học giọng chuẩn sẽ chép theo âm nó nghe chứ không theo ý người nói.

Âm cuối n và ng, t và c. Giọng Nam thường đọc "ăn" gần "ăng", "mặt" gần "mặc"; máy có thể chép đúng âm nghe được mà sai chữ.

Thanh của giọng Nghệ Tĩnh và Quảng. Hệ thanh nghe khác hẳn giọng Bắc và Nam, nhiều câu máy phải đoán gần như toàn bộ.

Số điện thoại và số tiền. Người ta nói "không chín không" hay "lẻ", "mốt", "lăm", "rưỡi", "tư"; máy dễ ghép sai thành số khác.

Tên riêng. Tên người, tên đường, tên thuốc, tên sản phẩm của cửa hàng hầu như không có trong dữ liệu học, nên bị thay bằng từ phổ thông gần âm.

Từ tiếng Anh chen giữa câu. "Gửi file", "check lại deadline", "chốt order" là kiểu nói rất phổ biến ở văn phòng, máy hay chép thành chữ Việt vô nghĩa.

Từ địa phương. "Mô, tê, răng, rứa", "hổng, hông, nhen", máy có thể bỏ hẳn hoặc thay bằng từ phổ thông.

Nhiều người nói chồng lên nhau. Trong cuộc họp gia đình hay họp tổ, máy không tách được ai nói câu nào, chữ của hai người trộn vào một dòng.

Câu bị cắt giữa chừng. Người nói ngập ngừng, nói lại, "à mà thôi", máy có khi giữ cả hai phiên bản trong bản chép.

Ở quán, ở xưởng, ở phòng khám: dùng chép giọng nói thế nào cho đúng việc

Một quán cơm nhận đặt món qua tin nhắn thoại. Chủ quán dùng tính năng chép giọng nói để chuyển tin thoại thành chữ cho nhân viên bếp đọc. Cách này tiết kiệm thời gian nghe lại, nhưng mỗi ngày vẫn có vài đơn sai số lượng hay sai tên món. Cách sửa không phải bỏ công cụ, mà là quy định: số lượng và số điện thoại thì nhân viên nghe lại đúng đoạn đó, phần còn lại đọc bản chép là đủ.

Ở một xưởng may, tổ trưởng ghi âm cuộc họp đầu ca rồi cho máy chép làm biên bản. Bản chép giúp ghi lại ý chính, nhưng tên mã hàng, số chuyền, tên công nhân thì sai liên tục. Cách làm khôn hơn là tổ trưởng đọc lại các con số quan trọng chậm và rõ ở cuối cuộc họp, ví dụ "chốt lại: mã hàng này, chuyền số ba, giao trước thứ sáu". Đoạn tóm tắt nói rõ đó máy chép chuẩn hơn nhiều so với lúc cả tổ nói chen nhau.

Ở phòng khám, chép giọng nói giúp bác sĩ đỡ gõ bệnh án. Nhưng đây là chỗ một chữ sai có thể thành chuyện lớn: tên thuốc gần âm, liều lượng, bên trái hay bên phải. Nơi nào dùng thì phải có bước bác sĩ đọc lại và ký xác nhận, coi bản chép như bản nháp do một người thư ký mới vào nghề viết. Tuyệt đối không để bản chép tự động chạy thẳng vào đơn thuốc.

Với người lớn tuổi muốn nhắn tin bằng giọng nói, công cụ chép rất hữu ích vì đỡ phải gõ. Nhưng người nhà nên hướng dẫn ông bà nói chậm hơn một chút, cầm điện thoại gần miệng, và đọc lại tin trước khi gửi. Một tin nhắn "con ơi mẹ mất ví" mà máy chép thành "con ơi mẹ mất vì" là đủ làm cả nhà hoảng.

Điểm chung của mọi ví dụ: máy chép giọng nói giỏi việc làm bản nháp nhanh, dở việc giữ đúng từng chi tiết. Hãy thiết kế quy trình sao cho chi tiết quan trọng luôn được người kiểm, còn phần chữ thường thì để máy gánh.

Mẹo ghi âm để máy chép đúng hơn

Cầm micro gần, cách miệng một gang tay. Khoảng cách ổn định giúp âm rõ và đều, máy bắt thanh điệu tốt hơn.

Tránh chỗ ồn có tiếng người. Tiếng quạt máy đều đều máy lọc được khá tốt; tiếng người nói bàn bên thì khó lọc vì nó cũng là giọng nói.

Nói chậm ở số và tên riêng. Đọc từng chữ số một, đọc tên kèm cách viết nếu cần, ví dụ "Vy, vê i cờ rét".

Tránh nói chồng lên nhau. Trong họp, nhắc mọi người nói lần lượt; máy không tách được hai giọng nói cùng lúc.

Chốt lại ý chính cuối buổi. Một đoạn tóm tắt nói rõ ràng giúp bản chép có phần đáng tin để làm biên bản.

Thêm từ điển riêng nếu công cụ cho phép. Nhiều công cụ cho nhập danh sách từ hay dùng như tên sản phẩm, tên nhân viên, thuật ngữ nghề; máy sẽ ưu tiên những chữ đó.

Chọn đúng ngôn ngữ nhận dạng. Để chế độ tiếng Việt, đừng để tự nhận ngôn ngữ khi câu có chen tiếng Anh, máy có thể nhảy sang chép tiếng Anh cả câu.

Dùng tai nghe có micro khi gọi điện. Micro tai nghe gần miệng thường rõ hơn micro máy đặt trên bàn.

Soát bản chép khi còn nhớ. Đọc lại ngay trong ngày, lúc mình còn nhớ người ta nói gì, sửa nhanh hơn nhiều so với để tuần sau.

Giữ lại tệp ghi âm gốc. Bản chép sai mà đã xoá ghi âm thì không còn gì để đối chiếu.

Hỏi ý người được ghi âm. Ghi âm cuộc họp, cuộc gọi khách hàng nên báo trước; đây là chuyện tôn trọng và cũng là chuyện dữ liệu cá nhân.

Dùng chép giọng nói ở đâu thì ổn, ở đâu phải cẩn thận

Ổn: ghi chú cá nhân. Đang chạy xe dừng đèn đỏ, nảy ra ý, nói vào điện thoại để nhớ; sai vài chữ cũng không sao.

Ổn: phụ đề nháp cho video. Có bản chép làm nền rồi sửa, nhanh hơn gõ tay từ đầu rất nhiều.

Ổn: tìm lại đoạn trong ghi âm dài. Bản chép dù chưa chuẩn vẫn đủ để tìm xem cuộc họp nhắc chuyện giao hàng ở phút thứ mấy.

Ổn: nhắn tin thường ngày. Tin nhắn hỏi thăm, hẹn giờ, chỉ cần đọc lại trước khi gửi.

Ổn: luyện phát âm cho học sinh. Học sinh đọc bài, xem máy chép ra gì, tự nhận ra chỗ mình đọc chưa rõ; nhưng đừng coi máy là thước đo giọng chuẩn.

Cẩn thận: đơn hàng có số lượng và địa chỉ. Phần số và địa chỉ phải có người nghe lại.

Cẩn thận: bệnh án, đơn thuốc. Tên thuốc gần âm, liều lượng, bên trái phải; bác sĩ phải đọc lại và chịu trách nhiệm.

Cẩn thận: biên bản có giá trị pháp lý. Hợp đồng miệng, biên bản bàn giao, biên bản xử lý sự việc cần người xác nhận từng câu.

Cẩn thận: phỏng vấn để trích dẫn. Viết báo, viết luận văn mà trích sai lời người được phỏng vấn là chuyện uy tín.

Cẩn thận: tổng đài tự động cho người lớn tuổi. Máy không hiểu thì phải chuyển ngay sang người thật, đừng bắt khách nói lại năm lần.

Cẩn thận: nội dung nhạy cảm. Ghi âm có thông tin sức khoẻ, tiền bạc, gia đình thì xem công cụ lưu dữ liệu ở đâu trước khi dùng.

Câu hỏi thường gặp

Máy chép giọng nói có hiểu giọng miền Trung không?

Có, nhưng thường kém hơn giọng Bắc và giọng Nam vì dữ liệu học ít hơn, nhất là giọng Nghệ Tĩnh và giọng Quảng. Nói chậm hơn và soát kỹ số, tên riêng giúp cải thiện đáng kể.

Vì sao trợ lý giọng nói hiểu câu lệnh mà chép tin nhắn lại sai?

Câu lệnh như "gọi cho mẹ", "đặt báo thức sáu giờ" rất ngắn và lặp lại nhiều, máy đã quen. Tin nhắn tự do dài hơn, nhiều từ đời thường và tên riêng hơn, nên tỉ lệ sai cao hơn.

Có nên dùng bản chép tự động làm biên bản họp chính thức không?

Chỉ nên dùng làm bản nháp. Biên bản chính thức cần người tham dự đọc lại và xác nhận, nhất là phần số liệu, quyết định và tên người chịu trách nhiệm.

Ghi âm người khác để chép bằng AI có cần xin phép không?

Nên báo và xin đồng ý, vì giọng nói và nội dung trò chuyện là thông tin cá nhân. Trường hợp cụ thể liên quan pháp lý thì hỏi luật sư để biết rõ nghĩa vụ của mình.

Làm sao để máy chép đúng tên sản phẩm của cửa hàng mình?

Dùng công cụ có chức năng thêm từ vựng riêng và nhập sẵn danh sách tên sản phẩm. Nếu không có, khi nói hãy đọc tên rõ và nhất quán, và soát lại riêng các tên đó.

Người lớn tuổi nói chậm, giọng yếu thì máy có chép được không?

Được nhưng dễ sai hơn vì giọng người lớn tuổi ít có trong dữ liệu học. Đặt micro gần, nói trong phòng yên tĩnh và đọc lại tin trước khi gửi là ba việc nên làm.

Cần tư vấn cụ thể cho trường hợp của bạn?

Chúng tôi sẽ liên hệ trong vòng 24 giờ.

Đăng ký tư vấn ngay

Bài viết liên quan

Bạn cần hỗ trợ thêm?

Để lại thông tin, chúng tôi sẽ liên hệ trong 24 giờ.