RobotsViet.comThị trường và tin tức robot Việt Nam
Robot nói tiếng Việt

Robot nghe hiểu tiếng Việt tới đâu rồi

Câu trả lời ngắn: khá tốt trong phòng yên tĩnh, kém hơn nhiều ở nơi công cộng. Đây là bức tranh cụ thể.

Người đang nói chuyện với robot trong không gian trong nhà

Cách đây vài năm, nói tiếng Việt với máy là một trải nghiệm bực bội. Bây giờ đã khác nhiều, nhưng mức cải thiện không đồng đều: rất tốt ở chỗ này và vẫn kém ở chỗ khác. Biết cụ thể chỗ nào là chỗ nào giúp đỡ mất thời gian.

Ba lớp cần phân biệt

Khi nói robot hiểu tiếng Việt, thực ra có ba việc khác nhau, và chúng tiến bộ với tốc độ khác nhau.

Nghe ra chữ. Chuyển âm thanh thành văn bản. Đây là lớp đã tốt lên nhiều nhất, và trong điều kiện yên tĩnh với giọng phổ thông thì độ chính xác khá cao.

Hiểu ý. Từ văn bản hiểu người ta muốn gì. Lớp này tốt hơn lớp đầu, vì mô hình ngôn ngữ hiện nay xử lý được cả câu diễn đạt lộn xộn hoặc thiếu chủ ngữ — vốn rất phổ biến trong tiếng Việt nói.

Nói ra cho tự nhiên. Chuyển văn bản thành giọng. Cũng đã tốt lên nhiều, tuy vẫn hay vấp ở tên riêng, số liệu và từ nước ngoài.

Điểm quan trọng: lỗi thường nằm ở lớp đầu tiên chứ không phải lớp thứ hai. Khi robot trả lời trật lất, phần lớn là vì nó nghe nhầm chữ chứ không phải vì nó không hiểu ý.

Điều này có ý nghĩa thực dụng: nếu robot hiểu sai, việc nên làm là nói lại rõ hơn chứ không phải diễn đạt lại theo cách khác.

Chỗ robot nghe tốt

Phòng yên tĩnh. Văn phòng, phòng khách, phòng họp. Đây là điều kiện mà các con số quảng cáo được đo, và trong điều kiện đó độ chính xác thật sự cao.

Câu ngắn và cụ thể. Mấy giờ ăn sáng dễ hơn nhiều so với một câu dài nhiều mệnh đề.

Giọng phổ thông. Các hệ thống được huấn luyện nhiều nhất trên giọng này.

Chủ đề thông thường. Hỏi giờ, hỏi đường, hỏi thông tin chung.

Đứng gần. Trong khoảng một mét, hướng mặt về phía micro.

Nếu bốn năm điều kiện trên thoả thì trải nghiệm thường trơn tru, và đó là lý do các buổi trình diễn luôn diễn ra trong phòng kín, yên tĩnh, với người nói giọng phổ thông đứng gần.

Chỗ robot nghe kém

Nơi ồn. Đây là yếu tố ảnh hưởng lớn nhất, lớn hơn cả giọng vùng miền. Sảnh mở, quán ăn, trung tâm thương mại cuối tuần — trên một mức ồn nhất định thì mọi hệ thống đều kém.

Giọng vùng miền đậm. Nhất là các âm cuối và các thanh điệu bị biến đổi so với giọng phổ thông. Người miền Trung thường gặp nhiều nhất.

Nói nhỏ. Rất nhiều người ngại nói to với robot trước mặt người khác, rồi robot không nghe được, rồi họ ngại hơn.

Nói nhanh và nuốt chữ. Tiếng Việt nói tự nhiên hay rút gọn, và điều đó làm việc nhận diện khó hơn.

Nhiều người nói cùng lúc. Đi theo nhóm và nói chồng lên nhau.

Tên riêng và địa danh. Nhất là tên ít gặp hoặc tên nước ngoài.

Số dài. Số điện thoại, số tài khoản, mã đơn hàng — đọc dài thì dễ sai một chữ số, và một chữ số sai là sai cả.

Người dùng làm gì để dễ hơn

Vài mẹo thực tế, không cần hiểu kỹ thuật.

Đứng gần và hướng mặt về robot. Đơn giản và hiệu quả nhất.

Nói ngắn. Một câu một ý. Câu dài dễ sai hơn nhiều.

Nói với âm lượng bình thường, đừng hét. Nói to quá làm âm thanh méo và ngược lại khó nhận diện hơn.

Đừng nói chậm quá. Nghe có vẻ ngược nhưng nói kéo dài từng chữ làm hệ thống khó hơn chứ không dễ hơn. Nói tự nhiên nhưng rõ là tốt nhất.

Nếu bị nghe nhầm hai lần, chuyển sang bấm. Phần lớn robot có màn hình với các lựa chọn sẵn.

Với số dài, dùng màn hình. Đừng đọc số điện thoại cho robot nghe.

Kiểm lại điều nó nghe được. Nhiều robot hiển thị lại câu nó nghe được — nhìn vào đó để biết nó hiểu đúng chưa.

Nên trông đợi gì trong vài năm tới

Không dự đoán con số, chỉ nói hướng.

Phần nghe trong môi trường ồn sẽ tốt lên. Đây là hướng đang được đầu tư nhiều và đã có tiến bộ đều đặn.

Giọng vùng miền sẽ được xử lý tốt hơn. Phụ thuộc vào việc có bao nhiêu dữ liệu tiếng Việt đa dạng được dùng để huấn luyện, và mức này đang tăng.

Giọng đọc sẽ tự nhiên hơn. Đã tiến rất nhanh và sẽ tiếp tục.

Nhưng phần vật lý không đổi. Micro trong môi trường ồn vẫn là micro, và có một giới hạn vật lý mà phần mềm không vượt qua được.

Và việc hiểu ngữ cảnh vẫn khó. Robot không biết mình vừa nói chuyện với ai trước đó, không đọc được nét mặt, không biết mình đang vội hay không.

Vì vậy dự đoán thực tế: trải nghiệm sẽ mượt hơn đáng kể trong phòng kín, và cải thiện chậm hơn ở nơi công cộng đông đúc — chính là nơi phần lớn người Việt gặp robot.

Câu hỏi thường gặp

Khi robot trả lời trật, lỗi thường nằm ở đâu?

Ở khâu nghe ra chữ chứ không phải khâu hiểu ý. Vì vậy việc nên làm là nói lại rõ hơn và ngắn hơn, chứ không phải diễn đạt lại theo cách khác.

Yếu tố nào ảnh hưởng nhiều nhất tới việc robot nghe được?

Tiếng ồn môi trường, lớn hơn cả giọng vùng miền. Trên một mức ồn nhất định thì mọi hệ thống đều nghe kém, không phân biệt sản phẩm.

Nói chậm từng chữ có giúp robot hiểu hơn không?

Không, thường còn khó hơn. Nói tự nhiên nhưng rõ ràng và đứng gần là cách hiệu quả nhất, kèm việc giữ câu ngắn với một ý mỗi câu.

Có nên đọc số điện thoại cho robot nghe không?

Không nên. Số dài rất dễ sai một chữ số, và một chữ số sai là sai cả. Với số nên dùng màn hình bấm thay vì đọc.

Đọc thêm trong Robot trong gia đìnhHệ sinh thái trong nước.

Cần tư vấn cụ thể cho trường hợp của bạn?

Chúng tôi sẽ liên hệ trong vòng 24 giờ.

Đăng ký tư vấn ngay

Bài viết liên quan

Bạn cần hỗ trợ thêm?

Để lại thông tin, chúng tôi sẽ liên hệ trong 24 giờ.

hoặc
Gọi ngay 0926 138 138