RobotsViet.comThị trường và tin tức robot Việt Nam
Robot nói tiếng Việt

Giọng vùng miền và chuyện robot nghe nhầm

Không phải mình nói sai. Hệ thống nhận diện được huấn luyện lệch, và đó là vấn đề có thật cần được nói ra.

Nhiều người đang trò chuyện trong không gian chung

Nhiều người thử nói với robot vài lần rồi bỏ, và kết luận rằng mình nói không chuẩn. Thường thì không phải vậy. Hệ thống được huấn luyện lệch về một giọng, và người có giọng khác chịu thiệt — đây là vấn đề có thật và đáng được nói ra rõ ràng.

Vì sao hệ thống lệch

Nguyên nhân khá đơn giản và không liên quan tới ai cố ý.

Máy học từ ví dụ. Hệ thống nhận diện giọng nói học từ hàng nghìn giờ ghi âm có kèm bản chữ. Nó nhận ra tốt những gì nó nghe nhiều.

Dữ liệu tiếng Việt phần lớn là giọng phổ thông. Tin tức, sách nói, video giảng bài, phim — đa số dùng giọng chuẩn hoá. Giọng đời thường của các vùng ít xuất hiện trong dữ liệu hơn nhiều.

Kết quả. Hệ thống nghe giọng phổ thông rất tốt và nghe các giọng khác kém hơn, tỷ lệ thuận với mức chênh so với giọng nó quen.

Không phải riêng tiếng Việt. Hiện tượng này xảy ra với mọi ngôn ngữ có nhiều giọng. Nhưng với tiếng Việt, thanh điệu làm khác biệt giữa các vùng lớn hơn nhiều so với các ngôn ngữ không có thanh.

Điều quan trọng cần nói với người dùng: robot nghe nhầm không phải vì bạn nói sai. Giọng địa phương là giọng đúng của một vùng, và hệ thống chưa được huấn luyện đủ mới là bên chưa đủ.

Ảnh hưởng thực tế

Không phải chuyện lý thuyết. Nó tạo ra khác biệt cụ thể.

Người bị nghe nhầm nhiều sẽ bỏ dùng. Sau vài lần phải lặp lại, người ta chuyển sang bấm hoặc bỏ hẳn.

Cảm giác bị coi thường. Phải nói lại nhiều lần trước mặt người khác là trải nghiệm khó chịu, và nó dễ bị hiểu thành mình có vấn đề.

Người lớn tuổi chịu ảnh hưởng nặng hơn. Họ thường giữ giọng địa phương đậm hơn và cũng ít kiên nhẫn với việc thử lại.

Ở dịch vụ công thì hệ quả lớn hơn. Nếu một quầy hướng dẫn chỉ có robot và robot nghe không được một nhóm người dân, nhóm đó bị bỏ lại.

Doanh nghiệp cũng chịu. Robot lắp ở một tỉnh mà nghe kém giọng địa phương thì tỷ lệ dùng thấp, và chủ đầu tư kết luận nhầm rằng khách không quan tâm công nghệ.

Cách khắc phục ở phía người dùng

Không giải quyết được gốc rễ nhưng giúp được ngay.

Nói câu ngắn. Ít chữ thì ít cơ hội sai.

Dùng từ phổ thông thay vì từ địa phương. Nếu biết một từ có cách gọi khác ở giọng phổ thông thì dùng cách đó.

Đứng gần và hướng mặt vào robot. Giảm được ảnh hưởng của tiếng ồn, và tiếng ồn cộng với giọng lạ thì tệ gấp đôi.

Chuyển sang bấm sau hai lần thất bại. Đừng cố lần thứ ba. Phần lớn robot có màn hình.

Nhìn vào phần hiển thị câu nó nghe được. Nếu thấy nó nghe sai một chữ, chỉ cần sửa chữ đó thay vì nói lại cả câu.

Nếu là robot ở nơi mình hay tới, có thể phản ánh với nơi đó. Nhiều hệ thống cho phép bổ sung cách nói địa phương vào phần nội dung, và phản ánh của người dùng là cách duy nhất để họ biết.

Doanh nghiệp nên làm gì

Nếu lắp robot ở một địa phương.

Thử với người bản địa trước khi mua. Cho vài người với giọng khác nhau nói thử. Đây là phép thử mà không nhà cung cấp nào chuẩn bị trước được, và nó cho câu trả lời rõ hơn mọi thông số.

Luôn có đường bấm song song. Đây là biện pháp quan trọng nhất. Mọi việc làm được bằng giọng phải làm được bằng cách chạm màn hình.

Hiển thị lại câu nghe được. Để người dùng sửa thay vì nói lại từ đầu.

Bổ sung cách nói địa phương vào nội dung. Nếu khách hay gọi một dịch vụ bằng từ địa phương thì đưa từ đó vào để robot khớp được.

Đo tỷ lệ nghe nhầm theo thời gian. Nếu cao bất thường thì đó là vấn đề của hệ thống chứ không phải của khách.

Luôn có người hỗ trợ gần đó. Ở nơi phục vụ mọi lứa tuổi, đây là yêu cầu tối thiểu.

Điều gì đang thay đổi

Có lý do để lạc quan vừa phải.

Dữ liệu tiếng Việt đang nhiều lên. Nội dung do người Việt tạo ra trên các nền tảng ngày càng nhiều và đa dạng về giọng, và điều đó vào dữ liệu huấn luyện.

Các đơn vị trong nước tham gia nhiều hơn. Sản phẩm phát triển bởi người hiểu tiếng Việt thường xử lý các đặc thù tốt hơn sản phẩm quốc tế thêm tiếng Việt vào sau.

Kỹ thuật huấn luyện cải thiện. Các phương pháp mới cần ít dữ liệu hơn để thích ứng với một giọng cụ thể.

Nhưng khoảng cách sẽ không biến mất hoàn toàn. Giọng nào có nhiều dữ liệu hơn thì vẫn được nhận diện tốt hơn, và đó là tính chất của cách công nghệ này hoạt động.

Điều người dùng có thể làm. Phản ánh khi bị nghe nhầm. Nghe có vẻ nhỏ, nhưng nhà phát triển chỉ biết vấn đề khi có người báo, và ở một thị trường mà phần lớn người dùng im lặng bỏ đi thì vấn đề không bao giờ được ưu tiên.

Câu hỏi thường gặp

Robot nghe nhầm có phải vì mình nói sai không?

Không. Giọng địa phương là giọng đúng của một vùng. Hệ thống được huấn luyện chủ yếu trên giọng phổ thông nên nó nghe kém các giọng khác — bên chưa đủ là hệ thống chứ không phải người nói.

Vì sao hệ thống lại lệch về giọng phổ thông?

Vì dữ liệu huấn luyện tiếng Việt phần lớn là tin tức, sách nói và video giảng bài — đều dùng giọng chuẩn hoá. Giọng đời thường của các vùng xuất hiện ít hơn nhiều trong dữ liệu.

Doanh nghiệp nên kiểm gì trước khi mua robot?

Cho vài người bản địa với giọng khác nhau nói thử trực tiếp. Đây là phép thử không nhà cung cấp nào chuẩn bị trước được và nó cho câu trả lời rõ hơn mọi thông số kỹ thuật.

Người dùng làm gì được để vấn đề này được cải thiện?

Phản ánh khi bị nghe nhầm. Nhà phát triển chỉ biết vấn đề khi có người báo, và ở thị trường mà phần lớn người dùng im lặng bỏ đi thì vấn đề không bao giờ được ưu tiên xử lý.

Đọc thêm trong Hệ sinh thái trong nướcRobot AI trong đời sống Việt.

Cần tư vấn cụ thể cho trường hợp của bạn?

Chúng tôi sẽ liên hệ trong vòng 24 giờ.

Đăng ký tư vấn ngay

Bài viết liên quan

Bạn cần hỗ trợ thêm?

Để lại thông tin, chúng tôi sẽ liên hệ trong 24 giờ.

hoặc
Gọi ngay 0926 138 138