Google đã ra mắt Gemini 3.5 Transcribe vào thứ Ba. Mô hình chuyển đổi giọng nói thành văn bản này loại bỏ các từ thừa, tôn trọng các từ vựng do người dùng cung cấp và gắn thẻ tối đa ba người nói trong một bản ghi âm duy nhất. Bằng cách chuyển đổi âm thanh thô thành văn bản có cấu trúc và trau chuốt mà không cần biên tập viên là con người, dịch vụ này giúp cắt giảm thời gian các nhà phát triển phải dành để làm sạch bản ghi chép cho biên bản cuộc họp, hồ sơ pháp lý và nhiều nội dung khác.

Tại sao Google lại thúc đẩy việc ra mắt vào lúc này

Hệ thống xử lý âm thanh của Google đã phát triển trong nhiều năm, nhưng sản phẩm trước đó là Chirp 3 vẫn còn gặp khó khăn với các khoảng nghỉ, thuật ngữ kỹ thuật và việc chuyển đổi người nói. Làm việc từ xa và podcasting đã làm bùng nổ thị trường chuyển soạn, tuy nhiên nhiều doanh nghiệp vẫn phải dựa vào việc hậu xử lý thủ công hoặc các nhà cung cấp chuyên biệt với chi phí đắt đỏ. Gemini 3.5 Transcribe giải quyết điểm nghẽn đó: một mô hình không chỉ nhận dạng giọng nói mà còn chỉnh sửa nó ngay lập tức.

Mô hình mới thực sự làm được gì

  • Tự động loại bỏ từ thừa – các từ như “um”, “uh” và các lỗi nói lắp tương tự sẽ biến mất khi bản ghi được tạo ra, để lại một bản văn bản sạch sẽ hơn.
  • Từ vựng tùy chỉnh – Người dùng có thể tải lên danh sách các từ chuyên ngành, ngăn mô hình "sửa" chúng thành các thuật ngữ thông thường. Điều này rất quan trọng đối với các lĩnh vực chứa đầy các từ viết tắt, tên sản phẩm hoặc cách đánh vần tiếng nước ngoài.
  • Gán nhãn người nói – Hệ thống nhận diện tối đa ba giọng nói khác nhau, gán nhãn người nói cho mỗi câu nói và thêm mốc thời gian ở cấp độ từ. Các đội ngũ pháp lý, thư ký y tế và nhà báo có thể tạo ra các bản ghi có mã thời gian trực tiếp từ tệp nguồn.
  • Khả năng đa ngôn ngữ – Google tuyên bố đã cải thiện độ chính xác trên hơn 85 ngôn ngữ, một bước tiến so với tập hợp ngôn ngữ hạn chế hơn của phiên bản tiền nhiệm.

Tất cả các khả năng này đều nằm sau một API dành cho nhà phát triển. Các ứng dụng yêu cầu bản ghi chép và nhận được một payload JSON đã bao gồm văn bản đã được làm sạch, các thẻ người nói và mốc thời gian.

Việc triển khai âm thanh Gemini rộng hơn

Gemini 3.5 Transcribe thuộc về một dòng mô hình âm thanh rộng lớn hơn:

  • Gemini 3.5 Live – Được tối ưu hóa cho tương tác thời gian thực, mô hình này xử lý các sự ngắt quãng giữa câu tốt hơn các mô hình live trước đó.
  • Gemini 3.5 Live Experimental – Một biến thể suy luận cấp độ cao hơn, có khả năng tường thuật lại quá trình tư duy từng bước của chính nó trong khi giải quyết các tác vụ phức tạp.

Cả hai mô hình live hiện đã có sẵn bằng tiếng Anh trên ứng dụng Gemini dành cho macOS và thông qua tính năng đọc chính tả Rambler trên Android tại một số khu vực.

Những ai sẽ được hưởng lợi

Các nhà phát triển có thể tích hợp quy trình "làm sạch khi đang nói" vào các công cụ cộng tác, nền tảng sáng tạo nội dung và các trợ lý điều khiển bằng giọng nói. Các doanh nghiệp có thể tạo ra các bản ghi chép sẵn sàng để xuất bản, giảm bớt sự phụ thuộc vào các dịch vụ bên thứ ba vốn tính phí theo phút và áp đặt các điều khoản xử lý dữ liệu nghiêm ngặt. Những người sáng tạo nội dung có thể xuất bản các phụ đề trau chuốt mà không cần qua một bước chỉnh sửa riêng biệt, giúp đẩy nhanh tốc độ hoàn thiện video và podcast.

Những ai có thể bị ảnh hưởng

Các nhà cung cấp dịch vụ chuyển soạn chuyên biệt vốn tính phí cao cho việc phân loại người nói (speaker diarization) và xử lý thuật ngữ chuyên ngành có thể thấy nhu cầu sụt giảm, đặc biệt là ở các startup nhạy cảm về chi phí. Giới hạn ba người nói của mô hình cũng có thể thúc đẩy các tổ chức lớn tìm đến các giải pháp chuyên dụng hỗ trợ nhiều người tham gia hơn trong một cuộc gọi.

Các hạn chế và câu hỏi còn bỏ ngỏ

  • Số lượng người nói – Chỉ có thể phân biệt tối đa ba người nói trên mỗi tệp; các cuộc họp với nhiều thành viên hơn vẫn sẽ cần đến các công cụ bên ngoài.
  • Triển khai ngôn ngữ – Việc hỗ trợ đa ngôn ngữ đã được công bố, nhưng các mô hình live vẫn chỉ giới hạn ở tiếng Anh, khiến người dùng không nói tiếng Anh phải chờ đợi để có đầy đủ chức năng.
  • Quyền riêng tư – Giống như bất kỳ dịch vụ giọng nói dựa trên đám mây nào, các doanh nghiệp phải cân nhắc giữa sự tiện lợi về cơ sở hạ tầng của Google với nhu cầu giữ các âm thanh nhạy cảm tránh xa các máy chủ bên ngoài. Các điều khoản của Google cho phép triển khai tại chỗ (on-premise) cho một số khách hàng nhất định, nhưng tùy chọn đó vẫn chưa được công khai.

Những điều cần theo dõi tiếp theo

Google đã gợi ý về các bản cập nhật trong tương lai nhằm nâng giới hạn số lượng người nói và mở rộng phạm vi ngôn ngữ cho các mô hình live. Việc theo dõi các mức giá của API cũng sẽ rất quan trọng; chi phí mỗi phút quá cao có thể làm xói mòn những lợi ích về năng suất đối với những người dùng có khối lượng công việc lớn. Cuối cùng, lộ trình áp dụng của các nhà phát triển sẽ cho thấy liệu sự tiện lợi của việc tự động loại bỏ từ thừa có bù đắp được bất kỳ lỗi còn sót lại nào trong các từ vựng chuyên ngành hay không.

Điểm mấu chốt: Gemini 3.5 Transcribe biến công việc tẻ nhạt là trau chuốt các bản ghi âm thành một lệnh gọi API duy nhất, cung cấp cho các nhà phát triển một công cụ có sẵn để tạo ra văn bản sạch và được gắn thẻ người nói. Sự thành công của nó phụ thuộc vào tốc độ Google mở rộng hỗ trợ ngôn ngữ, nâng giới hạn số lượng người nói và giải quyết các lo ngại về quyền riêng tư của doanh nghiệp.