У вівторок Google запустила Gemini 3.5 Transcribe. Ця модель перетворення мовлення в текст видаляє слова-паразити, враховує надані користувачем словники та позначає до трьох спікерів в одному записі. Перетворюючи необроблений аудіосигнал на чистий структурований текст без участі редактора, сервіс скорочує час, який розробники витрачають на очищення транскриптів для протоколів зустрічей, юридичних документів тощо.

Чому Google вирішила запустити це саме зараз

Стек Google для обробки аудіо розвивався роками, але його попередня пропозиція, Chirp 3, все ще помилялася на паузах, технічних термінах і змінах спікерів. Дистанційна робота та подкасти розширили ринок транскрипції, проте багато підприємств досі покладаються на ручну постобробку або дорогих нішевих постачальників. Gemini 3.5 Transcribe вирішує цю проблему: це модель, яка не лише розпізнає мовлення, а й редагує його на льоту.

Що насправді робить нова модель

  • Автоматичне видалення слів-паразитів — «ем», «е-е» та подібні заминки зникають під час генерації транскрипту, залишаючи чистий текст.
  • Спеціальні словники — користувачі завантажують список вузькоспеціалізованих слів, що запобігає «виправленню» моделі цих слів на загальновживані терміни. Це важливо для галузей, переповнених абревіатурами, назвами продуктів або іноземним написанням.
  • Ідентифікація спікерів — система розпізнає до трьох різних голосів, присвоює кожній репліці мітку спікера та додає часові мітки на рівні слів. Юридичні команди, медичні секретарі та журналісти можуть створювати записи з часовими кодами безпосередньо з вихідного файлу.
  • Багатомовність — Google заявляє про підвищену точність для понад 85 мов, що є значним кроком уперед порівняно з обмеженим набором мов попередньої моделі.

Усі ці можливості доступні через API, орієнтований на розробників. Додатки надсилають запит на транскрипт і отримують JSON-відповідь, яка вже містить очищений текст, мітки спікерів і часові мітки.

Ширше впровадження аудіомоделей Gemini

Gemini 3.5 Transcribe належить до ширшого сімейства аудіомоделей:

  • Gemini 3.5 Live — оптимізована для взаємодії в реальному часі, вона краще за попередні моделі обробляє переривання під час речення.
  • Gemini 3.5 Live Experimental — варіант із вищим рівнем міркування, який озвучує власні покрокові роздуми під час вирішення складних завдань.

Обидві моделі live наразі доступні англійською мовою в додатку Gemini для macOS та через функцію диктування Rambler на Android у деяких регіонах.

Хто отримає вигоду

Розробники можуть вбудовувати конвеєр «очищення під час мовлення» в інструменти для спільної роботи, платформи для створення контенту та голосових помічників. Підприємства можуть створювати готові до публікації транскрипти, зменшуючи залежність від сторонніх сервісів, які стягують плату за хвилину та нав'язують суворі умови обробки даних. Творці контенту можуть публікувати якісні субтитри без окремого етапу редагування, що прискорює випуск відео та подкастів.

Хто може відчути тиск

Спеціалізовані постачальники послуг транскрипції, які встановлюють високі тарифи за діаризацію спікерів та роботу з жаргоном, можуть побачити падіння попиту, особливо серед стартапів, чутливих до витрат. Обмеження моделі трьома спікерами також може підштовхнути великі організації до використання спеціалізованих рішень, що підтримують більше учасників під час одного дзвінка.

Обмеження та відкриті питання

  • Кількість спікерів — у файлі можна розрізнити лише трьох спікерів; для зустрічей з більшою кількістю учасників все ще знадобляться сторонні інструменти.
  • Розгортання мов — оголошено про багатомовну підтримку, але моделі live залишаються доступними лише англійською, тож користувачі інших мов чекатимуть на повний функціонал.
  • Приватність — як і у випадку з будь-яким хмарним сервісом розпізнавання мовлення, підприємства мають зважити зручність інфраструктури Google проти необхідності зберігати конфіденційне аудіо поза межами зовнішніх серверів. Умови Google дозволяють розгортання на власних серверах (on-premise) для певних клієнтів, але ця опція ще не є публічною.

За чим стежити далі

Google натякнула на майбутні оновлення, які збільшать ліміт кількості спікерів і розширять мовну підтримку моделей live. Також важливо буде стежити за рівнями цін API; висока вартість за хвилину може нівелювати переваги в продуктивності для користувачів з великими обсягами роботи. Зрештою, крива впровадження серед розробників покаже, чи перевага автоматичного видалення слів-паразитів переважає над залишками помилок у вузькоспеціалізованих словниках.

Підсумок: Gemini 3.5 Transcribe перетворює нудний процес обробки голосових записів на один виклик API, надаючи розробникам готовий інструмент для отримання чистого тексту з ідентифікацією спікерів. Його успіх залежить від того, наскільки швидко Google розширить підтримку мов, збільшить ліміт кількості спікерів та вирішить питання конфіденційності для корпоративного сектору.