Сегодня утром я задал своему ИИ-ассистенту простой вопрос: «А я могу создать голосового помощника со своим голосом?» К вечеру мой цифровой голос уже читал тексты, которые я никогда не произносил, — а жена в слепом тесте оценивала, где я настоящий. Рассказываю, как это было, сколько стоило до копейки и какие грабли мы собрали по дороге.
Зачем вообще бизнесу клон голоса
У нас в «Первом ИИ» голос давно в работе: наша Айка отвечает на звонки клиентов, а ролики для соцсетей мы озвучиваем синтезом. Но всё это — «чужие» голоса из библиотек. А лицо малого бизнеса — почти всегда сам владелец: репетитор, юрист, мастер, владелец автосервиса. Люди покупают у людей.
Проблема в том, что владельцу вечно некогда записываться. Контент упирается не в идеи, а в «сяду запишу на выходных». Клон голоса эту пробку убирает: один раз наговорил минуту — дальше любой текст озвучивается твоим голосом за секунды. Ролик, презентация, аудиоверсия статьи — без микрофона и дублей.
Первый сюрприз: знаменитый сервис отпал сразу
Мировой лидер клонирования голоса — ElevenLabs. С него мы и начали: я уже прикидывал тариф за 22 доллара. Но сайт с российского адреса даже не открылся: Россия у них в списке заблокированных стран, рядом с Ираном и КНДР. Через обходные пути пользоваться можно, но аккаунт банят при обнаружении — вместе с оплаченной подпиской и обученным голосом. Строить на этом рабочий инструмент нельзя.
И тут выяснилось приятное: российские сервисы синтеза за последний год выросли настолько, что по русской речи звучат не хуже, а стоят в разы дешевле. Мы взяли на тест GenVoice — оплата картой РФ, сервера в России, клонирование по образцу от трёх секунд.
Тест: цифры до копейки
Всё делалось на обычном айфоне, без микрофона и студии:
- Запись образца на диктофон — 53 секунды;
- Создание клона — около 10 секунд, бесплатно на стартовом тарифе;
- Первый синтез, 16 секунд речи, — 1 рубль 31 копейка.
Для сравнения: озвучка минутного ролика этим голосом обходится примерно в 3–4 рубля. Не тысячи. Не сотни. Рубли.
Фрагмент той самой записи с айфона, из которой сделан клон.
Этот текст целиком прочитал клон. Я его не произносил ни разу.
Главный урок: клон копирует не голос, а манеру
Первый результат мне честно не понравился: тембр мой, но звучит как диктор из лифта. Мы разобрались, и причина оказалась неожиданной: клон учится не «голосу вообще», а тому, как ты говоришь на записи. А я читал подготовленный текст — старательно, ровно, как диктант. Модель выучила «читающего меня» и стала так читать всё подряд.
Мы записали второй образец — уже не чтение, а живой рассказ своими словами. И тут началось интересное. Я устроил жене слепой тест: два клона, один текст. Она узнала мой голос сразу — «очень похож». А вот что удивило: из двух вариантов более похожим она назвала первый, «читающий». Тот самый, который мне казался роботом.
Свой голос в записи не нравится почти никому: ты слышишь себя изнутри, через кости черепа, а мир — снаружи. Поэтому судить, похож ли клон, должен кто угодно, кроме тебя самого.
Это, кстати, главный практический вывод для всех, кто соберётся повторить: не оценивайте свой клон сами. Дайте послушать тому, кто слышит вас каждый день.
А это вообще безопасно?
Первый вопрос, который я сам задал до загрузки записи: а мой голос отсюда не утечёт? Разобрались честно, и вывод получился отрезвляющим.
Стопроцентной гарантии не даёт ни один облачный сервис. Но вот правда, о которой мало кто задумывается: ваш голос уже публичен. Он есть в каждом ролике, каждом голосовом сообщении, каждом телефонном разговоре. Мошеннику, чтобы склонировать голос, хватит трёх секунд из любого вашего видео — ему не нужен ваш аккаунт в сервисе синтеза.
Поэтому реальная защита — не прятать голос, а поменять привычки семьи: голос в трубке больше не доказательство личности. Договоритесь о кодовом слове для любых денежных просьб. Это защищает лучше любой приватности. Ну и базовая гигиена: у нашего аккаунта отдельный пароль, доступ к клону только у нас, а для клиентских голосов мы оформляем письменное согласие владельца — без него клонировать чужой голос незаконно и неэтично.
Что это даёт бизнесу уже сейчас
- Ролики без записи. Владелец один раз наговорил минуту — дальше ролики для соцсетей выходят его голосом, даже когда ему некогда. Текст пишется, голос синтезируется, видео собирается.
- Голос бренда. Автоответчик, презентация, аудиоверсия коммерческого предложения — всё звучит голосом основателя, а не безликой Алисой.
- Скорость. Поменялась цена или акция — перезаписывать ничего не надо, поправил текст и синтезировал заново за рубль.
Мы у себя начнём с роликов: наш конвейер уже собирает товарные и имиджевые видео с синтезированной озвучкой, теперь он умеет делать это голосом владельца. Если вам интересно такое для своего бизнеса — напишите, покажем на живом примере, как это звучит.