Главная Блог Texterra Эта нейросеть заговорит вашим голосом – нужно всего 3 секунды сэмпла

Эта нейросеть заговорит вашим голосом – нужно всего 3 секунды сэмпла

К сожалению или счастью, воспользоваться ей каждому пока нельзя.

Новости Нейросети

Дата публикации: 12 янв 2023

3 минуты

8 786

Microsoft опубликовала препринт научной статьи (исследование, которое еще не прошло рецензирование экспертов и не было опубликовано в научном журнале), в котором подробно рассказала про свою нейросеть VALL-E. Этот алгоритм может воссоздавать голос говорящего всего по 3 секундам аудиозаписи голоса.

Как работает VALL-E

Microsoft называет VALL-E «языковой моделью нейронного кодека». Сообщается, что нейросеть основана на технологии под названием EnCodec, которую анонсировала компания Meta* в октябре 2022 года.

В отличие от других методов преобразования текста в речь, которые обычно синтезируют голос, изменяя форму звуковых сигналов, VALL-E анализирует, как звучит голос человека, разбивает эту информацию на отдельные компоненты (называемые «токены») при помощи EnCodec, а затем обрабатывает информацию нейросетевыми алгоритмами. Это позволяет программе собрать воедино все, что она «знает» о звучании голоса и воспроизвести другие фразы этим же голосом.

А у TexTerra вы можете заказать разработку приложения — сделаем быстро и качественно.

Вот как это описывает сама Microsoft:

«Для синтеза персонализированной речи VALL-E генерирует соответствующие акустические маркеры, основанные на 3-секундной записи и введенной подсказке. Они позволяют лучше интерпретировать информацию о говорящем и содержимом соответственно. Сгенерированные акустические маркеры используются для синтеза конечной формы сигнала».

Microsoft обучила VALL-E на аудиобиблиотеке LibriLight, собранной компанией Meta*. Она содержит 60 000 часов англоязычной речи от более чем 7000 ораторов. Такой массив компания получила по большей части из аудиокниг без авторского права LibriVox.

Создание звука нейросетью

На сегодняшний день ни исходного кода, ни какой-либо тестовой модели новой нейросети в общем доступе нет. Однако на сайте VALL-E есть десятки образцов работы нейросети, которые можно прослушать и сделать вывод о возможностях алгоритма.

Пролистав сайт нейросети ниже, можно увидеть несколько больших таблиц. В колонке Text находится расшифровка произносимых фраз, в колонке Ground Truth содержится образец реального голоса человека, который произнес ту или иную фразу, в столбце Speaker Prompt — образец голоса, на котором обучилась нейросеть, а в столбце VALL-E — озвученный нейросетью текст на основе 3-секундного отрывка из Speaker Prompt.

Сравнивая оригиналы произнесенных фраз и сгенерированную VALL-E версию, можно увидеть различия как в темпе речи, так и в интонациях, однако присутствие нейросети ни в одном из образцов не угадывается. Да, они получаются в итоге немного разными, однако нейросеть — не бог и не экстрасенс и не должна воссоздавать все интонации говорящего человека. Тем более, если речь идет лишь о 3-секундной обучающей выборке.

Есть все основания предполагать, что пара десятков минут записи вашего голоса позволит VALL-E с легкостью озвучивать вас, передавая даже эмоции в голосе и ваши любимые интонации. Как вам такая перспектива? Уже напрягает немного?

Новое на сайте

17 июл 2026

660

Стратегия AI-видимости: как связать бизнес-задачи, факты о бренде и потребности клиента

Одинаково слабая видимость в AI-ответах может говорить о противоположных проблемах: у зрелого бренда слишком много противоречивых сведений, у нового проекта — слишком мало подтвержденных фактов. Разбираемся, как провести диагностику и собрать GEO-стратегию под реальную ситуацию бизнеса.

GEO / AEO

16 июл 2026

12 199

Продвижение по позициям в 2026 году: полезная метрика, слабый KPI

Топ-3 давно не гарантирует бизнесу реальной пользы, тем более в современной выдаче. В этом материале мы вернулись к теме продвижения по позициям, потому что вокруг него снова вырос рынок накрутки: изучили, что теперь обещают сервисы, насколько усложнились их методы и появился ли в них практический смысл.

SEO

15 июл 2026

1 037

Как открыть сайт для AI и что для этого сделать маркетингу, SEO и разработке

Проблема с AI-видимостью может лежать в индексации, в настройках сервера или даже в бизнес-логике бренда. Разбираемся, что должен проверить каждый специалист и как собрать результаты в единую картину.

GEO / AEO

Смотреть все статьи

У вас есть деловой запрос? Давайте обсудим!

Оставьте свои контакты, мы свяжемся с вами в ближайшее время.

Ваше имя * Номер телефона * E-mail * Адрес сайта Опишите суть вашего запроса

Нажимая на кнопку «Оставить заявку», вы подтверждаете свое согласие на обработку пользовательских данных

Я хочу получать дайджест лучших публикаций TexTerra