Новый искусственный интеллект Microsoft научился имитировать голос обладая 3 секундным образцом
В четверг исследователи Microsoft объявили о новой модели искусственного интеллекта для преобразования текста в речь под названием VALL-E, которая может точно имитировать голос человека при наличии хотя-бы трехсекундного звукового образца. Как только VALL-E выучит конкретный голос, он может самостоятельно синтезировать звук, уже без образца, сохраняя при этом тембр и эмоциональный тон говорящего.
Его создатели предполагают, что VALL-E можно использовать для высококачественных приложений преобразования текста в речь и ее редактирования в случаях, когда запись человека должна быть изменена в соответствие с текстовой расшифровкой. Это также может быть полезно для создания аудиоконтента в сочетании с другими генеративными моделями ИИ, такими как GPT-3 .
Microsoft называет VALL-E «языковой моделью нейронного кодека» основанной на EnCodec, о котором Meta объявила в октябре 2022 года.Технология анализирует, как звучит человек и разбивает эту информацию на отдельные компоненты, называемые «токенами». Она использует обучающие данные, чтобы сопоставить то, что он «знает» о том, как этот голос будет звучать, если он произнесет другие фразы.
исследователи передали в VALL-E только трехсекундный образец «Speaker Prompt» и текстовую строку (то, что они хотели сказать голосом). В некоторых случаях записи получались удивительно похожими на оригинал. Некоторые результаты VALL-E пока кажутся сгенерированными компьютером, но другие потенциально могут быть ошибочно приняты за человеческую речь.
Помимо сохранения вокального тембра и эмоционального тона говорящего, VALL-E также может имитировать «акустическое окружение» сэмпла аудио. Например, если сэмпл взят из телефонного звонка, аудиовыход будет имитировать акустические и частотные свойства телефонного звонка в синтезированном фрагменте. А образцы Microsoft (в разделе «Синтез разнообразия») демонстрируют, что VALL-E может генерировать вариации тона голоса, изменяя случайное начальное число, используемое в процессе генерации.
Возможно, из-за потенциальной возможности использовать VALL-E в корыстных и незаконных целях, Microsoft не предоставила код VALL-E для экспериментов. Похоже, исследователи осознают потенциальный социальный вред, который может принести эта технология.
— Microsoft.
Его создатели предполагают, что VALL-E можно использовать для высококачественных приложений преобразования текста в речь и ее редактирования в случаях, когда запись человека должна быть изменена в соответствие с текстовой расшифровкой. Это также может быть полезно для создания аудиоконтента в сочетании с другими генеративными моделями ИИ, такими как GPT-3 .
Microsoft называет VALL-E «языковой моделью нейронного кодека» основанной на EnCodec, о котором Meta объявила в октябре 2022 года.Технология анализирует, как звучит человек и разбивает эту информацию на отдельные компоненты, называемые «токенами». Она использует обучающие данные, чтобы сопоставить то, что он «знает» о том, как этот голос будет звучать, если он произнесет другие фразы.
исследователи передали в VALL-E только трехсекундный образец «Speaker Prompt» и текстовую строку (то, что они хотели сказать голосом). В некоторых случаях записи получались удивительно похожими на оригинал. Некоторые результаты VALL-E пока кажутся сгенерированными компьютером, но другие потенциально могут быть ошибочно приняты за человеческую речь.
Помимо сохранения вокального тембра и эмоционального тона говорящего, VALL-E также может имитировать «акустическое окружение» сэмпла аудио. Например, если сэмпл взят из телефонного звонка, аудиовыход будет имитировать акустические и частотные свойства телефонного звонка в синтезированном фрагменте. А образцы Microsoft (в разделе «Синтез разнообразия») демонстрируют, что VALL-E может генерировать вариации тона голоса, изменяя случайное начальное число, используемое в процессе генерации.
Возможно, из-за потенциальной возможности использовать VALL-E в корыстных и незаконных целях, Microsoft не предоставила код VALL-E для экспериментов. Похоже, исследователи осознают потенциальный социальный вред, который может принести эта технология.
Поскольку VALL-E может синтезировать речь, сохраняющую идентичность говорящего, он может нести потенциальные риски неправильного использования модели, такие как подмена голосовой идентификации или выдача себя за конкретного говорящего. Чтобы снизить такие риски, можно создать модель для обнаружения того, был ли аудиоклип синтезирован VALL-E. Мы также будем следовать принципам искусственного интеллекта Microsoft при дальнейшей разработке моделей
— Microsoft.
Наши новостные каналы
Подписывайтесь и будьте в курсе свежих новостей и важнейших событиях дня.
Рекомендуем для вас
Азовское море наступает: российские ученые нашли причины стремительного разрушения берегов
Как оказалось, глобальное потепление и подъем Мирового океана тут вообще ни при чем...
Жители этого американского города были уверены, что переживут ураган. К утру было уже 12 000 погибших
Самое поразительное, что всех этих чудовищных человеческих жертв вполне можно было избежать. Но руководство Галвестона самонадеянно не желало оглядываться по...
Почему медведи нападают на людей в 2026 году: причины, статистика, мнения экспертов
Министерство природных ресурсов особых проблем не видит, но специалисты в корне не согласны...
Роковой «браунинг» №389965: почему пистолет, из которого должны были ликвидировать Сталина, в итоге выстрелил в Николая II?
Это, пожалуй, самый ироничный эпизод в истории России нового времени...
Антарктическая аномалия: ученые выяснили, почему масса льда на Шестом континенте увеличилась на колоссальные 700 миллиардов тонн
Эксперты предупреждают: радоваться рано. Возможно, это всего лишь временное затишье перед опасной бурей...
1400 землетрясений: КНДР прекратила ядерные испытания в 2017 году, но толчки идут до сих пор. Почему?
Эксперты говорят: есть процессы, которые сложно запустить, но еще труднее потом остановить...
Выброс на Солнце 1000 лет назад раскроет одну из главных тайн викингов?
Скандинавы на несколько веков опередили Колумба в открытии Северной Америки, но определить точный год их прибытия оказалось гораздо сложнее...
Китай — это не Америка: почему больше половины детей в КНР хотят стать космонавтами, а не блогерами, как в США?
Эксперты говорят: советский драйв 30-60-х годов плюс рынок и четкое планирование сверху — вот лицо нового китайского чуда...
Идеальное ДНК-алиби: как современные криминалисты ломают феномен однояйцовых близнецов
Дорого, долго и технически очень сложно, но это единственный способ вывести на чистую воду, казалось бы, неуязвимых преступников...
США официально признали, что размещают оружие в космосе. Как на это ответит Россия и другие ведущие страны
Почему даже американские эксперты, что это решение может больше навредить самому Вашингтону...
Динозавры делали... инкубаторы: именно так, согласно последним открытиям, они захватили холодные регионы
Придется признать, что некоторые ящеры не так зависели от тепла, как считалось...
Летящие в огонь: пока большинство животных спасаются бегством, некоторые хищные птицы «наживаются» на пожарах
Есть много фактов, что огненные ястребы не просто любят пламя, а сознательно разжигают его...