Новый искусственный интеллект Microsoft научился имитировать голос обладая 3 секундным образцом
В четверг исследователи Microsoft объявили о новой модели искусственного интеллекта для преобразования текста в речь под названием VALL-E, которая может точно имитировать голос человека при наличии хотя-бы трехсекундного звукового образца. Как только VALL-E выучит конкретный голос, он может самостоятельно синтезировать звук, уже без образца, сохраняя при этом тембр и эмоциональный тон говорящего.
Его создатели предполагают, что VALL-E можно использовать для высококачественных приложений преобразования текста в речь и ее редактирования в случаях, когда запись человека должна быть изменена в соответствие с текстовой расшифровкой. Это также может быть полезно для создания аудиоконтента в сочетании с другими генеративными моделями ИИ, такими как GPT-3 .
Microsoft называет VALL-E «языковой моделью нейронного кодека» основанной на EnCodec, о котором Meta объявила в октябре 2022 года.Технология анализирует, как звучит человек и разбивает эту информацию на отдельные компоненты, называемые «токенами». Она использует обучающие данные, чтобы сопоставить то, что он «знает» о том, как этот голос будет звучать, если он произнесет другие фразы.
исследователи передали в VALL-E только трехсекундный образец «Speaker Prompt» и текстовую строку (то, что они хотели сказать голосом). В некоторых случаях записи получались удивительно похожими на оригинал. Некоторые результаты VALL-E пока кажутся сгенерированными компьютером, но другие потенциально могут быть ошибочно приняты за человеческую речь.
Помимо сохранения вокального тембра и эмоционального тона говорящего, VALL-E также может имитировать «акустическое окружение» сэмпла аудио. Например, если сэмпл взят из телефонного звонка, аудиовыход будет имитировать акустические и частотные свойства телефонного звонка в синтезированном фрагменте. А образцы Microsoft (в разделе «Синтез разнообразия») демонстрируют, что VALL-E может генерировать вариации тона голоса, изменяя случайное начальное число, используемое в процессе генерации.
Возможно, из-за потенциальной возможности использовать VALL-E в корыстных и незаконных целях, Microsoft не предоставила код VALL-E для экспериментов. Похоже, исследователи осознают потенциальный социальный вред, который может принести эта технология.
— Microsoft.
Его создатели предполагают, что VALL-E можно использовать для высококачественных приложений преобразования текста в речь и ее редактирования в случаях, когда запись человека должна быть изменена в соответствие с текстовой расшифровкой. Это также может быть полезно для создания аудиоконтента в сочетании с другими генеративными моделями ИИ, такими как GPT-3 .
Microsoft называет VALL-E «языковой моделью нейронного кодека» основанной на EnCodec, о котором Meta объявила в октябре 2022 года.Технология анализирует, как звучит человек и разбивает эту информацию на отдельные компоненты, называемые «токенами». Она использует обучающие данные, чтобы сопоставить то, что он «знает» о том, как этот голос будет звучать, если он произнесет другие фразы.
исследователи передали в VALL-E только трехсекундный образец «Speaker Prompt» и текстовую строку (то, что они хотели сказать голосом). В некоторых случаях записи получались удивительно похожими на оригинал. Некоторые результаты VALL-E пока кажутся сгенерированными компьютером, но другие потенциально могут быть ошибочно приняты за человеческую речь.
Помимо сохранения вокального тембра и эмоционального тона говорящего, VALL-E также может имитировать «акустическое окружение» сэмпла аудио. Например, если сэмпл взят из телефонного звонка, аудиовыход будет имитировать акустические и частотные свойства телефонного звонка в синтезированном фрагменте. А образцы Microsoft (в разделе «Синтез разнообразия») демонстрируют, что VALL-E может генерировать вариации тона голоса, изменяя случайное начальное число, используемое в процессе генерации.
Возможно, из-за потенциальной возможности использовать VALL-E в корыстных и незаконных целях, Microsoft не предоставила код VALL-E для экспериментов. Похоже, исследователи осознают потенциальный социальный вред, который может принести эта технология.
Поскольку VALL-E может синтезировать речь, сохраняющую идентичность говорящего, он может нести потенциальные риски неправильного использования модели, такие как подмена голосовой идентификации или выдача себя за конкретного говорящего. Чтобы снизить такие риски, можно создать модель для обнаружения того, был ли аудиоклип синтезирован VALL-E. Мы также будем следовать принципам искусственного интеллекта Microsoft при дальнейшей разработке моделей
— Microsoft.
Наши новостные каналы
Подписывайтесь и будьте в курсе свежих новостей и важнейших событиях дня.
Рекомендуем для вас
Контрабандисты оккупировали Восточную Африку: зачем черных муравьев тайно вывозят в Китай и Европу?
Эксперты предупреждают: такой вывоз в итоге закончится непоправимой экологической катастрофой...
В мире заканчивается речной песок: чем это грозит человечеству?
Ученые говорят, что это самая не замечаемая, а оттого опасная проблема, которая уже касается миллионов людей...
Немецкий ученый был главным в секретной ракетной программе: однажды он вышел из кабинета и исчез навсегда
Как операция «Дамоклов меч» пресекла главную военную операцию целого государства...
К 2060 году половина плотин в мире выйдет из строя: США — главные в черном списке
Эксперты говорят: если не принять меры, часть Соединенных Штатов может полностью опустеть...
В России снова захотели строить железную дорогу в Индию: почему не удались прошлые попытки?
Эксперты говорят: дерзкий проект мог бы принести российской казне миллиардные прибыли...
За рамками науки: дети, которые помнят свои прошлые жизни
Ученые говорят, что феномена реинкарнации нет, но факты утверждают обратное...
Кольца на деревьях раскрыли тайну гибели последней империи кочевников в Евразии
Поразительно, но падение Джунгарского ханства началось за тысячи километров от Азии, в Северной Атлантике...
Тайна огней Марфы, 150 лет не дававшая покоя ученым, похоже, разгадана
Болотный газ? Огни святого Эльма? НЛО? Ответ оказался намного проще и сложнее одновременно...
Этим книгам осталось жить считаные дни: кто охотится на очень редкие экземпляры, а затем уничтожает их?
Эксперты бьют тревогу: это, пожалуй, самый циничный поворот в истории книгопечатания...
«Сувенир» от неандертальцев: секреты этих мутаций не разгаданы до конца
Они живут в ДНК 47 000 лет, но почему их совсем нет у африканцев, зато много у жителей Южной Азии...
Авокадо ежедневно меняет пол, и исследователи, наконец, выяснили, как именно
Почему селекционеры и ботаники ждали этого открытия более 100 лет?...
Самое жаркое лето в истории СССР: кто остановил огненную стихию
Почему в советское время подробности этой экологической катастрофы находились под грифом «совершенно секретно╗?...