Последовательное акустическое моделирование для преобразования голоса

В этой статье представлена нейронная сеть под названием Sequence-to-sequence ConvErsion NeTwork (SCENT) для акустического моделирования в преобразовании голоса. На этапе обучения модель SCENT оценивается путем неявного сопоставления последовательностей признаков исходного и целевого говорящих, используя механизм внимания. На этапе преобразования акустические характеристики и длительность исходных звуков преобразуются одновременно с использованием единой акустической модели. В качестве акустических характеристик используются спектрограммы в масштабе Mel, которые содержат описания речевых сигнал...

Непараллельное преобразование голоса из последовательности в последовательность с распутанными языковыми представлениями и представлениями говорящего

Преобразование голоса

Метки: 2019 | Jing-Xuan Zhang | Li-Rong Dai | Zhen-Hua Ling

В этой статье представлен метод преобразования голоса из последовательности в последовательность (seq2seq) с использованием непараллельных обучающих данных. В этом методе из акустических характеристик извлекаются неразборчивые лингвистические представления и представления говорящего, и преобразование голоса достигается путем сохранения лингвистических представлений исходных высказываний при замене представлений говорящего на целевые. Наша модель построена в рамках нейронных сетей кодирования-декодирования. Кодировщик распознавания предназначен для изучения неразборчивых лингвистических предста...

MelGAN-VC: Преобразование голоса и передача звукового стиля на произвольно длинных сэмплах с использованием спектрограмм

Преобразование голоса

Категории: Генеративно-состязательная сеть | Глубокое обучение | Состязательное обучение

Метки: 2019 | Marco Pasini

Традиционные методы преобразования голоса основаны на параллельной записи нескольких говорящих, произносящих одни и те же предложения. Однако для реальных приложений параллельные данные доступны редко. Мы предлагаем MelGAN-VC - метод преобразования голоса, который основан на непараллельных речевых данных и способен преобразовывать аудиосигналы произвольной длины из исходного голоса в целевой. Сначала мы вычисляем спектрограммы на основе данных формы сигнала, а затем выполняем преобразование предметной области с использованием архитектуры Generative Adversarial Network (GAN). Дополнительная сет...

Модульная нейронная сеть с языковыми выходными слоями для межъязыкового преобразования голоса

Преобразование голоса

Категории: Глубокое обучение | Мел-спектрограмма | Рекуррентная нейронная сеть

В этой статье представлена система межъязыкового преобразования голоса, использующая модульную нейронную сеть. Модульная нейронная сеть имеет общую структуру ввода, которая используется совместно для обоих языков, и два отдельных выходных модуля, по одному для каждого языка. Идея продиктована тем фактом, что фонетические системы языков схожи, поскольку у людей общая система воспроизведения голоса, но акустические способы передачи, такие как просодия и фонотаксика, сильно различаются от языка к языку. Модульная нейронная сеть обучена сопоставлять фонетическую апостериограмму (PPG) с акустически...

Полууправляемое преобразование голоса с амортизированным вариационным выводом

Преобразование голоса

Категории: Глубокое обучение | Динамическая трансформация временной шкалы | Рекуррентная нейронная сеть | Среднее число мнений

Метки: 2019 | Anil Thomas | Cory Stephenson | Gokce Keskin | Oguz H. Elibol

В этой работе мы представляем полууправляемый подход к задаче преобразования голоса, при котором речь от исходного диктора преобразуется в речь от целевого диктора. Предлагаемый метод использует как параллельные, так и непараллельные высказывания от исходного и целевого одновременно во время обучения. Этот подход может быть использован для расширения существующих систем параллельного преобразования речевых данных таким образом, чтобы их можно было обучать с полуавтоматическим контролем. Мы показываем, что включение режима полунаблюдения повышает эффективность преобразования голоса по сравнению...

Неконтролируемое преобразование певческого голоса

Преобразование голоса

Категории: WaveNet | Глубокое обучение | Обучение без учителя | Свёрточная нейронная сеть

Метки: 2019 | Eliya Nachmani | Lior Wolf

Мы представляем метод глубокого обучения для преобразования голоса певца. Предлагаемая сеть не зависит от текста или нот и напрямую преобразует аудио одного певца в голос другого. Обучение проводится без какого-либо контроля: никаких текстов или каких-либо фонетических особенностей, никаких нот и совпадающих сэмплов между певцами. Предлагаемая сеть использует единый кодер CNN для всех исполнителей, единый декодер WaveNet и классификатор, который обеспечивает независимое от певца скрытое представление. Каждый исполнитель представлен одним вектором встраивания, к которому привязан декодер. Чтобы...

AdaGAN: Адаптивный GAN для непараллельного преобразования голоса "многие ко многим"

Преобразование голоса

Категории: Генеративно-состязательная сеть | Глубокое обучение | Состязательное обучение

Преобразование голоса - это задача преобразования воспринимаемой идентичности говорящего от исходного к определенному целевому. Более ранние подходы, описанные в литературе, в основном заключаются в сопоставлении между заданными парами исходного и целевого говорящих. Разработка методов сопоставления для преобразования голоса "многие ко многим" с использованием непараллельных данных, включая обучение с нуля, остается менее изученной областью в преобразовании голоса. Большинство архитектур преобразования голоса "многие ко многим" требуют обучающих данных от всех целевых носителей, для которых мы...

Межъязыковое преобразование голоса на основе DNN с использованием функций "узкого места"

Преобразование голоса

Метки: 2019 | K Sreenivasa Rao | M Kiran Reddy

Преобразование голоса на разных языках является довольно сложной задачей, поскольку говорящие на разных языках говорят на разных языках. В этой статье предлагается платформа для преобразования голоса на разных языках, основанная на функциях "узких мест" и глубокой нейронной сети (DNN).). В предлагаемом методе признаки узких мест, извлеченные из глубокого автоэнкодера (DAE), используются для представления не зависящих от говорящего особенностей речевых сигналов с разных языков. Модель DNN обучается для определения соответствия между признаками узких мест и соответствующими спектральными характе...

StarGAN-VC2: Переосмысление условных методов преобразования голоса на основе Stargen

Преобразование голоса

Категории: Генеративно-состязательная сеть | Глубокое обучение | Состязательное обучение

Метки: 2019 | Hirokazu Kameoka | Kou Tanaka | Nobukatsu Hojo | Takuhiro Kaneko

Непараллельное многодоменное преобразование голоса - это метод изучения сопоставлений между несколькими доменами без использования параллельных данных. Это важно, но сложно из-за необходимости изучения нескольких сопоставлений и отсутствия явного контроля. В последнее время StarGAN-VC привлек к себе внимание благодаря своей способности решать эту проблему только с помощью одного генератора. Однако по-прежнему существует разрыв между реальной и преобразованной речью. Чтобы устранить этот пробел, мы переосмысливаем условные методы StarGAN-VC, которые являются ключевыми компонентами для достижени...

V2S attack: построение преобразования голоса на основе DNN автоматической проверки говорящего

Преобразование голоса

Категории: Глубокое обучение | Мел-спектрограмма | Преобразование Фурье

В этой статье представлена новая атака на имитацию голоса с использованием преобразования голоса. Регистрация личных голосов для автоматической проверки говорящего (ASV) предлагает естественные и гибкие системы биометрической аутентификации. В основном, системы ASV не включают голосовые данные пользователей. Однако, если система ASV неожиданно обнаруживается и взламывается злоумышленником, существует риск того, что злоумышленник будет использовать методы преобразования голоса для воспроизведения голосов зарегистрированных пользователей. Мы называем это атакой от проверки к синтезу (V2S)" и пре...

Категория: Глубокое обучение