Detail publikace

Multisv: Dataset for Far-Field Multi-Channel Speaker Verification

MOŠNER, L.; PLCHOT, O.; BURGET, L.; ČERNOCKÝ, J. Multisv: Dataset for Far-Field Multi-Channel Speaker Verification. In ICASSP, IEEE International Conference on Acoustics, Speech and Signal Processing - Proceedings. Singapore: IEEE Signal Processing Society, 2022. p. 7977-7981. ISBN: 978-1-6654-0540-9.

Název česky

Multisv: Dataset pro vzdálené multikanálové ověřování mluvčího

Typ

článek ve sborníku konference

Jazyk

anglicky

Autoři

Mošner Ladislav, Ing. (UPGM)
Plchot Oldřich, Ing., Ph.D. (UPGM)
Burget Lukáš, doc. Ing., Ph.D. (UPGM)
Černocký Jan, prof. Dr. Ing. (UPGM)

URL

Klíčová slova

Multi-channel, speaker verification, MultiSV,dataset, beamforming

Abstrakt

Motivováni nekonsolidovanou datovou situací a nedostatkem standardního benchmarku v této oblasti, doplňujeme naše předchozí úsilí a představujeme komplexní korpus určený pro trénování a vyhodnocování textově nezávislých vícekanálových systémů ověřování mluvčích. Lze jej snadno použít také pro experimenty s dereverberací, odšumováním a zvýrazněním řeči. Vyřešili jsme všudypřítomný problém nedostatku vícekanálových trénovacích dat využitím simulace dat nad čistými částmi korpusu Voxceleb. Vývojové a vyhodnocovací testy jsou založeny na znovu přeneseném korpusu Voices Obscured in Complex Environmental Settings (VOiCES), který jsme upravili tak, aby poskytoval vícekanálové testy. Zveřejňujeme úplné recepty, které vytvářejí datovou sadu z veřejných zdrojů jako datovou sadu MultiSV, a poskytujeme výsledky se dvěma z našich vícekanálových systémů pro ověřování mluvčích založené na "beamforming" na bázi neuronové sítě založené buď na předpovídání ideálních binárních masek, nebo na novějším Conv-TasNet.

Rok

2022

Strany

7977–7981

Sborník

ICASSP, IEEE International Conference on Acoustics, Speech and Signal Processing - Proceedings

Konference

2022 IEEE Mezinárodní konference o akustice, řeči a zpracování signálu (ICASSP), Singapore, SG

ISBN

978-1-6654-0540-9

Vydavatel

IEEE Signal Processing Society

Místo

Singapore

DOI

10.1109/ICASSP43922.2022.9746833

UT WoS

000864187908057

EID Scopus

2-s2.0-85131254513

BibTeX

@inproceedings{BUT178380,
  author="Ladislav {Mošner} and Oldřich {Plchot} and Lukáš {Burget} and Jan {Černocký}",
  title="Multisv: Dataset for Far-Field Multi-Channel Speaker Verification",
  booktitle="ICASSP, IEEE International Conference on Acoustics, Speech and Signal Processing - Proceedings",
  year="2022",
  pages="7977--7981",
  publisher="IEEE Signal Processing Society",
  address="Singapore",
  doi="10.1109/ICASSP43922.2022.9746833",
  isbn="978-1-6654-0540-9",
  url="https://ieeexplore.ieee.org/document/9746833"
}

Soubory

pdf mosner_icassp2022_Multisv_Dataset_for_Far-Field_Multi-Channel_Speaker_Verification.pdf 926 kB