espnet AI Models

Tracked by OpenModelStats since Aug 23, 2026 · View on Hugging Face ↗

Tracked models
590
Downloads 30D
44.8K
Total downloads
1.5M
Total likes
654
Gained 7D
10.9K

Most downloaded

  1. 1owsm_ctc_v4_1BSep 20, 202611.2K
  2. 2fastspeech2_conformerOct 6, 20236,276
  3. 3fastspeech2_conformer_with_hifiganOct 5, 20235,878
  4. 4hubert_dummySep 18, 20264,869
  5. 5voxcelebs12_rawnet3Sep 18, 20264,302
  6. 6voxcelebs12_ecapa_wavlm_jointSep 18, 20264,182
  7. 7kamo-naoyuki-mini_an4_asr_train_raw_bpe_valid.acc.bestSep 19, 20261,752
  8. 8owsm_v4_small_370MSep 19, 2026226
  9. 9fastspeech2_conformer_hifiganSep 18, 2026214
  10. 10powsmJan 21, 2026203

Fastest growing

  1. 1owsm_ctc_v4_1B+3,217 in 7D11.2K
  2. 2hubert_dummy+2,082 in 7D4,869
  3. 3fastspeech2_conformer+1,739 in 7D6,276
  4. 4fastspeech2_conformer_with_hifigan+1,583 in 7D5,878
  5. 5voxcelebs12_rawnet3+1,281 in 7D4,302
  6. 6kamo-naoyuki-mini_an4_asr_train_raw_bpe_valid.acc.best+707 in 7D1,752
  7. 7kan-bayashi_ljspeech_vits+52 in 7D95
  8. 8xeus+17 in 7D89

Recently updated

  1. 1must_c_esp2_st_train_st_conformerSep 24, 20265
  2. 2must_c_st_train_st_conformerSep 24, 20269
  3. 3meld_esp2_cls_wavlm_base_plusSep 21, 202614
  4. 4multi-talker-whisper-small-amiSep 20, 202653
  5. 5anogkongda_librimix_enh_train_raw_valid.si_snr.aveSep 20, 202619
  6. 6dns_icassp21_enh_train_enh_tcn_tf_rawSep 20, 202612
  7. 7chenda-li-wsj0_2mix_enh_train_enh_conv_tasnet_raw_valid.si_snr.aveSep 20, 202614
  8. 8anogkongda-librimix_enh_train_raw_valid.si_snr.aveSep 20, 202615
  9. 9Chenda_Li_wsj0_2mix_enh_train_enh_conv_tasnet_raw_valid.si_snr.aveSep 20, 202617
  10. 10tedlium2_streaming_transformerSep 20, 202621

All models

All tracked models published by espnet
ModelDL 30D7D
kan-bayashi_jsut_transformer_accentespnet/kan-bayashi_jsut_transformer_accent11—
kan-bayashi_csmsc_transformerespnet/kan-bayashi_csmsc_transformer11—
kan-bayashi_ljspeech_tts_train_conformer_fastspeech2_raw_phn_tacotron_-truncated-ec9e34espnet/kan-bayashi_ljspeech_tts_train_conformer_fastspeech2_raw_phn_tacotron_-truncated-ec9e3411—
kan-bayashi_jsut_tts_train_conformer_fastspeech2_transformer_teacher_r-truncated-f43d8fespnet/kan-bayashi_jsut_tts_train_conformer_fastspeech2_transformer_teacher_r-truncated-f43d8f11—
su_openslr36espnet/su_openslr3611—
kan-bayashi_vctk_tts_train_gst_fastspeech_raw_phn_tacotron_g2p_en_no_space_train.loss.bestespnet/kan-bayashi_vctk_tts_train_gst_fastspeech_raw_phn_tacotron_g2p_en_no_space_train.loss.best11—
kan-bayashi_jsut_tts_train_transformer_raw_phn_jaconv_pyopenjtalk_acce-truncated-be0f66espnet/kan-bayashi_jsut_tts_train_transformer_raw_phn_jaconv_pyopenjtalk_acce-truncated-be0f6611—
kan-bayashi_jsut_tacotron2_prosodyespnet/kan-bayashi_jsut_tacotron2_prosody11—
kan-bayashi_vctk_multi_spk_vitsespnet/kan-bayashi_vctk_multi_spk_vits11—
ftshijt_espnet2_asr_yolo_mixtec_transformerespnet/ftshijt_espnet2_asr_yolo_mixtec_transformer11—
kan-bayashi_jsut_fastspeech2espnet/kan-bayashi_jsut_fastspeech211—
kan_bayashi_jsut_tts_train_conformer_fastspeech2_raw_phn_jaconv_pyopenjtalk_train.loss.aveespnet/kan_bayashi_jsut_tts_train_conformer_fastspeech2_raw_phn_jaconv_pyopenjtalk_train.loss.ave11—
juice500ml_mls_10h_asr_fbankespnet/juice500ml_mls_10h_asr_fbank11—
kan-bayashi_jsut_tts_train_tacotron2_raw_phn_jaconv_pyopenjtalk_accent_with_pause_train.loss.aveespnet/kan-bayashi_jsut_tts_train_tacotron2_raw_phn_jaconv_pyopenjtalk_accent_with_pause_train.loss.ave11—
kan-bayashi_csmsc_tacotron2espnet/kan-bayashi_csmsc_tacotron211—
kan-bayashi_vctk_xvector_tacotron2espnet/kan-bayashi_vctk_xvector_tacotron211—
simpleoier_librispeech_asr_train_asr_conformer7_hubert_ll60k_large_raw_en_bpe5000_spespnet/simpleoier_librispeech_asr_train_asr_conformer7_hubert_ll60k_large_raw_en_bpe5000_sp11—
americasnlp22-asr-quyespnet/americasnlp22-asr-quy11—
espnet_tts_vctk_espnet_spk_voxceleb12_rawnetespnet/espnet_tts_vctk_espnet_spk_voxceleb12_rawnet11—
kan-bayashi_vctk_gst_fastspeechespnet/kan-bayashi_vctk_gst_fastspeech10—
kan-bayashi_jvs_jvs001_vits_accent_with_pauseespnet/kan-bayashi_jvs_jvs001_vits_accent_with_pause10—
kan-bayashi_jsut_tts_train_conformer_fastspeech2_raw_phn_jaconv_pyopenjtalk_train.loss.aveespnet/kan-bayashi_jsut_tts_train_conformer_fastspeech2_raw_phn_jaconv_pyopenjtalk_train.loss.ave10—
ta_openslr127espnet/ta_openslr12710—
kan-bayashi_csmsc_tts_train_fastspeech2_raw_phn_pypinyin_g2p_phone_train.loss.aveespnet/kan-bayashi_csmsc_tts_train_fastspeech2_raw_phn_pypinyin_g2p_phone_train.loss.ave10—
m4singer_svs_naive_rnn_dpespnet/m4singer_svs_naive_rnn_dp10—