Skip to content

Commit 7c00023

Browse files
Adjust fft sampling points and frame length according to audio SR
Signed-off-by: begeekmyfriend <begeekmyfriend@gmail.com>
1 parent 05de2ec commit 7c00023

2 files changed

Lines changed: 56 additions & 6 deletions

File tree

datasets/thchs30.py

Lines changed: 51 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -25,7 +25,57 @@ def build_from_path(in_dir, out_dir, num_workers=1, tqdm=lambda x: x):
2525
futures = []
2626
index = 1
2727

28-
trn_files = glob.glob(os.path.join(in_dir, 'data', '*.trn'))
28+
# male voice (do not use) A5 A8 A9 A33 A35 B6 B8 B21 B34 C6 C8 D8
29+
# too silent (do not use) A36 B33 C14 D32
30+
31+
trn_files = []
32+
33+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'A2_*.trn'))
34+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'A4_*.trn'))
35+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'A11_*.trn'))
36+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'A12_*.trn'))
37+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'A13_*.trn'))
38+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'A14_*.trn'))
39+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'A19_*.trn'))
40+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'A22_*.trn'))
41+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'A23_*.trn'))
42+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'A32_*.trn'))
43+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'A34_*.trn'))
44+
45+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'B2_*.trn'))
46+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'B4_*.trn'))
47+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'B7_*.trn'))
48+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'B11_*.trn'))
49+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'B12_*.trn'))
50+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'B15_*.trn'))
51+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'B22_*.trn'))
52+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'B31_*.trn'))
53+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'B32_*.trn'))
54+
55+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'C2_*.trn'))
56+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'C4_*.trn'))
57+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'C7_*.trn'))
58+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'C12_*.trn'))
59+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'C13_*.trn'))
60+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'C17_*.trn'))
61+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'C18_*.trn'))
62+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'C19_*.trn'))
63+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'C20_*.trn'))
64+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'C21_*.trn'))
65+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'C22_*.trn'))
66+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'C23_*.trn'))
67+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'C31_*.trn'))
68+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'C32_*.trn'))
69+
70+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'D4_*.trn'))
71+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'D6_*.trn'))
72+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'D7_*.trn'))
73+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'D11_*.trn'))
74+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'D12_*.trn'))
75+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'D13_*.trn'))
76+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'D21_*.trn'))
77+
trn_files += glob.glob(os.path.join(in_dir, 'data', 'D31_*.trn'))
78+
2979
for trn in trn_files:
3080
with open(trn) as f:
3181
f.readline()

hparams.py

Lines changed: 5 additions & 5 deletions
Original file line numberDiff line numberDiff line change
@@ -8,11 +8,11 @@
88
cleaners='basic_cleaners',
99

1010
# Audio:
11-
num_mels=80,
12-
num_freq=1025,
11+
num_mels=64,
12+
num_freq=513, # n_fft = 1024, n_fft / 2 + 1
1313
sample_rate=16000,
14-
frame_length_ms=50,
15-
frame_shift_ms=12.5,
14+
frame_length_ms=64,
15+
frame_shift_ms=16,
1616
preemphasis=0.97,
1717
min_level_db=-100,
1818
ref_level_db=20,
@@ -30,7 +30,7 @@
3030
use_cmudict=False, # Use CMUDict during training to learn pronunciation of ARPAbet phonemes
3131

3232
# Eval:
33-
max_iters=300,
33+
max_iters=200,
3434
griffin_lim_iters=60,
3535
power=1.5, # Power to raise magnitudes to prior to Griffin-Lim
3636
)

0 commit comments

Comments
 (0)