PaddleSpeech/infer.py

"""
   Inference for a simplifed version of Baidu DeepSpeech2 model.
"""

import paddle.v2 as paddle
import distutils.util
import argparse
import gzip
from audio_data_utils import DataGenerator
from model import deep_speech2
from decoder import ctc_decode

parser = argparse.ArgumentParser(
    description='Simplified version of DeepSpeech2 inference.')
parser.add_argument(
    "--num_samples",
    default=10,
    type=int,
    help="Number of samples for inference. (default: %(default)s)")
parser.add_argument(
    "--num_conv_layers",
    default=2,
    type=int,
    help="Convolution layer number. (default: %(default)s)")
parser.add_argument(
    "--num_rnn_layers",
    default=3,
    type=int,
    help="RNN layer number. (default: %(default)s)")
parser.add_argument(
    "--rnn_layer_size",
    default=512,
    type=int,
    help="RNN layer cell number. (default: %(default)s)")
parser.add_argument(
    "--use_gpu",
    default=True,
    type=distutils.util.strtobool,
    help="Use gpu or not. (default: %(default)s)")
parser.add_argument(
    "--normalizer_manifest_path",
    default='data/manifest.libri.train-clean-100',
    type=str,
    help="Manifest path for normalizer. (default: %(default)s)")
parser.add_argument(
    "--decode_manifest_path",
    default='data/manifest.libri.test-clean',
    type=str,
    help="Manifest path for decoding. (default: %(default)s)")
parser.add_argument(
    "--model_filepath",
    default='./params.tar.gz',
    type=str,
    help="Model filepath. (default: %(default)s)")
parser.add_argument(
    "--vocab_filepath",
    default='data/eng_vocab.txt',
    type=str,
    help="Vocabulary filepath. (default: %(default)s)")
parser.add_argument(
    "--decode_method",
    default='best_path',
    type=str,
    help="Method for ctc decoding, best_path or beam_search. (default: %(default)s)"
)
parser.add_argument(
    "--beam_size",
    default=50,
    type=int,
    help="Width for beam search decoding. (default: %(default)d)")
parser.add_argument(
    "--num_result_per_sample",
    default=2,
    type=int,
    help="Number of results per given sample in beam search. (default: %(default)d)"
)
args = parser.parse_args()


def infer():
    """
    Max-ctc-decoding for DeepSpeech2.
    """
    # initialize data generator
    data_generator = DataGenerator(
        vocab_filepath=args.vocab_filepath,
        normalizer_manifest_path=args.normalizer_manifest_path,
        normalizer_num_samples=200,
        max_duration=20.0,
        min_duration=0.0,
        stride_ms=10,
        window_ms=20)

    # create network config
    dict_size = data_generator.vocabulary_size()
    vocab_list = data_generator.vocabulary_list()
    audio_data = paddle.layer.data(
        name="audio_spectrogram",
        height=161,
        width=2000,
        type=paddle.data_type.dense_vector(322000))
    text_data = paddle.layer.data(
        name="transcript_text",
        type=paddle.data_type.integer_value_sequence(dict_size))
    output_probs = deep_speech2(
        audio_data=audio_data,
        text_data=text_data,
        dict_size=dict_size,
        num_conv_layers=args.num_conv_layers,
        num_rnn_layers=args.num_rnn_layers,
        rnn_size=args.rnn_layer_size,
        is_inference=True)

    # load parameters
    parameters = paddle.parameters.Parameters.from_tar(
        gzip.open(args.model_filepath))

    # prepare infer data
    feeding = data_generator.data_name_feeding()
    test_batch_reader = data_generator.batch_reader_creator(
        manifest_path=args.decode_manifest_path,
        batch_size=args.num_samples,
        padding_to=2000,
        flatten=True,
        sort_by_duration=False,
        shuffle=False)
    infer_data = test_batch_reader().next()

    # run inference
    infer_results = paddle.infer(
        output_layer=output_probs, parameters=parameters, input=infer_data)
    num_steps = len(infer_results) / len(infer_data)
    probs_split = [
        infer_results[i * num_steps:(i + 1) * num_steps]
        for i in xrange(0, len(infer_data))
    ]

    # decode and print
    for i, probs in enumerate(probs_split):
        best_path_transcription = ctc_decode(
            probs_seq=probs, vocabulary=vocab_list, method="best_path")
        target_transcription = ''.join(
            [vocab_list[index] for index in infer_data[i][1]])
        print("\nTarget   Transcription: %s \nBst_path Transcription: %s" %
              (target_transcription, best_path_transcription))
        beam_search_transcription = ctc_decode(
            probs_seq=probs,
            vocabulary=vocab_list,
            method="beam_search",
            beam_size=args.beam_size,
            num_results_per_sample=args.num_result_per_sample)
        for index in range(len(beam_search_transcription)):
            print("LM No, %d - %4f: %s " %
                  (index, beam_search_transcription[index][0],
                   beam_search_transcription[index][1]))


def main():
    paddle.init(use_gpu=args.use_gpu, trainer_count=1)
    infer()


if __name__ == '__main__':
    main()
Add function docs. 7 years ago			`"""`
			`Inference for a simplifed version of Baidu DeepSpeech2 model.`
			`"""`

Add infererence and add SortaGrad for only first pass. 7 years ago			`import paddle.v2 as paddle`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`import distutils.util`
Add infererence and add SortaGrad for only first pass. 7 years ago			`import argparse`
			`import gzip`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`from audio_data_utils import DataGenerator`
Add function docs. 7 years ago			`from model import deep_speech2`
Refactor decoder interfaces and add ./data directory. 7 years ago			`from decoder import ctc_decode`
Add infererence and add SortaGrad for only first pass. 7 years ago
			`parser = argparse.ArgumentParser(`
Add function docs. 7 years ago			`description='Simplified version of DeepSpeech2 inference.')`
Add infererence and add SortaGrad for only first pass. 7 years ago			`parser.add_argument(`
Add function docs. 7 years ago			`"--num_samples",`
			`default=10,`
			`type=int,`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`help="Number of samples for inference. (default: %(default)s)")`
Add infererence and add SortaGrad for only first pass. 7 years ago			`parser.add_argument(`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`"--num_conv_layers",`
			`default=2,`
			`type=int,`
			`help="Convolution layer number. (default: %(default)s)")`
			`parser.add_argument(`
			`"--num_rnn_layers",`
			`default=3,`
			`type=int,`
			`help="RNN layer number. (default: %(default)s)")`
			`parser.add_argument(`
			`"--rnn_layer_size",`
			`default=512,`
			`type=int,`
			`help="RNN layer cell number. (default: %(default)s)")`
			`parser.add_argument(`
			`"--use_gpu",`
			`default=True,`
			`type=distutils.util.strtobool,`
			`help="Use gpu or not. (default: %(default)s)")`
Add infererence and add SortaGrad for only first pass. 7 years ago			`parser.add_argument(`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`"--normalizer_manifest_path",`
Refactor decoder interfaces and add ./data directory. 7 years ago			`default='data/manifest.libri.train-clean-100',`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`type=str,`
			`help="Manifest path for normalizer. (default: %(default)s)")`
Add infererence and add SortaGrad for only first pass. 7 years ago			`parser.add_argument(`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`"--decode_manifest_path",`
Refactor decoder interfaces and add ./data directory. 7 years ago			`default='data/manifest.libri.test-clean',`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`type=str,`
			`help="Manifest path for decoding. (default: %(default)s)")`
Add infererence and add SortaGrad for only first pass. 7 years ago			`parser.add_argument(`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`"--model_filepath",`
			`default='./params.tar.gz',`
			`type=str,`
			`help="Model filepath. (default: %(default)s)")`
Refactor decoder interfaces and add ./data directory. 7 years ago			`parser.add_argument(`
			`"--vocab_filepath",`
			`default='data/eng_vocab.txt',`
			`type=str,`
			`help="Vocabulary filepath. (default: %(default)s)")`
enable ctc beam search decoder 7 years ago			`parser.add_argument(`
			`"--decode_method",`
			`default='best_path',`
			`type=str,`
			`help="Method for ctc decoding, best_path or beam_search. (default: %(default)s)"`
			`)`
			`parser.add_argument(`
			`"--beam_size",`
			`default=50,`
			`type=int,`
			`help="Width for beam search decoding. (default: %(default)d)")`
			`parser.add_argument(`
			`"--num_result_per_sample",`
			`default=2,`
			`type=int,`
			`help="Number of results per given sample in beam search. (default: %(default)d)"`
			`)`
Add infererence and add SortaGrad for only first pass. 7 years ago			`args = parser.parse_args()`


Refactor decoder interfaces and add ./data directory. 7 years ago			`def infer():`
Add function docs. 7 years ago			`"""`
			`Max-ctc-decoding for DeepSpeech2.`
			`"""`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`# initialize data generator`
			`data_generator = DataGenerator(`
Refactor decoder interfaces and add ./data directory. 7 years ago			`vocab_filepath=args.vocab_filepath,`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`normalizer_manifest_path=args.normalizer_manifest_path,`
			`normalizer_num_samples=200,`
			`max_duration=20.0,`
			`min_duration=0.0,`
			`stride_ms=10,`
			`window_ms=20)`
Refactor decoder interfaces and add ./data directory. 7 years ago
Add infererence and add SortaGrad for only first pass. 7 years ago			`# create network config`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`dict_size = data_generator.vocabulary_size()`
			`vocab_list = data_generator.vocabulary_list()`
Add infererence and add SortaGrad for only first pass. 7 years ago			`audio_data = paddle.layer.data(`
			`name="audio_spectrogram",`
			`height=161,`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`width=2000,`
			`type=paddle.data_type.dense_vector(322000))`
Add infererence and add SortaGrad for only first pass. 7 years ago			`text_data = paddle.layer.data(`
			`name="transcript_text",`
			`type=paddle.data_type.integer_value_sequence(dict_size))`
Refactor decoder interfaces and add ./data directory. 7 years ago			`output_probs = deep_speech2(`
Add infererence and add SortaGrad for only first pass. 7 years ago			`audio_data=audio_data,`
			`text_data=text_data,`
			`dict_size=dict_size,`
			`num_conv_layers=args.num_conv_layers,`
			`num_rnn_layers=args.num_rnn_layers,`
Refactor decoder interfaces and add ./data directory. 7 years ago			`rnn_size=args.rnn_layer_size,`
			`is_inference=True)`
Add infererence and add SortaGrad for only first pass. 7 years ago
			`# load parameters`
			`parameters = paddle.parameters.Parameters.from_tar(`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`gzip.open(args.model_filepath))`
Add infererence and add SortaGrad for only first pass. 7 years ago
			`# prepare infer data`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 7 years ago			`feeding = data_generator.data_name_feeding()`
			`test_batch_reader = data_generator.batch_reader_creator(`
			`manifest_path=args.decode_manifest_path,`
			`batch_size=args.num_samples,`
			`padding_to=2000,`
			`flatten=True,`
			`sort_by_duration=False,`
			`shuffle=False)`
Add infererence and add SortaGrad for only first pass. 7 years ago			`infer_data = test_batch_reader().next()`

Refactor decoder interfaces and add ./data directory. 7 years ago			`# run inference`
			`infer_results = paddle.infer(`
			`output_layer=output_probs, parameters=parameters, input=infer_data)`
			`num_steps = len(infer_results) / len(infer_data)`
			`probs_split = [`
			`infer_results[i * num_steps:(i + 1) * num_steps]`
			`for i in xrange(0, len(infer_data))`
Add infererence and add SortaGrad for only first pass. 7 years ago			`]`
Refactor decoder interfaces and add ./data directory. 7 years ago
			`# decode and print`
			`for i, probs in enumerate(probs_split):`
enable ctc beam search decoder 7 years ago			`best_path_transcription = ctc_decode(`
Refactor decoder interfaces and add ./data directory. 7 years ago			`probs_seq=probs, vocabulary=vocab_list, method="best_path")`
			`target_transcription = ''.join(`
			`[vocab_list[index] for index in infer_data[i][1]])`
enable ctc beam search decoder 7 years ago			`print("\nTarget Transcription: %s \nBst_path Transcription: %s" %`
			`(target_transcription, best_path_transcription))`
			`beam_search_transcription = ctc_decode(`
			`probs_seq=probs,`
			`vocabulary=vocab_list,`
			`method="beam_search",`
			`beam_size=args.beam_size,`
			`num_results_per_sample=args.num_result_per_sample)`
			`for index in range(len(beam_search_transcription)):`
			`print("LM No, %d - %4f: %s " %`
			`(index, beam_search_transcription[index][0],`
			`beam_search_transcription[index][1]))`
Add infererence and add SortaGrad for only first pass. 7 years ago

			`def main():`
			`paddle.init(use_gpu=args.use_gpu, trainer_count=1)`
Refactor decoder interfaces and add ./data directory. 7 years ago			`infer()`
Add infererence and add SortaGrad for only first pass. 7 years ago

			`if __name__ == '__main__':`
			`main()`