PaddleSpeech/model.py

"""
   A simplifed version of Baidu DeepSpeech2 model.
"""

import paddle.v2 as paddle

#TODO: add bidirectional rnn.


def conv_bn_layer(input, filter_size, num_channels_in, num_channels_out, stride,
                  padding, act):
    """
    Convolution layer with batch normalization.
    """
    conv_layer = paddle.layer.img_conv(
        input=input,
        filter_size=filter_size,
        num_channels=num_channels_in,
        num_filters=num_channels_out,
        stride=stride,
        padding=padding,
        act=paddle.activation.Linear(),
        bias_attr=False)
    return paddle.layer.batch_norm(input=conv_layer, act=act)


def bidirectional_simple_rnn_bn_layer(name, input, size, act):
    """
    Bidirectonal simple rnn layer with sequence-wise batch normalization.
    The batch normalization is only performed on input-state weights.
    """
    # input-hidden weights shared across bi-direcitonal rnn.
    input_proj = paddle.layer.fc(
        input=input, size=size, act=paddle.activation.Linear(), bias_attr=False)
    # batch norm is only performed on input-state projection 
    input_proj_bn = paddle.layer.batch_norm(
        input=input_proj, act=paddle.activation.Linear())
    # forward and backward in time
    forward_simple_rnn = paddle.layer.recurrent(
        input=input_proj_bn, act=act, reverse=False)
    backward_simple_rnn = paddle.layer.recurrent(
        input=input_proj_bn, act=act, reverse=True)
    return paddle.layer.concat(input=[forward_simple_rnn, backward_simple_rnn])


def conv_group(input, num_stacks):
    """
    Convolution group with several stacking convolution layers.
    """
    conv = conv_bn_layer(
        input=input,
        filter_size=(11, 41),
        num_channels_in=1,
        num_channels_out=32,
        stride=(3, 2),
        padding=(5, 20),
        act=paddle.activation.BRelu())
    for i in xrange(num_stacks - 1):
        conv = conv_bn_layer(
            input=conv,
            filter_size=(11, 21),
            num_channels_in=32,
            num_channels_out=32,
            stride=(1, 2),
            padding=(5, 10),
            act=paddle.activation.BRelu())
    output_num_channels = 32
    output_height = 160 // pow(2, num_stacks) + 1
    return conv, output_num_channels, output_height


def rnn_group(input, size, num_stacks):
    """
    RNN group with several stacking RNN layers.
    """
    output = input
    for i in xrange(num_stacks):
        output = bidirectional_simple_rnn_bn_layer(
            name=str(i), input=output, size=size, act=paddle.activation.BRelu())
    return output


def deep_speech2(audio_data,
                 text_data,
                 dict_size,
                 num_conv_layers=2,
                 num_rnn_layers=3,
                 rnn_size=256,
                 is_inference=False):
    """
    The whole DeepSpeech2 model structure (a simplified version).

    :param audio_data: Audio spectrogram data layer.
    :type audio_data: LayerOutput
    :param text_data: Transcription text data layer.
    :type text_data: LayerOutput
    :param dict_size: Dictionary size for tokenized transcription.
    :type dict_size: int
    :param num_conv_layers: Number of stacking convolution layers.
    :type num_conv_layers: int
    :param num_rnn_layers: Number of stacking RNN layers.
    :type num_rnn_layers: int
    :param rnn_size: RNN layer size (number of RNN cells).
    :type rnn_size: int
    :param is_inference: False in the training mode, and True in the
                         inferene mode.
    :type is_inference: bool
    :return: If is_inference set False, return a ctc cost layer;
             if is_inference set True, return a sequence layer of output
             probability distribution.
    :rtype: tuple of LayerOutput
    """
    # convolution group
    conv_group_output, conv_group_num_channels, conv_group_height = conv_group(
        input=audio_data, num_stacks=num_conv_layers)
    # convert data form convolution feature map to sequence of vectors
    conv2seq = paddle.layer.block_expand(
        input=conv_group_output,
        num_channels=conv_group_num_channels,
        stride_x=1,
        stride_y=1,
        block_x=1,
        block_y=conv_group_height)
    # rnn group
    rnn_group_output = rnn_group(
        input=conv2seq, size=rnn_size, num_stacks=num_rnn_layers)
    fc = paddle.layer.fc(
        input=rnn_group_output,
        size=dict_size + 1,
        act=paddle.activation.Linear(),
        bias_attr=True)
    if is_inference:
        # probability distribution with softmax
        return paddle.layer.mixed(
            input=paddle.layer.identity_projection(input=fc),
            act=paddle.activation.Softmax())
    else:
        # ctc cost
        return paddle.layer.warp_ctc(
            input=fc,
            label=text_data,
            size=dict_size + 1,
            blank=dict_size,
            norm_by_times=True)
Add function docs. 8 years ago			`"""`
			`A simplifed version of Baidu DeepSpeech2 model.`
			`"""`

Add infererence and add SortaGrad for only first pass. 8 years ago			`import paddle.v2 as paddle`

Add function docs. 8 years ago			`#TODO: add bidirectional rnn.`

Add infererence and add SortaGrad for only first pass. 8 years ago
			`def conv_bn_layer(input, filter_size, num_channels_in, num_channels_out, stride,`
			`padding, act):`
Add function docs. 8 years ago			`"""`
			`Convolution layer with batch normalization.`
			`"""`
Add infererence and add SortaGrad for only first pass. 8 years ago			`conv_layer = paddle.layer.img_conv(`
			`input=input,`
			`filter_size=filter_size,`
			`num_channels=num_channels_in,`
			`num_filters=num_channels_out,`
			`stride=stride,`
			`padding=padding,`
			`act=paddle.activation.Linear(),`
			`bias_attr=False)`
			`return paddle.layer.batch_norm(input=conv_layer, act=act)`


1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 8 years ago			`def bidirectional_simple_rnn_bn_layer(name, input, size, act):`
Add function docs. 8 years ago			`"""`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 8 years ago			`Bidirectonal simple rnn layer with sequence-wise batch normalization.`
			`The batch normalization is only performed on input-state weights.`
Add function docs. 8 years ago			`"""`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 8 years ago			`# input-hidden weights shared across bi-direcitonal rnn.`
			`input_proj = paddle.layer.fc(`
			`input=input, size=size, act=paddle.activation.Linear(), bias_attr=False)`
			`# batch norm is only performed on input-state projection`
			`input_proj_bn = paddle.layer.batch_norm(`
			`input=input_proj, act=paddle.activation.Linear())`
			`# forward and backward in time`
			`forward_simple_rnn = paddle.layer.recurrent(`
			`input=input_proj_bn, act=act, reverse=False)`
			`backward_simple_rnn = paddle.layer.recurrent(`
			`input=input_proj_bn, act=act, reverse=True)`
			`return paddle.layer.concat(input=[forward_simple_rnn, backward_simple_rnn])`
Add infererence and add SortaGrad for only first pass. 8 years ago

			`def conv_group(input, num_stacks):`
Add function docs. 8 years ago			`"""`
			`Convolution group with several stacking convolution layers.`
			`"""`
Add infererence and add SortaGrad for only first pass. 8 years ago			`conv = conv_bn_layer(`
			`input=input,`
			`filter_size=(11, 41),`
			`num_channels_in=1,`
			`num_channels_out=32,`
			`stride=(3, 2),`
			`padding=(5, 20),`
			`act=paddle.activation.BRelu())`
			`for i in xrange(num_stacks - 1):`
			`conv = conv_bn_layer(`
			`input=conv,`
			`filter_size=(11, 21),`
			`num_channels_in=32,`
			`num_channels_out=32,`
			`stride=(1, 2),`
			`padding=(5, 10),`
			`act=paddle.activation.BRelu())`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 8 years ago			`output_num_channels = 32`
			`output_height = 160 // pow(2, num_stacks) + 1`
			`return conv, output_num_channels, output_height`
Add infererence and add SortaGrad for only first pass. 8 years ago

			`def rnn_group(input, size, num_stacks):`
Add function docs. 8 years ago			`"""`
			`RNN group with several stacking RNN layers.`
			`"""`
Add infererence and add SortaGrad for only first pass. 8 years ago			`output = input`
			`for i in xrange(num_stacks):`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 8 years ago			`output = bidirectional_simple_rnn_bn_layer(`
Add infererence and add SortaGrad for only first pass. 8 years ago			`name=str(i), input=output, size=size, act=paddle.activation.BRelu())`
			`return output`


			`def deep_speech2(audio_data,`
			`text_data,`
			`dict_size,`
			`num_conv_layers=2,`
			`num_rnn_layers=3,`
Refactor decoder interfaces and add ./data directory. 8 years ago			`rnn_size=256,`
			`is_inference=False):`
Add function docs. 8 years ago			`"""`
			`The whole DeepSpeech2 model structure (a simplified version).`

			`:param audio_data: Audio spectrogram data layer.`
			`:type audio_data: LayerOutput`
			`:param text_data: Transcription text data layer.`
			`:type text_data: LayerOutput`
			`:param dict_size: Dictionary size for tokenized transcription.`
			`:type dict_size: int`
			`:param num_conv_layers: Number of stacking convolution layers.`
			`:type num_conv_layers: int`
			`:param num_rnn_layers: Number of stacking RNN layers.`
			`:type num_rnn_layers: int`
			`:param rnn_size: RNN layer size (number of RNN cells).`
			`:type rnn_size: int`
Refactor decoder interfaces and add ./data directory. 8 years ago			`:param is_inference: False in the training mode, and True in the`
			`inferene mode.`
			`:type is_inference: bool`
			`:return: If is_inference set False, return a ctc cost layer;`
			`if is_inference set True, return a sequence layer of output`
			`probability distribution.`
Add function docs. 8 years ago			`:rtype: tuple of LayerOutput`
			`"""`
			`# convolution group`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 8 years ago			`conv_group_output, conv_group_num_channels, conv_group_height = conv_group(`
			`input=audio_data, num_stacks=num_conv_layers)`
Add function docs. 8 years ago			`# convert data form convolution feature map to sequence of vectors`
Add infererence and add SortaGrad for only first pass. 8 years ago			`conv2seq = paddle.layer.block_expand(`
			`input=conv_group_output,`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 8 years ago			`num_channels=conv_group_num_channels,`
Add infererence and add SortaGrad for only first pass. 8 years ago			`stride_x=1,`
			`stride_y=1,`
			`block_x=1,`
1. Fix incorrect decoder result printing. 2. Fix incorrect batch-norm usage in RNN. 3. Fix overlapping train/dev/test manfests. 4. Update README.md and requirements.txt. 5. Expose more arguments to users in argparser. 6. Update all other details. 8 years ago			`block_y=conv_group_height)`
Add function docs. 8 years ago			`# rnn group`
Add infererence and add SortaGrad for only first pass. 8 years ago			`rnn_group_output = rnn_group(`
			`input=conv2seq, size=rnn_size, num_stacks=num_rnn_layers)`
			`fc = paddle.layer.fc(`
			`input=rnn_group_output,`
			`size=dict_size + 1,`
			`act=paddle.activation.Linear(),`
			`bias_attr=True)`
Refactor decoder interfaces and add ./data directory. 8 years ago			`if is_inference:`
			`# probability distribution with softmax`
			`return paddle.layer.mixed(`
			`input=paddle.layer.identity_projection(input=fc),`
			`act=paddle.activation.Softmax())`
			`else:`
			`# ctc cost`
			`return paddle.layer.warp_ctc(`
			`input=fc,`
			`label=text_data,`
			`size=dict_size + 1,`
			`blank=dict_size,`
			`norm_by_times=True)`