Проверяемый статус документов Полнотекстовый поиск Доступ без регистрации

Карточка нормативного документа

ГОСТ Р 53556.6-2013

Звуковое вещание цифровое. Кодирование сигналов звукового вещания с сокращением избыточности для передачи по цифровым каналам связи. Часть III (MPEG-4 AUDIO). Интерфейс преобразования текста в речь (TTSI)

Просмотреть PDF
Статус не подтверждённа 28.09.2026Перед применением сверяйтесь с официальным источником
Удобное чтениеАбзацы и заголовки без PDF-разрывов

Межгосударственный стандарт

ГОСТ Р 53556.6-2013

Звуковое вещание цифровое. Кодирование сигналов звукового вещания с сокращением избыточности для передачи по цифровым каналам связи. Часть III (MPEG-4 AUDIO). Интерфейс преобразования текста в речь (TTSI)

Редакционная карточка ГОСТНОРМ. Полный текст публикуется только при подтверждённом праве использования. Метаданные сверяются по нескольким источникам.

Область применения

Область применения пока не подтверждена.

1

Страница 1

Ф Е Д Е Р А Л Ь Н О Е А ГЕ Н ТС ТВО
                                  ПО Т Е Х Н И Ч Е С К О М У Р Е Г У Л И Р О В А Н И Ю И М Е Т Р О Л О ГИ И




                                                            НАЦИОНАЛЬНЫЙ
                                                                                                   ГО С ТР
                                                                 СТАНДАРТ
                                                                                                   55556.6    —
                                                               РОССИЙСКОЙ
                                                                                                   2013
                                                                ФЕДЕРАЦИИ




                                   Звуковое вещание цифровое
                            Кодирование сигналов звукового вещания с
                            сокращением избыточности для передачи по
                                    цифровым каналам связи.

                                                      ЧАСТЬ 111
                                                   (MPEG-4 AUDIO)
                            Интерфейс преобразования текста в речь (TTSI)
                                                        ISOIEC 14496-3:2009
                                                                 (NEQ)



                                                       Издание официальное




                                                                      Москва
                                                                Стандартинформ
                                                                     2014




срок действия сертификата

2

Страница 2

ГОСТ Р 53556.6 — 2013

                                             Предисловие

      1   РАЗРАБОТАН Санкт-Петербургским филиалом Центрального научно-исследовательского
института Связи «Ленинградское отделение- (ФГУП ЛО ЦНИИС)

         2   ВНЕСЕН Техническим комитетом по стандартизации № 480 «Связь»

     3   УТВЕРЖДЕН И ВВЕДЕН В ДЕЙСТВИЕ Приказом Федерального агентства по техническому
регулированию и метрологии от 22 ноября 2013 г. No 1703-ст

      4    Настоящий стандарт разработан с учетом основных нормативных положений
международного стандарта ИСО/МЭК 14496-3:2009 «Информационные технологии. Кодирование
аудиовизуальных объектов. Часть 3. Аудио» (ISO/IEC 14496-3:2009 Information technology - Coding of
audio-visual objects - Part 3: Audio (NEQ)

         5 ВВЕДЕН ВПЕРВЫЕ

     Правила применения настоящего стандарта установлены в ГОСТ Р 1.0 - 2012 (раздел 8).
     Информация об изменениях к настоящему стандарту публикуется в годовом (по состоянию на
     1 января текущего года) информационном указателе - Национапы<ыв с т а н д а р т ы а
     официальный текст изменений и поправок - в ежемесячно издаваемом информационном
     указателе - Национальные с т а н д а р т ы В случав пересмотра (замены) или отмены
     настоящего стандарта соответствующее уведомление будет опубликовано в ближайшем
     выпуске   ежемесячного    информационного     указателя    «Националышв     стандарты-.
     Соответствующая     информация,    уведомление    и  пгюксты размещаются       также  в
     информационной системе общего пользования - на официальном сайте Федерального
     агентства по техническому регулированию и метрологии в сети Интернет (gost.ru)




                                                                        © Стандартинформ. 2014

          Настоящий стандарт не может быть воспроизведен, тиражирован и распространен в качестве
     официального издания без разрешения Федерального агентства по техническому регулированию и
     метрологии


II

3

Страница 3

ГОСТ Р 53556.6 — 2013

  Н А Ц И О Н А Л Ь Н Ы Й             СТ А Н Д А Р Т         РОС СИЙС КОЙ                  Ф Е Д Е Р А Ц И И


                                        Звуковое вещание цифровое

 КОДИРОВАНИЕ СИГНАЛОВ ЗВУКОВОГО ВЕЩАНИЯ С СОКРАЩЕНИЕМ ИЗБЫТОЧНОСТИ ДЛЯ
                  ПЕРЕДАЧИ ПО ЦИФРОВЫМ КАНАЛАМ СВЯЗИ.
                          ЧАСТЬ III (MPEG-4 AUDIO)

                             Интерфейс преобразования текста в речь (TTSI)

                                             Sound broadcasting digital.
 Coding of signals of sound broadcasting with reduction of redundancy lor transfer on digital communication channels.
                                             A part III (MPEG-4 audio).
                                          Texe to speech interface (TTSI)


                                                                                    Д ата в в е д е н и я — 2014—09— 01
      1 Область применения

      Стандарт определяет кодированное представление преобразования текста в речь MPEG-A
Audio (М-TTS) и его декодер для синтеза речи высокого качества и для того, чтобы задействовать
различные приложения.
      Стандарт предназначается для приложения к функциональности М -7TS, такой как
функциональность анимации лица (FA) и совместимость кинофильмов (МР) с кодированным потоком
битов. Функциональности М -TTS включают возможность использования просодической информации,
извлеченной из естественной речи. Функциональности также включают приложения в переговорное
устройство для инструментов FA и устройство дублирования для кинофильмов, используя форму губ
и вводимую информацию о тексте.
      Технология синтеза преобразования текста в речь (7TS) становится довольно
распространенным инструментом интерфейса и начинает играть важную роль в различных областях
приложения мультимедиа. При использовании функциональности синтеза TTS легко могут быть
составлены мультимедийные комтенты с дикторским текстом, не записывая естественный звук речи.
Кроме того, функциональность синтеза TTS с анимацией лица (FA) / кинофильма (МР) возможно
сделала бы содержание контента более выразительным. Технология TTS может использоваться в
качестве устройства речевого выхода для инструментов FA и для дублирования МР с информацией о
форме губ.
      В MPEG-А общие интерфейсы определяются для синтезатора TTS и для функциональной
совместимости FA/МР. Функциональные возможности М -TTS можно рассматривать как надмножество
стандартной платформы TTS. Синтезатор TTS может также использовать просодическую
информацию естественной речи в дополнение к входному тексту и генерировать синтезированную
речь гораздо более высокого качества. Формат потока битов интерфейса в высшей степени удобен
для пользователя: если некоторые параметры просодической информации недоступны,
пропущенные параметры генерируются, используя предварительно установленные правила.
Функциональность M TTS. таким образом, простирается от обычной функции синтеза 7TS до
кодирования естественной речи и областей его приложения, то есть, от простой функции синтеза 7TS
до функций для FA и МР.

      2 Термины и определения

     В настоящем стандарте применены                     термины      с   соответствующими         определениями,
используемые в ГОСТ Р 53556.0-2009.




Издание официальное
                                                                                                                        1

4

Страница 4

ГОСТ Р 53556.6 — 2013

          3 Символы и сокращения

    FO                   основная частота (частота основного тона)

    DEMUX                демультиплексор
    FA                   анимация лица
    FAP                  параметр анимации лица
    ID                   идентификатор
    IPA                  Международный фонетический алфавит
    MP                   кинофильм

    M-TTS                 TTS MPEG-A Audio
    STOD                 повествователь историй по требованию
    TTS                  преобразование текста в речь

          4 Синтаксис потока битов преобразования текста в речь MPEG-A Audio

          4.1     TTSSpecificConfig MPEG-A Audio

          TTSSpecificConfig () {
              TTS_Sequence ()
          }

        Таблица 1 • Синтаксис TTS Sequence ()
                              Синтаксис                     Количество битое    Мнемоника
     TTS Sequence {)
    {
          TTS_Sequence_ID:                                         5              uimsbf
          Language_Code:                                           18             uimsbl
          Gender Enable:                                            1              bslbi
          AgeEnable;                                                1              bslbl
          Speech Rate Enable:                                       1              bslbi
          Prosody_Enable:                                           1              bslbl
          Video Enable:                                             1              bslbl
          bp_ Shape_ Enable:                                        1             bvsfbf
          Trick Mode Enable:                                        1              bslbl
    i
        4.2 Полезная нагрузка преобразования текста в речь MPEG-4 Audio
        AlPduPayload {
               TTS_Sentence ();
        }
        Таблица 2 — Синтаксис TTS_Sontence Q
                              Синтаксис                      Количество битов   Мнемоника
    TTS Sentence {){
          TTS_Senlence_ID:                                           10           uimsbl
                Silence:                                             1             bslbl
                H(Silence) {
                SilenceDuralion:                                     12            uimsbl
    }
    else {
             if (Gender_Enable) {
                   Gender:                                           1             bslbl
    }
          if (Age Enable) {                                          3            uimsbl
               Age:
    1___________________________________________________
2
Показаны первые 4 из 12

История статуса

Подтверждённых событий пока нет.