Межгосударственный стандарт
ГОСТ Р 53556.6-2013
Звуковое вещание цифровое. Кодирование сигналов звукового вещания с сокращением избыточности для передачи по цифровым каналам связи. Часть III (MPEG-4 AUDIO). Интерфейс преобразования текста в речь (TTSI)
Редакционная карточка ГОСТНОРМ. Полный текст публикуется только при подтверждённом праве использования. Метаданные сверяются по нескольким источникам.
Область применения
Область применения пока не подтверждена.
1
Страница 1
Ф Е Д Е Р А Л Ь Н О Е А ГЕ Н ТС ТВО
ПО Т Е Х Н И Ч Е С К О М У Р Е Г У Л И Р О В А Н И Ю И М Е Т Р О Л О ГИ И
НАЦИОНАЛЬНЫЙ
ГО С ТР
СТАНДАРТ
55556.6 —
РОССИЙСКОЙ
2013
ФЕДЕРАЦИИ
Звуковое вещание цифровое
Кодирование сигналов звукового вещания с
сокращением избыточности для передачи по
цифровым каналам связи.
ЧАСТЬ 111
(MPEG-4 AUDIO)
Интерфейс преобразования текста в речь (TTSI)
ISOIEC 14496-3:2009
(NEQ)
Издание официальное
Москва
Стандартинформ
2014
срок действия сертификата2
Страница 2
ГОСТ Р 53556.6 — 2013
Предисловие
1 РАЗРАБОТАН Санкт-Петербургским филиалом Центрального научно-исследовательского
института Связи «Ленинградское отделение- (ФГУП ЛО ЦНИИС)
2 ВНЕСЕН Техническим комитетом по стандартизации № 480 «Связь»
3 УТВЕРЖДЕН И ВВЕДЕН В ДЕЙСТВИЕ Приказом Федерального агентства по техническому
регулированию и метрологии от 22 ноября 2013 г. No 1703-ст
4 Настоящий стандарт разработан с учетом основных нормативных положений
международного стандарта ИСО/МЭК 14496-3:2009 «Информационные технологии. Кодирование
аудиовизуальных объектов. Часть 3. Аудио» (ISO/IEC 14496-3:2009 Information technology - Coding of
audio-visual objects - Part 3: Audio (NEQ)
5 ВВЕДЕН ВПЕРВЫЕ
Правила применения настоящего стандарта установлены в ГОСТ Р 1.0 - 2012 (раздел 8).
Информация об изменениях к настоящему стандарту публикуется в годовом (по состоянию на
1 января текущего года) информационном указателе - Национапы<ыв с т а н д а р т ы а
официальный текст изменений и поправок - в ежемесячно издаваемом информационном
указателе - Национальные с т а н д а р т ы В случав пересмотра (замены) или отмены
настоящего стандарта соответствующее уведомление будет опубликовано в ближайшем
выпуске ежемесячного информационного указателя «Националышв стандарты-.
Соответствующая информация, уведомление и пгюксты размещаются также в
информационной системе общего пользования - на официальном сайте Федерального
агентства по техническому регулированию и метрологии в сети Интернет (gost.ru)
© Стандартинформ. 2014
Настоящий стандарт не может быть воспроизведен, тиражирован и распространен в качестве
официального издания без разрешения Федерального агентства по техническому регулированию и
метрологии
II3
Страница 3
ГОСТ Р 53556.6 — 2013
Н А Ц И О Н А Л Ь Н Ы Й СТ А Н Д А Р Т РОС СИЙС КОЙ Ф Е Д Е Р А Ц И И
Звуковое вещание цифровое
КОДИРОВАНИЕ СИГНАЛОВ ЗВУКОВОГО ВЕЩАНИЯ С СОКРАЩЕНИЕМ ИЗБЫТОЧНОСТИ ДЛЯ
ПЕРЕДАЧИ ПО ЦИФРОВЫМ КАНАЛАМ СВЯЗИ.
ЧАСТЬ III (MPEG-4 AUDIO)
Интерфейс преобразования текста в речь (TTSI)
Sound broadcasting digital.
Coding of signals of sound broadcasting with reduction of redundancy lor transfer on digital communication channels.
A part III (MPEG-4 audio).
Texe to speech interface (TTSI)
Д ата в в е д е н и я — 2014—09— 01
1 Область применения
Стандарт определяет кодированное представление преобразования текста в речь MPEG-A
Audio (М-TTS) и его декодер для синтеза речи высокого качества и для того, чтобы задействовать
различные приложения.
Стандарт предназначается для приложения к функциональности М -7TS, такой как
функциональность анимации лица (FA) и совместимость кинофильмов (МР) с кодированным потоком
битов. Функциональности М -TTS включают возможность использования просодической информации,
извлеченной из естественной речи. Функциональности также включают приложения в переговорное
устройство для инструментов FA и устройство дублирования для кинофильмов, используя форму губ
и вводимую информацию о тексте.
Технология синтеза преобразования текста в речь (7TS) становится довольно
распространенным инструментом интерфейса и начинает играть важную роль в различных областях
приложения мультимедиа. При использовании функциональности синтеза TTS легко могут быть
составлены мультимедийные комтенты с дикторским текстом, не записывая естественный звук речи.
Кроме того, функциональность синтеза TTS с анимацией лица (FA) / кинофильма (МР) возможно
сделала бы содержание контента более выразительным. Технология TTS может использоваться в
качестве устройства речевого выхода для инструментов FA и для дублирования МР с информацией о
форме губ.
В MPEG-А общие интерфейсы определяются для синтезатора TTS и для функциональной
совместимости FA/МР. Функциональные возможности М -TTS можно рассматривать как надмножество
стандартной платформы TTS. Синтезатор TTS может также использовать просодическую
информацию естественной речи в дополнение к входному тексту и генерировать синтезированную
речь гораздо более высокого качества. Формат потока битов интерфейса в высшей степени удобен
для пользователя: если некоторые параметры просодической информации недоступны,
пропущенные параметры генерируются, используя предварительно установленные правила.
Функциональность M TTS. таким образом, простирается от обычной функции синтеза 7TS до
кодирования естественной речи и областей его приложения, то есть, от простой функции синтеза 7TS
до функций для FA и МР.
2 Термины и определения
В настоящем стандарте применены термины с соответствующими определениями,
используемые в ГОСТ Р 53556.0-2009.
Издание официальное
14
Страница 4
ГОСТ Р 53556.6 — 2013
3 Символы и сокращения
FO основная частота (частота основного тона)
DEMUX демультиплексор
FA анимация лица
FAP параметр анимации лица
ID идентификатор
IPA Международный фонетический алфавит
MP кинофильм
M-TTS TTS MPEG-A Audio
STOD повествователь историй по требованию
TTS преобразование текста в речь
4 Синтаксис потока битов преобразования текста в речь MPEG-A Audio
4.1 TTSSpecificConfig MPEG-A Audio
TTSSpecificConfig () {
TTS_Sequence ()
}
Таблица 1 • Синтаксис TTS Sequence ()
Синтаксис Количество битое Мнемоника
TTS Sequence {)
{
TTS_Sequence_ID: 5 uimsbf
Language_Code: 18 uimsbl
Gender Enable: 1 bslbi
AgeEnable; 1 bslbl
Speech Rate Enable: 1 bslbi
Prosody_Enable: 1 bslbl
Video Enable: 1 bslbl
bp_ Shape_ Enable: 1 bvsfbf
Trick Mode Enable: 1 bslbl
i
4.2 Полезная нагрузка преобразования текста в речь MPEG-4 Audio
AlPduPayload {
TTS_Sentence ();
}
Таблица 2 — Синтаксис TTS_Sontence Q
Синтаксис Количество битов Мнемоника
TTS Sentence {){
TTS_Senlence_ID: 10 uimsbl
Silence: 1 bslbl
H(Silence) {
SilenceDuralion: 12 uimsbl
}
else {
if (Gender_Enable) {
Gender: 1 bslbl
}
if (Age Enable) { 3 uimsbl
Age:
1___________________________________________________
2Показаны первые 4 из 12
История статуса
Подтверждённых событий пока нет.