Межгосударственный стандарт
ГОСТ Р ИСО 24614-1-2013
Менеджмент языковых ресурсов. Пословная сегментация письменных текстов. Часть 1. Основные концепции и общие принципы
Редакционная карточка ГОСТНОРМ. Полный текст публикуется только при подтверждённом праве использования. Метаданные сверяются по нескольким источникам.
Область применения
Область применения пока не подтверждена.
1
Страница 1
ФЕДЕРАЛЬНОЕ АГЕНТСТВО
ПО ТЕХНИЧЕСКОМУ РЕГУЛИРОВАНИЮ И МЕТРОЛОГИИ
<£>
НАЦИОНАЛЬНЫ Й ГОСТ Р и с о
СТАНДАРТ
РО ССИЙСКО Й 24614-1—
ФЕДЕРАЦИИ
2013
Менеджмент языковых ресурсов
Пословная сегментация письменных текстов
Часть 1
Основные концепции и общие принципы
ISO 24614-1:2010
Language resource management - Word segmentation of written texts - Part 1:
Basic concepts and general principles
(IDT)
Издание оф ициальное
Москва
Стандартинформ
2014
вязание скатерти2
Страница 2
ГОСТ Р ИСО 24614-1—2013
Предисловие
1 ПОДГОТОВЛЕН ЗАО «Проспект» на основе собственного аутентичного перевода на русский
язык международного стандарта, указанного в пункте 4
2 ВНЕСЕН Техническим комитетом по стандартизации ТК 55 «Терминология, элементы данных
и документация в бизнес-процессах и электронной торговле»
3 УТВЕРЖДЕН И ВВЕДЕН В ДЕЙСТВИЕ Приказом Федерального агентства по техническому
регулированию и метрологии от 08 ноября 2013г. Np 1386-ст
4 Настоящий стандарт идентичен международному стандарту ИСО 24614-1:2010 «Менеджмент
языковых ресурсов. Пословная сегментация письменных текстов. Ч а с т ь ! Основные концепции и
общие принципы» (ISO 24614-1:2010 «Language resource management - Word segmentation of written
texts - Part 1: Basic concepts and general principles»).
5 ВВЕДЕН ВПЕРВЫЕ
Правила применения настоящ его ста н д а р та установлены в ГОСТ Р 1.0—2012 (раздел 8).
Информация об изменениях к настоящ ему ста н д а р ту публикуется в ежегодном (по состоянию на
1 января те кущ е го года) информационном указателе «Национальнью стандарты », а
официальный т е к с т изменений и поправок - в ежемесячном информационном указателе
«Национальные стандарты ». В случае пересмотра (замены) или отм ены настоящ его ста н д а р та
со о тве тствую щ е е уведомление будет опубликовано в ближайшем выпуске информационного
указателя «Национальные стандарты ». С о о тветствую щ ая информация, уведомление и т е к с т ы
размещ аю тся та кж е в информационной систем е общего пользования - на официальном са йте
Федерального а ге н тс тв а по техническом у регулированию и м етрологии в с е ти И н те р н е т
(gost.ru)
© Стандартинформ. 2014
Настоящий стандарт не может быть воспроизведен, тиражирован и распространен в качестве
официального издания без разрешения национального органа Российской Федерации по стандар
тизации3
Страница 3
ГОСТ Р ИСО 24614-1—2013
НАЦИОНАЛЬНЫЙ СТАНДАРТ РОССИЙСКОЙ ФЕДЕРАЦИИ
Менеджмент я зы ко вы х ресурсов. Пословная сегментация письменны х текстов. Часть 1.
Основные концепции и общие принципы
Language resource management - Word segmentation of written texts - Part 1: Basic concepts and general principles
Дата введения — 2015—01—01
1 Область применения
В настоящем стандарте представляются основные понятия и общие принципы пословной
сегментации и даются не зависящие от языка руководящие указания по сегментации письменных
текстов надежным и воспроизводимым способом на единицы пословной сегментации (WSU).
ПРИМЕЧАНИЕ: В связанной с языком научно-исследовательской и практической работе слово
является фундаментальным и необходимым понятием. Поэтому для целей сегментации текста на
слова важно иметь универсальное определение того, что включает слово. Нельзя просто
использовать для разграничения слов правила, основанные на идентификации пробелов и знаков
пунктуации. Такие правила не учитывают случаи сложных слов, которые пишутся через дефис,
сокращений, идиом или словоподобных выражений, содержащих символы или цифры. Пословная
сегментация еще более проблематична в языках, которые не содержат пробелов для разделения
слов, например, для китайского и японского языков, а также в агглютинативных языках, где некоторые
классы функциональных слое реализуются как аффиксы, например, в корейском языке.
Некоторые применения и сферы, которые требуют сегментировать тексты на слова и к которым,
следовательно, применима данная часть ИСО 24614, представлены ниже
Перевод
Подсчет слов является главным методом оценки стоимости перевода. Пословная сегментация -
это стандартная функция в системах переводческой памяти и в инструментальных средствах
автоматизированного перевода (CAT). Пословная сегментация выполняется средствами извлечения
терминов, которые иногда предоставляются в системах управления терминологией и в средствах
CAT.
Управление контентом
Большинство систем и баз данных для управления информационным содержанием (контентом)
предусматривают поиск по отдельным словам. Содержание, по которому производится поиск, должно
быть сегментировано, чтобы была возможность сравнения со словом поиска. Кроме того, поисковые
функции требуют знания границ слов.
Технологии распознавания речи
Системы речевого воспроизведения текста синтезируют речь на базе слов и поэтому требуют
пословной сегментации для обеспечения возможности словарного поиска, расстановки ударений,
установления просодического образца и др.
Прикладная лингвистика
Различные системы обработки текстов на естественных языках (NLP) должны сегментировать
текст на слова для того, чтобы выполнить свои функции. Системы NLP включают:
- морфосинтаксические программы обработки.
- синтаксические анализаторы.
- программы проверки правописания.
- системы классификации текстов, и
- лингвистическое аннотирование корпуса текстов.
Лексикография
Лексические ресурсы часто оцениваются по их объёму - обычно на основе подсчёта числа слов.
ПРИМЕЧАНИЕ: Объём языковых ресурсов - весьма важный показатель для управления ими.
Количественное определение объёма языковых ресурсов, как правило, основывается на подсчёте
количества слов. Однако поскольку в приложениях NLP используются разные методы сегментации,
каждый из них подсчитывает число слов по-разному и даёт в итоге разные суммы для одного и того
же текста. Наличие надёжной воспроизводимой стандартной меры могло бы обеспечить получение
сопоставимых результатов. Однако это не значит, что приложения не могут использовать свои
специфические методы сегментации; например, в системе синтеза речи текст может
сегментироваться на меньшие или большие единицы по сравнению с другими приложениями.
Издание оф ициальное
14
Страница 4
ГОСТ Р ИСО 24614-1—2013
2 Термины и определения
В данном документе используются следующие термины и определения:
2.1 сокращение (abbreviation): Вербальное обозначение, образованное путем исключения слов
или отдельных букв из более длинной формы и идентифицирующее то же самое понятие.
[ISO 1087-1:2000]
2.2 аффикс (affix): Связанная морфема, которая может добавляться к основе или лексеме.
П р и м е ч а н и е - Аффиксы можно классифицировать на несколько подтипов, например, префикс,
суффикс, инфикс и циркумфикс. Аффиксы могут быть деривационными, инфлективными или агглютинативными.
2.3 агглютинация (agglutination): Процесс присоединения одного или большего числа аффиксов
к основе.
[ISO 24613:2008]
2.4 заимствование (borrowing): Процесс образования слова, в котором лингвистическое
выражение заимствуется из другого языка, как правило, когда не существует термина для нового
объекта или понятия.
2.5 связанная морфема (bound morpheme): Морфема (2.18). которая появляется только вместе с
одной или несколькими другими морфемами.
Пример 1 - Китайский: иероглиф означает «великий», но он не может помещаться отдельно как
слово в тексте. Вместо этого он может использоваться как составляющий элемент многих слов, например. (15А
«великое», (? А «гигант», and «величие».
П р и м е р 2 - Корейский: суффикс «-в», который эквивалентен английскому предлогу «to» — как в
«hakkyo-е» (в школе). - это связанная морфема.
[ISO 24613:2008]
2.6 сложное слово (compound): Слово, построенное из двух или большего числа лексем.
П р и м е ч а н и е 1 -Адаптированное определение 3.10 из ISO 24613:2008.
П р и м е ч а н и е 2 - Сложное слово может быть эндоцентрическим. если оно имеет ведущее слово (т.е.
основную часть, которая содержит основной смысл всего сложного слова) и модификаторы (которые
ограничивают это смысловое значение) или экзоцентрическим. если оно не имеет ведущего слова. Сложное
слово может быть длинным. Существуют два главных подтипа сложных слов в соответствии со степенью их
лексикализации: составное слово и фразовое образование.
2.7 словосложение (compounding): Способ образования слов, при котором новое слово
составляется путем соединения по крайней мере двух лексем в их исходных формах или с
небольшими изменениями.
[ISO 24613:2008]
2.8 словообразование (derivation): Изменение в форме слова для создания нового слова,
обычно путем модификации основы или аффиксации.
[ISO 24613:2008]
2.9 свободная морфема (free morpheme): Морфема, которая может самостоятельно
использоваться как слово.
П р и м е р - В английском слове «goodness» (доброта) основа «good» является свободной морфемой,
тогда как часть, «-ness» таковой не является и представляет собой связанную морфему.
2.10 омограф (homograph): Каждая из двух или большего числа форм слова или слов с
идентичным правописанием, но представляющие различные понятия (семантическая омонимия) или
синтаксические функции (синтаксическая омонимия).
2.11 флексия (inflection): Процесс, в котором форма слова составляется путем добавления
аффикса к основе.
П р и м е ч а н и е - Флексия - это скорее грамматический, чем лексический процесс.
2Показаны первые 4 из 16
История статуса
Подтверждённых событий пока нет.