Информационные технологии документационного обеспечения управленческой деятельности

Автор: Пользователь скрыл имя, 25 Января 2012 в 11:45, контрольная работа

Описание работы

Первоначальным направлением развития СУБД стала разработка и использование фактографических информационных систем, которые ориентированы на обработку структурированных данных. Были разработаны модели организации фактографических данных, отработаны программно-технические решения по накоплению и физическому хранению таких данных, реализованы языки запросов к БД.

Работа содержит 1 файл

Информационные технологии документационного обеспечения управленческой деятельности.docx

— 58.78 Кб (Скачать)

Информационные  технологии документационного  обеспечения управленческой деятельности.

1. Виды документальных информационных систем

  Первоначальным  направлением развития СУБД стала разработка и использование фактографических информационных систем, которые ориентированы на обработку структурированных данных. Были разработаны модели организации фактографических данных, отработаны программно-технические решения по накоплению и физическому хранению таких данных, реализованы языки запросов к БД.

  Однако  создание фактографических информационных систем требует предварительной структуризации данных, например, на основе таблиц. Она зачастую требует больших накладных расходов. Вместе с тем накапливаются большие объемы неструктурированной информации: в организационно-распорядительных документах или других текстовых источниках. Представление такой информации в фактографических системах зачастую экономически не оправдано.

 Теоретические исследования вопросов автоматизации  обработки неструктурированной информации, начавшись еще в 50-х годах, пока не привели к созданию такой строгой, полной и технически реализуемой модели представления и обработки данных, как реляционная модель. Пока не разработаны стандартные информационно-поисковые языки (подобные SQL), которые можно было бы использовать для формализованного описания содержания документов и построения запросов.

 Элементом данных в документальных ИС является документ (в фактографических информационных системах элементом является запись). Обычно под документом понимается текстовый файл.

 Основной  задачей документальных информационных систем является хранение и предоставление пользователю документов, содержание которых соответствуют его информационным потребностям. 

  Документальная  информационная система (ДИС) — единое хранилище документов с инструментарием поиска и выдачи необходимых пользователю документов.

  Поисковый характер документальных информационных систем (определил еще одно их название — информационно-поисковые системы (ИПС).

  Соответствие  найденных документов информационным потребностям пользователя называется пертинентностью. В силу теоретических и практических сложностей формализации смыслового содержания документов пертинентность относится скорее к качественным понятиям.

  В зависимости от особенностей реализации хранилища документов и механизмов поиска, ДИС можно разделить на две группы:

» системы на основе индексирования;

» семантически-навигационные  системы.

 Семантика (от греч. semantikos — обозначающий) — значения единиц языка.

 В семантически-навигационных (гипертекстовых) системах документы, помещаемые в хранилище документов, оснащаются специальными навигационными конструкциями (гиперссылками), соответствующими смысловым связям между различными документами или отдельными фрагментами одного документа.

 В системах на основе индексирования исходные документы  помещаются в базу без какого-либо дополнительного преобразования, но при этом смысловое содержание каждого документа отображается в некоторое поисковое пространство. Процесс отображения документа в поисковое пространство называется индексированием и заключается в присвоении каждому документу некоторого индекса — координаты в поисковом пространстве. Формализованное представление индекса документа называется поисковым образом документа (ПОД). Пользователь выражает свои информационные потребности посредством специального языка, формируя поисковый образ запроса (ПОЗ) к базе документов.

 На  основе определенных критериев ДИС  осуществляет поиск и выдачу документов, поисковые образы которых соответствуют поисковым образам запроса пользователя.

 Соответствие  найденных документов запросу пользователя называется релевантностью.

 Информационно-поисковый  язык (ИПЯ) представляет собой некоторую формализованную семантическую систему, предназначенную для выражения содержания документа и поискового запроса .

  Основными элементами ИПЯ являются алфавит, лексика  и грамматика.

 Алфавит ИПЯ — система знаков, используемых для записи слов и выражений ИПЯ.

 Лексика, или словарный состав, ИПЯ — совокупность слов, словосочетаний и выражений, используемых для построения текстов ИПЯ.

 Грамматика  ИПЯ — совокупность средств и способов построения, изменения и сочетания лексических единиц. Грамматика включает морфологию и синтаксис.

 Можно указать следующие требования, которым  должен удовлетворять ИПЯ:

    * располагать  лексико-грамматическими средствами  для точного отображения темы документа и запроса;

* не содержать  полисемии, синонимии и омонимии;

    * отображать  только объективные характеристики  предметов и отношений между ними;

* быть удобным  для алгоритмического сопоставления  ПОД и ПОЗ.

  Построение  выражений ИПЯ требует решения по крайней мере двух проблем. Первая из них связана с выбором лексических единиц ИПЯ, необходимых для построения выражений.

 Выбор слов определяется их смыслом, обусловленным парадигматическими отношениями между предметами и явлениями, которые они определяют. 

Парадигматические отношения — это отношения, обусловленные наличием логических связей между предметами и явлениями, обозначенными данными словами. Перечислим некоторые парадигматические отношения :

    * «вид—род»,  например, «шкаф—мебель». В данном  случае понятие «шкаф» является видовым по отношению к понятию «мебель». Родовое понятие всегда включает в себя видовое;

* «часть—целое»,  например «лезвие—нож»;

* «причина—следствие»,  например, «лампа—свет»;

* «функциональное  сходство», например, «лопата—экскаватор».

 Естественный  язык обладает высокой многозначностью. В ИПЯ недопустима многозначность. Поэтому здесь необходимо учитывать отношения синонимии и омонимии слов естественного языка, используемых в ИПЯ.

 Омонимия — это совпадение слов по написанию или звучанию и несовпадение по смыслу.

 Полисемия слова состоит в том, что одно и то же слово выражает пучок родственных понятий. Например, слово «соль» обозначает вещество, а также понятие смысла. Оба значения близки по сути.

 Синонимия — это совпадение слов по значению и несовпадение по написанию.

 Вторая  проблема построения фраз ИПЯ связана с определением последовательности выбранных слов.

 Синтагматические  отношения отношения слов при соединении их в словосочетания и фразы. Для уточнения смысла документа или запроса, помимо ключевых слов, часто необходимо указывать, в каких синтагматических отношениях эти слова находятся. Так, фраза «защита окружающей среды от человека» и фраза «защита человека от окружающей среды» имеют совершенно разный смысл, хотя и состоят из одних и тех же ключевых слов.

 Многообразие  используемых в ИПЯ парадигматических  и синтагматических отношений определяет семантическую силу ИПЯ.

По способу  организации понятий различают  следующие ИПЯ:

* предкоординируемые (классификационные) ИПЯ;

* посткоординируемые (дескрипторные) ИПЯ.

 Предкоординация — предварительное (до использования при индексировании) построение сложных классов путем логического умножения (координации) простых классов. Словарный состав задается в виде фиксированного списка слов, словосочетаний и фраз. Введение в язык новых лексических единиц строго ограничено и возможно лишь до индексирования документов, т. е. при создании языка .

  Посткоординируемые (дескрипторные) языки основаны на методе координатного индексирования. В посткоординируемых ИПЯ лексические единицы объединяются в поисковом образе лишь во время индексирования документа. Словарь дескрипторного ИПЯ состоит из специальным образом выбранных отдельных слов или словосочетаний естественного языка — ключевых слов и дескрипторов.

 Координатное  индексирование — индексирование, при котором основное смысловое содержание текста (документа) или информационного запроса представляется в виде сочетания ключевых слов или дескрипторов.

 Ключевые  словаэто наиболее существенные для отображения содержания документа слова и словосочетания, обладающие назывной функцией.

К классификационным  языкам относят :

  • информационно-поисковый язык иерархического типа;
  • информационно-поисковый язык фасетного типа;
  • алфавитно-предметную классификацию.

 Основными показателями эффективности функционирования ДИС являются полнота и точность информационного поиска .

  Полнота информационного поиска R определяется отношением числа найденных релевантных документов A к общему числу релевантных документов С, имеющихся в системе: 

  R=A/C 

 Точность  информационного поиска Р определяется отношением числа найденных релевантных документов А к общему числу документов L, выданных на запрос пользователя :

 P=A/L 

 Наличие среди  отобранных на запрос пользователя  нерелевантных документов называется  информационным шумом  системы.  Коэффициент информационного шума  К определяется отношением нерелевантных  документов (L-A), выданных в ответе пользователю, к общему числу документов L, выданных на запрос пользователя : 

K = (L-A)/ L 
 

2. Классификационные  информационно-поисковые  языки 

 Информационно-поисковые  каталоги, основанные на классификации сведений по определенной предметной области, были первыми системами информационного поиска документов.

Классификация — это группировка объектов по признакам.

 Первоначальные  подходы к классификации тематики документов основывались на формировании списка предметных заголовков, располагаемых в алфавитном порядке. Каждая предметная рубрика получала определенный цифровой или буквенно-цифровой код. Содержание документа индексировалось перечислением кодов тех рубрик, которые отражали темы документа. Это перечислительная классификация.

 Особенностью  систем перечислительной классификации  является возможность индексирования документов любым количеством рубрик, отражающих содержание документа. Для осуществления поиска необходимых документов по классификатору определяются коды интересующих пользователя рубрик и далее отбираются из хранилища те документы, которые проиндексированы соответствующими кодами. Отсутствие систематизированных связей и отношений между предметными рубриками является основным недостатком перечислительной классификации. 

  При систематизированной классификации список предметных рубрик строится как иерархическая структура, в виде перевернутого дерева. Вся предметная область разбивается на ряд взаимоисключающих (непересекающихся) рубрик. Каждая рубрика, в свою очередь, может включать несколько подрубрик. Таким образом, при систематизированной классификации учитываются уже некоторые семантические основы предметной области, выражаемые в родо-видовых отношениях основных категорий, понятий и классов.

  Содержание  документа индексируется кодами соответствующих рубрик, однако при этом отпадает необходимость в явном указании

более общих рубрик, к которым относятся  выделенные подрубрики. В результате индексирование и поиск документов на основе иерархической классификации позволяют более адекватно отражать содержание документов и обеспечивают большую точность поиска.

 Перечислительный  и иерархический подходы к  классификации используются в алфавитно-предметных каталогах библиотек. Недостатком как перечислительной, так и иерархической классификации является принципиальная невозможность заранее перечислить все возможные темы документов.

Информация о работе Информационные технологии документационного обеспечения управленческой деятельности