ПОИСК ИНФОРМАЦИИ В ИНТЕРНЕТЕ
Количество информации, размещенной в Интернете, постоянно увеличивается. В связи с этим возникает проблема поиска данных.
В Интернете существует два типа поисковых систем - классификаторы и поисковые машины. В зависимости от информации, которую необходимо найти, удобнее воспользоваться поисковой системой того или иного типа.
Рис. 7.4. Домашняя страница одного из самых первых классификаторов Yahoo!
Классификаторы хранят упорядоченные списки ссылок на Web-узлы. Обычно каждой ссылке сопутствует краткое описание. Списки упорядочены по тематическим разделам на поисковом сервере. Эти списки образуют иерархическую древовидную структуру. Спускаясь по дереву каталогов, можно последовательно ограничить область поиска и, в конечном итоге, получить список ссылок на Web-узлы, связанные с той темой, которая интересна пользователю.
Использовать классификаторы удобно в том случае, когда тема для поиска достаточно общая. Например, "Вузы Санкт-Петербурга" или "Авиационная промышленность". В первом случае искомый ресурс, скорее всего, будет размещен в разделе "Образование: Вузы: Вузы Санкт-Петербурга", а во втором - в разделе Промышленность: Машиностроение: Авиационная промышленность. При использовании для поиска информации классификаторов необходимо достаточно четко представлять, к какой категории эта информация относится. Кроме того, классификация ресурсов проводится людьми, поэтому часто бывает достаточно субъективна.
Рис. 7.5. Популярный российский классификатор List.ru
Этими недостатками не обладает другой тип поисковых систем - поисковые машины. Поисковые машины просматривают страницы, размещенные в Интернете, и составляют индексы используемых слов. Пользователь вводит искомое слово, набор слов или логическое выражение, и по его запросу поисковая машина выдает список ссылок на страницы, в которых это слово используется.
Одним из основных элементов поисковых машин является индексатор (иногда используется термин "паук") - программный модуль, периодически сканирующий Интернет для сбора данных о состоянии информационных ресурсов.
Эти данные используются для формирования и обновления индекса - массива данных поисковой машины, служащего для поиска адреса информационного ресурса. Основные составляющие индекса - это прямой и инвертированный списки, устанавливающие соответствие между поисковыми терминами и содержащими их документами.
Третий элемент поисковой машины - аппарат поиска, непосредственно обеспечивающий работу пользователя с индексом. Под этим термином подразумевают информационно-поисковый язык системы, пользовательский интерфейс и механизмы осуществления запросов в индексной базе.
Рис. 7.6. Поисковая система AltaVista
Для того чтобы не увеличивать размеры словарей и индексов, введено такое понятие, как вес термина. Он определяется в процессе индексирования и зависит от метода индексирования, который используется данной поисковой машиной.
Методы индексирования делятся на статистические, теоретико-информационные и вероятностные.
В статистических методах документы рассматриваются как точки в информационном пространстве. Чем ближе группы терминов, составляющих документы, тем ближе находятся отображающие их точки. В качестве терминов индексации выбираются понижающие плотность пространства документов.
Теоретико-информационные методы основаны на предположении о том, что наибольшую информационную ценность имеют наименее часто встречающиеся слова. Для оценки полезности термина применяются концепции теории информации.
Вероятностные методы предполагают наличие обучающего множества документов для оценки релевантности результатов обработки запроса. Обучающее множество применяется для вычисления весовых коэффициентов, получаемых путем оценки условной вероятности вхождения термина в данный документ в случае его релевантности (или нерелевантности). На основе этих коэффициентов определяется вес термина.
Рис. 7.7, Форма для запроса на российском поисковом сервере Rambler
При построении индекса реальные документы заменяются поисковыми образами документов. При индексирования нетекстовой информации в поисковые образы входят главным образом универсальные адреса ресурсов, в случае новостей и почтовых списков - поля Subject и Keywords. Из составляющих HTML-документы слов в поисковые образы обычно входят имеющие наибольший вес.
Формальную релевантность вычисляет система, на основании чего ранжируется выборка найденных документов. Реальная релевантность - это оценка самим пользователем ценности найденных документов.
Некоторые поисковые машины показывают дату, когда был проиндексирован тот или иной документ. Это помогает пользователю понять, насколько актуальным является ресурс, ссылку на который выдает поисковая машина. Часто поисковые машины не включают определенные слова в свои индексы или могут не включать эти слова в запросы пользователей. Такими словами обычно считаются предлоги или просто очень часто использующиеся слова. Не включают их ради экономии места на носителях.
Рис. 7.8. Форма для запроса на российском поисковом сервере Яndex
В последнее время Web-серверы, предназначенные для поиска информации в Интернете, сочетают в себе возможности классификаторов и поисковых машин.
Дата добавления: 2015-11-18; просмотров: 505;