ТЕЗАУРУСЫ. ЛИНГВИСТИЧЕСКИЕ ПРИНЦИПЫ ПОСТРОЕНИЯ ТЕЗАУРУСА
3.1. Понятие тезауруса
Тезаурус (от греч. θήσαϋροξ — сокровище, запас) или идеографический словарь (от греч. idea — понятие, представление, идея и grapho — пишу, описываю) — в современной лингвистике: 1) особая разновидность словарей общей или специальной лексики, в которых указаны семантические отношения между лексическими единицами; 2) словарь для поиска какого-либо слова по его смысловой связи с другими словами; 3) определенный способ организации (расположения) слов в словаре; 4) способ организации лексического состава, который позволяет экономно «моделировать мир».
В первом, исконном, значении — хранилище, сокровище термин тезаурус использовал Л.В. Щерба в статье «Опыт общей лексикографии» (противоположение третье: thesaurus — обычный (толковый или переводной) словарь). Ученый пишет: «Когда говорят thesaurus, то нынче у нас чаще всего имеют при этом в виду «Thesaurus linguae latinae», предприятие пяти немецких академий, начатое еще в 1900 г. и до сих пор доведенное с пропусками лишь до буквы М. Характерная особенность этого типа словарей состоит в том, что в них приводятся все решительно слова, встретившиеся в данном языке хотя бы один раз, и что под каждым словом приводятся решительно все цитаты из имеющихся на данном языке текстов. В основе вышеуказанного противоположения - thesaurus -обычный (толковый или переводной) словарь - лежит противоположение «языкового материала» и «языковой системы» - понятия, которые я пытался обосновать в своей статье «О трояком аспекте языковых явлений и об эксперименте в языкознании» [7: 228].
Второе значение этого термина связано с имеющим широкую известность словарем-тезаурусом «Тезаурус английских слов и выражений» П.М. Роже (Roget's Thesaurus of English Words and Phrases, 1852) и его продолжением, словарем О.В. Баранова.
В этой трактовке термин тезаурус обозначает определенный способ организации, расположения лексического состава в словаре (см. третье значение термина).
Четвертое значение термина тезаурус связано с всеобщим признанием такого способа организации лексического состава, который позволяет экономно «моделировать мир». С этой точки зрения тезаурус-словарь представляет собой «систематическое упорядочение лексики какой-либо научной или технической области, а в наиболее общем виде - общелитературной лексики, и более того, всей лексики данного языка».
Согласно Ю.Н. Караулову, общеязыковой тезаурус, фиксируя в структуре и взаимоотношениях своих рубрик, разделов, зон, областей широкие возможности невербального соединения идей, обеспечивает учет человеческих ценностей [13: 5-15].
А.Н. Баранов и Д.О. Добровольский в предисловии «От редакторов» к своему «Словарю-тезаурусу современной русской идиоматики» дают тезаурусу следующее определение - особый вид словаря, отличающийся от других (в частности, толкового, двуязычного и др.) способом организации языкового материала. В тезаурусе языковые единицы представлены не в алфавитном порядке, как в обычном словаре, а сгруппированы на основании их значения [29].
Л.П. Крысин называет тезаурус (идеографический словарь) толковым словарем особого рода, словарем «наоборот». «Если в толковом словаре, пишет ученый, «входом» в словарную статью является слово, а содержанием словарной статьи - толкование смысла этого слова, то в идеографическом словаре «входом» служит смысл, идея (отсюда и название этого вида словарей — идеографические), а содержанием словарной статьи — перечень слов, выражающий данный смысл. И если толковый словарь — незаменимый инструмент при понимании текста, то идеографический может быть использован при порождении текста: очень часто человек хочет выразить определенную мысль, но не может найти подходящих для этого слов; идеографический словарь облегчает эти поиски. Различают два основных вида тезаурусов:
лингвистический тезаурус — словарь, содержащий перечень слов естественного языка, отобранных в результате содержательного анализа текстов и систематизированных в соответствии с принятой классификационной системой;
статистический тезаурус - информационно-поисковый словарь, содержащий перечень слов, отобранных в результате статистического анализа текстов по какой-либо определенной тематике и сгруппированных в словарные статьи на основе частоты совместной встречаемости этих слов в одних и тех же текстах.
Информационно-поисковые тезаурусы (ИПТ) облегчают поиск информации при ее автоматической обработке. ИПТ максимально раскрывают семантические отношения между лексическими единицами. Как сказано в ГОСТе по ИПТ, «тезаурус информационно-поисковый одноязычный — контролируемый и изменяющийся словарь лексических единиц, основанный на лексике одного естественного языка, отображающий семантические отношения между лексическими единицами и предназначенный для обработки и поиска информации».
Основной единицей ИПТ являются термины-дескрипторы . Алфавитная, лексико-семантическая часть ИПТ представляет собой свод дескрипторных статей.
Дескриптивные словари предназначены для полного описания лексики определенной сферы и фиксации всех имеющихся там употреблений; в них фиксируются все имеющиеся релевантные случаи. Типичным примером дескриптивного словаря является «Толковый словарь живого великорусского языка» В.И. Даля (первое издание в четырех томах выходило в 1863— 1866 гг.). Цель его создателя заключалась не в нормировании языка, а в полном описании всего многообразия великорусской речи — в том числе ее диалектных форм просторечия.
Каждая дескрипторная словарная статья начинается дескриптором, при котором ниже в пределах статьи по ГОСТу приводятся синонимы этого дескриптора, а также другие лексические единицы, связанные с основным дескриптором родо-видовыми или ассоциативными отношениями.
Таким образом, тезаурусы, особенно в электронном формате, являются одним из действенных инструментов для описания отдельных предметных областей.
В чистом виде тезаурус встречается редко. В реальных тезаурусах происходит упрощение исходной идеи или добавление посторонней, но потенциально необходимой пользователю информации. Наиболее известными сегодня являются «Русский семантический словарь» Ю.Н. Караулова, «Словарь идентичного названия» Н.Ю. Шведовой, «Тематический словарь русского языка» Л.Г. Смеховой и др.
Резюме. Термин тезаурус Л.В. Щерба употребил применительно к словарю, который фиксировал по возможности все контексты, в которых встречается данное слово. Характерная особенность тезаурусов состоит в том, что в них приводятся все слова, встретившиеся в данном языке хотя бы один раз, и под каждым словом приводятся все цитаты из имеющихся на данном языке текстов. Содержание словаря-тезауруса составляет языковой материал, а обычного словаря — языковой материал и языковая система (термины Л.В. Щербы).
Данная характеристика дополняется перекрестными связями самого разного рода — чаще парадигматическими (синонимическими или антонимическими), которые указывают на общность или противопоставление значений. Кроме того, различного рода ассоц. связями (т.е. синтагм. связями).
Таким образом, задача тезауруса (идеографического словаря) — дать представление о смысловой организации некоторого среза языкового материала, показав основные семантические поля, их внутреннюю структуру и внешние связи. Тезаурус является наглядной демонстрацией системного характера языка, позволяя увидеть множество типов отношений, связывающих отдельные языковые единицы и группы единиц [21].
3.2. История представления концептуального знания о мире в виде тезауруса
Необходимость в расположении слов по сходству, смежности, аналогии их значений ощущалась на всем протяжении обозримой истории человеческой мысли.
Проследить путь зарождения идеи представления концептуального знания о мире в виде тезауруса нам поможет обращение к истории составления тезаурусов (идеографических словарей).
Так, на заре цивилизации, когда люди могли выразить свои мысли на письме лишь при помощи идеограмм и символов, единственно возможным словарем был, вероятно, такой, в котором слова располагались по тематическим группам. Лексикографу в то время просто трудно было найти иной критерий для классификации слов, кроме отношений, существующих в самой действительности.
К сожалению, у нас нет свидетельств того, действительно ли народы, пользовавшиеся идеографическим письмом, располагали подобными словарями. Среди наиболее древних из известных нам попыток идеографической классификации называют Attikai Lexeis греческого грамматика, директора Александрийской библиотеки Аристофана Византийского (умер в 180 году до н. э.).
Во II в. н. э. появляется капитальный труд «Ономастикон», составленный на материале греческого языка лексикографом и софистом Юлием Поллуксом (настоящее имя Полидевк), уроженцем египетского города Навкратис. Ю. Поллукс написал несколько сочинений, но до нас дошел лишь «Ономастикон» (Поллукс Ю. Ономастикон. М., 1956).
Ономастикон состоит из 10 книг. Книги по существу являются отдельными трактатами и содержат в себе наиболее важные слова, относящиеся к той или иной теме. Так, в первой книге говорится о богах и царях; во второй — о людях, их жизни и физиологическом строении; в третьей — о родстве и гражданских отношениях и т. д. Слова, помещенные в словаре, сопровождаются краткими толкованиями. В новое время словарь был впервые опубликован в 1502 г. в Венеции.
Между II и III вв. н. э. в свет выходит замечательный санскритский словарь «Амаракоша» (Амаракоша. Париж, 1839). Его автором является древнеиндийский поэт, грамматик и лексикограф Амара Сина, которого называли «одной из девяти жемчужин, украшающих трон Викрамадитье» [6: 7]. Амаракоша в переводе на русский язык означает сокровищница Амара. Словарь содержит 10 тыс. слов. Для лучшего запоминания толкования значений слов словарные статьи построены в форме стихов. Весь материал словаря разбит на 3 книги. Каждая книга включает в себя несколько глав, а глава в свою очередь при необходимости разбивается на ряд секций. Первая книга посвящена небу, богам и всему тому, что имеет к ним непосредственное отношение. Во второй книге приводятся слова, относящиеся к земле, поселениям, растениям, животным и человеку (сначала человек рассматривается как живое существо, а затем как существо общественное; перед нашими глазами предстает вся кастовая структура современного автору общества; жрецы как поверенные бога находятся на самом верху, а ниже идут военные и цари, еще ниже — землевладельцы, а в самом низу ремесленники, жонглеры, слуги и т.п.). Третья книга является собственно языковой, что явствует из названий шести ее глав.
Словарь стал известен европейским ученым лишь в конце XVIII в., когда в 1798 г. в Риме была опубликована его первая часть. Полностью он был издан с переводом на английский язык в 1808 г. английским санскритологом Г.Т. Коулбруком (Н.Т. Colebrooke). В 1839 г. появился и его французский перевод, выполненный А.Л. Делоншаном (A.L. Deslongchamps). Дальнейшее развитие идеи смысловой классификации лексики связано с проблемой так называемого всемирного языка.
Резюме. Таков в самых общих чертах первый этап развития традиции идеографической классификации лексики. Этот этап можно назвать предысторией идеографических словарей. Теперь целесообразно обратиться к современной классификации словарей-тезаурусов.
Нетрудно заметить, насколько непохожи описанные труды на алфавитные словари. Если в алфавитных словарях подача слов регулируется таким условным и в высокой степени нейтральным инструментом, как алфавит, то при построении идеографического словаря решающее значение приобретает мировоззрение самого лексикографа [6:8].
3.3. Принципы классификации словарей-тезаурусов
Как уже было показано выше, проблема составления классификации тезаурусов не нова и в течение нескольких десятков лет привлекала внимание ряда отечественных и зарубежных лингвистов (К. Марелло, В.В. Морковкин, Л.П. Ступин, В.В. Дубичинский и др.). Результатом исследований в этой области стало создание альтернативных классификаций указанных лексикографических произведений. В основу одной из последних классификаций положены следующие критерии: а) тип смысловых связей между единицами словника; 2) объем словника; 3) генерализованность словника; 4) разработка значения лексем; 5) грамматико-стилистическая квалификация лексем; 6) демонстрация функционирования лексем; 7) количество представленных языков; 8) тип семиотических средств, используемых для семантизации лексем. Названная классификация основывается на созданных ранее классификациях О.М. Карповой [3] и И. Бурханова (Burchanov I. On the Ideographic Description of Stylistically and Pragmatically Relevant Aspects of Lexical Meanings. London, 1996); терминология, используемая в классификации, введена в лексикографический аппарат
В.В. Морковкиным [6], Ю.Н. Карауловым [2], К. Марелло [14]. Критерии классификации сформулированы О.М. Карповой [3]. В то же время К. Марелло выделяет три типа тезаурусов:
кумулятивные, представляющие собой группировки слов без определения их значений;
дефинитивные, толкующие каждую лексическую единицу группировки слов;
дву- и многоязычные тезаурусы для путешественников (Marello C. TheThesaurus//W.D.D. 1990. V. 2. P. 1083).
Кумулятивные тезаурусы не только представляют возможность найти более понятное, точное, стилистически верное слово в ситуации нахождения в определенном семантическом поле, но и становятся основой для формирования тематических компьютерных банков данных.
Дефинитивные тезаурусы могут включать, наряду с определением значения, этимологическую информацию и цитаты из литературных произведений, что показывает непосредственную энциклопедическую направленность этого вида тезаурусов. Кроме того, словари данного вида вводят пользователя в необходимую систему концептов, разъясняют сущность, сходства и различия понятий, их парадигматические и синтагматические связи, иногда дают информацию о произносительных, грамматических, словообразовательных и других возможностях лексических единиц, обозначающих эти понятия.
Дву- и многоязычные тезаурусы для путешественников создаются обычно по тематическим разделам: числа, еда, транспорт, гостиница и т.д. с приведением переводных эквивалентов двух и более языков.
Для максимально полного отображения типов существующих словарей-тезаурусов создается многоуровневая классификация. Во-первых, по типу смысловых связей между единицами словника тезаурусы подразделяются на три крупных класса:
1. Ассоциативный тезаурус (терминология Ю.Н. Караулова
2. Аналогический тезаурус (терминология В.В. Морковкина
3. Идеографический (идеологический) тезаурус (терминология Л.В. Щербы, В.В. Морковкина. Названные три типа тезаурусов отражают следующие виды смысловых связей лексем соответственно:
1. Семантико-синтаксические связи, на основании которых
слова объединяются в группы или пары, предопределенные в своем возникновении и существовании двойными связями: смысловыми и синтаксическими. Смысловые связи слов устанавливаются, главным образом, между глаголами и прилагательными, выполняющими предикативную функцию в предложении, и существительными, например:
а) между действием и органом (инструментом), при помощи которого оно совершается: хватать - рука, видеть - глаз, плыть - лодка и т.д.;
б) между глаголами действия, требующими одного субъекта, и субъектом: лаять - собака, ржать - лошадь и т.д.; в) между глаголами и определенным грамматическим дополнением, которого первые требуют: рубить - дерево, есть - еда и т.д.
Отсюда ассоциативный тезаурус - это словарь-тезаурус, организующий лексические единицы на основании существующих между ними смысловых и синтаксических связей и располагающий группы в соответствии с графической формой слов-центров.
2. Лексико-семантические связи. Объединение в группы с таким типом связи происходит по основному для слов признаку - лексическому значению. При этом также учитываются лексико- грамматические связи, в форме которых реализуются отдельные значения слов.
Таким образом, аналогический тезаурус - это лексикографический справочник, основной единицей макроструктуры которого является лексико-семантическая группа; группы систематизированы в порядке алфавитного следования смысловых доминант.
3. Предметные или тематические связи, где объединение слов в одну группу происходит в силу сходства или общности функций обозначаемых словами предметов и процессов: предметы
домашнего обихода, части тела, виды одежды, постройки и т.д.
Таким образом, идеографический тезаурус - это лексикографическое произведение, представляющее лексические единицы в составе предметных (тематических) групп и организующее их в иерархическую структуру, предназначенную для репрезентации концептуализированного знания о мире.
В рамках того же критерия проводим дальнейшее подразделение типов. Так, идеографический тезаурус представлен 4-мя следующими типами:
Собственно идеографический тезаурус.
Тематический словарь.
Систематический словарь.
Тематико-систематический словарь
Собственно идеографический тезаурус - это особый тип идеографического словаря, макроструктура которого организуется в соответствии с синоптической картой a priori, наложенной на лексический состав языка. В отличие от других типов идеографического словаря, собственно идеографический тезаурус характеризуется логичной и строго упорядоченной классификационной структурой, созданной на основе научной таксономии, даже если лексикографическому описанию подвергается общая лексика (New Webster' Thesaurus. Landoll, 1991).
Тематический словарь - это особый тип идеографического тезауруса, основной единицей макроструктуры которого является тематическая группа, включающая лексемы, объединенные на основе классификации их денотатов (референтов) и рассматриваемые с точки зрения соответствия определенной теме.
Систематический словарь - это особый тип идеографического тезауруса, классификационная структура которого предназначена для представления действительных семантических отношений, существующих между лексическими единицами языка. По своей сути классификационная структура представляет лексико-грамматическую классификацию вокабуляра, иными словами, его парадигматическую структуру, описанную с точки зрения подчинения и сочинения [3: 49].
Тематико-систематический словарь - это особый тип идеографического словаря, представляющий собой сочетание тематического и систематического словаря [5: 30].
Резюме. Рассмотренная классификация лингвистических тезаурусов включает в себя следующие виды словарей: аналогический тезаурус (терминология В.В. Морковкина); идеографический (идеологический) тезаурус (терминология Л.В. Щербы и В.В. Морковкина); ассоц. тезаурус (терминология Ю.Н. Караулова). Далее будут представлены поп. тезаурусы и раскрыты их особенности.
3.4. Популярные тезаурусы и их особенности
Наиболее известный из имеющихся словарей-тезаурусов, которому обязан своим существованием и сам этот термин, создан на материале английского языка; это постоянно переиздаваемый тезаурус П.М. Роже Roget's Thesaurus of English Words and Phrases (1852).
Важно отметить, что автор «Тезауруса английских слов и выражений» в полной мере использовал имеющийся к этому времени опыт. «Принцип, которым я руководствовался, классифицируя слова, — пишет П.М. Роже, — является тем же самым, который используется при классификации особей в различных областях естественной истории. Поэтому разделы, выделенные мной, соответствуют естественным семьям ботаники и зоологии, а ряды слов сцементированы теми же отношениями, которые объединяют естественные ряды растений и животных»
П.М. Роже считал, что убедительная классификация слов по их смыслам невозможна до тех пор, пока должным образом не изучены и не организованы объекты действительности, называемые этими словами. Поэтому он начинает свою работу с расчленения понятийного поля английского языка на четыре больших класса: абстрактные отношения, пространство, материю и дух (разум, воля, чувства). Эти классы разбиваются в дальнейшем на ряд родов, которые в свою очередь распадаются на определенное число видов.
К числу недостатков идеографического словаря П.М. Роже ученые относят следующие: 1) не совсем убедительная номенклатура основных понятийных классов; 2) абстрактная логичность превалирует над естественными связями слов; 3) относительное неудобство пользования (в значительной мере данный недостаток исправлен в последующих изданиях).
В современной русской лексикографии имеется несколько словарей, которые должны быть отнесены к разряду словарей-тезаурусов (идеографических словарей). Это, например, созданный под руководством Ю.Н. Караулова «Русский семантический словарь» [17], «Русский семантический словарь» под редакцией Н.Ю. Шведовой [18], «Тематический словарь русского языка» Л.Г. Саяховой, Д.М. Хасановой и В.В. Морковкина [19], «Словарь лексико-семантических групп русских глаголов» под ред. Э.В. Кузнецовой [20], «Идеографический словарь русского языка» О.С. Баранова [11], «Концептосфера внутреннего мира человека в русском языке» В.И. Убийко [22], комплексный учебный словарь «Лексическая основа русского языка» под руководством В.В. Морковкина [15].
Познакомимся с некоторыми из них.
Словарь-тезаурус современной русской идиоматики» под редакцией А.Н. Баранова и Д.О. Добровольского включает четыре основные части: 1) синопсис; 2) легенду; 3) основной корпус Словаря-тезауруса; 4) указатели. Цель Синопсиса - дать общее представление о структуре Основного корпуса Тезауруса. В нем указаны все таксоны с подтаксонами и соответствующими парадигматическими отсылками. Основной корпус Словаря-тезауруса представляет собой совокупность словарных статей, объединенных в группы (таксоны) и подгруппы (подтаксоны) в соответствии со значением описываемых в них идиом. Каждая статья содержит идиому и примеры ее употребления в современном русском языке. Синопсис, Легенда, Указатели - служебные части вышеназванного Словаря-тезауруса, обеспечивающие пользователю возможность быстро и эффективно работать. Легенда используется в тех случаях, когда не нужны примеры употребления идиом, т.к. она воспроизводит всю информацию, кроме примеров. Фактически, это словник Словаря. Единицами словника являются леммы. Лемма в данном случае представляет собой идиому в исходной (словарной) форме и включает по возможности все ее существенные варианты. Например, идиома стоять на месте входит в состав леммы топтаться на месте, стоять на месте, буксовать на месте.
Словарь содержит два указателя. В конце книги помещена статья «Теоретическая концепция Словаря-тезауруса современной русской идеоматики», в которой подробно анализируются научные особенности данного проекта.
«Русский семантический словарь», созданный под руководством Ю.Н. Караулова включает 10 тыс. русских слов, которые разнесены по 1600 понятийным группам. В основе выделения групп - повторяющиеся элементы толкований слов в толковых словарях: например, «действие», «свойство», «инструмент» и т.п.
«Русский семантический словарь», созданный под руководством академика Н.Ю. Шведовой, основывается на несколько иных принципах, характерных для составления как идеографических, так и толковых словарей. Во-первых, все слова языка разделены здесь на четыре класса: 1) единицы указующие (местоимения), 2) именующие (знаменательные слова), 3) собственно связующие (союзы, предлоги, глаголы-связки), 4) классифицирующие (модальные слова, частицы, междометия). Во-вторых, внутри каждого класса все слова распределены по частям речи. В-третьих, внутри каждой части речи выделены множества и подмножества на основании тематической близости или, наоборот, противопоставленности значений слов.
DUDEN - это книга с картинками (чертежами) на левой стороне (по разным ПО) с пронумерованными деталями (до мельчайших). На правой стороне этот нумерованный список сопровождается названиями (даже на двух языках). Например, на целой странице нарисованы железнодорожная техника, станции, пути. Справа - названия стрелок, семафоров, костылей и т.п.
«Тематический словарь русского языка» Л.Г. Саяховой, Д.М. Хасановой и В.В. Морковкина содержит 25 тыс. лексических единиц, сгруппированных по трем крупным классам: «Человек», «Общество», «Природа», которые ступенчато ветвятся на более мелкие подклассы. Например, в классе «Человек» выделяются подклассы «Тело и организм человека», «Жизнь человека», «Внешний вид, наружность человека», «Эмоциональный вид человека» и др. Каждый из подклассов в свою очередь разбивается на еще более частные: «Эмоциональный мир человека» — «Психические свойства человека» — «Темперамент», «Характер» — «Общие черты характера» и т.д. Значение и употребление слов, относящихся к каждому классу, иллюстрируются наиболее употребительными словосочетаниями. Например, слово «смех», находящееся в подгруппе «выражение чувств, эмоций» класса «Человек», сопровождается указанием таких сочетаний с этим словом, как веселый смех, радостный смех, смех ребенка, заливаться смехом и др.
Резюме. Одним из действенных инструментов описания отдельных предметных областей, особенно в электронном формате, являются тезаурусы.
Термин тезаурус уже давно широко используется в лингвистике для обозначения специального типа словарей, в той или иной степени отражающих «картину мира», «языковую модель мира» (по Ю.Н. Караулову). Тезаурус как «сокровищница» вырос в своем смысловом объеме, получил новое значение. Им стали называть словарь, не просто вбирающий в себя все лексические богатства языка, а упорядочивающий их определенным логико-системным образом. В словаре-тезаурусе слова сводятся в группы, а объединение это происходит на основе способности того или иного слова передавать определенное понятие.
Тезаурус-словарь всегда рассматривался в лингвистике как некоторая универсальная система, обеспечивающая хранение коллективного (для того или иного социума) знания о мире в вербальной форме. В отличие от других словарей в тезаурусе-словаре это знание хранится в структурированной форме, отражающей наши представления о «структуре мира».
Наиболее известными и популярными тезаурусами в настоящее время являются английский Тезаурус Роже, Идеографический словарь русского языка О.В. Баранова, Русский семантический словарь Ю.Н. Караулова, Русский семантический словарь академика Н.Ю. Шведовой, DUDEN, Тематический словарь русского языка Л.Г. Саяховой, Д.М. Хасановой и В.В. Морковкина.
<== предыдущая лекция | | | следующая лекция ==> |
Основные характеристики усвоения | | | Выбор информативных показателей средствами описательной статистики |
Дата добавления: 2018-06-28; просмотров: 4768;