Новости НКРЯ
Существенно улучшена функциональность основного корпуса: в нем появилась лексико-грамматическая разметка с автоматическим разрешением омонимии и автоматическая синтаксическая разметка. Теперь в основном корпусе разведены морфологические омонимы, а также появилась возможность задавать поиск по таким синтаксическим параметрам, как типы сложных предложений, предикативных групп (клауз), дополнения, связки, обращения и многим другим. Новая разметка сделала доступными в основном корпусе все новейшие функции, появившиеся ранее в корпусе региональных СМИ: Поиск коллокаций, Частотный словарь, Частотность выдачи.
Кроме того, в основном и газетных корпусах появилась возможность задавать поиск лемм и словоформ с использованием регулярных выражений (β-версия), а также статистика корпуса и подкорпуса в виде таблицы с объемом в текстах и словах, географической карты (только для корпуса региональных СМИ) и диаграммы значений метаатрибутов, что дает пользователям возможность сравнивать заданный подкорпус с корпусом, в том числе визуально.
Существенно обновлен интерфейс церковнославянского корпуса, корпус подключен к обзору возможностей.
Мультимедийный корпус пополнен до 5,7 млн словоупотреблений.
Параллельный корпус пополнен до 168 млн словоупотреблений. В нем появились новые языковые пары: сербско-русская и словенско-русская (по 2 млн словоупотреблений каждая), а также небольшие пилотные корейско-русская и хинди-русская языковые пары с транслитерацией и словарной поддержкой. Последние две пары впервые в истории параллельного корпуса включают выровненные поэтические тексты. Пополнены новыми текстами также чешско-русская и испанско-русская языковые пары.
Существенно обновлен интерфейс старорусского корпуса, корпус подключен к обзору возможностей.
В региональном корпусе появился новый вид выдачи — Частотность, с помощью которого можно проанализировать статистическое распределение результатов поиска по леммам, словоформам и набору грамматических признаков. Частотность рассчитывается на основе разборов с автоматически снятой омонимией по случайной подвыборке размером 1 млн результатов поиска. Пользователи могут управлять уровнем доверительной вероятности для сравнения доверительных интервалов частотности.
Диалектный корпус пополнен до 604 тыс. словоупотреблений.
Синтаксический корпус пополнен на 30 тыс. словоупотреблений.
В частотных словарях корпуса и подкорпуса теперь выводится 500 лемм вместо 100.
НКРЯ подвел итоги 2022-го года в Корпусе. Изменений в этом году много – объем Корпуса вырос в полтора раза и достиг 1,5 млрд словоупотреблений, в составе НКРЯ появилось два новых корпуса – Панхронический и «От 2 до 15», корпус берестяных грамот стал параллельным, в региональном корпусе появились автоматически снятая омонимия и новый функционал, связанный с сочетаемостью и частотностью. Закрыта старая версия Корпуса. Кроме того, НКРЯ переходит на новый интерфейс. Подробнее все изменения показаны на рисунке.
Каждый корпус в составе НКРЯ получил свой собственный Портрет. Функционал «Портрет корпуса» задуман как инструмент, позволяющий пользователю НКРЯ проанализировать особенности корпуса и оценить, подходит ли корпус для решения его исследовательских или учебных задач. В портрет корпуса на данном этапе входит:
* описание корпуса
* частотный словарь (только в корпусе Региональных СМИ)
Все корпуса НКРЯ размечены тегами, позволяющими классифицировать корпуса по историческому периоду, типам текстов, наличию специфической разметки и т.д.
При наличии пользовательского подкорпуса пользователи также получают доступ к «Портрету подкорпуса». С помощью этого инструмента, нажав на (i) в шапке подкорпуса, можно увидеть список отобранных текстов, а также сравнить статистические характеристики подкорпуса и корпуса. Например, можно сравнить частотные словари регионального корпуса и отобранного в нем подкорпуса.
В 2023 году в портретах корпуса и подкорпуса появится больше статистических данных.
Корпус берестяных грамот пополнен текстами археологических находок 2021-го года, опубликованными в 2022-ом году: это очередные грамоты из Великого Новгорода и Старой Руссы, а также первая грамота из Переяславля Рязанского (современной Рязани).
В составе НКРЯ появился корпус «От 2 до 15», включающий 75 прозаических произведений отечественных и зарубежных авторов, которые читают современные дети и подростки. Главная отличительная особенность нового корпуса — автоматическая разметка фрагментов текста по возрасту читателей, которым эти фрагменты должны быть понятны. Модель работает в экспериментальном режиме, поэтому в разметке пока могут встречаться ошибки.
Существенно обновлен интерфейс обучающего корпуса, корпус подключен к «Обзору возможностей», обновлено и уточнено описание корпуса.
Разработан раздел «Упражнения на основе Корпуса», в котором представлены упражнения, составленные на материале Обучающего корпуса и других корпусов НКРЯ. Упражнения относятся к разным разделам школьного курса русского языка и предназначены для самостоятельной работы на уроке и дома, а также для контроля знаний. Мы планируем развивать и пополнять раздел новыми заданиями и приглашаем учителей и преподавателей принять в этом участие. Присылайте свои уникальные упражнения на адрес info@ruscorpora.ru с темой письма «Упражнения», и мы разместим их в этом разделе.
В составе Национального корпуса русского языка создан Панхронический корпус. Он объединяет три исторических – древнерусский, корпус берестяных грамот и старорусский – и основной корпус. В совокупности Панхронический корпус охватывает тысячелетие истории русского языка, от 1020-х до 2020-х годов. В Панхроническом корпусе можно сформулировать запрос и найти результаты одновременно на всем этом хронологическом диапазоне.
Для этого мы унифицировали подачу лексической, орфографической и семантической разметки. Лемму можно задавать и в раннедревнерусском виде (съвѣдѣтель), и в позднем/старорусском (свѣдѣтель или свидѣтель), и в современном виде (свидетель): по каждому из этих запросов находятся и древние, и современные примеры. Точно так же в разном облике можно указывать и словоформы. Исторические тексты получили лексико-семантическую аннотацию.
Теперь пользователю доступны конкордансы и частотные графики на протяжении всех десяти веков по таким запросам, как «предлог по с предложным падежом», «история существительного забава», «сочетаемость глаголов движения с абстрактным субъектом», «имена собственные на -славъ».
В корпусе региональных СМИ появилась возможность искать коллокации. Для поиска применяется статистический подход, то есть коллокациями считаются такие сочетания слов, которые встречаются совместно чаще, чем случайно. Для подсчета используются меры Dice, Loglikelihood, t-score, MI3 и агрегированная мера (геометрическое среднее мер t-score и MI3.
Подробнее о новой функциональности см. здесь.
Параллельный корпус пополнен до 168,8 млн словоупотреблений. Новыми текстами расширены английская, немецкая, французская, испанская и чешская языковые пары.
Церковнославянский корпус пополнен до 5,3 млн словоупотреблений. В него частично вошли «Зеленые минеи» издания 2002 года в гражданской печати. Церковнославянский корпус получил более подробную метатекстовую разметку: все тексты размечены по дате издания, произведения Нового времени снабжены датировками и указаниями на авторство, а новые (с XVIII в.) литургические тексты — еще и сведениями об их разработке и утверждении.
Старорусский корпус пополнен до 8,8 млн словоупотреблений. Новые тексты — это том «Библиотеки литературы древней Руси», посвященный XVII веку (прозаические повести и песни), ранние тексты из «Писем и бумаг Петра Великого», посольская книга XVI в. по связям с Крымским ханством. Исправлена и дополнена морфологическая разметка ранее включенных в корпус текстов.
Обновлен интерфейс поиска по газетному и региональному корпусам. Мы включили газетные корпуса в Обзор возможностей, переработано и дополнено их описание на русском и английском языках.
В новом интерфейсе сайта ruscorpora.ru произошли следующие изменения:
На главной странице, нажав на ссылку «все корпуса», теперь можно открыть полный список, состоящий из 38 корпусов (включая все двуязычные пары параллельного корпуса, все исторические корпуса и др.). Перейти на форму поиска по любому корпусу можно, кликнув на его название.
На странице «Статистика» также приведен полный список корпусов с данными о количестве текстов, предложений и словоупотреблений.
Усовершенствованы формы поиска и отбора подкорпуса для всех корпусов, переведенных на новый интерфейс. Форма лексико-грамматического поиска развернута по умолчанию, при желании пользователь может раскрыть строку запроса поиска точных форм. Поле ввода леммы отображается первым в списке полей. При отборе подкорпуса предоставлена возможность выбрать диапазон дат обновления версий корпуса.
С помощью меню на кнопке «Искать» пользователь теперь может выбрать предпочтительный для себя вид выдачи (конкорданс, KWIC, графики, n-граммы). Выбор пользователя автоматически запоминается в браузере и показывается при следующих посещениях.
Во всплывающем окне при клике на слово в тестовом режиме отображаются «Похожие слова», т.е. слова, которые близко связаны с данным словом по смыслу и употребляются в схожих контекстах. Коэффициент близости слов, приведенный в скобках, подсчитывается с помощью моделей дистрибутивной семантики, построенных на материале основного корпуса НКРЯ и предоставленных проектом RusVectōrēs. Подробнее об этом эксперименте см. здесь.
Планируется постепенный перевод остальных корпусов на новый интерфейс и новую платформу. Просим вас активно пользоваться новой версией сайта и сообщать нам о всех замеченных ошибках.
Акцентологический корпус пополнен до 133,8 млн словоупотреблений.
Устный корпус пополнен до 13,9 млн словоупотреблений.
В наших больших корпусах появились новые типы разметки с использованием нейросетевых методов — это лексико-грамматическая разметка с автоматическим разрешением омонимии и автоматическая синтаксическая разметка. Сегодня поиск по такой разметке открыт в Газетном корпусе региональных СМИ, на следующем этапе он станет доступен для основного и газетного корпусов.
На всем объёме регионального корпуса автоматически разведены морфологические омонимы: например, существительное печь теперь размечено иначе, чем глагол печь, а дательный падеж — чем предложный. Можно искать такие синтаксические параметры, как разные типы сложных предложений, предикативных групп (клауз), дополнения, связки, обращения и многое другое. Синтаксическая разметка в региональном корпусе устроена иначе, чем в отдельном синтаксическом корпусе, и сильнее ориентирована на синтаксис составляющих.
Просим вас активно пользоваться новыми возможностями поиска и сообщать нам о всех замеченных ошибках.
В синтаксическом корпусе существенно пополнена информация о текстах: теперь пользователю показываются пол автора, сфера функционирования, тема и тип текста, издание и дата разметки. Для предложений с неоднословными оборотами (например, потому что или по меньшей мере) показывается два варианта структуры предложения: с пословным разбором и с разбором, где оборот представлен как одно слово. Объем корпуса вырос до 1,5 млн словоупотреблений.