Российские ученые запатентовали программу для извлечения ключевых слов из научных текстов
Она сочетает статистические методы с лингвистическими знаниями
Сотрудники Южно-Уральского государственного университета (ЮУрГУ) запатентовали программный продукт, предназначенный для автоматического извлечения ключевых слов длиной от одного до четырех компонентов из текстов любых жанров на различных языках. Программа пригодится для решения широкого спектра задач обработки текста, сообщается на сайте вуза – партнера медиасети TV BRICS.
Программа может работать в двух режимах. Первый – полностью автоматический: сервис сам обрабатывает документы и выдает ключевые слова. Второй режим – для специалистов: можно вручную настраивать инструмент под конкретный язык, область знаний или тип текста, а также уточнять, какие именно слова и словосочетания считать ключевыми.
Основной разработчик программы профессор кафедры лингвистики и перевода ЮУрГУ Светлана Шереметьева рассказала, что программа обеспечивает верное извлечение не только высокочастотных, но и низкочастотных грамматически корректных лексических групп.
«Программа легко адаптируется под разные языки и предметные области через интерактивный интерфейс», – пояснила она.
Приложение можно использовать в научных лингво-информационных исследованиях, а также для различных целей работы с текстом, включая когнитивное моделирование, многоязычное индексирование, поиск информации и преподавательскую деятельность.