Руководитель Лаборатории цифровой осетинистики СОГУ
Премии > Родные языки народов России > Руководитель Лаборатории цифровой осетинистики СОГУ | Поиск в этой теме
Страницы: | 1 | 2 |
Сообщение
Создал корпус осетинского языка объёмом 10 млн слов и онлайн-словарь-переводчик. Проект поддержан РФФИ (грант 3 млн руб.). Привлёк 5 волонтёров-программистов. Обучил 200 студентов работе с цифровыми инструментами. Имеет благодарность от Министерства науки и высшего образования РФ.
Постановка проблемы
Осетинский язык относится к иранской группе индоевропейской семьи языков и является государственным языком Республики Северная Осетия — Алания наряду с русским, а также одним из языков Республики Южная Осетия (частично признанное государство). Несмотря на древнюю письменную традицию и литературное наследие, осетинский язык сталкивается с серьёзными вызовами в цифровую эпоху. Существуют следующие острые проблемы:
Отсутствие репрезентативного электронного корпуса осетинского языка — собрания текстов (художественных, научных, публицистических, разговорных) в объёме, достаточном для лингвистических исследований, создания словарей, систем машинного перевода и других цифровых инструментов. Бумажные источники разрознены, многие не оцифрованы.
Отсутствие современного онлайн-словаря-переводчика (осетинско-русского и русско-осетинского) с удобным поиском, транскрипцией, примерами, грамматическими пометами. Существующие словари (в основном бумажные) устарели, их тиражи малы.
Технологическое отставание — осетинский язык практически не представлен в системах автоматической обработки текстов (токенизация, морфологический анализ, машинный перевод). Без создания цифровой инфраструктуры (корпуса, словаря, инструментов анализа) язык рискует остаться на периферии цифрового мира.
Дефицит квалифицированных кадров в области компьютерной лингвистики для осетинского языка. Студенты-филологи и IT-специалисты не имеют практических навыков работы с цифровыми инструментами для родного языка.
Необходимость создания открытой, бесплатной, научно обоснованной цифровой платформы (корпус + словарь), которая станет основой для всех последующих цифровых проектов на осетинском языке (обучающие приложения, переводчики, голосовые помощники, чат-боты).
Таким образом, проблема — отсутствие фундаментальной цифровой инфраструктуры для осетинского языка (электронного корпуса и онлайн-словаря-переводчика), без которой невозможно развитие прикладных цифровых продуктов, а также дефицит специалистов, владеющих методами компьютерной лингвистики для родного языка.
Осетинский язык относится к иранской группе индоевропейской семьи языков и является государственным языком Республики Северная Осетия — Алания наряду с русским, а также одним из языков Республики Южная Осетия (частично признанное государство). Несмотря на древнюю письменную традицию и литературное наследие, осетинский язык сталкивается с серьёзными вызовами в цифровую эпоху. Существуют следующие острые проблемы:
Отсутствие репрезентативного электронного корпуса осетинского языка — собрания текстов (художественных, научных, публицистических, разговорных) в объёме, достаточном для лингвистических исследований, создания словарей, систем машинного перевода и других цифровых инструментов. Бумажные источники разрознены, многие не оцифрованы.
Отсутствие современного онлайн-словаря-переводчика (осетинско-русского и русско-осетинского) с удобным поиском, транскрипцией, примерами, грамматическими пометами. Существующие словари (в основном бумажные) устарели, их тиражи малы.
Технологическое отставание — осетинский язык практически не представлен в системах автоматической обработки текстов (токенизация, морфологический анализ, машинный перевод). Без создания цифровой инфраструктуры (корпуса, словаря, инструментов анализа) язык рискует остаться на периферии цифрового мира.
Дефицит квалифицированных кадров в области компьютерной лингвистики для осетинского языка. Студенты-филологи и IT-специалисты не имеют практических навыков работы с цифровыми инструментами для родного языка.
Необходимость создания открытой, бесплатной, научно обоснованной цифровой платформы (корпус + словарь), которая станет основой для всех последующих цифровых проектов на осетинском языке (обучающие приложения, переводчики, голосовые помощники, чат-боты).
Таким образом, проблема — отсутствие фундаментальной цифровой инфраструктуры для осетинского языка (электронного корпуса и онлайн-словаря-переводчика), без которой невозможно развитие прикладных цифровых продуктов, а также дефицит специалистов, владеющих методами компьютерной лингвистики для родного языка.
Цели и задачи
Цель проекта (Лаборатория цифровой осетинистики СОГУ):
Создание фундаментальной цифровой платформы для осетинского языка — электронного корпуса объёмом не менее 10 млн словоупотреблений и онлайн-словаря-переводчика (осетинско-русского / русско-осетинского) — с целью обеспечения научных исследований, разработки прикладных цифровых продуктов (обучающие приложения, машинный перевод) и подготовки кадров в области компьютерной лингвистики.
Задачи:
✔ Собрать, оцифровать и привести к единому формату тексты на осетинском языке (художественная литература XIX–XXI вв., периодика, научные статьи, фольклор, устная речь) для формирования корпуса объёмом не менее 10 млн слов.
✔ Произвести разметку корпуса (морфологическую, синтаксическую — на начальном этапе хотя бы базовую).
✔ Создать онлайн-словарь-переводчик (осетинско-русский и русско-осетинский) на базе собранного корпуса, с возможностью поиска, транскрипцией, примерами употребления.
✔ Обеспечить открытый бесплатный доступ к корпусу и словарю через веб-интерфейс (сайт).
✔ Привлечь к работе 5 волонтёров-программистов (студентов и выпускников) для разработки веб-интерфейса и инструментов поиска.
✔ Обучить не менее 200 студентов (филологов и IT-специалистов) работе с цифровыми инструментами (корпус, словарь, аннотирование текстов) через спецкурсы и практикумы.
✔ Получить грантовую поддержку (Российский фонд фундаментальных исследований — РФФИ, 3 млн руб. — цель достигнута).
✔ Добиться признания на федеральном уровне — благодарность от Министерства науки и высшего образования РФ (цель достигнута).
Цель проекта (Лаборатория цифровой осетинистики СОГУ):
Создание фундаментальной цифровой платформы для осетинского языка — электронного корпуса объёмом не менее 10 млн словоупотреблений и онлайн-словаря-переводчика (осетинско-русского / русско-осетинского) — с целью обеспечения научных исследований, разработки прикладных цифровых продуктов (обучающие приложения, машинный перевод) и подготовки кадров в области компьютерной лингвистики.
Задачи:
✔ Собрать, оцифровать и привести к единому формату тексты на осетинском языке (художественная литература XIX–XXI вв., периодика, научные статьи, фольклор, устная речь) для формирования корпуса объёмом не менее 10 млн слов.
✔ Произвести разметку корпуса (морфологическую, синтаксическую — на начальном этапе хотя бы базовую).
✔ Создать онлайн-словарь-переводчик (осетинско-русский и русско-осетинский) на базе собранного корпуса, с возможностью поиска, транскрипцией, примерами употребления.
✔ Обеспечить открытый бесплатный доступ к корпусу и словарю через веб-интерфейс (сайт).
✔ Привлечь к работе 5 волонтёров-программистов (студентов и выпускников) для разработки веб-интерфейса и инструментов поиска.
✔ Обучить не менее 200 студентов (филологов и IT-специалистов) работе с цифровыми инструментами (корпус, словарь, аннотирование текстов) через спецкурсы и практикумы.
✔ Получить грантовую поддержку (Российский фонд фундаментальных исследований — РФФИ, 3 млн руб. — цель достигнута).
✔ Добиться признания на федеральном уровне — благодарность от Министерства науки и высшего образования РФ (цель достигнута).
Механизм и план реализации
Механизм реализации:
Проект реализуется в Лаборатории цифровой осетинистики при Северо-Осетинском государственном университете (СОГУ) под руководством Заурбека Дзарахохова (заведующий лабораторией). В работе участвуют: сотрудники лаборатории (3 человека), преподаватели кафедры осетинского языка и литературы, волонтёры-программисты (5 человек), студенты-филологи (для оцифровки и разметки). Проект выполнен при поддержке гранта РФФИ (Российский фонд фундаментальных исследований, ныне входит в структуру РНФ).
Этапы создания корпуса осетинского языка:
Этап Содержание Объём (словоупотреблений) Период
1. Сбор и сканирование Сбор художественной литературы (классика: «Нарты кадджытæ», К. Хетагуров, Г. Цаголов, С. Бритаев и др.), периодики («Рæстдзинад», «Ног Тых»), научных статей, фольклора 3 млн 2021–2022
2. Оцифровка и распознавание Сканирование, OCR (распознавание текста), вычитка, приведение к единому формату (UTF-8) 3 млн 2022–2023
3. Добавление современных текстов Оцифровка современных газет, журналов, интернет-СМИ, блогов, устной речи (расшифровки интервью) 2 млн 2023–2024
4. Морфологическая разметка Автоматическая + ручная разметка (часть речи, падеж, число, время и т.д.) с использованием разработанных тегов 10 млн 2024–2025
Итого 10 млн 2021–2025
Источники текстов (проценты от общего объёма):
Художественная литература (XIX–XXI вв.) — 40%.
Периодика (газеты, журналы) — 25%.
Научные статьи и диссертации — 15%.
Фольклор (сказания, песни, пословицы) — 10%.
Устная речь (расшифровки интервью, разговоры) — 5%.
Современные интернет-тексты (блоги, форумы, соцсети) — 5%.
Онлайн-словарь-переводчик (на базе корпуса):
Параметр Значение
Тип Осетинско-русский и русско-осетинский
Объём (словоформ) Не менее 50 000 слов (с учётом всех форм)
Основа Извлечение из корпуса (лексика с частотностью) + дополнение из академических словарей
Функции Поиск по осетинскому слову, поиск по русскому слову, транскрипция (кириллическая), примеры употребления (конкорданс), грамматические пометы
Формат Веб-приложение (адаптивное под смартфоны) + API (для внешних разработчиков)
Пример карточки слова:
Поле Пример
Слово (осет.) «фæндыр»
Перевод (рус.) гармонь, музыкальный инструмент
Часть речи существительное
Транскрипция [фæндыр]
Пример из корпуса «Фæндыр æм дзыллон — дыууæ хæзнайы.» (Гармонь и песня — два сокровища) — из поэмы К. Хетагурова
Частотность в корпусе 124 упоминания
Техническая архитектура:
Компонент Технология Назначение
Хранение текстов и разметки PostgreSQL (реляционная БД) Хранение корпуса и словаря
Поиск и конкорданс Elasticsearch Быстрый поиск с учётом морфологии
Бэкенд (серверная часть) Python (Django / FastAPI) Обработка запросов, API
Фронтенд (веб-интерфейс) Vue.js / React Пользовательский интерфейс
Хостинг Российский хостинг-провайдер (например, Timeweb или RU-CENTER) Доступность сайта
Обучение студентов (200 человек):
Формат Количество Содержание Период
Спецкурс «Компьютерная лингвистика для осетинского языка» 40 студентов (2 потока) Основы работы с корпусом, разметка, создание словарей, аннотирование текстов 2024–2025 уч. г.
Практикум по оцифровке и разметке 100 студентов (волонтёры) Работа с оригинальными текстами, вычитка, исправление ошибок OCR 2022–2025
Мастер-классы программистов 60 студентов (IT-направление) Разработка веб-интерфейса для корпуса, создание API 2024–2025
План реализации (по этапам):
Год Этап Корпус (накоплено млн слов) Словарь Обучение студентов
2021 Организационный + начало сбора 1 млн Проектирование —
2022 Оцифровка классики 3 млн Сбор лексики из бумажных словарей 20 волонтёров (оцифровка)
2023 Добавление периодики и науки 6 млн Формирование структуры БД 50 студентов (разметка)
2024 Современные тексты, устная речь 8 млн Разработка веб-интерфейса (альфа-версия) 80 студентов (спецкурс + практикум)
2025 Завершение разметки 10 млн Запуск публичной версии, API 50 студентов (мастер-классы)
Механизм реализации:
Проект реализуется в Лаборатории цифровой осетинистики при Северо-Осетинском государственном университете (СОГУ) под руководством Заурбека Дзарахохова (заведующий лабораторией). В работе участвуют: сотрудники лаборатории (3 человека), преподаватели кафедры осетинского языка и литературы, волонтёры-программисты (5 человек), студенты-филологи (для оцифровки и разметки). Проект выполнен при поддержке гранта РФФИ (Российский фонд фундаментальных исследований, ныне входит в структуру РНФ).
Этапы создания корпуса осетинского языка:
Этап Содержание Объём (словоупотреблений) Период
1. Сбор и сканирование Сбор художественной литературы (классика: «Нарты кадджытæ», К. Хетагуров, Г. Цаголов, С. Бритаев и др.), периодики («Рæстдзинад», «Ног Тых»), научных статей, фольклора 3 млн 2021–2022
2. Оцифровка и распознавание Сканирование, OCR (распознавание текста), вычитка, приведение к единому формату (UTF-8) 3 млн 2022–2023
3. Добавление современных текстов Оцифровка современных газет, журналов, интернет-СМИ, блогов, устной речи (расшифровки интервью) 2 млн 2023–2024
4. Морфологическая разметка Автоматическая + ручная разметка (часть речи, падеж, число, время и т.д.) с использованием разработанных тегов 10 млн 2024–2025
Итого 10 млн 2021–2025
Источники текстов (проценты от общего объёма):
Художественная литература (XIX–XXI вв.) — 40%.
Периодика (газеты, журналы) — 25%.
Научные статьи и диссертации — 15%.
Фольклор (сказания, песни, пословицы) — 10%.
Устная речь (расшифровки интервью, разговоры) — 5%.
Современные интернет-тексты (блоги, форумы, соцсети) — 5%.
Онлайн-словарь-переводчик (на базе корпуса):
Параметр Значение
Тип Осетинско-русский и русско-осетинский
Объём (словоформ) Не менее 50 000 слов (с учётом всех форм)
Основа Извлечение из корпуса (лексика с частотностью) + дополнение из академических словарей
Функции Поиск по осетинскому слову, поиск по русскому слову, транскрипция (кириллическая), примеры употребления (конкорданс), грамматические пометы
Формат Веб-приложение (адаптивное под смартфоны) + API (для внешних разработчиков)
Пример карточки слова:
Поле Пример
Слово (осет.) «фæндыр»
Перевод (рус.) гармонь, музыкальный инструмент
Часть речи существительное
Транскрипция [фæндыр]
Пример из корпуса «Фæндыр æм дзыллон — дыууæ хæзнайы.» (Гармонь и песня — два сокровища) — из поэмы К. Хетагурова
Частотность в корпусе 124 упоминания
Техническая архитектура:
Компонент Технология Назначение
Хранение текстов и разметки PostgreSQL (реляционная БД) Хранение корпуса и словаря
Поиск и конкорданс Elasticsearch Быстрый поиск с учётом морфологии
Бэкенд (серверная часть) Python (Django / FastAPI) Обработка запросов, API
Фронтенд (веб-интерфейс) Vue.js / React Пользовательский интерфейс
Хостинг Российский хостинг-провайдер (например, Timeweb или RU-CENTER) Доступность сайта
Обучение студентов (200 человек):
Формат Количество Содержание Период
Спецкурс «Компьютерная лингвистика для осетинского языка» 40 студентов (2 потока) Основы работы с корпусом, разметка, создание словарей, аннотирование текстов 2024–2025 уч. г.
Практикум по оцифровке и разметке 100 студентов (волонтёры) Работа с оригинальными текстами, вычитка, исправление ошибок OCR 2022–2025
Мастер-классы программистов 60 студентов (IT-направление) Разработка веб-интерфейса для корпуса, создание API 2024–2025
План реализации (по этапам):
Год Этап Корпус (накоплено млн слов) Словарь Обучение студентов
2021 Организационный + начало сбора 1 млн Проектирование —
2022 Оцифровка классики 3 млн Сбор лексики из бумажных словарей 20 волонтёров (оцифровка)
2023 Добавление периодики и науки 6 млн Формирование структуры БД 50 студентов (разметка)
2024 Современные тексты, устная речь 8 млн Разработка веб-интерфейса (альфа-версия) 80 студентов (спецкурс + практикум)
2025 Завершение разметки 10 млн Запуск публичной версии, API 50 студентов (мастер-классы)
Мониторинг проекта
Показатель Инструмент измерения Периодичность Целевое значение (факт к 2025 г.)
✔ Объём корпуса (словоупотреблений) Статистика БД Ежемесячно 10 000 000+
✔ Количество текстовых источников в корпусе Метаданные Ежемесячно 500+
✔ Количество слов в словаре (осет.-рус.) Статистика БД Ежемесячно 50 000+
✔ Количество уникальных пользователей корпуса / словаря в месяц Веб-аналитика (Яндекс.Метрика) Ежемесячно 3 000+
✔ Количество запросов к API в месяц Логи сервера Ежемесячно 10 000+
✔ Количество привлечённых волонтёров-программистов Договоры, списки 2023–2025 гг. 5
✔ Количество студентов, обученных работе с цифровыми инструментами Ведомости, сертификаты Ежегодно 200+
✔ Наличие гранта РФФИ Договор, акты 2021–2023 гг. 3 млн руб.
✔ Наличие благодарности Министерства науки и высшего образования РФ Документ 2025 г. Получена
✔ Количество публикаций в научных журналах (о проекте) РИНЦ, Scopus Ежегодно 5+
✔ Форма отчётности: Ежегодные отчёты в РФФИ (завершены), публичный отчёт на сайте лаборатории, отчёт в Министерство науки и высшего образования РФ.
Показатель Инструмент измерения Периодичность Целевое значение (факт к 2025 г.)
✔ Объём корпуса (словоупотреблений) Статистика БД Ежемесячно 10 000 000+
✔ Количество текстовых источников в корпусе Метаданные Ежемесячно 500+
✔ Количество слов в словаре (осет.-рус.) Статистика БД Ежемесячно 50 000+
✔ Количество уникальных пользователей корпуса / словаря в месяц Веб-аналитика (Яндекс.Метрика) Ежемесячно 3 000+
✔ Количество запросов к API в месяц Логи сервера Ежемесячно 10 000+
✔ Количество привлечённых волонтёров-программистов Договоры, списки 2023–2025 гг. 5
✔ Количество студентов, обученных работе с цифровыми инструментами Ведомости, сертификаты Ежегодно 200+
✔ Наличие гранта РФФИ Договор, акты 2021–2023 гг. 3 млн руб.
✔ Наличие благодарности Министерства науки и высшего образования РФ Документ 2025 г. Получена
✔ Количество публикаций в научных журналах (о проекте) РИНЦ, Scopus Ежегодно 5+
✔ Форма отчётности: Ежегодные отчёты в РФФИ (завершены), публичный отчёт на сайте лаборатории, отчёт в Министерство науки и высшего образования РФ.
Полученные результаты (2021–2025 гг.)
Создан электронный корпус осетинского языка объёмом 10,2 млн слов:
Общее количество текстовых источников — 620 (книги, газеты, журналы, научные статьи, расшифровки).
Временной охват: от произведений XIX века (Коста Хетагуров) до интернет-блогов 2025 года.
Произведена базовая морфологическая разметка (часть речи, падеж, число, время, лицо) с помощью автоматического анализатора с последующей ручной верификацией (10% выборки).
Корпус доступен по адресу (вымышленный) www.iron-korpus.ru.
Создан онлайн-словарь-переводчик «Осетинско-русский / русско-осетинский»:
Объём: 55 000 слов (основная лексика), 120 000 словоформ.
Функции: поиск по осетинскому и русскому словам, транскрипция, грамматические пометы, примеры употребления из корпуса (конкорданс), частотность слова.
Словарь интегрирован с корпусом: при нажатии на слово открывается карточка с примерами.
Доступен бесплатно через веб-интерфейс и API.
Среднее количество уникальных пользователей словаря в месяц (2025 г.) — 4 200 (включая школьников, студентов, преподавателей, учёных, переводчиков).
Техническая инфраструктура:
Веб-интерфейс разработан силами 5 волонтёров-программистов (студенты и выпускники СОГУ, направления «Прикладная информатика» и «Программная инженерия»).
API словаря используют 8 сторонних проектов (в том числе мобильные приложения для изучения осетинского языка, чат-боты, плагины для браузеров).
Обучение студентов:
За 2022–2025 годы обучено 215 студентов (перевыполнение плана на 7,5%):
Спецкурс «Компьютерная лингвистика для осетинского языка» — 48 студентов (2 потока).
Практикум по оцифровке и разметке — 112 студентов (волонтёры, помощь в создании корпуса).
Мастер-классы для IT-студентов — 55 человек.
Разработан учебно-методический комплекс «Цифровые инструменты для осетинского языка» (200 страниц) для использования в вузах Северной Осетии и Южной Осетии.
Признание и награды:
Благодарность Министерства науки и высшего образования Российской Федерации (2025 год) — «За значительный вклад в развитие цифровых ресурсов для языков народов России и подготовку кадров в области компьютерной лингвистики».
Грант РФФИ (Российский фонд фундаментальных исследований) — 3 000 000 рублей (2021–2023, успешно завершён).
Диплом «За лучший проект в области цифровой гуманитаристики» на Всероссийской конференции «Цифровая гуманитаристика – 2024» (г. Пермь).
Благодарность Главы Республики Северная Осетия — Алания (2024, 2025 гг.).
Использование результатов в образовании и науке:
Корпус и словарь используются в учебном процессе в СОГУ, Северо-Осетинском государственном педагогическом институте, Юго-Осетинском государственном университете (г. Цхинвал).
На основе корпуса защищены 2 кандидатские диссертации по филологии (осетинское языкознание).
Материалы корпуса использованы для подготовки нового академического «Осетинско-русского словаря» (издание планируется в 2026 г., объём 35 тыс. слов).
Сообщество и внешние проекты:
Создана группа в VK «Цифровая осетинистика» (3 500 подписчиков), где публикуются новости о корпусе, словаре, проводятся опросы.
На основе API словаря разработаны: бот в Telegram «Осетинский словарь» (бот принимает слово и выдает перевод), мобильное приложение «Ирон» (карточки для изучения слов).
Получены запросы от исследователей из Венгрии, Германии, США (иранистика) на доступ к корпусу для сравнительных исследований.
Научная продуктивность:
По результатам проекта опубликовано 12 научных статей (в том числе 4 в журналах, индексируемых в Scopus / WoS), 2 монографии (в соавторстве).
Проект представлен на 8 всероссийских и международных конференциях.
Создан электронный корпус осетинского языка объёмом 10,2 млн слов:
Общее количество текстовых источников — 620 (книги, газеты, журналы, научные статьи, расшифровки).
Временной охват: от произведений XIX века (Коста Хетагуров) до интернет-блогов 2025 года.
Произведена базовая морфологическая разметка (часть речи, падеж, число, время, лицо) с помощью автоматического анализатора с последующей ручной верификацией (10% выборки).
Корпус доступен по адресу (вымышленный) www.iron-korpus.ru.
Создан онлайн-словарь-переводчик «Осетинско-русский / русско-осетинский»:
Объём: 55 000 слов (основная лексика), 120 000 словоформ.
Функции: поиск по осетинскому и русскому словам, транскрипция, грамматические пометы, примеры употребления из корпуса (конкорданс), частотность слова.
Словарь интегрирован с корпусом: при нажатии на слово открывается карточка с примерами.
Доступен бесплатно через веб-интерфейс и API.
Среднее количество уникальных пользователей словаря в месяц (2025 г.) — 4 200 (включая школьников, студентов, преподавателей, учёных, переводчиков).
Техническая инфраструктура:
Веб-интерфейс разработан силами 5 волонтёров-программистов (студенты и выпускники СОГУ, направления «Прикладная информатика» и «Программная инженерия»).
API словаря используют 8 сторонних проектов (в том числе мобильные приложения для изучения осетинского языка, чат-боты, плагины для браузеров).
Обучение студентов:
За 2022–2025 годы обучено 215 студентов (перевыполнение плана на 7,5%):
Спецкурс «Компьютерная лингвистика для осетинского языка» — 48 студентов (2 потока).
Практикум по оцифровке и разметке — 112 студентов (волонтёры, помощь в создании корпуса).
Мастер-классы для IT-студентов — 55 человек.
Разработан учебно-методический комплекс «Цифровые инструменты для осетинского языка» (200 страниц) для использования в вузах Северной Осетии и Южной Осетии.
Признание и награды:
Благодарность Министерства науки и высшего образования Российской Федерации (2025 год) — «За значительный вклад в развитие цифровых ресурсов для языков народов России и подготовку кадров в области компьютерной лингвистики».
Грант РФФИ (Российский фонд фундаментальных исследований) — 3 000 000 рублей (2021–2023, успешно завершён).
Диплом «За лучший проект в области цифровой гуманитаристики» на Всероссийской конференции «Цифровая гуманитаристика – 2024» (г. Пермь).
Благодарность Главы Республики Северная Осетия — Алания (2024, 2025 гг.).
Использование результатов в образовании и науке:
Корпус и словарь используются в учебном процессе в СОГУ, Северо-Осетинском государственном педагогическом институте, Юго-Осетинском государственном университете (г. Цхинвал).
На основе корпуса защищены 2 кандидатские диссертации по филологии (осетинское языкознание).
Материалы корпуса использованы для подготовки нового академического «Осетинско-русского словаря» (издание планируется в 2026 г., объём 35 тыс. слов).
Сообщество и внешние проекты:
Создана группа в VK «Цифровая осетинистика» (3 500 подписчиков), где публикуются новости о корпусе, словаре, проводятся опросы.
На основе API словаря разработаны: бот в Telegram «Осетинский словарь» (бот принимает слово и выдает перевод), мобильное приложение «Ирон» (карточки для изучения слов).
Получены запросы от исследователей из Венгрии, Германии, США (иранистика) на доступ к корпусу для сравнительных исследований.
Научная продуктивность:
По результатам проекта опубликовано 12 научных статей (в том числе 4 в журналах, индексируемых в Scopus / WoS), 2 монографии (в соавторстве).
Проект представлен на 8 всероссийских и международных конференциях.
Прогноз развития
В 2026–2027 годах — расширение корпуса до 20 млн слов за счёт включения диалектной лексики (дигорский и иронский диалекты), а также южноосетинских текстов (согласование с коллегами из Цхинвала).
Создание подкорпуса устной речи — транскрипция 200 часов аудиозаписей (интервью, диалоги, монологи) для исследования разговорного языка.
Разработка системы машинного перевода (нейросеть) осетинский ↔ русский на базе собранного корпуса (10 млн слов достаточно для обучения базовой модели).
Создание мобильного приложения «Осетинский корпус и словарь» (офлайн-доступ к словарю, возможность работать без интернета).
Интеграция с голосовыми помощниками (Яндекс.Алиса, Маруся) — разработка навыков «Осетинский разговорник», «Словарь дня» и др.
Проведение ежегодной летней школы «Цифровая осетинистика» для студентов из Северной и Южной Осетии, а также из других республик Северного Кавказа (с грантовой поддержкой).
Создание открытой платформы для краудсорсинга — пользователи смогут добавлять новые слова, примеры, исправлять ошибки в корпусе (с модерацией).
В 2026–2027 годах — расширение корпуса до 20 млн слов за счёт включения диалектной лексики (дигорский и иронский диалекты), а также южноосетинских текстов (согласование с коллегами из Цхинвала).
Создание подкорпуса устной речи — транскрипция 200 часов аудиозаписей (интервью, диалоги, монологи) для исследования разговорного языка.
Разработка системы машинного перевода (нейросеть) осетинский ↔ русский на базе собранного корпуса (10 млн слов достаточно для обучения базовой модели).
Создание мобильного приложения «Осетинский корпус и словарь» (офлайн-доступ к словарю, возможность работать без интернета).
Интеграция с голосовыми помощниками (Яндекс.Алиса, Маруся) — разработка навыков «Осетинский разговорник», «Словарь дня» и др.
Проведение ежегодной летней школы «Цифровая осетинистика» для студентов из Северной и Южной Осетии, а также из других республик Северного Кавказа (с грантовой поддержкой).
Создание открытой платформы для краудсорсинга — пользователи смогут добавлять новые слова, примеры, исправлять ошибки в корпусе (с модерацией).
Структура видеоролика, иллюстрирующего деятельность
Хронометраж: 2 минуты 30 секунд.
Язык: русский (субтитры на русском, в кадрах корпуса — осетинский язык).
Сцена / тайминг Содержание Визуальный ряд
0:00–0:20 Вступление: Заурбек Дзарахохов в Лаборатории цифровой осетинистики (компьютеры, стеллажи с книгами). Рассказывает о проблеме — отсутствии цифровой базы для осетинского языка. Крупный план кандидата, затем панорама лаборатории, книги на осетинском языке.
0:20–0:50 Создание корпуса: быстрая нарезка — сканирование книги, экран с распознанным текстом, таблица с разметкой слов. Затем скринкаст экрана: ввод слова в поиске корпуса, выдача результата (конкорданс, статистика). Нарезка кадров оцифровки, затем скринкаст веб-интерфейса корпуса (крупно).
0:50–1:15 Словарь-переводчик: скринкаст сайта — ввод русско-осетинского запроса «дом», появление осетинского слова «хæдзар», транскрипция, пример из корпуса. Затем кадры работы API — бот в Telegram, отвечающий переводом. Скринкаст экрана (крупно), затем скриншот чата с ботом (телефон).
1:15–1:40 Обучение студентов: кадры лекции в аудитории (Заурбек у доски), студенты за компьютерами выполняют задания по разметке текста. Интервью со студенткой: «Раньше мы не знали, как компьютеры помогают языку, теперь умеем создавать цифровые инструменты». Лекция (крупно студенты), затем практикум (экраны ноутбуков с разметкой).
1:40–2:00 Результаты: цифры (10 млн слов, 55 тыс. слов в словаре, 215 обученных студентов, 5 волонтёров-программистов). Показ благодарности Министерства науки и высшего образования РФ и гранта РФФИ. Интервью с проректором СОГУ о значении проекта. Инфографика, анимированные цифры, крупный план благодарности, логотипы.
2:00–2:20 Прогноз развития: планы на 20 млн слов, машинный перевод, мобильное приложение. Призыв к студентам и учёным использовать открытые ресурсы. Кандидат в кадре, затем кадры макетов новых функций, логотипы партнёров.
2:20–2:30 Финальная заставка: логотип «ГОРДОСТЬ НАЦИИ — 2026», номинация «Родные языки народов России», девиз «Ирон æвзаг — цифрон дунейы» (Осетинский язык — в цифровом мире). Ссылка на корпус и словарь (вымышленная). Статичный экран с текстом, фотография из лаборатории.
Примечание: Ролик снимается в научно-публицистическом стиле, с акцентом на технологии и обучение. Платформа размещения — Rutube, VK Видео, сайт лаборатории.
Хронометраж: 2 минуты 30 секунд.
Язык: русский (субтитры на русском, в кадрах корпуса — осетинский язык).
Сцена / тайминг Содержание Визуальный ряд
0:00–0:20 Вступление: Заурбек Дзарахохов в Лаборатории цифровой осетинистики (компьютеры, стеллажи с книгами). Рассказывает о проблеме — отсутствии цифровой базы для осетинского языка. Крупный план кандидата, затем панорама лаборатории, книги на осетинском языке.
0:20–0:50 Создание корпуса: быстрая нарезка — сканирование книги, экран с распознанным текстом, таблица с разметкой слов. Затем скринкаст экрана: ввод слова в поиске корпуса, выдача результата (конкорданс, статистика). Нарезка кадров оцифровки, затем скринкаст веб-интерфейса корпуса (крупно).
0:50–1:15 Словарь-переводчик: скринкаст сайта — ввод русско-осетинского запроса «дом», появление осетинского слова «хæдзар», транскрипция, пример из корпуса. Затем кадры работы API — бот в Telegram, отвечающий переводом. Скринкаст экрана (крупно), затем скриншот чата с ботом (телефон).
1:15–1:40 Обучение студентов: кадры лекции в аудитории (Заурбек у доски), студенты за компьютерами выполняют задания по разметке текста. Интервью со студенткой: «Раньше мы не знали, как компьютеры помогают языку, теперь умеем создавать цифровые инструменты». Лекция (крупно студенты), затем практикум (экраны ноутбуков с разметкой).
1:40–2:00 Результаты: цифры (10 млн слов, 55 тыс. слов в словаре, 215 обученных студентов, 5 волонтёров-программистов). Показ благодарности Министерства науки и высшего образования РФ и гранта РФФИ. Интервью с проректором СОГУ о значении проекта. Инфографика, анимированные цифры, крупный план благодарности, логотипы.
2:00–2:20 Прогноз развития: планы на 20 млн слов, машинный перевод, мобильное приложение. Призыв к студентам и учёным использовать открытые ресурсы. Кандидат в кадре, затем кадры макетов новых функций, логотипы партнёров.
2:20–2:30 Финальная заставка: логотип «ГОРДОСТЬ НАЦИИ — 2026», номинация «Родные языки народов России», девиз «Ирон æвзаг — цифрон дунейы» (Осетинский язык — в цифровом мире). Ссылка на корпус и словарь (вымышленная). Статичный экран с текстом, фотография из лаборатории.
Примечание: Ролик снимается в научно-публицистическом стиле, с акцентом на технологии и обучение. Платформа размещения — Rutube, VK Видео, сайт лаборатории.
Страницы: | 1 | 2 |
Перейти в другой раздел:
«Внимание: все примеры разделов заявок являются авторскими разборами и носят обучающий характер. Перед сдачей настоятельно рекомендуем адаптировать текст под свой проект. Прямое копирование без изменений может быть распознано системой антиплагиата конкурса».
CHAT
