11 Jul 2026, 15:34 UTC184 views17 reactionsread 6 August 2026 Video
Журналы «Спутник 2.0. Россия в мире» 🔗
В прошлом году наша лаборатория была привлечена к неожиданному проекту. На первый взгляд – совсем не научному. Хотя…
Как вы знаете, мы много исследуем тексты: изучаем, что удерживает внимание читателя, как устроен интерес, почему один текст хочется дочитать до конца, а другой закрывают после первого абзаца.
И вдруг появился шанс проверить наши идеи не только в статьях и экспе…
❤7👏4🔥4🥰2
1 Jul 2026, 13:38 UTC284 views18 reactionsread 6 August 2026 Photo
Вернулись с IMS-2026 – делимся короткими впечатлениями и немного рассказываем о том, что сейчас происходит в мире компьютерной лингвистики. 🖥
В этом году в рамках международной конференции «Интернет и современное общество» (IMS-2026), которая проходила в Университете ИТМО в Санкт-Петербурге, снова работала секция CompLing – и, как всегда, она собрала исследователей из самых разных областей. На одной площадке встретил…
❤10🤩4🔥2🥰2
29 Jun 2026, 14:54 UTC233 views13 reactionsread 6 August 2026 Почему метрике DP нужна нормализация?
Напомним, что DP сравнивает для каждого урока две доли: долю объёма этой части в корпусе и долю вхождений интересующего слова. Если уроки сильно различаются по размеру, то даже при очень неравномерном распределении слова DP не достигает 1, т.к. его теоретический максимум в таком корпусе меньше единицы. Сравнивать значения DP для разных слов внутри такого корпуса было бы некоррек…
🔥8👍2🤔2❤1
26 Jun 2026, 13:01 UTC277 views15 reactionsread 6 August 2026 Как измерить равномерность распределения слова в учебнике
В предыдущем посте мы выяснили, что десять появлений слова в одном уроке и десять появлений в разных уроках — это методически совсем не одно и то же. Но можно ли такое измерить?
Предлагаем использовать метрику DP (Deviation of Proportions). Идея простая: допустим, интересующая нас линейка состоит из 4 учебников, суммарно в них 100 уроков. Для каждого урока с…
❤8🔥4👍3
23 Jun 2026, 12:04 UTC311 views19 reactionsread 6 August 2026 Поговорим о повторяемости лексики в учебниках (и не только о ней)
Представим, что глагол мечтать появляется в учебнике десять раз... но все десять раз в одном уроке, а потом тишина на сто страниц. А теперь представим, что он встречается те же десять раз, но в разных уроках, при этом известно количество вхождений, длина шага между уроками, а также вся метаинформация об упражнении, в котором это слово появилось.
Это …
❤11🔥6👍2
19 Jun 2026, 13:39 UTC339 views21 reactionsread 6 August 2026 После того, как мы собрали датасет RU-CEFR-Short и удостоверились в адекватности разметки, мы перешли к следующему вопросу: а можно ли научить большие языковые модели автоматически определять уровень таких коротких фрагментов текста? 🧐
Мы сравнили несколько подходов. Сначала — традиционный machine learning: модели, которые работают с признаками текста (лексика, частотность слов, синтаксис и т.д.). Сюда вошли SVM, XG…
🔥10❤6⚡5
17 Jun 2026, 15:01 UTC276 views22 reactionsread 6 August 2026 В прошлом посте мы рассказали, как отбирали «типичные» фрагменты текстов по лингвистическим признакам. Но отдельный важный вопрос — насколько вообще стабильно эксперты оценивают такие короткие тексты и насколько можно доверять этой разметке. 😱
Чтобы это проверить, мы попросили трёх опытных преподавателей РКИ независимо оценить 400 фрагментов. 🤩
Коэффициент согласия между экспертами Krippendorff’s alpha составил 0.79…
🔥14👍5❤3
15 Jun 2026, 18:56 UTC269 views25 reactionsread 6 August 2026 Photo
Возможно, вы помните нашу масштабную работу по разметке аутентичных фрагментов из НКРЯ по уровням сложности с точки зрения РКИ. Сейчас она находится на стадии обсчёта результатов. А пока расскажем историю с самого начала — со стадий торга, отрицания и прочих неизбежных этапов научного процесса. 😉
Итак, когда нам выпала возможность включиться в проект по разметке выдачи корпуса для РКИ-задач с помощью больших языковы…
❤17🔥4👍2👏2
13 Jun 2026, 13:05 UTC361 views27 reactionsread 6 August 2026 Photo
Лаборатория на Северном Кавказе ⛰️
Таня Обухова и Поля Дорожкина прилетели в образовательный центр «Машук», чтобы провести несколько мастер-классов для 25 преподавателей РКИ из Китая.
Коллеги знают Национальный корпус русского языка и пользуются им, однако параллельный и мультимедийный подкорпус, отдельные возможности поиска не были им знакомы. А Текстометр стал настоящим открытием! 🧐 Участники отмечали, что навык…
❤21👏5🔥1
9 Jun 2026, 07:59 UTC413 views35 reactionsread 6 August 2026 Photo
Лучшие предзащиты проходят не в аудиториях, а на траве!
Сегодня обсуждали магистерские работы. В этом году под руководством Марии Лебедевой к защите подготовлены три диссертации — и все они связаны с чтением и учебным текстом.
📈 Исследования затрагивают разные аспекты читательской деятельности: роль мотивационного компонента в обучении чтению, использование коммуникативных игр для активизации читательской деятельно…
🥰14❤10🔥10🎉1
1 Jun 2026, 15:04 UTC455 views18 reactionsread 6 August 2026 Мы привыкли думать, что автоматическая проверка текста — это в первую очередь проверка орфографии и пунктуации. Но современные корпусные методы позволяют анализировать и более сложные вещи:
- лексическую сочетаемость;
- повторяемость слов и конструкций;
- особенности организации текста;
- естественность письменной речи в целом.
В нашем исследовании мы обнаружили ещё одну интересную закономерность.
К концу текста…
❤7🔥7👍4
29 May 2026, 12:29 UTC437 views20 reactionsread 6 August 2026 Что такое t-score и зачем он нужен лингвистам? 🤔
Если совсем коротко, t-score — это статистическая мера, которая помогает понять, насколько часто слова встречаются вместе.
Например:
🟢 принять решение
🟢 сильный дождь
— типичные сочетания для русского языка.
А вот конструкции вроде:
🔴 делать решение
🔴 тяжёлый дождь
звучат для носителя странно и неестественно, даже если формально грамматически построены правильно.
В…
❤12👍3🔥3👏2
Showing the 12 most recent of 13 posts we hold for @digitalpushkin. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.