17 Oct 2025, 14:30 UTC667 views7 reactionsread 8 August 2026 Forwarded from @nlpbotanPhoto
Сегодня расскажу про нашу свежую статью «When Models Lie, We Learn: Multilingual Span-Level Hallucination Detection with PsiloQA», которую приняли на EMNLP 🎉
Кстати, если работа вам понравилась прошу проголосовать за нее на HuggingFace Daily Papers.
В работе мы предложили метод генерации синтетических данных, содержащих естественные (не инсценированные) галлюцинации, размеченные на уровне спанов. Но ценность этой ра…
❤5🔥2
17 Oct 2025, 14:30 UTC555 viewsread 8 August 2026 Всем привет!
Не освещала в своих постах кажется проблему галлюцинаций моделей, так что пора это сделать. То, что LLM галюцинируют — пожалуй основная проблема, которая мешает использовать LLM во многих доменах. Сегодня вышла статья у коллег, в которой они рассматривают проблему на уровне спанов (слов или фраз), а не предложений, как это делается во многих других статьях. Также интересно то, что эта работа потвержда…
2 Oct 2025, 17:36 UTC806 views9 reactionsread 8 August 2026 Photo
Исследователям надо было держать баланс между тем, чтобы
а) тесты были корректным, осмысленными и действительно проверяли ввод, а не просто были легкопроходимым заглушками;
б) в тестах не было регулярных выражений;
в) чтобы весь процесс, как определения признаков, так и вмешательство во время генерации было не очень долгим.
И как раз их метод SAE-based интервенеций лучше всего справился с тем, чтобы выдержать этот …
👍6🔥3
2 Oct 2025, 17:33 UTC601 views7 reactionsread 8 August 2026 Photo
Всем привет!
Давно конечно было постов, так как я буквально пару дней назад приехала на учебу в Австрию и до этого нужно было сделать примерно миллион дел. Надеюсь, что учеба здесь даст еще больше поводов готовить посты и рассказывать интересное из научной жизни тут:)
Сегодня я хотела сделать небольшой рассказ о том, как можно применять инструменты анализа внутренних представлений моделей для задачи написания тесто…
❤7
7 Sept 2025, 13:37 UTC925 views16 reactionsread 8 August 2026 Photo
Пару дней назад наткнулась на исследование о том, как конкретно дообучение LLM изменяет внутреннее распределение предсказания следующих токенов. Ниже кратко расскажу про его суть, а также почему это предложенный метод это хорошие новости для исследователей интерпретируемости моделей, и плохие для тех, кто занимается алайнментом (ниже кратко рассказала, что это).
Интуитивно понятно, что дообучение на медицинском доме…
👍8❤5🔥3
22 Aug 2025, 12:01 UTC≈1,080 views13 reactionsread 8 August 2026 Photo
Вопрос «Как именно внутри LLM устроен reasoning?» остаётся достаточно сложным, но достаточно важным, поскольку понимание внутрениих процесс поможет для лучшего решения целого класса задач, например, поиск галлюцинаций, улучшение математических способностей и т.д. Мы до сих пор не до конца понимаем, есть ли в модели специальные блоки — отдельные головы или их кластеры, — которые отвечают за рассуждения, или хотя бы от…
❤13
10 Aug 2025, 10:08 UTC856 views13 reactionsread 8 August 2026 Photo
Тем не менее, на сегодняшний день SAE показывают результаты ниже ожидаемых в ряде задач.
Первая из них — обнаружение концепций (concept detection). Суть в том, чтобы определить, присутствует ли в тексте заранее заданный концепт, например: «упоминается ли в тексте баскетболист?» или «есть ли в тексте позитивная эмоция?». Тут SAE уступают гораздо более простым подходам, таким как логистическая регрессия или даже прост…
❤12👍1
10 Aug 2025, 10:08 UTC704 views13 reactionsread 8 August 2026 Очень интересно наблюдать за тем, как развивается область интерпретации того, как «думают» языковые модели. Основным инструментом, которым пользуются для этого исследователи (в том числе и мы в нашей работе по интерпретации искуственных текстов) — это разреженные автоэнкодеры (Sparse Auto Encoders). Для тех, кому интересно больше узнать про принцип их работы, есть замечательное видео от Welsh Labs The Dark Matter of …
❤12👍1
30 Jul 2025, 19:11 UTC≈1,110 views19 reactionsread 8 August 2026 Photo
People who frequently use ChatGPT for writing tasks are accurate and robust detectors of AI-generated text
Сегодня разберу интересную работу с идущей сейчас главной конференции по NLP — ACL 2025.
TL;DR: Люди, которые часто используют LLM для написания / редактуры текстов, могут очень хорошо отличать сгенерированные тексты от человеческого. Каждый такой аннотатор обращает внимание на различные характеристики текста…
❤17👍2
26 Jul 2025, 14:45 UTC866 views18 reactionsread 8 August 2026 Всем привет!
Искала какой-то повод для себя вернуться после отпуска и водоворота рабочих проектов, а тут мой канал прорекламировали (https://t.me/boris_again) так что посчитаю для себя это знаком вернуться!
В последнее время стала много времени уделять исследованию по анализу качества текстов. Расскажу сегодня немного про задачу и зачем вообще ей заниматься. Буду рада и вашим мыслям в комментариях.
Изначально, п…
❤12🔥6
25 Apr 2025, 08:00 UTC≈1,130 views13 reactionsread 8 August 2026 Photo
Последние пару месяцев была довольно сильно занята проектами по работе, поэтому не получалось уделять блогу достаточно времени, очень хочу это наверстать на майских праздника.
Тем не менее, хотелось бы поделиться, что сейчас идет (и почти заканчивается!) набор в летнюю школу по машинному обучению в Лиссабоне. Я была в ней в прошлом году, и помимо достаточно интересных и продвинутых лекций каждый день, к нам приезжа…
❤9🙏4
3 Mar 2025, 17:08 UTC≈9,680 views22 reactionsread 8 August 2026 File
Сегодня выступаю на воркшопе Preventing and Detecting LLM Misinformation AAAI с нашей статьей по анализу датасетов с искуственными текстами. Прикладываю слайды и кратко рассказываю про мотивацию статьи:
Если сравнить результаты с соревнований по детекции искуственных текстов и с тем, какой результат выдают реальные детекторы, то мы увидим довольно сильное расхождение. На соревнованиях участники выбивают точность под…
🔥11❤8🎉3
Showing the 12 most recent of 19 posts we hold for @nlp_with_heart. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.