3 Jun 2026, 13:18 UTC558 views23 reactions15 Starsread 8 August 2026 Сегодня мы рады представить результаты нашей работы последних месяцев — семейство специализированных SLM-моделей OCC-RAG для question answering по контексту. Несмотря на компактный размер (всего 0.6B и 1.7B параметров), наши модели способны отвечать на сложные multi-hop вопросы, рассуждать по шагам и, что особенно важно, корректно отказываться от ответа, если в контексте недостаточно информации.
Как нам удалось этог…
🔥23
3 Jun 2026, 13:17 UTC343 views10 reactionsread 8 August 2026 Photo
https://huggingface.co/papers/2606.00683
🔥6🤯4
4 May 2026, 05:50 UTC321 views3 reactionsread 8 August 2026 Продолжаем неторопливо разбирать статьи с #ICLR 2026 🇧🇷 в этот раз LiteCoST — двухэтапный фреймворк для QA на длинном контексте (от 10K токенов).
Stage 1️⃣: Генерация CoST-трейсов с GPT-4o
Сначала GPT-4o генерирует Chain-of-Structured-Thought (CoST) трейсы: анализирует запрос, выбирает структуру (таблица/граф), строит схему, извлекает данные, проверяет качество и уточняет итеративно, если ответ не совпадает с рефере…
❤3
4 May 2026, 05:50 UTC257 viewsread 8 August 2026 Photo
Photo, posted without a caption
28 Apr 2026, 06:38 UTC320 views4 reactionsread 8 August 2026 Photo
🔥 ICLR 2026: детекция LLM-контента через галлюцинации в библиографии?
Подошла к концу одна из топовых AI-конференций — ICLR 2026 в Рио. Из 19 525 сабмитов приняли всего 5355, acceptance rate — 27.4%. Помимо скандалов с утечками данных на OpenReview (что уже стало традицией), главное — методы детекции LLM-генерацией в научных статьях. Самый надежный способ выявить такой контент? Искать галлюцинации! А в научных стать…
🔥4
27 Apr 2026, 14:36 UTC290 views8 reactionsread 8 August 2026 Photo
📣 CFP AIST 2026
Приглашаем подать статью на AIST 2026 – 13-ю международную конференцию по анализу изображений, социальных сетей и текстов.
В этом году конференция пройдёт 16–18 октября 2026 в Назарбаев Университете в Астане 🇰🇿
✍️ Для NLP-аудитории особенно релевантны темы:
– LLM / RAG / text mining
– social network analysis
– multimodal AI, image/video analysis
– data mining и machine learning applications
Что ва…
❤5🔥3
24 Mar 2026, 16:37 UTC581 views13 reactionsread 8 August 2026 Photo
📜Multimodal Evaluation of Russian-language Architectures
Мультимодальный бенчмарк, содержащий текст, изображения, аудио и видео, учитывающий культурно‑языковую специфику русского и предлагающий универсальную таксономию мультимодальных способностей языковых моделей
📜Detecting Overflow in Compressed Token Representations for Retrieval-Augmented Generation
Авторы предлагают механизм обнаружения случаев, когда компресси…
❤9🔥3👍1
24 Mar 2026, 10:31 UTC463 views10 reactionsread 8 August 2026 Photo
🚀 Первый день EACL 2026 в Рабате, Марокко!
Друзья, сегодня стартовала европейская конференция EACL в солнечном Рабате! Как всегда, буду подробно освещать самые интересные работы по NLP. Начну с краткого обзора работ от наших коллег.
📜Wikontic: Constructing Wikidata-Aligned, Ontology-Aware Knowledge Graphs with Large Language Models
Wikontic — многошаговый конвейер построения компактных, онтологически согласованных …
❤6🔥4
9 Feb 2026, 17:12 UTC426 views12 reactionsread 8 August 2026 Photo
Когда встреча прошла, а заметок — ноль? Команда NLP из НГУ придумала, как спасти вас от этой проблемы. Представляем Pisets — инструмент для конспектирования лекций, интервью и докладов, где стандартные ASR‑модели вроде Whisper или WhisperX часто выдают галлюцинации.
🧠 Что внутри?
Pisets — это пайплайн из нескольких моделей:
1️⃣ Wav2Vec2-сегментер: на длинном аудио сначала выделяются участки, где вообще есть речь
2️…
🔥7❤3👍1👏1
15 Jan 2026, 06:33 UTC552 views9 reactionsread 8 August 2026 Photo
🚀 MedGemma 1.5 4B от Google: мультимодалка для медицины!
Google Research выпустил апгрейд открытой модели MedGemma 1.5 4B — компактный генеративный ИИ для здравоохранения. Работает с текстом + изображениями: высокое разрешение MRI/CT, серии рентгена грудной клетки, локализация анатомии и разбор меддокументов. Задавай вопросы по снимкам — получай результат. Звучит как идеальный ассистент рентгенолога 👨🏻⚕️.
💊Особенн…
🔥6💊3
11 Dec 2025, 11:39 UTC478 views5 reactions7 Starsread 8 August 2026 Photo
Как мы знаем, многократная генерация и majority vote — это надёжный, но вычислительно затратный способ получить фактологичную генерацию (self-consistency). Авторы статьи Confidence Improves Self-Consistency in LLMs из Google предложили подход под названием Confidence-Informed Self-Consistency (CISC), где происходит взвешенный majority vote на основе confidence модели.
⚙️Чем отличаются CISC от простого self-confiden…
🔥5
1 Dec 2025, 10:07 UTC452 views10 reactions5 Starsread 8 August 2026 Photo
Итак, как мы знаем, галлюцинации можно определять на уровне всего респонса, на уровне спанов и на уровне атомарных фактов. С галлюцинациями на уровне всей генерации понятно, но как обстоят дела с поспановыми и на уровне клемов. В работе MUCH: A Multilingual Claim Hallucination Benchmark сделан шаг вперед: от поспановых к формированию «клеймов», но все еще на уровне спанов.
📜О чём статья
Авторы делают попытку перейт…
🔥7👍3
Showing the 12 most recent of 20 posts we hold for @nlpbotan. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.