5 Aug 2026, 20:03 UTC252 views15 reactionsread 6 August 2026 Photo
Новая библиотека SIRIN для оценки и мониторинга contextual hallucinations в RAG и memory-based LLM системах (статья arxiv + github )
Идейно внутри три инструмента:
- probing по hidden states - легкий классификатор по hidden states генератора но нужно немного разметки
- LLM-as-a-judge. Есть response-level и span-level варианты, где модель пытается локализовать конкретные галлюцинированные фрагменты.
- uncertainty (e…
👍10🔥3❤1🤔1
31 Jul 2026, 20:49 UTC351 views8 reactionsread 6 August 2026 Все еще сидите на codex и claude code. А как насчет уробороса 🤌🏻
ps человек отдал 50к $ чтобы прогнать все бенчи
😁7🤔1
31 Jul 2026, 20:49 UTC297 views15 reactionsread 6 August 2026 Forwarded from @abstractDLPhoto
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench
Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.
Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследован…
❤6🫡5🔥4
26 Jul 2026, 20:00 UTC620 views11 reactionsread 6 August 2026 Придумали еще скилл, который создает скилл по книгам (Book-to-Skill - 10k ⭐️). По сути, зумеры заново изобрели оглавление.
Собрал такой скилл по книге "Братья Карамазовы" и спросил: что будет с AI? Ответ со смыслом:
Не к сознанию, как у Ивана, и не к святости, как у Алёши, а к институту опеки с лицом чуда. Пока свобода не станет дороже комфорта и явным выбором
- если главный KPI — снятие тревоги и принятие решений…
😁5❤4🔥1🫡1
23 Jul 2026, 19:32 UTC637 views13 reactionsread 6 August 2026 Harness evaluation - deepeval
Кто-то, возможно, начинает разработку harness решений и скиллов для них. Стало интересно, какие инструменты можно использовать для тестирования качества.
Если для RAG многие использовали Ragas, то для LLM и агентов активно применяются решения для трейсинга, например Langfuse и Phoenix. Однако они больше про observability, хотя на их основе также можно прогонять выборки и анализировать …
❤6👍5🔥1🤔1
19 Jul 2026, 09:56 UTC690 views8 reactionsread 6 August 2026 Прикольно, что Cloudflare позволяет без регистрации за пару секунд поднять статический сайт - просто перекинув ZIP-архив.
А если зарегистрироваться, то уже можно бесплатно хостить небольшие проекты. Да, собственного домена не будет, но возможность управлять всем через API - мое уважение. Вот сделал инглишь реплику канала (но надо покупать доменное имя иначе сложности с dns)
Upd еще подсказывают что можно использов…
👍5❤2🤝1
18 Jul 2026, 14:43 UTC571 views19 reactionsread 6 August 2026 Posted without readable text
😁9🤯7🗿3
15 Jul 2026, 17:54 UTC685 views18 reactionsread 6 August 2026 Photo
TabFM - придумали foundation-модель для табличных данных (что? 😅), и она SOTA на TabArena. Не прошло и года, новый лидер
В отличие от привычных LightGBM, CatBoost или TabM, она работает в zero-shot режиме: для нового датасета не требуется обучение или подбор гиперпараметров, достаточно передать обучающие строки в качестве контекста. TabFM рассматривает задачу табличного ML как in-context learning. Вместо обучения п…
👍13❤3🤯2
14 Jul 2026, 03:45 UTC540 views15 reactionsread 6 August 2026 Photo
Потестировал новый PageAgent от Alibaba
Это open-source браузерный AI-агент, который умеет самостоятельно работать с сайтами: понимать интерфейс, двигать курсор, кликать по элементам, вводить текст и выполнять многошаговые сценарии. Для быстрого старта разработчики уже предоставляют доступ к Qwen, так что ключик к api не нужен
Запускается очень просто, но если использовать версию по ссылке, то PageAgent.js рассчита…
👍8❤6🤔1
7 Jul 2026, 03:48 UTC574 views13 reactionsread 6 August 2026 Photo
AI-кофе с робо рукой: Чита - Москва 1:0 по внедрению ИИ 😎
😁10🥰2🤔1
28 Jun 2026, 13:02 UTC775 views18 reactionsread 6 August 2026 Photo
Corporate Bullshit Receptivity Scale (2026г)
Статья исследует, почему часть людей воспринимает бессодержательные корпоративные формулировки (где много разных buzzwords) как значимые и умные, и предлагает инструмент для измерения этой склонности. Как итог более высокая восприимчивость к корпоративному bullshit связана с более низкими показателями аналитического мышления и когнитивной рефлексии. Все выводы конечно п…
😁14❤3🤝1
14 Jun 2026, 15:51 UTC≈1,170 views14 reactionsread 6 August 2026 Photo
*это только документацию прочитал
😁11🫡2🤪1
Showing the 12 most recent of 20 posts we hold for @ai_tablet. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.