4 Aug 2026, 10:59 UTC201 views9 reactionsread 7 August 2026 Photo
Хочу поделиться апдейтом, который я недавно добавил в свою библиотеку eval-ai-library, и заодно рассказать, почему я вообще над этим работал.
Когда команды берут готовые инструменты оценки, такие как DeepEval, Ragas, Promptfoo, то они получают набор стандартных метрик: faithfulness, answer relevancy, contextual precision и так далее. Работает это отлично, пока ваша AI система решает более-менее типовую задачу. RAG н…
🔥8❤1
30 Jul 2026, 14:23 UTC334 views4 reactionsread 7 August 2026 Photo
Пока весь фокус на capability-бенчмарках, буквально пару недель назад восесь стран (Сингапур, Япония, Австралия, Канада, Франция, Кения, Корея, Великобритания) + ЕС провели совместное тестирование безопасности агентных ИИ.
Они прогнали ИИ агентов через примерно 1500 задач и 1200 тулов на девяти языках, от английского до кисуахили и главный результат, который они получили, что safety pass rate у лучшей модели состав…
👍4
28 Jul 2026, 10:49 UTC296 views4 reactionsread 7 August 2026 Photo
Сегодня поговорим о Robustness testing через призму метаморфического тестирования.
Немного разберем, что такое метаморфическое тестирование. Это метод тестирования программного обеспечения, при котором проверка корректности основана не на самих результатах, а на метаморфических отношениях - ожидаемых зависимостях между входами и выходами программы.
Проще говоря:
Мы задаём системе вход X и получаем результат Y.
Зате…
👍2❤1🔥1
24 Jul 2026, 07:38 UTC348 views6 reactionsread 7 August 2026 Photo
Недавно изучил исследование "Coin Flip Judge?" , в котором исследователи прогнали 29 задач из 10 категорий через две judge-модели от OpenAI, повторяя одну и ту же пару ответов много раз.
Результат получился интересным, потому что судья меняет вердикт в среднем в 13,6% прогонов. На 28% вопросов отклонение было выше 20%, а на одном вопросе судья менял решение в 56% случаев, то есть по сути как подбрасывать монетку.
П…
👍4🤔2
23 Jul 2026, 07:41 UTC368 views7 reactionsread 7 August 2026 Photo
Всем привет! У меня отличные новости, я определился с датой старта 4-го потока на курсе по оценке и тестированию ИИ систем!
Ииии…. мы начинаем 9 сентября!
Если вы давно хотели изучить для себя эту область тестирования, но откладывали, то сейчас до 19 августа вы можете записаться на курс и получить скидку 10% на все обучение.
Для записи нужно просто оставить заявку на сайте: eval-ai.com
Напомню, что это едиственны…
🔥5❤2
14 Jul 2026, 13:39 UTC463 views8 reactionsread 7 August 2026 Photo
Кажется то, что происходит с бенчмарками агентов последние пару месяцев, реально стоит обсудить.
В апреле Berkeley RDI взломали восемь индустриальных agent-бенчмарков, таких как Terminal-Bench, SWE-bench, WebArena, OSWorld, GAIA и другие, и получили результаты, близкие к 100%, вообще не решая задачу по существу. Где-то модель просто подделывала pass результат. Где-то агент скачивал эталонный файл по ссылке из конфи…
👍3🤔3🔥2
9 Jul 2026, 12:28 UTC464 views11 reactionsread 7 August 2026 Photo
Недавно подумал насколько мы привыкли использовать ИИ в своей работе, особенно кодинг агентов, типа Cursor или Claude Code, что начали постепенно забывать по аспекту связанные с качеством и что немаловажно эффективность работы такого агента.
И я пришел к этому выводу не случайно. Буквально недавно я создал мультиагента ИИ агента на базе claude code sdk, который решает различные задачи связанные с тестирование, такие…
💯6❤5
7 Jul 2026, 07:15 UTC405 views9 reactionsread 7 August 2026 Photo
Сегодня разберем частые ошибки, которые могут встречаться в в работе AI агентов. Если тестируете AI агентов, то этот список поможет сфокусироваться на ключевых проблемах.
1. Зацикливание (Infinite Loops). Агент повторяет одни и те же действия бесконечно, например, агент пытается получить информацию, но получает ошибку или считает, что информации недостаточно для продолжения работы и повторяет запрос снова и снова.
…
👍3💯3❤2🔥1
1 Jul 2026, 07:25 UTC477 views7 reactionsread 7 August 2026 Photo
Для всех, кто использует ИИ, но всегда задавался вопросом, а как же собственно LLM работают, я хочу поделиться подборкой видео от 3blue1brown.
3Blue1Brown объясняют сложные концепции через визуализации, которые делают абстрактные идеи понятными. В нескольких видео они разбирают принципы и архитектуру работы LLM, показывая, как LLM работает под капотом.
Что вы узнаете из видео:
Tokenization - как текст превращается …
❤4🔥2👍1
29 Jun 2026, 12:45 UTC453 views10 reactionsread 7 August 2026 File
Всем привет!
Сегодня хочу поделиться своим новым исследованием, которое прошло рецензирование и было опубликовано в Journal of Electrical Systems and Information Technology.
Ссылка на публикацию
В статье проводится анализ существующих подходов к оценке качества систем, построенных на основе генеративного искусственного интеллекта. Рассматриваются лексические методы (TF-IDF и BM25), семантические эмбеддинги, гибрид…
🔥6👍4
24 Jun 2026, 15:29 UTC558 views10 reactionsread 7 August 2026 Photo
AI Harness в тестировании
В индустрии сейчас все больше набирает популярность новый модный термин - agent harness. Это весь софт вокруг LLM, который превращает “модель, отвечающую на промпт” в агента, который реально делает работу. Инструменты, управление контекстом, цикл “действие → результат → следующий шаг”, память, обработка ошибок, все это является harness.
Почему это важно?
Сегодня в том же SWE-bench одна и т…
👍4🔥4❤1💯1
17 Jun 2026, 07:07 UTC540 views4 reactionsread 7 August 2026 Photo
Сегодня поговорим о том, почему оценка качества AI-систем стала критически важной.
Современный AI переживает революцию: от простых классификаторов мы дошли до моделей, которые пишут код, создают изображения, управляют роботами. Но вместе с этим пришли и новые вызовы.
1. Масштаб.
Модели обучаются на терабайтах данных, и классические методы вроде cross-validation уже не работают, потому что это слишком дорого и сложн…
🔥4
Showing the 12 most recent of 20 posts we hold for @testingofai. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.