25 Feb 2026, 07:00 UTC586 views13 reactionsread 8 August 2026 Photo
Когда ковырял Skills, меня не покидало ощущение, что это реально крутая вещь по двум причинам. Первое - это то, что наконец-то появилась еще одна стандартизация концепции. На самом деле у многих уже появлялись зачатки скиллов, но как это назвать и как оформить так, чтобы все понимали, о чем ты говоришь, было сложно. Поэтому очень круто, что появился еще один термин, который стандартизирует некий подход (тут снова Ant…
🔥9👍4
30 Sept 2025, 05:36 UTC≈1,150 views16 reactionsread 8 August 2026 Photo
◀️ Что же по Qwen3-4B, - я его запускал не только в обычном режиме, но и с применением некоторого подхода. Я ожидал увидеть заметный прирост, но результаты оказались почти одинаковыми (не знаю, с чего я так решил, что будет какой-то буст, но ресерч - дело такое).
Идея заключалась в том, чтобы помочь небольшой модели справиться с большим контекстом. Вместо того чтобы подавать весь контекст целиком, я разделил его на…
👍11🔥3❤2
29 Sept 2025, 20:33 UTC752 views13 reactionsread 8 August 2026 Photo
Пока в AI чатах бурно обсуждают новые плюшки от антропиков: свежая модель Sonnet 4.5, обновленный Claude Code 2.0, и SDK для создания кодовых агентов.
⭐ Я же делюсь результатами по бенчмарку оценки качества извлечения данных. Напомню, я убрал из процесса этап поиска и подавал моделям контекст со страниц напрямую, чтобы сфокусироваться именно на их аналитических способностях. Контекст был ограничен 10 000 токенов д…
👍6🔥4❤3
26 Sept 2025, 17:48 UTC650 views12 reactionsread 8 August 2026 Photo
Наконец-то запустил бенчмарк по оценке качества извлечения данных, взял за основу датасет для DeepResearch SealQA
Но как я говорил, этап поиска в этом бенчмарке довольно тривиальный - большинство ссылок ведут на Википедию и легко находятся. Поэтому я решил не мучать этим этапом LLM и сейчас подаю контекст страниц напрямую.
Но раз я сменил условия игры - мне нужны данные по разным моделькам, чтобы потом сравнивать р…
🔥7👍3❤2
24 Sept 2025, 19:54 UTC554 views6 reactionsread 8 August 2026 Photo
Тестирую модель Qwen3-4B на задаче извлечения релевантных данных.
Здесь нужно не просто найти ответ в контексте, а провести аналитическую оценку информации на соответствие запросу.
И вот такое чудит, в ризонинге видно, что она правильно определила релевантных игроков, но в финальном ответе все равно написала всех...
🤔5💔1
19 Sept 2025, 08:18 UTC731 views11 reactionsread 8 August 2026 Photo
На этом одном примере, я стабильно получал низкую полноту ответа (всего 20%). Оказалось, проблема не в логике LLM, а в том, в каком виде она получает данные.
Я использовал tavily-adapter для поиска, который возвращал содержимое страниц как сплошную строку, вытащенную через bs4.
И если ответ был спрятан в таблице, то для LLM это была просто каша из слов. Она не видела никакой структуры.
Решение: Я переписал адаптер…
🔥8👍3
19 Sept 2025, 08:17 UTC519 views6 reactionsread 8 August 2026 Когда получаешь первые результаты, сразу думаешь: как их улучшить?
На первый взгляд, решение казалось очевидным: добавить моему ReAct-агенту больше инструментов. Например, planner или todo-список, чтобы сделать поиск более контролируемым.
Но проанализировав логи, я увидел, что мой агент посещал 80% сайтов, на которых содержался правильный ответ.
Значит, проблема не в поиске, а в чём-то другом.
⚡Проблема: маленька…
👍6
19 Sept 2025, 07:49 UTC≈5,920 views16 reactionsread 8 August 2026 Photo
Вместе с коллегами по цеху взялись за интересный бенчмарк по deep research - SealQA.
Хотим протестировать разные подходы к реализации ReAct-агентов, но с одним важным условием: использовать только небольшие LLM, в идеале до 30B параметров. Сейчас для тестов взяли gpt-4o-mini.
🤔 Почему это важно?
Большие LLM, без сомнения, справляются лучше, но они всё ещё дороги. И хотя со временем все модели дешевеют, вопрос выбор…
🔥9👍7
16 Sept 2025, 11:11 UTC617 views7 reactionsread 8 August 2026 Photo
Только вышел новый Codex от OpenAI - тут же появился слитый промт - еще один крутой репозиторий с промтами.
Этот промт выдала сама LLM - поэтому за формат и его первозданный вид не ручаюсь.
Какие особенности:
1) Формат
В основном используется Markdown, но и есть два блока с XML-тегами:
<GUIDELINES>: оборачивает целый блок, который является шаблоном.
<EXAMPLE_FINAL_ANSWER>: предоставляет конкретный, заполненный п…
🔥4👍2❤1
16 Sept 2025, 06:44 UTC496 views14 reactionsread 8 August 2026 Photo
Продолжаем анализировать промты агентов из репозитория и после разбора XML-тегов переходим к следующему паттерну.
Речь о механизме планирования и To-Do list - важном и часто встречающемся стандарте для агентов
Три основных способа реализации:
Управление через инструменты (Tool-Based): Самый частый подход. Агент использует инструменты (todo_write, update_plan) для интерактивного управления списком задач. (Примеры:…
👍7🔥5❤2
15 Sept 2025, 15:01 UTC466 views17 reactionsread 8 August 2026 Photo
Когда я вижу очередную статью о Prompt Engineering - я думаю, ну опяяяять.... Сколько можно то?
Но если надо разобраться в том, как работают топовые AI-агенты под капотом, с какими системными промтами, ты должен читать такие статьи, а иногда даже писать 👀
Поэтому, ловите первую статью о Prompt Engineering - это результат анализа огромного количества самых топовых промтов для агентов.
⚡️ Первый инсайт: использован…
👍11🔥6
12 Sept 2025, 07:13 UTC434 views13 reactionsread 8 August 2026 Photo
Почему субагенты в ClaudeCode - это еще не настоящая мультиагентность
Все, кто строил мультиагентные системы знают подход, где есть главный агент оркестратор, который координирует работу, и есть спец. агенты (субагенты), которые заточены под конкретную задачу (тестирование, ревью, ведение задач в JIRA).
С появлением субагентов в ClaudeCode (CC) показалось, что вот оно, готовое решение - создавай субагентов, подключ…
👍6❤4🔥3
Showing the 12 most recent of 19 posts we hold for @filippovd_ai. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.