7 Aug 2026, 07:40 UTC128 views7 reactionsread 8 August 2026 Забавная история со стандартизацией агентов
Vercel вместе с AWS, Cursor, GitHub, Microsoft и OpenAI представили Agent Plugins 1.0.0 — открытый стандарт упаковки расширений для агентов. Google тоже объявил о поддержке.
Смысл в том, чтобы один раз собрать расширение агента в переносимый пакет и использовать его в разных харнессах. Внутри — небольшой манифест, Agent Skills с инструкциями и скриптами и конфигурация MCP…
👍5⚡2
1 Aug 2026, 07:06 UTC323 views19 reactionsread 8 August 2026 Photo
🧰 Вышел релиз Deep Agents v0.7
Забавно наблюдать за метаморфозами подходов. Год назад, когда Deep Agents только появился, его представили как сочетание четырёх ключевых особенностей:
— планирование;
— субагенты;
— огромный системный промпт;
— файловая система.
А теперь в Deep Agents v0.7 две из четырёх основ перестали быть обязательными.
Встроенный системный промпт изрядно сократили, а инструмент со списком задач…
❤11👍5🔥3
25 Jul 2026, 05:40 UTC361 views9 reactionsread 8 August 2026 🔗 Как LangChain теперь оценивают Deep Agents
Продолжаю вам надоедать постами про эвалы и Deep Agents, уж простите 🥲
Я уже писал про эксперимент LangChain и NVIDIA, в котором Nemotron 3 Ultra почти дотянули до Opus 4.8 за счёт настройки харнесса.
Тогда изменения проверяли в основном на собственных узких задачах для отдельных способностей агента и небольшом количестве сложных примеров из крупных бенчмарков. Такого н…
❤7👍2
23 Jul 2026, 06:28 UTC334 views16 reactionsread 8 August 2026 🔗 LangChain выпустили скилл для разработки эвалов
В марте я уже писал про официальные скиллы LangChain, которые можно подключить к любому кодинговому агенту. На тот момент их было 11, с тех пор количество увеличилось до 15, в том числе eval-engineering, про который хочу сегодня рассказать. Если кратко, то eval-engineering создает оценочные задачи для агента на основе трейсов.
Новый скилл во многом похож на подход Х…
🔥9❤4👍3
13 Jul 2026, 05:33 UTC391 views12 reactionsread 8 August 2026 🧪 Вышел пост Хамела Хусейна (Hamel Husain) про автоэвалы
Хамел не человек с улицы: 25 лет в ML, работал в Airbnb и GitHub. Сейчас консультирует компании по эвалам и ведёт курс по оценке ИИ-систем стоимостью какие-то жалкие 4200 долларов 😁
Автоэвалы — это системы, которые получают производственные трейсы агента и должны сами понять, что в его работе ломается: найти повторяющиеся проблемы и превратить их в автоматиче…
👍6❤3🔥3
10 Jul 2026, 07:40 UTC411 views10 reactionsread 8 August 2026 Уже попробовали GPT-5.6? Как вам?
А я вот на что обратил внимание: если смотреть на новые фичи, а не саму модель, то OpenAI методично собирает у себя то, что уже есть у Anthropic.
1. Programmatic Tool Calling в Responses API: модель пишет JavaScript, который вызывает инструменты параллельно, фильтрует промежуточные результаты и возвращает в контекст компактный итог. Придумали это в Anthropic (хотя может есть и боле…
🔥5👏3❤2
9 Jul 2026, 05:33 UTC433 views14 reactionsread 8 August 2026 🤝 LangChain и NVIDIA заколлабились на тему опенсорсных агентов
Я вам ранее жаловался, что LangChain дрейфует в сторону проприетарных решений. Но вот есть и обратные примеры. На этот раз они выложили материалы на тему того, как делать агентов целиком на открытом и при этом безопасном стеке.
Вместе с NVIDIA они выпустили блюпринт (NVIDIA так называет готовые сборки агентов со всеми компонентами и настройками). Туда в…
👍9❤3🔥2
8 Jul 2026, 05:40 UTC397 views9 reactionsread 8 August 2026 🤗 Вчера мне попался еще один пример кодингового агента, созданного в учебных целях, чтобы как можно больше людей разобрались в том, как работает харнесс.
Речь про нового минималистичного агента Tau от Hugging Face. Как можно догадаться из названия, он похож на агента Pi. Разница в том, что Tau написан на Python и несколько упрощен в сравнении с Pi.
Внутри у агента, как положено, ReAct-цикл, 4 инструмента (read, wr…
👍9
7 Jul 2026, 05:54 UTC381 views8 reactionsread 8 August 2026 💰 Про подсчет экономики кодинговых агентов или сколько стоит один pull request
Попались сразу два текста на эту тему. Поскольку лидеры внедрения ИИ в разработку переходят от стадии экспериментов к регулярным тратам на агентов, встаёт вопрос: как эти траты считать и чем их оправдывать.
🧐Cursor запускают CFO Council — это прямо клуб финансовых директоров, которые будут вырабатывать правила учёта расходов на ИИ. Повод…
👍6🔥2
6 Jul 2026, 11:01 UTC320 views7 reactionsread 8 August 2026 🚀 Сегодня опенсорс-релиз GigaChat 3.5
Новая модель представляет собой MoE с линейным вниманием: 430 млрд параметров, из них активны ~28 млрд. За счёт линейного внимания модель лучше держит длинный контекст — обрабатывает его быстрее (до 4×) и экономнее по памяти (до 2×).
Фокус релиза — код и математика🧮: заметный прирост здесь и в общих знаниях, ответы точнее и структурнее.
Но самое важное для меня — рост качества…
👍5🔥2
6 Jul 2026, 06:09 UTC388 views8 reactionsread 8 August 2026 🔧 Модели становятся умнее, а инструменты вызывают хуже
Армин Ронахер (создатель Flask и Jinja2, сооснователь Earendil — компании, развивающей кодинговый агент Pi) написал важную заметку: новые модели Anthropic (Opus 4.8, Sonnet 5) стали чаще старых ошибаться при вызове инструментов сторонних агентов, таких как Pi. Ронахер поясняет на примере инструмента правки файлов: модель передаёт ему, какой кусок текста на какой…
🔥5👏3
3 Jul 2026, 06:17 UTC436 views15 reactionsread 8 August 2026 ⚡️Посмотрите, какими проектами занимаются стажёры у нас в GigaChat💬
На Хабре вышла статья про GFusion — диффузионную языковую модель, которую в качестве проектной работы разработал стажёр команды GigaChat Pretrain Даниил Тихонов. Даниил пришёл в Сбер студентом 4-го курса ФКН НИУ ВШЭ, успешно защитил диплом и теперь полноценно работает в команде фундаментальных моделей Сбера.
В чем суть: привычные LLM пишут текст по…
🔥15
Showing the 12 most recent of 20 posts we hold for @gigatrash. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.