9 Aug 2026, 07:34 UTC≈1,480 views23 reactions1 Starread 12 August 2026 Photo
Luna - потрясающая модель для Code Review
Собственно, похоже, что GPT 5.6 Luna max сейчас лучшая моделька для код ревью по соотношению цена-качество, да и в принципе одна из лучших моделей для ревью.
Это подтверждают как наши внутренние бенчи на Code Review, так и новый бенчмарк от Vercel DeepsecBench (да да, бенч на секьюрити в принципе можно смело экстраполировать на код ревью).
С учетом ее предельной дешевизны, …
👍13❤9🎉1
8 Aug 2026, 19:54 UTC≈1,480 views11 reactionsread 12 August 2026 Photo
Не все мне нравится в UX десктопной версии Claude Code, но надо отдать им должное - фича просмотра прототипов прямо в диалоге Claude Code просто бомбическая.
Раньше для этого требовалось просить сгенерить HTML, и отдельно открывать ее в браузере - не очень удобно.
Напомню, что прототип - это супер крутой и быстрый способ еще до того, как агент написал хоть строку кода, посмотреть как будет выглядит результат и направ…
👍11
8 Aug 2026, 07:04 UTC≈1,500 views32 reactionsread 12 August 2026 Важность исследования контекста
Тема заезженная, но я сейчас кодю с Opus 5 и, конечно, провожу новую фичу через research стадию и интервью. Собственно, хоть фича и совсем небольшая, даже после того, когда кажется, что все готово, я все равно прошу опуса доисследовать контекст и проработать корнер кейсы и он действительно находит что-то новое и мы учитываем дополнительные инварианты, т. е. не зря просили доисследоват…
👍24🤯4👎3❤1
30 Jul 2026, 20:06 UTC≈2,590 views25 reactionsread 12 August 2026 Какой-то баг с реациями в ТГ случился (навайбкодили опять) и были доступны только дизлайки и сомнения, поэтому мы с дядей Бобом собрали рекордное кол-во дизайков под постом, я еще начал думать, что никто уже не читает такие "длинные" посты до конца. Короче, если вы хотели отреагировать как-то иначе - теперь можно. А еще лучше - подключайтесь к дискусси, тк дебаты разгорелись нехилые в комментариях...
😁18🎉3🤔2👍1🤯1
30 Jul 2026, 19:16 UTC≈2,700 views56 reactions1 Starread 12 August 2026 Агентам не нужен TDD
Дядя Боб говорит, что TDD вообще-то для людей и агентам совсем не обязателен, ведь у агента дела с краткосрочной памятью обстоят куда лучше, чем у людей.
А что нужно агентам по его мнению? Юнит тест, CRAP метрика и мутационное тестирование... Кто-то считает CRAP и делает мутационные тесты? Если первое ещё иногда интересно, то второе довольно спорная техника - если практикуете расскажите.
TDD !…
👍32👎10🤔8❤4🎉2
30 Jul 2026, 18:34 UTC≈2,420 views26 reactionsread 12 August 2026 Photo
Мой тест на AGI
🤯18😁8
29 Jul 2026, 08:01 UTC≈2,380 views21 reactions2 Starsread 12 August 2026 Photo
Kimi K3 и ревью моделями разных семейств
Ну как вам новая Kimi K3? Медленно? Если использовать ее не как основную модель, а как еще одно мнение - вполне норм, тем более, что она действительно находит интересное в дополнение к Опусу. Сейчас как раз работаю над очень сложной задачкой по улучшению комплексного и длительного воркфлоу, он должен быть устойчивым к разным сбоям, там всякие outbox'ы, умные фолбеки и другие …
👍16❤5
24 Jul 2026, 17:33 UTC≈2,910 views19 reactionsread 12 August 2026 Photo
Аномалии Opus 5 и оптимальный reasoning effort
Если вы используете агентов так активно, что даже 200$ лимитов вам не хватает, ну или просто хотите получать адекватный результат быстрее (иногда в разы), то надо озаботиться выбором оптимального уровня размышления модели. Так вот, из официального анонса это неочевидно, а вот из системной карточки вполне.
И там видно, что в Opus 5 medium effort часто оказывается даже э…
👍12❤7
24 Jul 2026, 17:02 UTC≈2,280 views12 reactionsread 12 August 2026 Photo
Opus 5
Похоже, все-таки придется снова брать Claude 200$...
Для гурманов: Opus 5 System Card. (193 страницы paper!)
🤯8👍4
24 Jul 2026, 06:47 UTC≈2,760 views28 reactions3 Starsread 12 August 2026 Photo
Все лимиты и ресеты для Codex 200$ закончились. Рекорд - расход 2 недельных подписки за сутки (работа над RepoContextBench v2 ведется полным ходом). А Claude медленный, да еще и с лимитированным фейблом. В итоге, взял Грока за 300$ 100$ - говорят, там лимиты почти бесконечные и все очень быстро. Грок за 30$ мне понравился как по качеству, так и по скорости.
Грока я использую в качестве исполнителя внутри OpenCode (во…
❤19👍9
21 Jul 2026, 19:21 UTC≈2,100 viewsread 12 August 2026 Вырубал комментарии временно, защищаясь от наплыва ботов. Сейчас вернул - пишите!
21 Jul 2026, 19:17 UTC≈2,280 views9 reactionsread 12 August 2026 Photo
Ну, это так для сравнения (DeepSWE 1.1).
Юзает ли кто-нибудь Gemini нынче? Кажется, совсем у них дела плохи. Раньше хоть дешевые мелкие модели были (мы в CodeAlive вовсю их гоняли при индексации), а сейчас вообще юзкейсы непонятны.
Я, кстати, в добавку к Codex и Claude взял еще на Grok подписку и использую в кач-ве ревьюера - действительно находит много интересного, я доволен.
А Fable использую как эксперта-консульта…
❤5👍4
Showing the 12 most recent of 18 posts we hold for @ai_driven. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.