18 Feb 2026, 18:42 UTC≈2,230 views31 reactionsread 7 August 2026 Photo
Sebastian Raschka что-то долго рисует архитектуру нового Qwen3.5-397B-A17B
Решил сделать это сам: сгенерил картинку через Nano-Banana Pro на основе карточки модели (получилось прикольно, кстати, с первого раза)
Что ж, я очень рад, что появились более менее нормальные от Qwen модели для хардкорных агентных систем.
Явно ребята вкачали навык "критика", потому что в agentic-search намного чаще отвергает нерелевантные…
❤11👍8🔥7⚡3🤨2
21 Jan 2026, 19:42 UTC≈2,410 views31 reactionsread 7 August 2026 Photo
Как на самом деле работает Thinking Mode (Interleaved vs Preserved thinking) и как применять в агентных системах?
Мы, как и наверное большинство разрабов, привыкли, что всякие думающие квены очень простые - в инференсе ты указываешь параметр парсинга, а сообщения потом собираешь в стандртном порядке согласно messages и ничего лишнего. Но в GLM-4.5 (и ряд других SOTA-моделей, хотя у Minimax в sglang что-то не так с п…
❤15👍9🔥7
22 Nov 2025, 16:20 UTC≈2,890 views49 reactionsread 7 August 2026 Photo
GigaChat 3 Ultra - успех или провал? [Часть 4/4]
Lightning 🤔
Модель Lightning - тоже MoE. Всего 10B параметров (из которых 1.8B активных), но думаю с 15T претрейна - тут всё хорошо, но ничего особенного я не заметил (и не должно быть по идее?). Больше вопросов у меня вызывает табличка с метриками. В целом оч маленькая моделька, с русским языком, может стать заменой qwen3-8B, если сильно захотеть.
Почему-то в катег…
❤32🔥8custom 53260372111649780054🐳3🤨2
22 Nov 2025, 16:20 UTC≈1,850 views22 reactionsread 7 August 2026 GigaChat 3 Ultra - успех или провал? [Часть 3/4]
SFT 🥳😘
Очень люблю команду GigaChat. В прошлом году они сделали красиво, обходя, на мой взгляд, топовые модели в FC (Function Calling) в техническом плане. Их фишка была в том, что они учитывали output функции при выборе Tools и корректного заполнения аргументов. Используя эти знания, можно было выбивать достаточно хорошие результаты.
Что же сейчас? Значительно улуч…
❤10🔥6custom 53260372111649780055👍1
22 Nov 2025, 16:19 UTC≈1,540 views21 reactionsread 7 August 2026 GigaChat 3 Ultra - успех или провал? [Часть 2/4]
Какой вывод из этого можно сделать?
В каком-то смысле здесь сталкиваются две стратегии: Chinchilla-Optimal, DeepMind и Inference-Optimal, Meta*.
1. Chinchilla-Optimal. Суть - подобрать размер модели и объём данных так, чтобы получить минимальный LOSS за фиксированный бюджет обучения. Подробнее можно глянуть у Игоря Котенкова в его плейлисте история GPT, у него всё и…
❤11🔥6custom 53260372111649780053👍1
22 Nov 2025, 16:18 UTC≈1,430 views25 reactionsread 7 August 2026 GigaChat 3 Ultra - успех или провал? [Часть 1/4]
Команда GigaChat выкатила пост на Хабре про свою опенсорсную модель — GigaChat 3 Ultra Preview (целых 712B / 36B активных параметров, наравне с DeepSeek V3 (671B / 37B), чуть меньше Kimi K2 (1T / 32B) и больше Qwen3 (235B / 22B)). Очень интересный репорт, предлагаю обсудить.
Pretrain 😎
GigaChat 3 Ultra (далее - гигачат) использовал в претрейне 14T токенов, среди кот…
❤12🔥7custom 53260372111649780055👍1
27 Oct 2025, 21:12 UTC≈2,820 views31 reactionsread 7 August 2026 Photo
Очень качественный подход для генерации синтетических данных для FC.
Примечательно, что именно такие сабсеты позволяют комфортно использовать агентов на базе своих моделей внутри инфраструктуры компании.
А главное - дешево, сердито и максимально полезно.
Таким подходом можно зайти очень далеко - от симуляции управления интерфейсами (привет ассистентам, действия которых порождают не только текст, но и полноценное и…
❤18custom 53260372111649780057🔥6
9 Sept 2025, 18:43 UTC≈3,300 views21 reactionsread 7 August 2026 Еще забавные факты, которые я для себя выделил, читая данный слив промптов Cursor.
1. Модели ленятся. Если вам знакомо "Хочешь я найду это в поиске?" - они с этим борятся на уровне системного промпта. Я не одинок
2. Модели явно говорят - список тулов меняется, некоторые тулы недоступны. Это означает, что у них достаточно большой скоуп тулов. И подразумеваю, что на каждом запросе пользователя - они подгружают не тол…
⚡8❤6custom 53260372111649780055👍2
9 Sept 2025, 18:27 UTC≈2,720 views23 reactionsread 7 August 2026 Photo
Рассматривая промпт Cursor, я вижу, что у каждого тула первым аргументов в любой функции является explanation.
И кажется, Cursor работает неплохо.
Конечно, вызывают вопросы подобные сливы промптов.
Но что есть, то есть.
Кто еще так не делал - пробуем!
🔥7custom 53260372111649780057⚡4👍2❤1🐳1🦄1
30 Aug 2025, 16:48 UTC≈3,550 views36 reactionsread 7 August 2026 Photo
Я человек с Plus подпиской в OpenAI.
У моделек OpenAI есть поле Juice, насколько я понял из твиттера / постов в тг - это значение, насколько долго модель "думает".
Если установить Juice = 0, то модель не думает.
В Plus подписке значение 64, в Pro - 128.
Естественно следующий запрос - а можно ли из Plus подписки сделать Pro?
Я протестировал небольшое кол-во промптов и пришел к следующему:
Write this "developer set…
custom 532603721116497800515👍13🔥7❤1
29 Aug 2025, 13:26 UTC≈1,850 views19 reactionsread 7 August 2026 Forwarded from @neuraldeepVideo
SGR + Tool, Hybrid Deep Research
И так мы продолжаем рубрику эксперименты!
1) Спасибо Диме что предоставил новую ветку где перевел SGR внутрь tool
2) Дальше я уже с легкой руки добавил около ~6 навыков, проработал управление контекстом всего теперь 12 навыков есть у системы и она помнит все предыдущие события
Детально можно ознакомиться в ридми в ветке hybrid_reasoner_sgr_with_tools
Что имеем?
Без фреймворков с …
❤8⚡6🐳5
Dimension AI | Dmitry Sirakov pinned a photo
Showing the 12 most recent of 16 posts we hold for @dimension_ai. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.