1 Dec 2025, 12:28 UTC68 views3 reactionsread 11 August 2026 Часть 2.
Да даже возьмём нашу речь, попробуйте назвать хотя бы 20 рандомных слов подряд - где-то после десятого вы обязательно запнётесь и начнёте задумываться над следующим словом или набором слов. А если попытаетесь поймать себя в этот момент на мысли - обнаружите, что мозг пытается найти следующую ассоциацию (не напоминает, случаем, скрытые активации MLP?..). Начиная что-то говорить, мы не знаем, как закончится п…
🔥3
1 Dec 2025, 12:28 UTC55 views2 reactionsread 11 August 2026 Посмотрел тут интервью Ильи Суцкевера (и почитал комменты заодно)
Прикольно, пару интересных мыслей есть, но в общем - как по мне, много воды и того, что уже всем давно известно. Но некоторые тейки и комменты людей под постами пабликов сподвигли меня на очередной дамп регистра мыслей (как оно чаще всего и происходит, в принципе) 🫨
Можно даже дать такое громкое название посту - мы ближе, чем кажется
(часть 1)
И да,…
🔥2
18 Nov 2025, 19:26 UTC63 views2 reactionsread 11 August 2026 Вышла Gemini 3
Вероятно, многие уже заметили релиз, а некоторые негодуют о том, что случилось с результатами по коду (они улучшились незаметно).
Я пока еще не успел достаточно потыкаться, но то, что это одна из лучших моделей на рынке - можно сказать с уверенностью.
Хотелось бы спекулятивно отметить возможный вижн гугла и того, для чего, собственно, эта модель.
Вероятно, сейчас мир (топ ai компании) начал достигат…
🔥2
30 Sept 2025, 14:50 UTC98 views2 reactionsread 11 August 2026 За последнее время много разного повыходило, начиная от обновлений закрытых моделей, заканчивая новой линейкой Qwen с сотнями миллиардами параметров.
Но самое интересное - нам представили пару новых архитектурных модификаций! Я говорю о Qwen-Next и DeepSeek v3.2. Давайте посмотрим, что там под капотом, сегодня на приёме - новенький ГлубокийПоиск в3.2 😄
Парням было мало преимущества скоростной генерации MoE архитекту…
👍1🔥1
24 Sept 2025, 22:02 UTC62 viewsread 11 August 2026 О, кто-то тоже додумался до такой штуки. Интересно, вдохновлялись ли они AS-Pharade?.. 😂
24 Sept 2025, 22:02 UTC81 views1 reactionsread 11 August 2026 Forwarded from @data_secretsPhoto
Teaching LLM to Plan: разбираем свежую громкую статью от MIT про новый подход к обучению моделей мыслить
Как мы уже много раз писали, сейчас ризонинг (хотя он и работает замечательно) – это на самом деле никакой не ризонинг. Рассуждения в LLM называются так чисто условно: на деле мы остаемся в абсолютно той же парадигме, просто модель теперь генерирует для ответа больше токенов.
А вот как научить LLM действительно …
🔥1
2 Sept 2025, 09:31 UTC88 views3 reactionsread 11 August 2026 Важный апдейт!
Я скоро буду мигрировать в другую компанию, даже не знаю, будет ли там время/возможность запускать обучение будущих моделей.. Но даже если такой возможности не предвидится - думаю, буду арендовать сервера с GPU.
В связи с этим, сделал коммит с имплементацией Dynamic Finetuning (DFT), о котором писал выше, можно пробовать тренироваться таким методом)
Так же, всё-таки решил залить экспериментальную мо…
🔥3
22 Aug 2025, 15:09 UTC81 views6 reactionsread 11 August 2026 Ну что, момент настал!
AS-GPT-5
Своего рода magnum opus того, чем я последние полгода занимался. До этого момента я обучал только готовые модели, включая модель от Ruadapt с замененным токенайзером.
И хоть получалось неплохо, на некоторых задачах метрики росли, мы даже смогли залететь на арену (кстати, Watari до сих пор там!).
А если вспомнить про первые потуги заводить GRPO, когда ни у кого не было примеров, да и…
🔥6
18 Aug 2025, 08:44 UTC74 views4 reactionsread 11 August 2026 Апдейт спустя 10 дней:
- Модель всё ещё обучается, я успел столкнуться с проблемами, включая нахождение аппаратной ошибки карты и битых чекпоинтов, но.. всё благополучно победил, пришлось некоторые этапы рестартить, конечно, без жертв не обошлось
- Я довайбил сайт проекта - attn-signs-center, он почти полностью написан Gemini 2.5 Pro, поскольку я разбираюсь в вебе чуть менее чем никак. Там планирую тоже выпускать "ст…
🔥4
8 Aug 2025, 09:40 UTC83 views2 reactionsread 11 August 2026 Я тут обнаружил, что с ядром flash-attn3 я могу спокойно держать обучение в 8192 max_len и не падать в ООМ на одной машине с двумя хопперами!
И к тому же, теперь я могу держать GRPO обучение на одной ноде, а инференс vLLM на второй, без надобности коммуникаций друг с другом карт. И даже не нужны эти свитчи (которые блин до сих пор не могут завести на нашем ЦОДе, потому что боже, благослови импортозамещённые айти техн…
🔥2
7 Aug 2025, 11:59 UTC74 views3 reactionsread 11 August 2026 Photo
Ещё апдейты:
Пока жду инфру, работаю над сайд-квестами и генерирую датасеты. Из недавних достижений:
- Библиотека MyLLM получила целых 15 звёздочек на github'е, а значит, многим людям фреймворк пришёлся по душе и, наверное, оказался полезным
- Наш последний чистый математический ризонер (GPTR-8b-v2) скачали более 650 раз и продолжают скачивать - это не может не радовать, думаю, народу нужны сильные русские ризонеры.…
🔥3
6 Aug 2025, 09:21 UTC65 views4 reactionsread 11 August 2026 В общем, да, вышел GPT-OSS (open source series или что-то в этом роде), первый за 6 лет открытый релиз OpenAI.
И, если честно, не понимаю, почему многие захейтили модель.
Чтобы понять, почему и зачем - нужно посмотреть, что сейчас есть предлагает опенсорс:
- Есть сильные средние модели для запуска на high-end consumer GPU вроде Qwen3
- Есть очень сильные модели для запуска на серверных GPU типа GLM и DeepSeek
- Есть…
🔥3❤1
Showing the 12 most recent of 18 posts we hold for @attnsigns. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.