3 Jun 2026, 17:40 UTC122 views2 reactionsread 8 August 2026 Forwarded from @ai_newzPhoto
Gemma 4 12B
Принимает на вход текст, аудио и изображения с видео. Длина видео ограничена 30 секундами, а аудио 60 секундами. Модель ризонер, с 256к контекста и лицензией Apache 2.0.
Самое интересное в релизе — то как в нём устроена мультимодальность. Обычно моделям для мультимодальности нужен отдельный энкодер, здесь же они обходятся простыми линейными проекциями, что требует меньше параметров и вычислений.
Техреп…
🔥2
14 Apr 2026, 15:47 UTC208 views4 reactions4 Starsread 8 August 2026 Forwarded from @tech_rwbVideo
⚙️ Тестируем мультимодальный поиск товаров
Теперь можно не только загрузить изображение, но и добавить к нему текстовое уточнение — система учитывает оба источника и точнее подбирает товары.
Функция приближает поиск к формату ассистента: пользователь может показать пример и сразу уточнить, что именно хочет изменить или найти.
В основе решения лежит комбинация нейросетей, обученных разработчиками Wildberries. Благо…
🔥4
2 Apr 2026, 16:30 UTC209 views2 reactionsread 8 August 2026 Forwarded from @ai_newzPhoto
Вышла Gemma 4
Линейка состоит из 4 моделей — 31B Dense, 26B-A4B MoE и E4B и E2B для смартфонов (у этих двух архитектура схожая на Gemma 3n). Все они гибридные ризонеры и умеют в картинки с видео, а E4B с E2B ещё и воспринимают аудио. Контекст поддерживается 256к для двух больших моделей и 128к для двух маленьких.
Все модели, кроме самой маленькой, бьют Gemma 3 27B на всех представленных бенчах (самая маленькая на п…
🔥2
1 Mar 2026, 11:19 UTC176 views4 reactionsread 8 August 2026 Forwarded from @kostya_tretyakovPhoto
Photo, posted without a caption
❤4
1 Mar 2026, 11:19 UTC224 views6 reactions2 Starsread 8 August 2026 Forwarded from @kostya_tretyakov
CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding
Сегодня хотелось бы разобрать относительно новую статью, в которой представлен интересный метод оптимизации работы с кодом в MLLM. Авторы предлагают вместо подачи стандартного текстового представления использовать сжатое изображение кода. Такой подход позволяет существенно сократить количество входных токенов и тем самым повысить скорость …
🔥6
24 Feb 2026, 19:51 UTC221 views3 reactionsread 8 August 2026 Forwarded from @downloadmoregpus
Совсем недавно ребята из Z.ai опубликовали техрепорт GLM-5. Что из важного можно сказать об их трейн инфре:
* Всё делалось на китайских чипах, - чуваки проделали большую работу чтобы адаптировать различные существующие GPU-кернелы под них. Партия довольна.
* Используют Pipeline Parallelism, - это когда модель делится на кусочки вертикально, и каждый PP-ранг обладает срезом слоёв всей модели. Пайплайнинг очень вкусн…
❤3
20 Feb 2026, 10:28 UTC175 views3 reactions1 Starread 8 August 2026 Forwarded from @WaveCut_VibinPhoto
Это было неизбежно: рано или поздно должны были появиться специализированные решения для инференса.
И вот, Taalas (бывшая команда из Tenstorrent) выкатили то, чего я так ждал — настоящий Direct-to-Silicon.
Ребята не стали мелочиться и буквально «запекли» модель в кремний. Никакой внешней памяти, никакого HBM, никакой сложной упаковки. Веса модели и архитектура — это и есть сам чип.
Цифры выглядят дико: 17,000 токен…
❤3
25 Jan 2026, 14:57 UTC455 views4 reactions1 Starread 8 August 2026 Photo
Современные модели компьютерного зрения видят только то, что у них "перед глазами", не вникая в абстрактный смысл изображения. Такой взгляд резко контрастирует со взглядом человека, который способен увидеть большее нежели конкретный объект.
Авторы статьи Relational Visual Similarity попытались решить эту проблему.
В основе их подхода лежит создание анонимных описаний для изображений, отражающих логику отношений меж…
❤🔥2❤1🔥1
20 Jan 2026, 10:54 UTC295 views9 reactionsread 8 August 2026 Обновление на канале, теперь с постами мне будут помогать еще несколько моих коллег. Каждый пост будет подписан автором в виде упоминания никнейма в телеграм.
Помогают мне с каналом:
• @r_656_a - Настя
• @hegzom - Глеб
• @fluke_88 - Костя
❤9
30 Dec 2025, 15:40 UTC329 views2 reactionsread 8 August 2026 Photo
Всех с наступающим Новым Годом!
Прикладываю уже традиционную карточку с итогами года, спасибо что читаете!
P.S. в этом году карточку сгенерировал через сервис от @neural_prosecco, как мне кажется выглядит интереснее чем от tgstat.
❤2
19 Dec 2025, 08:38 UTC322 views7 reactionsread 8 August 2026 Forwarded from @abstractDLPhoto
OLMo 3
Это, пожалуй, самый честный и воспроизводимый релиз года. Тут выкатили вообще всё: от исходного кода и 6T токенов (Dolma 3) до каждого промежуточного чекпоинта и точного порядка данных в батчах.
Для тех, кто занимается ресёрчем, это не просто модель, а идеальный полигон для экспериментов.
В техрепорте много «вкусного» (и спорного):
- Delta-DPO: Авторы подтвердили гипотезу, что для ризонинга важнее не качес…
🔥4❤2👍1
25 Nov 2025, 20:58 UTC333 views3 reactionsread 8 August 2026 Хороший гайд про то как устроены non_blocking и pin_memory операции в PyTorch, наглядно демонстрирует как работает host2device, device2host копирование и рассказывает в каких ситуациях стоит использовать non_blocking и pin_memory, а в каких нет.
https://docs.pytorch.org/tutorials/intermediate/pinmem_nonblock.html
🔥2❤1
Showing the 12 most recent of 13 posts we hold for @neural_info. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.