1 Jun 2026, 13:35 UTC737 views18 reactionsread 6 August 2026 🤖 Обновление пула моделей в LLM Arena.
Давно не добавляли новые модели — пора это исправить.
Мы видим, что интерес к проекту не просто сохраняется, а растет: каждый месяц в LLM Arena приходят новые пользователи, а анонимная арена продолжает получать ваши голоса. Для нас это лучший показатель того, что проект остается нужным и полезным.
Поэтому обновили пул моделей:
— добавили Gemini 3.5 Flash
— добавили GPT-5.5
—…
❤11👍3👎2💩2
26 May 2026, 14:47 UTC≈1,030 views18 reactionsread 6 August 2026 👀 В сентябре 2025 года мы опубликовали исследование о том, что рейтинги LLM теряют доверие в вопросе выбора модели для бизнес-задач.
В мае этого года команда Generation AI продолжила изучать вопрос основываясь на нашем исследовании.
В 2026 году бизнес выбирает уже не «лучшую модель», а рабочую конфигурацию под конкретный процесс.
То есть лояльность к конкретной LLM почти исчезает. Именно поэтому главный навык бизн…
❤7👍5🔥4👎1💩1
23 Mar 2026, 06:18 UTC≈1,530 views17 reactionsread 6 August 2026 👤 Добавили на LLM Arena новые модели
Теперь доступна вся линейка GPT 5+ от OpenAI (с 5 по 5.4). Стабилизировали работу Claude Haiku 4.5 и Claude Opus 4.1 — эти модели запрашивали чаще всего.
Улучшили скорость ответа и мониторинг на своей стороне: теперь будем оперативнее восстанавливать доступность в случае сбоев.
❤️ Спасибо всем, кто голосует на анонимной арене. Именно благодаря вам мы понимаем, что проект остает…
👍12🔥3❤2
22 Jan 2026, 07:46 UTC≈2,140 views21 reactionsread 6 August 2026 Photo
📣Обновили рейтинг LLM Arena
✅Это первый апдейт в новом году! Проверяйте актуальные позиции по ссылке.
Нам нужна ваша помощь: За последние пару месяцев добавлено много новых моделей, но для отображения их в общем зачете критически не хватает голосов.
Пожалуйста, уделите пару минут и проголосуйте в анонимном сравнении. Это поможет нам быстрее откалибровать новинки и добавить их в таблицу.
✍️Перейти к голосованию: l…
👍14❤5🔥2
19 Jan 2026, 15:19 UTC≈3,740 views27 reactions3 Starsread 6 August 2026 ⚡️ Анализируем исследование OpenRouter, вышедшее в декабре 2025 года.
В исследовании изучили 100 трлн токенов живого трафика через OpenRouter (300+ моделей, 60+ провайдеров, миллионы пользователей, данные до ноября 2025 года).
1. После выхода OpenAI o1 (декабрь 2024) индустрия дружно подсела на multi-step reasoning — думать “в несколько шагов” стало базовой потребностью.
• Reasoning-модели уже >50% всего трафика.
•…
👍16🔥6🤝4❤1
15 Jan 2026, 09:41 UTC≈1,530 views21 reactionsread 6 August 2026 ⚡️ Новые модели на арене: обновления декабря и января
❌ В декабре добавили флагманы от Сэма Альтмана и Ляна Вэньфэна: GPT-5.2 и DeepSeek 3.2. В представлении модели не нуждаются, но стоит отметить: они задали новую планку SOTA в задачах Math/Code, подтверждая, что законы масштабирования пока продолжают работать.
Также обновилась на арене и экосистема Яндекса: YandexGPT 5.1 PRO и Alice AI LLM. Архитектуру заметно до…
👍13❤5🔥3
24 Dec 2025, 17:36 UTC≈2,070 views35 reactions2 Starsread 6 August 2026 🎭OpenRouter всё?
На этой неделе OpenRouter начал отключать клиентов из РФ. Это задело и нашу Арену (мы использовали их API для балансировки и диверсификации проектов), но мы оперативно всё починили и восстановили доступ.
Полагаться на OR становится рискованно. Чтобы вы не теряли доступ к API LLM и других GenAI моделей, предлагаем бесшовный переход в экосистему VseLLM. Бесшовный, потому, что мы используем OpenAI-сов…
👍25💩5👎3❤2
10 Dec 2025, 14:03 UTC≈1,920 views15 reactionsread 6 August 2026 Подборка актуальных материалов по LLM и автоматизации
Основатель LLM Arena, Роман Куцев продолжает развивать тему LLM и автоматизации в блоге на Хабр, в том числе публикуя переводы зарубежных статей по теме, исследования и руководства.
Делимся подборкой полезных материалов за 2025:
👀 LLM в роли «судьи» vs. человеческая оценка: почему вместе — лучше
👀 Как подключить LLM в n8n без иностранной карты и протестироват…
👍10🔥3🤝2
24 Nov 2025, 11:14 UTC≈9,810 views29 reactions2 Starsread 6 August 2026 Video
🔫 GenCode Mini Gallery Bench
LLM Arena совместно с Сергеем Курбановым (руководитель направления RnD в компании MWS) рады представить новый бенчмарк.
📈 LLM стремительно эволюционируют и выходят на уровень AGENT-поведения, где модели решают задачи от анализа данных до полноценной разработки. На этом фоне особенно интересно посмотреть на то, как модели в режиме реального времени справляются даже с такими, на первый вз…
❤11👍9🔥3🎄2💩2🤡1🤮1
19 Nov 2025, 05:34 UTC≈1,610 views17 reactionsread 6 August 2026 Photo
✅Gemini 3 Pro уже на арене!
Добавили свежую модель от Google, которая по отзывам многих превосходит Claude в задачах по коду — особенно в логике и архитектуре решений.
• Улучшенное рассуждение в сложных STEM-задачах
• Стабильная работа в агентных сценариях — от вызова инструментов до долгосрочного планирования
• Более надежные автономные действия
Протестировать можно уже на LLM Arena! Напоминаем, нам очень важны в…
👍9🔥6👌2
17 Nov 2025, 10:15 UTC≈1,450 views16 reactionsread 6 August 2026 💬 Добавили GPT 5.1
Заменили модель Polaris Alpha на то, чем она по сути и являлась.
Что говорят сами OpenAI о версии 5.1:
— Улучшено следование инструкциям пользователя;
— Модель сильнее ориентируется на смысловые связи в программировании, лучше анализирует архитектуру проектов, умнее формулирует причины и объяснения решений в коде;
— Возросла скорость реагирования на простые запросы — наблюдается снижение времени…
👍11❤5
14 Nov 2025, 16:54 UTC≈1,380 views21 reactionsread 6 August 2026 ⚡️ ЧЕРНАЯ ПЯТНИЦА НА LLM ARENA
— Обновили лидерборд LLM Arena, благодаря вашим голосам. Отдельно отметили модели доступные на VseLLM;
— Обновили рейтинг t2i Arena, опять же благодаря вам;
— Сделали небольшие UI-улучшения и оптимизацию в мобильной версии;
— Обновили лидерборд Ru Arena Hard;
— Улучшили отображение графика анализа соотношения качества и цены.
🔞И все это со скидкой 99% 100% для вас. Рады стараться.
📸…
❤13😁5🤝2👍1
Showing the 12 most recent of 20 posts we hold for @llm_arena. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.