30 Jun 2026, 17:05 UTC71 views5 reactionsread 10 August 2026 Photo
Can LLMs Compute Zakat? A Symbolic Islamic Finance Benchmark for Cross-Lingual Islamic Finance
Авторы предлагают кросс-языковой символьный бенчмарк для оценки LLM на задачах из области финансов но с исламской спецификой 🔫. Бенчмарк включает 129 шаблонов, опирающихся на формально специфицированные шариатские нормы AAOIFI. Шаблоны охватывают шесть категорий операций: закят (50), исламское наследование (фараид, 31), це…
👍2🫡2🔥1
9 Nov 2025, 19:22 UTC161 views9 reactionsread 10 August 2026 Photo
NP-Engine: Empowering Optimization Reasoning in Large Language Models with Verifiable Synthetic NP Problems
В статье предлагают фреймворк NP-ENGINE для обучения и оценки LLM способности находить приближенные решения NP-трудных задач. Суть работы в том, чтобы научить ЛЛМ "оптимизационному мышлению", т.е. способности находить качественные (т.е. субоптимальные), а не только допустимые решения. В основе NP-ENGINE лежит …
🔥5👍3👌1
9 Jul 2025, 15:32 UTC156 views8 reactionsread 10 August 2026 Photo
Memory Sharing for Large Language Model based Agents
В работе предлагается довольно интересная модель логики обмена сообщениями ЛЛМ-агентов на основе шины.
Есть такое классическое решение для разработки архитектур передачи сообщений - шина. Например, в пк процессор и интерфейсы ввода/вывода, или на уровне ОС логика передачи сообщений между приложениями может быть реализована через Desktop Bus (шина). Так вот, в ста…
❤4👍2🔥2
5 Jul 2025, 15:49 UTC117 views4 reactionsread 10 August 2026 Photo
Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
В работе разрабатывается генеративный датасет Enigmata, который предназначен для улучшения способностей к ризонингу у LLM. Бенчмарк содержит 36 игр и задач из разных категорий (криптография, арифметика, логика, сеточные головоломки и др.) В основе бенчмарка лежит 1) генератор задач (для каждого из 36 типов) контролируемой…
👍2🔥2
5 Jul 2025, 15:01 UTC81 views4 reactionsread 10 August 2026 Photo
OJBench: A Competition Level Code Benchmark For Large Language Models
В работе представлена оценка всех топовых ЛЛМ на задачах по код ризонингу. Предлагается бенчмарк OJBench включает 232 задачи из соревнований по программированию China’s National Olympiad in Informatics (NOI) и International Collegiate Programming Contest (ICPC). Результаты показывают, что даже самые топовые модели фейлятся на задачах повышенной сл…
🔥2😱2
25 May 2025, 14:31 UTC126 views7 reactionsread 10 August 2026 Photo
Harnessing the Universal Geometry of Embeddings
Работа представляет метод vec2vec для трансляции эмбеддингов текстов из одного векторного пространства в другое без каких-либо парных данных (как в CLIP). Подход основан на гипотезе платонических представлений (предположение, что пространство векторных представлений внутри разных моделей и даже для разных модальностей в конечно счете имеет некоторую универсальную общую…
👍3🔥3😱1
24 Apr 2025, 07:51 UTC131 views3 reactionsread 10 August 2026 Photo
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
В статье предлагается подход для улучшения математического ризонинга LLM в задачах, где модели, обученные с помощью RL (например, DeepSeek R1), уступают интерпретаторам кода. Подход называется ReTool и работает в 2 этапа:
1) Динамическое чередование выполнения кода в реальном времени и рассуждений на естественном языке.
2) Автоматизированный RL-based под…
🔥2👍1
14 Apr 2025, 19:50 UTC108 views5 reactionsread 10 August 2026 Photo
Can LLMs Obfuscate Code? A Systematic Analysis of Large Language Models into Assembly Code Obfuscation (AAAI 2025)
Авторы вредоносных программ часто используют обфускацию кода, чтобы их вредоносное ПО было сложнее обнаружить. Существующие инструменты для генерации обфусцированного кода часто требуют доступа к исходному коду, а добавление новых обфускаций является нетривиальным, трудоемким процессом. Авторы задаются …
👍2🔥2❤1
11 Apr 2025, 13:25 UTC94 views3 reactionsread 10 August 2026 Photo
StructRAG: Boosting Knowledge Intensive Reasoning of LLMs via Inference-time Hybrid Information Structurization (ICLR 2025)
Retrieval-augmented generation (RAG) - подход для улучшения LLM во многих задачах, основанных на внешних знаниях. Существующие методы RAG работают не очень хорошо с задачами на ризонинг, поскольку полезная информация, необходимая для этих задач, сильно разбросана по системам хранения знаний. С…
🔥2👍1
8 Apr 2025, 14:39 UTC105 views3 reactionsread 10 August 2026 Photo
Can ChatGPT Learn My Life From a Week of First-Person Video?
Исследуется способность LLM узнавать о личной жизни владельца с помощью данных с action-камеры. Автор носил гарнитуру с камерой 54 часа в течение недели. Затем вгружал в GPT-4o and GPT-4o-mini и запрашивал анализ полученной инфы. Обе модели узнали базовую информацию об авторе (приблизительный возраст, пол). Более того, GPT-4o правильно сделала вывод, что а…
👍1🔥1🤣1
7 Apr 2025, 12:56 UTC84 views5 reactionsread 10 August 2026 Photo
Synthesizing Programmatic Reinforcement Learning Policies with Large Language Model Guided Search (ICLR 2025)
Programmatic reinforcement learning (PRL) has been explored for representing policies through programs as a means to achieve interpretability and generalization. Despite promising outcomes, current state-of-the-art PRL methods are hindered by sample inefficiency, necessitating tens of millions of program-env…
👍2🔥2🫡1
5 Apr 2025, 06:54 UTC78 views5 reactionsread 10 August 2026 Photo
Beyond the Lazy versus Rich Dichotomy: Geometry Insights in Feature Learning from Task-Relevant Manifold Untangling
(ICLR 2025 rejected)
The ability to integrate task-relevant information into neural representations is a fundamental aspect of both human and machine intelligence. Recent studies have explored the transition of neural networks from the lazy training regime (where the trained network is equivalent to a…
👍2🔥2🫡1
Showing the 12 most recent of 17 posts we hold for @arxiv_links. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.