9 Dec 2023, 21:51 UTC≈2,120 views6 reactionsread 7 August 2026 🔥 Подборка интересных проектов:
Text Embeddings Inference (HF) - production ready деплой классификационных моделей (внутри докер, grpc, динамический батчинг). По тестам чутка быстрее onnx.
^ [github]
AnomalyCLIP - клип для детекция аномалий (аварий, нападений) в видео. По факту обычная классификация, но выглядит прикольно.
^ [github]
PokemonRedExperiments - обучили RL на 2D игре про покемонов. Возможно получиться…
🔥6
Signed Максим Герасимов
17 Oct 2023, 06:59 UTC≈1,990 views10 reactionsread 7 August 2026 Photo
MLC LLM
*Machine Learning Compilation for Large Language Models
🔥Коротко: движок, который помогает деплоить ваши модели под Android, IOS, Windows, Linux, Mac и Web Browser
Больше всего меня заинтересовал WebGPU - можно переложить часть вычислений на пользователя, чтобы разгрузить сервер. Особенно актуально для чат-ботов или небольших приложений, для которых хост с гпу - оверкилл.
@data_morning
Сайт
Github
👍6🔥3🥰1
Signed Максим Герасимов
15 Oct 2023, 14:47 UTC≈14,200 views9 reactionsread 7 August 2026 Video
🧹Scrapper
Инструмент для парсинга страниц с JS.
Работает в докере, можно обращаться по апи, сложнее детектируется как бот, может парсить в режиме просмотра (только текст), может использовать прокси и многое другое.
@data_morning
Github
👍9
Signed Максим Герасимов
23 Sept 2023, 17:20 UTC≈7,360 views8 reactionsread 7 August 2026 Video
Сморите что нашел
👉DragDiffusion - модель, способная редактировать изображения на основе точек, заданных юзером. Есть примеры использования, руководство по настройке и запуску модели.
@data_morning
github
примеры
🔥5👍3
Signed Максим Герасимов
21 Sept 2023, 16:39 UTC≈8,440 views10 reactionsread 7 August 2026 Photo
👀 Распознавание патологий глаза
👉 FLAIR - моделька по типу клипа для распознавания 96-и классов патологий глаза. Обучена на 37 датасетах. Показывает высокие результаты при zero-shot подходе с "расшифровками" медицинских абревиатур. Для каждой аббревиатуры есть таблица с полным названием и 1-5 коротких экспертных описаний. Для анализа требуется изображение глаза в высоком разрешении.
@data_morning
Project Page | Pa…
👍9🤩1
Signed Максим Герасимов
7 Aug 2023, 16:26 UTC≈1,400 views10 reactionsread 7 August 2026 Photo
👉Streamsync
Достойный аналог Streamlit для деплоя Big Data приложений.
🔥Плюсы: разделение концепции UI и бизнес-логики, многократный прирост скорости за счет сокетов, скрипты запускаются только раз.
Основная проблема Streamlit - любое действие на странице требует полный прогон всего кода. Вас не спасет кеширование - если данные весят несколько гигов, то на любое действие пользователя придется создавать копию данны…
🔥10
Signed Максим Герасимов
31 Jul 2023, 17:34 UTC≈5,610 views18 reactionsread 7 August 2026 Photo
Fonetika
👉Библиотека позволяет представить варианты написания одного слова как последовательность букв и цифр, может измерять расстояние между фонемами.
корован -> 3090208
караван -> 3090208
К0р0ван -> 3090208
километр -> 30708049
кoрован -> 3090208 (первая 'o' - латиница)
🔥Кейс - проверка никнейма на запрещенные слова
@data_morning
Github
🔥16👍1🤯1
Signed Максим Герасимов
24 Jul 2023, 19:24 UTC≈1,770 views8 reactionsread 7 August 2026 Photo
🥋Парсинг кода
👉 tree-hugger - надстройка над tree-sitter (абстрактное синтаксическое дерево) для Python, PHP, Java, JavaScript, C++.
Основной плюс этого API - запуск из питона. Часто парсеры пишутся и запускаются из под одного языка (Условный парсер Go написан на Go). Это накладывает некоторые ограничения, когда приходится работать с несколькими ЯП.
🔥 Библиотека адаптирована под датамайнинг из открытых репозиторие…
🔥7❤1
Signed Максим Герасимов
23 Jun 2023, 19:50 UTC849 views6 reactionsread 7 August 2026 Photo
Confusion Matrix
Вероятно вы сталкивались с ней, когда изучали метрики классификации. Считать таблицу приходится крайне редко, но бывает необходимо во время собеседований.
Задача решается просто, когда мы работаем с бинарной классификацией - легко запомнить 4 случая. Но как считать матрицу, когда у нас N лейблов?
Не советую запоминать картинку как FN - строка или FP - колонка. Порешайте, потупите, но осознайте.
С…
👍6
Signed Максим Герасимов
4 May 2023, 19:44 UTC≈7,540 views14 reactionsread 7 August 2026 Photo
ML Model Watermarking
SAP сделали инструмент для защиты моделей машинного обучения путем добавления водяных знаков (в веса модели) на основных фреймворках: Scikit-learn, PyTorch, HuggingFace.
Добавление водяных знаков не сильно влияет на точность модели, но позволяет доказать ее владение и предотвратить несанкционированное использование.
@data_morning
github
🔥10🌚2👍1🤔1
Signed Максим Герасимов
21 Apr 2023, 17:49 UTC≈1,070 views10 reactionsread 7 August 2026 Photo
Multilingual databricks dolly 15k
Набор из 15 000 высококачественных пар запросов/ответов (инструкций), созданных людьми и предназначенных для настройки больших языковых моделей. Может применяться в коммерции.
Сделал параллельный корпус на 6 языков (Russian, English, Kazakh, Spanish, Italian, French) из исходного databricks-dolly-15k. Всего около 90к строк.
Ждем Dolly v2 для русского.
@data_morning
Данные на Kag…
🔥8👍1💩1
Signed Максим Герасимов
16 Apr 2023, 15:25 UTC≈6,180 views9 reactionsread 7 August 2026 Photo
Tweets for Stocks
Вы наверняка слышали о том, как сообщения известных личностей могут повлиять на цены акций. Нашел проект, в котором решили проверить существует ли зависимость между твитами и изменением цен на акции.
Для этого они использовали несколько моделей, включая catboost, tr roberta и naive bayes. Наилучший результат на классификации (повышение/понижение цены) составил 0,58.
@data_morning
В репозитории е…
👍9
Signed Максим Герасимов
Showing the 12 most recent of 17 posts we hold for @data_morning. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.