17610
@haarrp - админ Вопросы с собеседований по Machine Learning, Data Science, Deep Learning и Нейроннным сетям @data_analysis_ml - анализ данных @ai_machinelearning_big_data @itchannels_telegram - важное для программиста
🔥 5ire — кроссплатформенный AI-ассистент и клиент MCP (Model Context Protocol)!
🌟 Он поддерживает интеграцию с популярными поставщиками AI-сервисов (например, OpenAI, Anthropic, Google и другими), а также предоставляет локальную базу знаний для обработки и векторизации документов. Проект использует MCP-протокол для подключения к различным инструментам, что позволяет работать с файловыми системами, базами данных и удаленными источниками данных.
🔐 Лицензия: GPL-3.0
🖥 Github
@bigdatai
🔥 UI-TARS Desktop — это приложение с графическим интерфейсом, основанное на модели компьютерного зрения, которое позволяет управлять компьютером с помощью естественного языка!
🌟 Оно поддерживает управление мышью и клавиатурой, а также выполняет захват экрана и распознавание объектов. Это кросс-платформенный инструмент для Windows и MacOS, который обрабатывает запросы локально, обеспечивая безопасность и конфиденциальность.
🔐 Лицензия: Apache-2.0
🖥 Github
@bigdatai
🔥 MedSSS — это небольшой медицинский языковой модельный проект, разработанный с использованием метода «медленного мышления» и самосовершенствующейся методики!
💡 Цель проекта — улучшить способность модели к медицинским рассуждениям. MedSSS использует модель PRM для выбора наиболее корректного ответа из нескольких возможных вариантов, что позволяет эффективно решать как традиционные задачи медицинского вопросно-ответного характера, так и более сложные клинические сценарии.
🔐 Лицензия: MIT
🖥 Github
@bigdatai
👣 Training a Rust 1.5B Coder LM with Reinforcement Learning (GRPO)
Источник: Oxen.ai Blog
Ссылка: Oxen.ai
Статья подробно рассказывает о процессе обучения специализированной языковой модели для генерации кода на Rust, обладающей 1.5 млрд параметров.
Авторы применяют метод обучения с подкреплением (GRPO) с использованием обратной связи от инструментов Rust (компилятор и система сборки cargo). Это позволяет модели учиться генерировать код, который успешно компилируется, проходит линтер (cargo clippy) и unit-тесты.
Подход к данным и метрикам: Описаны этапы подготовки датасета, в том числе адаптация существующих Python-подобных задач под синтаксис Rust, а также разработка специальных reward-функций, проверяющих качество сгенерированного кода.
Материал показывает, как можно использовать инструменты Rust для автоматизированной проверки качества кода, что может служить основой для создания интеллектуальных помощников и средств автоматизации.
🔗 Читать
@rust_code
🔥 Jina Serve — это облачно-ориентированный фреймворк для создания и развертывания мультимодальных AI-сервисов!
🌟 Он поддерживает взаимодействие через gRPC, HTTP и WebSocket, предлагая высокопроизводительную архитектуру для масштабирования, потоковой передачи данных и динамической обработки запросов. Основные возможности включают нативную интеграцию с ML-фреймворками, контейнеризацию, встроенный оркестратор микросервисов и поддержку Kubernetes.
🔐 Лицензия: Apache-2.0
🖥 Github
@machinelearning_ru
🔥 MiniCPM-o 2.6 — это мощная языковая модель с 8 млрд параметров, разработанная OpenBMB! Она поддерживает текст, изображения, видео и аудио, а также обеспечивает высококачественные ответы на естественном языке. Производительность модели сравнима с GPT-4o-202405, особенно в обработке мультимодального контента.
💡 Особенности MiniCPM-o включают расширенные возможности оптического распознавания символов (OCR), улучшенное понимание видео и поддержку голосовых диалогов в реальном времени на английском и китайском языках. Модель может адаптировать тембр, скорость и эмоции речи, что делает её полезной для голосовых ассистентов и интерактивных приложений.
🔐 Лицензия: Apache-2.0
🖥 Github
@bigdatai
🔥 Cofounder — это генеративная платформа для создания полноценных веб-приложений с бэкендом и UI!
🌟 Он использует ИИ для генерации приложений, включая проектирование интерфейсов и создание структур на основе описаний. На данный момент это ранняя альфа-версия, нестабильная, которая требует больших вычислительных ресурсов. В будущем проект планирует улучшения и добавление новых функций, таких как интеграция с мобильными фреймворками и расширенная настройка приложений.
🔐 Лицензия: MIT
🖥 Github
@bigdatai
⚡️ Magma-8B – это экспериментальная модель от Microsoft, которая объединяет обработку текста и изображений в одном агентском решении.
Чем полезен инструмент:
- Мультимодальность: Возможность работать с изображениями, видео и текстом позволяет строить комплексные системы – от навигации по пользовательским интерфейсам до управления робототехникой.
Агентские возможности: Модель не просто описывает содержимое картинки, а умеет генерировать план действий, что особенно ценно для интерактивных приложений.
- ИспользованиеSet-of-Mark и Trace-of-Mark, помогает связать визуальные элементы с текстовыми командами, обеспечивая более точное понимание и планирование.
Magma-8B специально разработан для сценариев работы с агентами – акцент не только на генерации текста, но и на взаимодействии с реальными объектами (например, интерфейсами).
Модель обучалась на разнообразных источниках, включая неразмеченные видео, в результате этого удалось добиться понимания динамики и пространственных отношений в видео.
Современные технические решения и масштабируемость, что позволяет адаптировать модель под разные задачи.
Минусы:
- На данном этапе модель ориентирована на исследовательские проекты, поэтому может требовать доработки перед использованием в боевых условиях.
- Ограничения по языкам: основной фокус сделан на английском, что может усложнить работу с другими языками.
Возможны нестабильные результаты - в некоторых сценариях, особенно если задача выходит за рамки обучающих данных, что требует осторожности при внедрении в реальные приложения.
В целом, Magma-8B – это интересный экспериментальный инструмент, который может стать отправной точкой для создания новых, более «умных» агентных систем, объединяющих восприятие и действие в одном флаконе.pip install torchvision Pillow open_clip_torch
https://huggingface.co/microsoft/Magma-8B
#microsoft #magma #multimodal
Как прокачаться в DS за два дня? Приезжайте на Data Fusion 2025 — самое масштабное событие этой весны в сфере анализа данных и искусственного интеллекта.
Что вас ждет?
🔹 14 треков и 70+ сессий, посвященных передовым разработкам в Data Science и AI
🔹 Кейс-стади по применению DS в различных сферах бизнеса от финтеха и промышленности до медицины.
🔹 250+ экспертов — от известных ученых до лидеров бизнеса
📅 Когда? 16-17 апреля
📍 Где? Москва, технологический кластер «Ломоносов»
Конференция бесплатная. Регистрируйтесь по ссылке — https://data-fusion.ru/
#AI #ML #BigData #DataFusion #DataScience #IT
*AI-искусственный интеллект
*DS-Data Science-наука о методах анализа данных.
AI-буткемп от red_mad_robot: получи практические навыки в новых AI-профессиях NLP и MarkUp
red_mad_robot — технологическая компания с широкой экспертизой в запуске цифровых продуктов и бизнесов. Мы развиваем собственный центр исследований и разработки ИИ-решений и обучаем специалистов в сфере GenAI.
Сейчас мы запускаем AI-буткемп — это 4 недели интенсивной практики с экспертами red_mad_robot, которые помогут тебе освоить новые востребованные навыки в AI-разработке.
Ты можешь выбрать одно из двух направлений
– NLP-инженер — будешь работать с языковыми моделями (Chat GPT, LLaMA, Claude), настраивать промты, обрабатывать данные и тексты. Подойдёт аналитикам, разработчикам и тем, кто хочет работать с AI.
– MarkUp-инженер — занимается разметкой данных, генерацией контента и интеграцией с LLM. Полезно тестировщикам, техническим специалистам и тем, кто хочет автоматизировать рутинные задачи.
Что ждёт участников
– 80% практики — разметка, промпты, LLM, RAG.
– Поддержка от менторов — экспертов из red_mad_robot.
– Кейс в портфолио и востребованные навыки в сфере AI.
Приём заявок до 10 марта. Старт буткемпа — 17 марта.
Участие бесплатное, но с отбором.
Подробности и регистрация по ссылке.
Реклама ООО «РЭДМЭДРОБОТ МСК». ИНН 7703435262. erid 2VtzqvfBFfc.
⚡️ NVIDIA’s New AI: Text To Video Supercharged!
https://www.youtube.com/watch?v=FpZ_6bxx5v8
@bigdatai
🌟 ReasonFlux: математические рассуждения для LLM.
ReasonFlux - методика, которая используется как для обучения, так и для инференса, чтобы повысить способность LLM к сложному логическому мышлению. Применение метода позволяет превосходить OpenAI o1-preview и DeepSeek V3 в задачах математического рассуждения.
При использовании в обучении ReasonFlux использует иерархическую структуру с подкреплением на последовательности высокоуровневых шаблонов мышления. Это позволяет базовой LLM научиться планировать оптимальную траекторию шаблонов для решения сложных задач. В процессе обучения ReasonFlux анализирует и обобщает информацию о решении задач, выявляя общие закономерности, и на основе этого создает шаблоны мышления.
Во время инференса ReasonFlux автоматически извлекает релевантные шаблоны мышления и масштабирует их для достижения превосходной производительности в сложных задачах рассуждения. Он динамически выбирает наиболее подходящий шаблон высокого уровня для каждой подзадачи, упрощая поиск путей рассуждений. ReasonFlux использует новую систему масштабирования во время вывода, которая адаптирует шаблоны мышления.
В экспериментальных тестах ReasonFlux-32B достиг 91,2% точности на MATH benchmark, опередив o1-preview на 6,7%. На AIME benchmark модель решила в среднем 56,7% задач, превзойдя o1-preview и DeepSeek-V3 на 27% и 45% соответственно.
Практическая реализация метода доступна в репозитории проекта, в нем cодержится необходимый код и описание для файнтюна LLM на примере SFT-датасета решений GaoKao Bench.
⚠️ Для трейна моделей на SFT-сете проект использует фреймворк LLaMA-Factory.
▶️ Локальная установка и запуск:
# Clone the repository
git clone https://github.com/ReasonFlux
cd ReasonFlux
# Create a Conda venv
conda create -n ReasonFlux python==3.9
conda activate ReasonFlux
# Install dependencies
pip install -r requirements.txt
# When you complete your first-stage training, you can try to use simple inference
from reasonflux import ReasonFlux
reasonflux = ReasonFlux(navigator_path='path-to-navigator',
template_matcher_path='jinaai/jina-embeddings-v3',
inference_path='path-to-infernece-model',
template_path='template_library.json')
problem = """Given a sequence {aₙ} satisfying a₁=3, and aₙ₊₁=2aₙ+5 (n≥1), find the general term formula aₙ"""
IaaS, PaaS, SaaS — эти слова вы слышали часто. А DBaaS? 🤓
Уже завтра, 20 февраля, Cloud․ru проведет вебинар, на котором расскажет про DBaaS и покажет:
😶🌫️DBaaS в Cloud․ru Evolution: какие сервисы есть и какие можно протестировать бесплатно;
😶🌫️с какими вызовами мы столкнулись при создании решения;
😶🌫️преимущества построения DBaaS поверх K8s
Еще есть время зарегистрироваться 👈
🔥 FlashVideo — это проект, направленный на создание высококачественного видео с использованием эффективных методов генерации! Проект включает две стадии: первая отвечает за генерацию видео с разрешением 270p, вторая — за улучшение качества до 1080p.
🔐 Лицензия: Apache-2.0
🖥 Github
@bigdatai
✔️ Исследование: ChatGPT проходит тест Тьюринга по психотерапии.
Исследование группы университетов США ставит под сомнение границы между человеческим и ИИ в психотерапии. Оказывается, обычному человеку все сложнее отличить ответы, сгенерированные ChatGPT, от профессиональных советов психологов.
В эксперименте с участием 830 человек, ответы ChatGPT не только оказались неотличимы от экспертных, но и были оценены выше по ключевым аспектам психотерапии. Языковой анализ показал, что ChatGPT использует более позитивный тон и предоставляет более развернутые ответы, что способствовало более высоким оценкам в фокусной группе.
journals.plos.org
✔️ Apple и Amazon сталкиваются с трудностями при обновлении голосовых помощников Alexa и Siri.
ИТ-гиганты столкнулись с неожиданными препятствиями в разработке и запуске обновленных версий своих голосовых помощников, Siri и Alexa, на базе генеративного ИИ. Тестирование выявило регулярные проблемы с надежностью и точностью ответов.
По данным Bloomberg, Apple может отложить выпуск улучшенной Siri до мая 2025 года или позже из-за многочисленных программных ошибок и "технических проблем". Аналогичная ситуация наблюдается и в Amazon, где выпуск LLM-версии Alexa также отложен из-за неверных ответов, выявленных в ходе тестирования. Несмотря на планы анонсировать обновление Alexa 26 февраля, публичный доступ будет открыт не ранее 31 марта, то есть через 18 месяцев после первоначального анонса в 2024 году.
bloomberg.com
✔️ Южнокорейские власти приостановили работу приложения DeepSeek.
Южнокорейское правительство запретило загрузку мобильного приложения DeepSeek из-за опасений по поводу безопасности данных. Ограничение, вступившее в силу в субботу, не затронуло пользователей, у которых приложение уже установлено, и доступ к сервису DeepSeek через веб-версию остается открытым.
Корейская комиссия по защите персональной информации (PIPC) заявила, что DeepSeek "частично пренебрегла" своими обязательствами в соответствии с законами Южной Кореи о защите данных. По словам директора отдела расследований PIPC Нам Сока, DeepSeek "недостаточно прозрачна в вопросах передачи данных третьим лицам и потенциально собирает избыточную личную информацию".
Представитель DeepSeek прибыл в Южную Корею для решения возникших проблем. Сроки снятия ограничений на скачивание приложения пока не определены.
nytimes.com
✔️ Ученые обучают ИИ интерпретировать эмоции животных.
Ресерчеры разрабатывают системы ИИ, способные распознавать эмоции животных, чтобы открыть новые возможности для улучшения их благополучия.
Например, система Intellipig, разработанная в Великобритании, анализирует фотографии свиней и предупреждает фермеров о признаках боли, болезни или эмоционального стресса. В Университете Хайфы разрабатывают ИИ, способный распознавать признаки дискомфорта у собак, что может помочь людям лучше понимать своих питомцев.
Система, разработанная в Университете Сан-Паулу, обучилась распознавать признаки боли у лошадей, анализируя фотографии их морд до и после операций, а также до и после приема обезболивающих средств. ИИ смог самостоятельно выявить признаки, указывающие на боль, с точностью 88%, демонстрируя потенциал таких систем для автоматизации мониторинга состояния животных.
science.org
✔️ ИИ теперь помещается в кармане: портативные LLM на USB-накопителях.
Энтузиасты в области ИИ создают портативные версии LLM, которые помещаются на обычный USB-накопитель. Эти модели, хотя и менее мощные, чем их "большие братья", открывают новые возможности для использования ИИ в мобильных и эмбедед-устройствах.
Один из таких проектов, Binh, позволяет запускать LLM на Raspberry Pi Zero W, помещенном в корпус USB-накопителя. Пользователю достаточно создать пустой текстовый файл с именем, и LLM автоматически заполнит его сгенерированным текстом. Хотя скорость работы оставляет желать лучшего, автор проекта считает его первым plug-and-play LLM на USB-носителе.
hackaday.com
@ai_machinelearning_big_data
#news #ai #ml
Хотите получить много практики на рельных задачах, собрать портфолио и узнать как выглядит рабочий день аналитика?
CEO Simulative и эксперт с большим опытом в аналитике, Андрон Алексанян организовал бесплатный интенсив, где в течение 3 недель вы будете решать реальные задачи, с которыми аналитики сталкиваются на работе
На прямых эфирах вы сделаете:
🟠Анализ активности пользователей с помощью SQL
🟠Анализ маркетинговых активностей с помощью Python
🟠ABC анализ ассортиментной матрицы в Excel (уже прошел, но вам будет доступна запись)
Во время эфиров вы узнаете много лайфхаков, а также будете получать полезные материалы для развития в аналитике на протяжении всего интенсива
❗️Знать Python и SQL не обязательно — все будем разбирать с нуля
🕗Встречаемся на новом эфире уже завтра, 13 марта в 19:00 по мск
Участвовать в бесплатном интенсиве
❓Готовы ли вы изучить Machine Learning на профессиональном уровне?
👨💻🛠 Пройдите короткое вступительное тестирование и узнайте.
В случае успешного прохождения вас ждут подарки — доступ к открытым урокам для знакомства с форматом обучения и специальная цена на курс.
За 5 месяцев на курсе «Machine Learning. Professional» вы освоите NLP, рекомендательные системы, временные ряды, PyTorch и Spark. Будете работать на реальных кейсах, с поддержкой экспертов, а в финале получите проект для портфолио и навыки для Junior+ / Middle позиций в Data Science и ML.
➡️ Оставить заявку на обучение прямо сейчас: https://otus.pw/6Hdv/?erid=2W5zFJUQkqn
Реклама. ООО "ОТУС ОНЛАЙН-ОБРАЗОВАНИЕ". ИНН 9705100963.
📹 NVIDIA’s New AI Grows Stuff Out Of Nothing!
Смотреть
🔥 Code2Prompt — это инструмент командной строки, который помогает разработчикам передавать структуру и содержимое кода большим языковым моделям!
🌟 Он автоматически генерирует Markdown-файлы с подробным представлением проекта, что упрощает анализ, документирование и рефакторинг кода. Это особенно полезно для работы с крупными кодовыми базами, где важно дать модели контекст перед генерацией ответов.
🔐 Лицензия: MIT
🖥 Github
@bigdatai
📖 NExT-Mol: объединение 3D-диффузионных моделей и 1D-языкового моделирования для генерации молекул!
🌟 В этой статье представлена новая модель NExT-Mol, сочетающая преимущества 1D-языковых моделей (LM) и 3D-диффузионных моделей для генерации трехмерных структур молекул. Авторы отмечают, что, хотя 3D-диффузионные модели эффективно моделируют непрерывные 3D-конформеры, они могут генерировать некорректные молекулы. В то же время 1D-LM, основанные на SELFIES, обеспечивают 100% валидность создаваемых молекул, используя большие одномерные наборы данных.
🔗 Ссылка: *клик*
@bigdatai
💥 Почему ансамблирование — это must-have в ML?
Даже лучшие ML-модели не идеальны. Но что если можно усилить их точность, объединив несколько алгоритмов?
На открытом уроке разберём популярные методы ансамблирования:
- Бэггинг снижает дисперсию модели, делая её устойчивее
- Градиентный бустинг усиливает предсказания, обучая модели на ошибках
Вы узнаете, как эти методы повышают точность прогнозов, и разберёте их на практике.
📅 Встречаемся онлайн 17 марта в 18:00 мск. Открытый урок пройдёт в преддверии старта курса «Специализация Machine Learning», а все участники получат скидку на обучение.
➡️ Ссылка для регистрации: https://otus.pw/wVh8/?erid=2W5zFHHsWPa
Реклама. ООО "ОТУС ОНЛАЙН-ОБРАЗОВАНИЕ". ИНН 9705100963.
🔥 OpenObserve — это облачное решение для мониторинга и анализа данных с открытым исходным кодом!
🌟 Оно позволяет собирать, индексировать и визуализировать различные метрики и логи в реальном времени.
🔐 Лицензия: Apache-2.0
🖥 Github
@bigdatai
🔥 openpilot — это открытое программное обеспечение, которое служит операционной системой для робототехники для улучшения системы помощи водителю в автомобилях!
🌟 openpilot расширяет возможности существующих систем помощи водителю (ADAS) и может быть установлен на более чем 275 поддерживаемых моделях автомобилей. Он добавляет функции, такие как удержание полосы, адаптивный круиз-контроль и автоматическое экстренное торможение.
🔐 Лицензия: MIT
🖥 Github
@bigdatai
📝 E2M (Everything to Markdown) — библиотека на Python для преобразования различных типов файлов в формат Markdown!
🌟 Он поддерживает широкий спектр форматов, включая doc, docx, epub, html, url, pdf, ppt, mp3, и m4a. Библиотека использует архитектуру «парсер-конвертер»: сначала данные извлекаются из файлов с помощью парсеров, а затем преобразуются в Markdown через конвертеры.
🌟 E2M разработан для упрощения работы с данными, особенно для задач Retrieval-Augmented Generation (RAG), обучения моделей и их дообучения. Поддерживаются инструменты обработки текста, изображений и звука, такие как OpenAI Whisper API для преобразования аудио в текст.
🔐 Лицензия: Apache-2.0
🖥 Github
@bigdatai
🔥 Open Computer Use — платформа для безопасного использования компьютеров с помощью ИИ, управляемого через E2B Desktop Sandbox!
🌟 Это решение позволяет удалённо управлять компьютером с помощью команд, моделируя действия клавиатуры, мыши и терминала. Интерфейс поддерживает интеграцию с различными моделями LLM (Large Language Models), включая Llama, Hugging Face и другие.
💡 Ключевые функции: живая трансляция дисплея из песочницы, возможность приостановить выполнение агентом задач для внесения обратной связи, поддержка любых операционных систем и платформ, а также гибкость настройки моделей.
🔐 Лицензия: Apache-2.0
🖥 Github
@bigdatai
🔥 Magic 1-For-1 — это модель генерации видео, разработанная для оптимизации использования памяти и снижения задержек при выводе!
🌟 Она разделяет задачу генерации видео из текста на два этапа: генерацию изображения из текста и преобразование изображения в видео, что способствует более эффективному обучению и дистилляции.
🖥 Github
@bigdatai
🔥 Quickwit — облачно-нативный поисковый движок, предназначенный для анализа и наблюдаемости данных, таких как логи и трассировки!
🌟 Это альтернатива инструментам вроде Elasticsearch, Datadog, Loki и Tempo, оптимизированная для высокой скорости работы на облачных хранилищах, таких как Amazon S3, Azure Blob Storage и Google Cloud Storage.
💡 Quickwit поддерживает полнотекстовый поиск, агрегационные запросы, API, совместимые с Elasticsearch, и интеграции с OpenTelemetry (OTEL) и Jaeger. Движок обладает схемно-независимой архитектурой, разделением вычислительных и хранилищных операций, что позволяет масштабировать его под большие объёмы данных.
🔐 Лицензия: AGPL-3.0
🖥 Github
@bigdatai
⚡️ R1 1776 – обновлённая версию модели DeepSeek-R1 от perplexity_ai, которая прошла пост-обучение для устранения цензуры Коммунистической партии Китая.
Главное:
- Модель создана для предоставления непредвзятой, точной и фактической информации без излишней цензуры.
Высокие рассуждательные способности:
- Несмотря на отказ от цензуры, R1 1776 сохраняет выдающиеся аналитические и логические возможности.
- Многоязычная проверка: Для оценки модели был сформирован разнообразный набор из более чем 1000 примеров, охватывающих широкий спектр чувствительных тем, с участием как человеческих экспертов, так и специализированных LLM-судей.
https://huggingface.co/perplexity-ai/r1-1776
@bigdatai
А всё, а раньше надо было!
Именно это скажут вам потерянные данные, когда из Кафки они превратятся в кашку. Лучше разбираться в инструменте до того, как начнёшь с ним работать по-серьёзному — не только в теории, но и на практике.
Пока все данные на месте, приходите на «Apache Kafka для разработчиков»:
➡️ Разберётесь в основах Kafka, её архитектуре и бизнес-процессах.
➡️ Научитесь работать с системами, передающими и получающими большие объёмы сообщений.
➡️ Подготовитесь к базовым собеседованиям на позиции, связанные с Kafka.
Углубленный курс с практикой на Java, Docker и Postgres.
▶️Занять место — по ссылке
#реклама
О рекламодателе
🔥 pydantic-ai-agents-tutorial — пошаговое руководство по созданию ИИ-агентов с использованием библиотеки Pydantic AI!
🌟 В проекте рассматривается процесс настройки и реализации агентов, которые могут работать с инструментами, обрабатывать файлы и использовать модели для анализа изображений. Примеры охватывают работу с локальными моделями и OpenAI или Ollama, показывая, как создавать динамические подсказки и управлять сложными задачами.
🔐 Лицензия: Apache-2.0
🖥 Github
@bigdatai