15113
life = curiosity + irreducible noise Whois: https://t.me/boris_again/1652 Лс: @btseytlin
🚀 Серия соревнований по МЛ и научный проект ! Денежный призовой фонд больше 100 000 р и будет расти ! Кому интересен МЛ/RL или математика или пазлы или роботы.
Приглашаем Вас принять участие в серии челленджей и развитии научного опен-соурс проекта.
Соревнование организуется совместно с учеными лаборатории интеллектуальных технологий робототехники МФТИ, (руководит проектом - Илья Осокин), которые поставили себе амбициозную цель создать робота, который побьет мировой рекорд по сборке Мегаминкса ! Узнать больше о робототехнической части проекта Вы можете в сообщении д.ф.-м.н. А. Арутюнова: /channel/forodirchNEWS/3165 , или хабре или чате @starkitmega.
Проект CayleyPy предлагает Вам принять участие в решении алгоритмической части задачи - создании алгоритмов - которые смогут получать наиболее короткие (близкие к оптимальным ) решения. Методы решения важны в широком круге проблем от математики до квантовых компьютеров, МЛ/РЛ и теории струн. Для этого мы организовали соревнования на платформе Каггл. Первый Второй разыгрываемый приз - 10 000 рублей.
Условия первого второго этапа очень простые.
Есть три челленджа на Каггле
Мегаминкс
https://www.kaggle.com/competitions/cayley-py-megaminx/leaderboard
Кубик Рубика 333
https://www.kaggle.com/competitions/cayleypy-ihes-cube
Кубик Рубика 444
https://www.kaggle.com/competitions/cayley-py-444-cube
Приз будет получен первым, кто достигнет ЛЮБУЮ из целей:
1 Или в конкурсе Мегаминкс - кто достигает скор 75 000 (вы получите 5 000 рублей, 70 000 ещё 5 000 рублей) и опубликует публичное решение. (Первая цель 80 000 уже достигнута. Приз уйдёт Владу Кузнецову, МФТИ).
2 Или обогнать Томаса Рокицкого в конкурсах по кубику 333 или 444 (любом из них) и тоже опубликовать публичное решение. (Томас Рокицкий - легендарный специалист по вычислительным аспектам головоломок - именно его команда нашла "число Бога" кубика Рубика в 2010 году - подведя итог более 30 годам усилий большого количества специалистов).
Подробное описание соревнований -- по ссылкам выше. Кратко: даны 1000 состояний пазлов и Вам надо предъявить их решения -- чем короче решение тем лучше (то есть чем меньше шагов/"мувов"). Score на лидерборде = сумма длин решений по всем пазлам. Соревнования полностью аналогичны соревнованию Каггл Санта 2023 -- можно навайбкодить изменения лучших решений оттуда. Также стоит взять наш подход CayleyPy и изменить в нем образующие на мегаминкс. Это сделали те, кто сейчас в топе. Дополнительную информацию, обсуждение и советы - см. чаты - @starkitmega @sberlogacompete @sberlogasci. Вводные лекции: четверг 19.00, пятница 20.00 (время по Москве).
Дополнительным призом будет возможное участие в научных публикациях. Наши цели амбициозны - мы уже добились исключительных результатов, которые имеют приложение в МЛ, математике, теории струн, квантовых вычислениях и т.д. Публикации отмечены NIPS spotlight. Узнать больше Вы можете в наших статьях. Если у Вас есть несколько свободных часов в неделю, знание Питона или математики и Вам интересно принять участие - пишите @alexander_v_c - мы рады всем - начинающим и профи.
Планируется серия челленджей и призов. Первый приз уже разыгран, второй объявлен, скоро будут новые объявления -- оставайтесь с нами !
================
А также мы ищем Cпоносоров.
Вы можете поддержать нас переведя на карту Илье Осокину 2202208362030505
Или напишите @alexander_v_c (Александр Червов)
И кидайте нам, пожалуйста, звезды на гитхаб, Вы нам очень поможите:
https://github.com/cayleypy/cayleypy
================
Выражаем благодарность компании RYBE - толстовки для айтишников: https://rybe.store /channel/rybe_store
================
Выражаем благодарность агентству BLASTIM за поддержку:
❤️ Наши курсы: agency.blastim.ru
🥨 Свежие вакансии в биотехе: blastim.ru
🤝 /channel/blastim
🔺 Opus 4.7
Друзья, новая модель. Что интересного:
🟢 Сильно улучшили разрешение картинок, которые модель может распознавать (больше чем в 3 раза). То есть будет лучше понимать примеры целевых интерфейсов, если ей такие подсунуть, и что-нибудь точно разметить. Это полезно.
🟢 Новая команда /ultrareview. Начал вбивать её, сразу пишет, что будет стоить $5-$20 за раз 😱. Предлагает ну очень хорошо посмотреть последние коммиты. Зуб дает, что найдет ошибки (вот не мог сразу без ошибок писать). Дают 3 бесплатных таких ревью. Насколько полезно пока не ясно.
🟢 Добавили уровень с названием xhigh как в Codex. Среднее между high и max. Сделали его по умолчанию вместо medium, типа чтобы пользователи не ставили всегда max. Ну-ну.
🟢 Ещё есть нюанс с токенизатором, который скромно упоминают в конце. Его оптимизировали, но он стал выдавать больше токенов, "1.0–1.35× depending on the content type", т.е. сильнее кушать подписку. Звучит как не самая классная оптимизация.
🟢 На Max подписку открыли режим auto (claude --enable-auto-mode). Это более лайтовый вариант ковбойского --dangerously-skip-permissions. Нужны эти режимы для меньшего внимания со стороны пользователя пока агент делает долгую задачу.
Все бенчи подросли, качество должно улучшиться, пробуем.
https://www.anthropic.com/news/claude-opus-4-7
Grok ненавидит китайцев, модели большой тройки сохраняют жизни меньшиствам и евреям и все модели ненавидят натуралов. А у меня вообще шансы на выживание отрицательные
https://whitecircle.ai/killbench?nat=Russian&rel=Satanist&skin=Light-skinned&body=Athletic&orient=Asexual&gender=Cisgender&pol=Far-right&phone=No+phone
#дайджест
Дайджест AI/ML за неделю 6–12 апреля 2026
Meta: Muse Spark
Модель Meta Superintelligence Lab - первый результат закидывания топовых ресерчеров горой денег . Нативно мультимодальная: текст, картинки, видео, аудио, код на входе и выходе. Contemplating mode (оркестрация нескольких reasoning-агентов). По бэнчмаркам модель на сопоставимом с большими игроками уровне, местами SOTA. НЕ оупенсорс, что для Meta в новинку.
Доступна на meta.ai, API в закрытом превью.
Блогпост
Anthropic: Claude Mythos Preview
SWE-bench Verified 93.9% (vs 80.8% у Opus 4.6), USAMO 2026 97.6%, OSWorld 79.6%. При тестировании кибер-способностей модель нашла тысячи zero-day уязвимостей, после чего Anthropic ограничила доступ - только по приглашению через Project Glasswing, созданный чтобы подготовить критическую инфраструктуру к новым моделям. С другой стороны у разрабов Антропик AGI Achived Internally уже полтора месяца как, а утечки и падения только увеличились.
Системная карточка
Alibaba: HappyHorse 1.0
Анонимная 15B видеомодель, которая вышла из ниоткуда и заняла #1 на Video Arena (Elo 1333 T2V, 1392 I2V), обойдя Seedance 2.0, Kling 3.0 и Sora 2 Pro. 40-layer unified Transformer, совместная генерация видео+аудио в одном проходе, липсинк на 7 языках. 1080p, 5-8 секунд, ~38с на H100. В итоге интригу развеяли, модель от Alibaba. Веса обещают, но пока не выложили.
Блогпост
Netflix: VOID
Video Object and Interaction Deletion - удаление объектов из видео с учётом физики. Убираешь человека с гитарой — гитара падает. Убираешь шар для боулинга — кегли остаются стоять. Под капотом CogVideoX-Fun 5B с четырёхзначной маской (quadmask): что удалить, что физически затронуто, где перекрытие, что оставить. VLM (Gemini) рассуждает о каузальных последствиях удаления. 64.8% предпочтений юзеров vs Runway (18.4%).
GitHub, HF
Alibaba: VimRAG
RAG-агент с графом мультимодальной памяти вместо линейной истории. На Qwen3-VL-8B backbone: +12.5пп overall vs vanilla RAG (50.1% vs 37.6%), HotpotQA 79.1% (+15пп), SlideVQA 62.4% (+14пп).
Статья, GitHub
Менее значительные релизы:
Runway: Characters - реалтайм-аватары на GWM-1, одно фото, без файнтюнинга. Блогпост
Black Forest Labs: FLUX.2 Small Decoder - 1.4x быстрее, меньше VRAM, ~28M параметров (vs ~50M), Apache 2.0. HF
sync: sync-3 - 16B модель для липсинка, 95+ языков, 4K, в 32 раза больше предшественника, по отзывам очень хороша. Блогпост
Milla Jovovich: MemPalace - да, Мила Йовович написала memory-фреймворк на основе человеческой мнемотехники, выбивший 96.6% на LongMemEval. Уже 23K звезд на GitHub, а чего добился ты?
OpenBMB: VoxCPM2 - 2B TTS на 30 языков (включая русский, WER 5.21%), без токенизатора, есть клонирование голоса GitHub
Generalist AI: GEN-1 - робот складывает футболки с 99% успехом, 86 подряд без ошибок. 1 час данных на задачу
NVIDIA: NTC - нейросетевое сжатие текстур, с 6.5GB до 970MB VRAM
Qwen: HopChain - обучение reasoning-VLM с помощью синтетических многоэтапных вопросов к модели, улучшает 20 из 24 бенчмарков на Qwen3.5. Статья
MiniMax: Music 2.6 - еще одна музыкальная модель. Блогпост
World Labs: Marble 1.1 - еще один генератор 3D-миров. Блогпост
MiniMax: M2.7 - опубликовали веса. 229B MoE, 10B активных, SWE-Pro 56.2%, $0.30/$1.20. HF, Блогпост
OpenAI: ChatGPT Pro - подписка за $100/мес, 5x больше Codex чем в Plus, доступ к gpt-5.4pro
Добрым словом и Клод Кодом можно добиться куда большего, чем одним только добрым словом.
Читать полностью…
Skywork AI: Matrix-Game 3.0
Интерактивная world model, 720p/40FPS, до 1мин. В двух размерах: 5B и 2x14B
Сайт, GitHub, HF
Google: Lyria 3 Pro - музыкальная модель, треки до 3 минут (было 30 секунд у Lyria 3). Доступно по подписке, в AI Studio и по API, $0.08 за трек.
Google: Gemini 3.1 Flash Live - голосовая модель для real-time разговоров, 90+ языков, удвоенный контекст диалога.
Suno 5.5 - новее, лучшее. Теперь есть клонирование голоса для пения. Доступно для Pro/Premier.
Runway: Multi-Shot App - AI сам делает мульти-ракурсы и решает где резать. В общем, автоматизация монтажа. Приложение
CapCut: Seedance 2.0 наконец раскатили на весь мир (кроме США от греха подальше). Только для CapCut Pro, наслаждайтесь прорывом в видеогенерации, но теперь без Томов Крузов.
Cohere: Transcribe - open-source ASR, 2B параметров, 14 языков, WER 5.42%. Первое место на HF Open ASR Leaderboard, обогнали Whisper Large v3.
Терренс Тао доказал теорему с помощью ChatGPT о чем и написал в статье, теперь можете авторитетно писать в своих публикациях "proved using ChatGPT"
Астронавты Artemis II сделали красивые фото Земли в высоком разрешении, тут и тут можно скачать себе новые обои.
Еще, оказывается, есть лайв трансляция на Youtube прямо с корабля. What a time to be alive
Gemma 4
blogpost | model card | huggingface
4 размера: E2B, E4b (бывшие Gemma 3n/Gemini Nano); 26A4B, 31B Dense. Теперь лицензия Apache 2.0!
Для всех моделей релизим претрейн и intruction tuned чекпойнты. Context length 256k у 31B модельки, 128k у остальных. Скажу по секрету – можно пробовать и больше, должно работать.
LLM Arena на уровне Kimi 2.5, бенчмарки можно посмотреть на huggingface
https://developers.googleblog.com/google-colab-is-coming-to-vs-code/
Оказывается аж с ноября можно работать в VS Code используя GPU из Google Colab. Просто ставите расширение и выбираете в качестве ядра для своих ноутбуков Colab.
Наконец-то можно пользоваться нормальной IDE и бесплатными GPU одновременно
FYI запуск Artemis II примерно через 25 мин:
https://www.youtube.com/watch?v=Tf_UjBMIzNo
Смотрим!
Мем про Слоп Тесея стал реальностью! Скоро мы узнаем является ли код слопизированный через LLM новой сущностью или нет. Максимально иронично, что целью стал клиент Claude Code.
Какой-то анимешник с помощью OpenAI Codex переписал слитые исходники Claude Code на Python. Чтобы хранение кода не попадало под нарушение копирайта.
https://github.com/instructkr/claw-code
Я думаю это шиза + копирайт так не работает + скоро удалят
Короче я давно написал статью на РБК. Сегодня она наконец вышла и я узнал, что она доступна только по подписке. Даже я не могу прочитать, что там
😳
🤖 Хабр статья: поучаствовал в RAG челлендже
Помните, я рассказывал про юридический AI-челлендж ARLC 2026? Так вот, я в нём поучаствовал
В соревновании нужно было строить RAG-пайплайн поверх корпуса судебных решений и законов: находить нужные страницы, извлекать ответы, давать точные ссылки. Соло, с Claude Code в качестве напарника
Раньше я не разбирался в RAG. За 5 дней и 17 итераций прошёл путь от 0.034 до 0.791. А потом вышел в финал – и папйлайн, который отлично работал на 30 документах, потерял 42% на 300 документах
Сложно сказать с таким скором, что я в нем разобрался, но точно стало лучше
Описал весь опыт участия в статье на Хабре:
• Полная архитектура с кодом
• Математика F-beta, которая перевернула стратегию
• 3 регрессии, которые научили больше, чем все успехи
• Честный разбор работы с Claude Code на соревновании
• 88 USD на API за всё соревнование
Буду благодарен за лайки, комментарии и сохранения на Хабре – это продвинет статью в рекомендациях:)
🔗 Ссылка: https://habr.com/ru/articles/1014758/
Пишите в комментах, если тоже участвовали! 👉
@tagir_analyzes
🌸ГиперАгенты, или вперед к Open-Ended Exploration🌸
#nlp #nlp_papers
Что будет, если дать агентам полную свободу модифицировать самих себя?
Наконец-то выпускаю долгожданную статью, где я побыла уже не соавтором, а научным руководителем.
Вместе с Jenny Zhang, автором Darwin Gödel Machine , выпускаем HyperAgents — open-ended self-improvement для агентов, на многих задачах сразу
🌸TL;DR
HyperAgents — это пример системы, где агент улучшает самого себя итеративно, от промптов до кода.
При этом, в отличие от Darwin Gödel Machine, мы пошли дальше и сделали multi-task objective:
— агент должен улучшать сам себя из поколения в поколение, и делать это одновременно на многих задачах сразу.
Улучшения возможны в обеих группах доменов:
— verifiable rewards: кодинг (Polyglot), математика (IMO), симуляции в робототехнике (Genesis)
— unverifiable rewards: рецензирование статей (Apres)
🌸Пайплайн
Как и в первой версии DGM, агент вносит модификацию — и затем оценивает ее успешность на основе результатов: в данном случае на бенчмарках, тестах и тд.
Модификации образуют граф версий, который можно контролировать в git.
В системе всегда работает цепочка из двух агентов: есть мета-агент и агент, который выполняет задачи.
Мета-агент опирается на результаты выполнения задач и вносит изменения и в себя, и в агента-работника одновременно.
Гиперагентов можно использовать с разными моделями: Claude-4.5-sonnet, O4-mini, GPT-4o
🌸Почему это работает: Абляционные исследования
Как должна выглядеть оптимальная система агента, чтобы поощрять открыты поиск новых модификаций?
Как правило, в предыдущих работах, если агенту и позволяется что-то модицифировать, то только в определнных рамках и заданных примитивах.
Мы проверили, что будет, если этого избежать: результирующая система — Гиперагенты — оптимизирована под более быстрый поиск новых модификаций — и in-context обучение более эффективному самооулучшению.
Модель в рамках итераций (их может быть хоть 200) начинает лучше понимать, какие изменения стоит вносить.
Итак, что мы сравниваем:
— HyperAgents (DGM-H): метаагент улучшает сам себя и агента-работника в многозадачной среде
— HyperAgents без самомодификации: метаагент улучшает только агента работника в многозадачной среде, себя оставляет как есть
— HyperAgents без архива предыдущих решений и их результатов: метаагент вносит улвчшения в себя и агента-работника, не опираясь на предыдущие результаты
— Классика, DGM: метаагент изолированно улучшает агента-работника, на всех задачах и кастомно по одной задаче.
🟣HyperAgents (DGM-H) демонстрирует более динамичный рост общего перформанса на всех задачах — плюс, улучшения, полученные таким способам на одних доменах, переносятся в улучшения на других.
🌸Учимся самоулучшаться
Мы вводим новую метрику, чтобы определить способность мета-агента вносит успешные улучшения: imp@50 (по аналогии с pass@50)
🟣Именно в рамках итеративного процесса самоулучшения у мета-агента в конце эксперимента существенно вырастает imp@50 в сравнении со стартовым состоянием (0 --> 0.63).
🟣Агент обрастает тулзами для поддержания памяти, трекинга изменений, отслеживания тенденций в результатах.
🟣Arxiv https://arxiv.org/abs/2603.19461
🟣Github https://github.com/facebookresearch/HyperAgents
🟣HF papers: https://huggingface.co/papers/2603.19461
🟣AlphArxiv https://www.alphaxiv.org/abs/2603.19461
#дайджест
Дайджест AI/ML за неделю 16–22 марта 2026
Nvidia: GTC week 2026
Дженсен три дня подряд что-то анонсировал не щадя куртку. Поэтому Nvidia на этой неделе сожрала пол дайджеста.
Groq 3 LPX - первый продукт после покупки Groq за ~$20B. Инференс-чип: 1.2 PFLOPS FP8, 500MB SRAM. Рэк из 256 штук обещает 35x throughput Blackwell NVL72 на триллион-параметровых моделях при $45/M токенов. Для Китая готовят отдельный вариант на май - инференс в обход экспортных ограничений на GPU, Дженсен уже получил лицензию от Трампа. Блогпост
DLSS 5 - вместо апскейлинга теперь нейрорендеринг. Нейросеть берет цвет и motion vectors из движка и генерирует физически корректное освещение, тени и материалы в реалтайме. Различает кожу, волосы, воду, металл, стекло. Только RTX 50xx, осень 2026. Блогпост
GWM-1 - Runway и Nvidia показали General World Models на чипах Vera Rubin. Реалтайм HD-видео с задержкой 100мс. Три варианта: Avatars (говорящие головы), Robotics (песочница для роботов), Worlds (бесконечные миры). Avatars уже можно потестить. Блогпост
Nemotron-Cascade 2
30B MoE с 3B активных параметров. Cascade RL + дистилляция из нескольких учителей по доменам. AIME 2025 - 92.4, IMO 2025 - золото (79.3%), IOI и ICPC - тоже золото. Второй опенсорс после DeepSeek-V3.2-Speciale, собравший золото на всех трех олимпиадах, но в 20 раз меньше.
Cтатья, HF
OpenAI: GPT-5.4 mini и nano
Через две недели после старшей модели вышли маленькие версии. Mini: $0.75/$4.50, контекст 400K, нативный vision, SWE-Bench Pro 54.4%, OSWorld-Verified 72.1% - на уровне полной GPT-5.4 по computer use. Nano: $0.20/$1.25, API-only, ~200 т/с, для классификации и субагентов. Nano дешевле Gemini Flash-Lite, можно описать 76 000 фото за $52. По APEX-Agents от Mercor mini (24.5%) обходит Sonnet 4.6 (23.7%) при сильно меньшей цене.
Блогпост
Cursor: Composer 2
Вторая "собственная" модель Cursor для кодинга. Terminal-Bench 2.0: бьет Opus 4.6 (61.7 vs 58.0), проигрывает GPT-5.4 (75.1). Цена $0.5/$2.5, fast-версия $1.5/$7.5 - в 7 раз дешевле Opus за сравнимое качество. Из забавного, выяснилось что это пост-трейн Kimi 2.5, о чем Cursor тактично умолчали.
Блогпост
Менее значительные релизы:
MiniMax: M2.7 - модель которая участвует в собственной оптимизации: 100+ автономных циклов RL, +30% перформанс. SWE-Pro 56.22%, $0.30/$1.20. Блогпост
Xiaomi: MiMo-V2-Pro - 1T параметров (42B активных), 1M контекст. Тайно тестировалась на OpenRouter под кодовым именем "Hunter Alpha". AI Intelligence Index #8 в мире. Блогпост
Microsoft: MAI-Image-2 - генератор картинок, третье место на Image Arena. Только text-to-image, без редактирования, без image2image. Просто text2image в 2026 году. Блогпост
Midjourney: V8 Alpha - генерация в 5x быстрее, нативный 2K, но альфа сырая. V7 пока лучше, народ (который еще помнит кто это такие) не в восторге. Анонс
Mistral: Leanstral - опенсорс 120B/6B для формальной верификации кода на Lean 4. Блогпост
Mistral: Forge - платформа для тренировки корпоративных LLM с нуля на своих данных. Полный цикл: претрейн, SFT, DPO, RL. Блогпост
Naver: Seoul World Model - мечтали ли вы в 13 об игре чтобы было как гта, но там ваш город и в свой подъезд зайти можно? Пока вы мечтали Naver впихнули Сеул в 2B DiT на базе Cosmos Predict 2.5. 15 fps на одной H100, тренировали на 24 H100. Можно промптить Годзиллу и наводнения. Пейпер, GitHub
Adobe: Firefly Custom Models - теперь можно обучать Firefly на своих работах. Блогпост
ElevenLabs: Music Marketplace - маркетплейс нейродегенеративной музыки внутри ElevenCreative. Блогпост
# ULTRAPACK
Я стал настолько много клод-кодить, что захотелось поработать напильником.
TL;DR: мой минималистичный пак скиллов для Claude Code, построенный вокруг коротких планов и работы над одной фичой в одном диалоге: https://github.com/btseytlin/ultrapack или просто /up:.
Установка:
/plugin marketplace add btseytlin/ultrapack
/plugin install up@ultrapack
/reload-plugins
/up:make <описание вашей фичи>
docs/tasks/<ваша-фича>.md который будет пополняться по ходу планирования и исполнения. Всегда можно возобновить работу с этого файла или закинуть его в контекст другому агенту./up:make handsoff <описание вашей фичи> будет стараться минимально вас о чем-то спрашивать и при этом делать самые безопасные выборы (например, ничего не удалять без бекапа). Явно документирует какие решения он принял без вас, см. пример.up агент всегда сам "протыкивает" свои изменения.
tl;dr: AI researcher (EBM), $225k-350k+ plus equity, San Francisco
Ищем ресёрчеров в стартап, который делает reasoning AI. Ситуация следующая:
💖 Founding Chair — Ян ЛеКун, лауреат премии Тьюринга и крёстный отец всего AI;
💜 Главный математик — Майкл Фридман, лауреат медали Филдса;
💛 В команде 10 PhD и шесть медалистов ICPC;
💚 А основательница — квантовый физик из Беркли, написавшая PhD у нобелевского лауреата 2025 года.
Ризонинг AI, про который идёт речь — не LLM-based, и от языка вообще не зависит.
Это EBM — energy-based models — модели, которые не угадывают следующий токен, а минимизируют функцию энергии в латентном пространстве. Высокая энергия — что-то не так, низкая — близко к правде. Когда-то многие считали, что ризонинг модели будут именно такими — в том числе сам ЛеКун, который топит за EBM ещё с 1980х!
Реальность, как мы знаем, оказалась просто RL-ем на длинные цепочки рассуждений. Вышло не так уж плохо — но такой ризонинг выходит очень дорогим.
EBM оптимизируют не правдоподобие, как LLM, а корректность — «что минимально нарушает ограничения».
И не генерируют отдельные токены по очереди, а оптимизируют весь трейс целиком — с возможностью улучшать его итеративно 🔧
Одно из многих применений такого ИИ — возможность писать формально верифицируемый код намного эффективнее, чем это делают LLM. А это означает надёжные системы для кардиостимуляторов, финансовых рынков, ядерных реакторов — you name it.
Logical Intelligence занимаются и разработкой EBM, и верификацией. В одном из бенчей их модель решает 96% сложных судоку, когда фронтирные LLM-ки осиливают ~2%. А их агент формальной верификации выбил безумные 99.4% на PutnamBench — и заодно исправил 15 ошибок в заданиях 🔍
Мы ищем к ним AI Researcher — с довольно узким профилем:
✨ MSc / PhD;
✨ публикации на ICLR, ICML, NeurIPS или CVPR;
✨ идеально — опыт и публикации с EBM;
✨ но могут подойти также: бэкграунд в диффузионных моделях, файнтюнинге LLM для reasoning, reasoning без авторегрессии или MCMC в латентном пространстве.
Посоветуйте нам таких людей! Особенное место в нашем сердце займут контакты тех, кто уже в Штатах, и ваших англоязычных знакомых. Здесь лежит этот текст на английском — перешлите его своим знакомым, это космическая возможность для релевантных ресерчеров!
Платят от $225k-$350k, а иногда и выше, дают эквити, работа в офисе в Сан-Франциско, помогут с O-1 визой. Пишите @owlkov 💜
Data Fest 2026: Call 4 Speakers
В этом году в Белграде целых две площадки:
- 24 мая снова в Яндексе
- 31 мая в сербском университете
До 19 апреля открыта подача заявок:
- ссылка для Белграда
А по общей ссылке можно посмотреть секции по докладам, там от Core DS/ML и LLM до MLOps, Open Source и карьеры в данных
Теперь прибавится сербская аудитория, а доклады будут как на русском, так и на английском
По всем вопросам писать @salavat_mj
Омни-модели
Традиционно все учили, например, отдельно LLM, отдельно модель для картинок, затем это как-то склеивали и полировали пост-обучением, чтобы получить VLM.
Плохо лежащие данные заканчиваются, и в 2025 появился тренд на объединение разных модальностей, чтобы выжать больше сигнала: Omni-модели. Например, Qwen3-Omni — это LLM с ASR и TTS. Transfusion объединил LLM и диффузию внутри одного трансформера: текстовые токены обрабатываются авторегрессионно, а изображения — диффузионно, и всё это живёт в единой архитектуре. По доступным мне слухам, Gemini лучше всех в мультимодальности именно из-за объединения всех данных гугла в одной трансформерной модели. Все это позволяет обучаться на бОльшем количестве данных и находить синергию в качестве, а также emerging properties между разными модальностями.
Об этом рассказал Рома Исаченко (отвечает за базовые технологии VLM и ART в Яндекс R&D). Особенно интересно было послушать о том, как они переходили от отдельной текстовой Alice AI LLM и картиночной Alice AI VLM к омни-модели.
Новый пайплайн такой:
1. LLM pretrain на первом стейдже – текстовая стадия
2. Omni pretrain – добавляются картинки для провязывания модальностей и вбирания визуальных знаний
3. Omni SFT – модель переходит в мультимодальный инструктивный режим
4. Omni RL – основная стадия мультимодального алайнмента модели.
#дайджест
Дайджест AI/ML за две недели 23 марта – 5 апреля 2026
Google: Gemma 4 (OMG hiiii 👀👀👀)
Четыре размера: E2B и E4B для мобильных устройств (работают на телефонах, Raspberry Pi и Jetson Nano с околонулевой задержкой), 26B MoE (3.8B активных, оптимизирован на скорость) и 31B Dense (максимальное качество). 31B занял 3-е место на Arena AI (Elo 1452), 26B - 6-е. Бенчмарки 31B: AIME 2026 89.2%, GPQA Diamond 84.3%, LiveCodeBench 80.0%, MMLU Multilingual 85.2%. 140 языков, нативный function calling, мультимодальность (аудио + визуал).
Блогпост, DeepMind, HF
Google: Veo 3.1 Lite
бюджетная видео-модель text-to-video и image-to-video, 720p/1080p, длительность 4/6/8 секунд. Стоит менее 50% от Veo 3.1 Fast при той же скорости генерации. Доступна через Gemini API и AI Studio по подписке.
Блогпост
Microsoft: MAI-Transcribe-1
Speech Recognition на 25 языков с WER 3.8% на FLEURS - первое место, обогнали Whisper Large v3, Scribe v2, GPT-Transcribe и Gemini 3.1 Flash-Lite. Заточена под плохие условия: фоновый шум, низкое качество записи, одновременная речь нескольких человек. В 2.5 раза быстрее Azure Fast. $0.36 за час аудио. Уже работает в Copilot Voice Mode.
Блогпост
Z .ai: GLM-5V-Turbo
Мультимодальная модель для фронтенд-кодинга с нативным визуальным восприятием. Превращает макеты дизайна в исполняемый фронтенд-код. На собственном Design2Code бенчмарке 94.8 против 77.3 у Opus 4.6 (верим). Контекст 200K, выход до 131K токенов. Цена $1.20/$4.00. API-only, весов нет.
Блогпост
Alibaba: Wan2.7-Image
Генерация и редактирование картинок с thinking mode - модель рассуждает о композиции и пространственных отношениях перед генерацией. Рендеринг текста на 12 языках при входе до 3000 токенов, до 9 референсных картинок, батч-генерация до 12 штук. Есть Pro-версия с 4K выходом. Доступно через Model Studio и Qwen App.
Блогпост
Microsoft: Harrier-OSS-v1 Семейство мультиязычных эмбеддингов: 270M, 0.6B, 27B. SOTA на Multilingual MTEB v2 (74.3 у 27B). Контекст 32K токенов, 94 языка. Построены на Gemma 3 (270M и 27B) и Qwen 3 (0.6B)
AI engineer
@
fits a linreg over 2 points (unsuccessfully)
Раньше я писал про IQDOC AI: ИИ ассистента для врачей в России. Это RAG опирающийся на клинические рекомендации Минздрава и нормативные документы.
С тех пор сервис успешно запустился и им уже воспользовались тысячи врачей! Очень радуюсь за проект.
Команда IQDOC проанализировала более 25 тыс. запросов. Публикации с результатами вышли в Медвестнике и Коммерсанте.
Там можно почитать что ищут врачи, кто чаще обращается к ИИ инструментам и другие инсайты. Например, почему-то врачи из Челябинска задают вопросы про рак легкого в 19,6 раза чаще 🌚
Подписывайтесь на их телеграм канал: /channel/iqdocai. У них там скоро будет медицинский хакатон
Сейчас много разговоров о том, что инвестиции в ИИ будут снижаться, на этом фоне немного боязно, не свернут ли открытые исследования и опенсорс совсем. Тем более российского качественного на гитхабе и так не очень много.
В этом контексте всегда приятно слышать от компаний, что они не планируют снижать инвестиции в рисеч, в том числе фундаментальный:
«Мы смотрим через призму: если наука не превращается в продукт, значит, инвестиция не завершена — надо продолжать инвестировать»,
Лев если и спрашивал у юзеров разрешения перед тем как обучать на их данных, то так, между делом, чисто на Хакерньюсе ответил один раз, без публичных релизов
GitHub очень тихо обновил правила и собирается тренироваться на почти всех приватных репозиториях. Если вы явно не укажите, что не хотите "доступа к этой фиче"
LiteLLM версии 1.82.7 (хотя местами в посте написано 1.82.8, но вы поверьте мне) подвергся supply chain атаке. Зафиксируйтесь на предыдущей версии и не обновляйтесь.
https://futuresearch.ai/blog/litellm-pypi-supply-chain-attack/
https://github.com/BerriAI/litellm/issues/24512
HR: Кем вы видите себя через 5 лет?
Я: (на фотографии)
Самая идея оружия разработанного Кагглерами внушает мне страх
Читать полностью…