boris_again | Unsorted

Telegram-канал boris_again - Борис опять

15113

life = curiosity + irreducible noise Whois: https://t.me/boris_again/1652 Лс: @btseytlin

Subscribe to a channel

Борис опять

Data Fest 2026: Call 4 Speakers

В этом году в Белграде целых две площадки:
- 24 мая снова в Яндексе
- 31 мая в сербском университете

До 19 апреля открыта подача заявок:
- ссылка для Белграда

А по общей ссылке можно посмотреть секции по докладам, там от Core DS/ML и LLM до MLOps, Open Source и карьеры в данных

Теперь прибавится сербская аудитория, а доклады будут как на русском, так и на английском

По всем вопросам писать @salavat_mj

Читать полностью…

Борис опять

Блин, а кто знает как заполнять?

Читать полностью…

Борис опять

Омни-модели

Традиционно все учили, например, отдельно LLM, отдельно модель для картинок, затем это как-то склеивали и полировали пост-обучением, чтобы получить VLM.

Плохо лежащие данные заканчиваются, и в 2025 появился тренд на объединение разных модальностей, чтобы выжать больше сигнала: Omni-модели. Например, Qwen3-Omni — это LLM с ASR и TTS. Transfusion объединил LLM и диффузию внутри одного трансформера: текстовые токены обрабатываются авторегрессионно, а изображения — диффузионно, и всё это живёт в единой архитектуре. По доступным мне слухам, Gemini лучше всех в мультимодальности именно из-за объединения всех данных гугла в одной трансформерной модели. Все это позволяет обучаться на бОльшем количестве данных и находить синергию в качестве, а также emerging properties между разными модальностями.

Об этом рассказал Рома Исаченко (отвечает за базовые технологии VLM и ART в Яндекс R&D). Особенно интересно было послушать о том, как они переходили от отдельной текстовой Alice AI LLM и картиночной Alice AI VLM к омни-модели.

Новый пайплайн такой:
1. LLM pretrain на первом стейдже – текстовая стадия
2. Omni pretrain – добавляются картинки для провязывания модальностей и вбирания визуальных знаний
3. Omni SFT – модель переходит в мультимодальный инструктивный режим
4. Omni RL – основная стадия мультимодального алайнмента модели.

Читать полностью…

Борис опять

#дайджест

Дайджест AI/ML за две недели 23 марта – 5 апреля 2026

Google: Gemma 4 (OMG hiiii 👀👀👀)
Четыре размера: E2B и E4B для мобильных устройств (работают на телефонах, Raspberry Pi и Jetson Nano с околонулевой задержкой), 26B MoE (3.8B активных, оптимизирован на скорость) и 31B Dense (максимальное качество). 31B занял 3-е место на Arena AI (Elo 1452), 26B - 6-е. Бенчмарки 31B: AIME 2026 89.2%, GPQA Diamond 84.3%, LiveCodeBench 80.0%, MMLU Multilingual 85.2%. 140 языков, нативный function calling, мультимодальность (аудио + визуал).
Блогпост, DeepMind, HF

Google: Veo 3.1 Lite
бюджетная видео-модель text-to-video и image-to-video, 720p/1080p, длительность 4/6/8 секунд. Стоит менее 50% от Veo 3.1 Fast при той же скорости генерации. Доступна через Gemini API и AI Studio по подписке.
Блогпост

Microsoft: MAI-Transcribe-1
Speech Recognition на 25 языков с WER 3.8% на FLEURS - первое место, обогнали Whisper Large v3, Scribe v2, GPT-Transcribe и Gemini 3.1 Flash-Lite. Заточена под плохие условия: фоновый шум, низкое качество записи, одновременная речь нескольких человек. В 2.5 раза быстрее Azure Fast. $0.36 за час аудио. Уже работает в Copilot Voice Mode.
Блогпост

Z .ai: GLM-5V-Turbo
Мультимодальная модель для фронтенд-кодинга с нативным визуальным восприятием. Превращает макеты дизайна в исполняемый фронтенд-код. На собственном Design2Code бенчмарке 94.8 против 77.3 у Opus 4.6 (верим). Контекст 200K, выход до 131K токенов. Цена $1.20/$4.00. API-only, весов нет.
Блогпост

Alibaba: Wan2.7-Image
Генерация и редактирование картинок с thinking mode - модель рассуждает о композиции и пространственных отношениях перед генерацией. Рендеринг текста на 12 языках при входе до 3000 токенов, до 9 референсных картинок, батч-генерация до 12 штук. Есть Pro-версия с 4K выходом. Доступно через Model Studio и Qwen App.
Блогпост

Microsoft: Harrier-OSS-v1 Семейство мультиязычных эмбеддингов: 270M, 0.6B, 27B. SOTA на Multilingual MTEB v2 (74.3 у 27B). Контекст 32K токенов, 94 языка. Построены на Gemma 3 (270M и 27B) и Qwen 3 (0.6B)

Читать полностью…

Борис опять

AI engineer
@
fits a linreg over 2 points (unsuccessfully)

Читать полностью…

Борис опять

Раньше я писал про IQDOC AI: ИИ ассистента для врачей в России. Это RAG опирающийся на клинические рекомендации Минздрава и нормативные документы.

С тех пор сервис успешно запустился и им уже воспользовались тысячи врачей! Очень радуюсь за проект.

Команда IQDOC проанализировала более 25 тыс. запросов. Публикации с результатами вышли в Медвестнике и Коммерсанте.

Там можно почитать что ищут врачи, кто чаще обращается к ИИ инструментам и другие инсайты. Например, почему-то врачи из Челябинска задают вопросы про рак легкого в 19,6 раза чаще 🌚

Подписывайтесь на их телеграм канал: /channel/iqdocai. У них там скоро будет медицинский хакатон

Читать полностью…

Борис опять

Кто-то скажет это фейк

Читать полностью…

Борис опять

Сейчас много разговоров о том, что инвестиции в ИИ будут снижаться, на этом фоне немного боязно, не свернут ли открытые исследования и опенсорс совсем. Тем более российского качественного на гитхабе и так не очень  много.

В этом контексте всегда приятно слышать от компаний, что они не планируют снижать инвестиции в рисеч, в том числе фундаментальный:

«Мы смотрим через призму: если наука не превращается в продукт, значит, инвестиция не завершена — надо продолжать инвестировать»,

- сообщил исполнительный директор Т-Технологий Вячеслав Цыганов.

В общем, я делаю вывод, что инвестиции в ИИ для компании остаются приоритетными и мы продолжим видеть как минимум научные публикации от их команды, а если повезет может и новые опенсорс модели.

Читать полностью…

Борис опять

Раст разрабы бывают двух типов

Читать полностью…

Борис опять

Лев если и спрашивал у юзеров разрешения перед тем как обучать на их данных, то так, между делом, чисто на Хакерньюсе ответил один раз, без публичных релизов

GitHub очень тихо обновил правила и собирается тренироваться на почти всех приватных репозиториях. Если вы явно не укажите, что не хотите "доступа к этой фиче"

Читать полностью…

Борис опять

LiteLLM версии 1.82.7 (хотя местами в посте написано 1.82.8, но вы поверьте мне) подвергся supply chain атаке. Зафиксируйтесь на предыдущей версии и не обновляйтесь.

https://futuresearch.ai/blog/litellm-pypi-supply-chain-attack/

https://github.com/BerriAI/litellm/issues/24512

Читать полностью…

Борис опять

HR: Кем вы видите себя через 5 лет?

Я: (на фотографии)

Читать полностью…

Борис опять

Самая идея оружия разработанного Кагглерами внушает мне страх

Читать полностью…

Борис опять

#разное

Так как мотоциклетные права не выгорели, я проживаю свой кризис 30 и закрываю ачивки в других сферах жизни.

Примерно полгода назад увидел пост у @btseytlin про то, как он вписался в открытые микрофоны, и я подумал, что this is the way (c) чтобы разнообразить свой сет скиллов.

Держите 4 минуты про экономику с отсылками на Гарри Поттера и Звёздные войны с моего первого опенмайка. Работать есть много над чем, но аудитории сравнительно зашло.

Пока главное открытие: про члены шутить легче

Второе открытие - у такого формата плохое удержание в тиктоке/инсте, алгоритмы не подхватывают. Поэтому в лентах можно увидеть кучу видосов с разговорами с аудиторией - там виральность гораздо выше, хотя шутки могут быть хуже

Читать полностью…

Борис опять

Вайбкодинг конечно скорее заработал, но иногда хочется рвать на себе волосы.

Рис. 1: frontier artificial intelligence написал функцию, затем во время дебага написал скрипт в котором она вызывается и перепутал порядок аргументов. В результате все выполнилось, но неправильно, из-за чего на выходе была абсолютная дичь. Которую агент интерпретировал будто так и задумано. Если бы я не заглянул внутрь, то так и не узнал бы, что меня кормят отборнейшим потоком галлюцинаций.

Поставил себе hook с ty после этого.

Это я решил на вайбах залететь в agentic RAG challenge и пришел к тому состоянию вайбкод проекта когда кажется, что проще все сжечь. Это когда чувствуешь себя несчастным меинтейнером легаси в своем же пет-проекте и тратишь больше времени на правки одним вайбкодом другого вайбкода, чем на полезную работу. Когда есть страх, что если полезу разбираться в любой фиче, то окажется, что там костыль на костыле и всё работает неправильно.

Я пытался понять, почему с одними проектами у меня это происходит, а с другими нет. Например, в TapAgent такого нет. Пришел к выводу: чтобы хорошо вайбкодилось надо читать код. В TapAgent я читаю и правлю код всех критических компонентов вроде агентского цикла, часто нахожу там проблемы и исправляю их вовремя.

Есть и более медленная и ущербная версия этого для тех, кто не умеет читать код. Промптим клода: объясни мне по шагам как у нас работает фича Х. Попробуйте на своем проекте. Почти наверняка реакция у вас будет: "чего???"

В решении для соревнования я на это забил, посчитав, что хорошо описанных в промптах принципов будет достаточно. В итоге возникают, например, такие ситуации:
1. В одной сессии клод код пытался реализовать поиск именованных сущностей в документах и сделал это криво, я не заметил
2. В другой сессии он пытался сделать изменение ранжирования опирающееся на обнаруженные ранее сущности. Увидев, что первое не работает, он реализовал еще один костыльный поиск сущностей
3. Какое-то время это работало, но при очередном сабмите всё сломалось

Попытки исправить это еще одним слоем вайбкодинга приводят к ещё одному слою слоп-костылей.

В общем, всё ещё крайне полезно читать код, что бы там ни говорили

Читать полностью…

Борис опять

#дайджест

Дайджест AI/ML за неделю 6–12 апреля 2026

Meta: Muse Spark
Модель Meta Superintelligence Lab - первый результат закидывания топовых ресерчеров горой денег . Нативно мультимодальная: текст, картинки, видео, аудио, код на входе и выходе. Contemplating mode (оркестрация нескольких reasoning-агентов). По бэнчмаркам модель на сопоставимом с большими игроками уровне, местами SOTA. НЕ оупенсорс, что для Meta в новинку.
Доступна на meta.ai, API в закрытом превью.
Блогпост

Anthropic: Claude Mythos Preview
SWE-bench Verified 93.9% (vs 80.8% у Opus 4.6), USAMO 2026 97.6%, OSWorld 79.6%. При тестировании кибер-способностей модель нашла тысячи zero-day уязвимостей, после чего Anthropic ограничила доступ - только по приглашению через Project Glasswing, созданный чтобы подготовить критическую инфраструктуру к новым моделям. С другой стороны у разрабов Антропик AGI Achived Internally уже полтора месяца как, а утечки и падения только увеличились.
Системная карточка

Alibaba: HappyHorse 1.0
Анонимная 15B видеомодель, которая вышла из ниоткуда и заняла #1 на Video Arena (Elo 1333 T2V, 1392 I2V), обойдя Seedance 2.0, Kling 3.0 и Sora 2 Pro. 40-layer unified Transformer, совместная генерация видео+аудио в одном проходе, липсинк на 7 языках. 1080p, 5-8 секунд, ~38с на H100. В итоге интригу развеяли, модель от Alibaba. Веса обещают, но пока не выложили.
Блогпост

Netflix: VOID
Video Object and Interaction Deletion - удаление объектов из видео с учётом физики. Убираешь человека с гитарой — гитара падает. Убираешь шар для боулинга — кегли остаются стоять. Под капотом CogVideoX-Fun 5B с четырёхзначной маской (quadmask): что удалить, что физически затронуто, где перекрытие, что оставить. VLM (Gemini) рассуждает о каузальных последствиях удаления. 64.8% предпочтений юзеров vs Runway (18.4%).
GitHub, HF

Alibaba: VimRAG
RAG-агент с графом мультимодальной памяти вместо линейной истории. На Qwen3-VL-8B backbone: +12.5пп overall vs vanilla RAG (50.1% vs 37.6%), HotpotQA 79.1% (+15пп), SlideVQA 62.4% (+14пп).
Статья, GitHub

Менее значительные релизы:

Runway: Characters - реалтайм-аватары на GWM-1, одно фото, без файнтюнинга. Блогпост
Black Forest Labs: FLUX.2 Small Decoder - 1.4x быстрее, меньше VRAM, ~28M параметров (vs ~50M), Apache 2.0. HF
sync: sync-3 - 16B модель для липсинка, 95+ языков, 4K, в 32 раза больше предшественника, по отзывам очень хороша. Блогпост
Milla Jovovich: MemPalace - да, Мила Йовович написала memory-фреймворк на основе человеческой мнемотехники, выбивший 96.6% на LongMemEval. Уже 23K звезд на GitHub, а чего добился ты?
OpenBMB: VoxCPM2 - 2B TTS на 30 языков (включая русский, WER 5.21%), без токенизатора, есть клонирование голоса GitHub
Generalist AI: GEN-1 - робот складывает футболки с 99% успехом, 86 подряд без ошибок. 1 час данных на задачу
NVIDIA: NTC - нейросетевое сжатие текстур, с 6.5GB до 970MB VRAM
Qwen: HopChain - обучение reasoning-VLM с помощью синтетических многоэтапных вопросов к модели, улучшает 20 из 24 бенчмарков на Qwen3.5. Статья
MiniMax: Music 2.6 - еще одна музыкальная модель. Блогпост
World Labs: Marble 1.1 - еще один генератор 3D-миров. Блогпост
MiniMax: M2.7 - опубликовали веса. 229B MoE, 10B активных, SWE-Pro 56.2%, $0.30/$1.20. HF, Блогпост
OpenAI: ChatGPT Pro - подписка за $100/мес, 5x больше Codex чем в Plus, доступ к gpt-5.4pro

Читать полностью…

Борис опять

Добрым словом и Клод Кодом можно добиться куда большего, чем одним только добрым словом.

Читать полностью…

Борис опять

Skywork AI: Matrix-Game 3.0
Интерактивная world model, 720p/40FPS, до 1мин. В двух размерах: 5B и 2x14B
Сайт, GitHub, HF

Google: Lyria 3 Pro - музыкальная модель, треки до 3 минут (было 30 секунд у Lyria 3). Доступно по подписке, в AI Studio и по API, $0.08 за трек.

Google: Gemini 3.1 Flash Live - голосовая модель для real-time разговоров, 90+ языков, удвоенный контекст диалога.

Suno 5.5 - новее, лучшее. Теперь есть клонирование голоса для пения.  Доступно для Pro/Premier.

Runway: Multi-Shot App - AI сам делает мульти-ракурсы и решает где резать. В общем, автоматизация монтажа. Приложение

CapCut: Seedance 2.0 наконец раскатили на весь мир (кроме США от греха подальше). Только для CapCut Pro, наслаждайтесь прорывом в видеогенерации, но теперь без Томов Крузов.

Cohere: Transcribe - open-source ASR, 2B параметров, 14 языков, WER 5.42%. Первое место на HF Open ASR Leaderboard, обогнали Whisper Large v3.

Терренс Тао доказал теорему с помощью ChatGPT о чем и написал в статье, теперь можете авторитетно писать в своих публикациях "proved using ChatGPT"

Читать полностью…

Борис опять

Астронавты Artemis II сделали красивые фото Земли в высоком разрешении, тут и тут можно скачать себе новые обои.

Еще, оказывается, есть лайв трансляция на Youtube прямо с корабля. What a time to be alive

Читать полностью…

Борис опять

Gemma 4
blogpost | model card | huggingface

4 размера: E2B, E4b (бывшие Gemma 3n/Gemini Nano); 26A4B, 31B Dense. Теперь лицензия Apache 2.0!

Для всех моделей релизим претрейн и intruction tuned чекпойнты. Context length 256k у 31B модельки, 128k у остальных. Скажу по секрету – можно пробовать и больше, должно работать.

LLM Arena на уровне Kimi 2.5, бенчмарки можно посмотреть на huggingface

Читать полностью…

Борис опять

https://developers.googleblog.com/google-colab-is-coming-to-vs-code/

Оказывается аж с ноября можно работать в VS Code используя GPU из Google Colab. Просто ставите расширение и выбираете в качестве ядра для своих ноутбуков Colab.

Наконец-то можно пользоваться нормальной IDE и бесплатными GPU одновременно

Читать полностью…

Борис опять

FYI запуск Artemis II примерно через 25 мин:
https://www.youtube.com/watch?v=Tf_UjBMIzNo

Смотрим!

Читать полностью…

Борис опять

Мем про Слоп Тесея стал реальностью! Скоро мы узнаем является ли код слопизированный через LLM новой сущностью или нет. Максимально иронично, что целью стал клиент Claude Code.

Какой-то анимешник с помощью OpenAI Codex переписал слитые исходники Claude Code на Python. Чтобы хранение кода не попадало под нарушение копирайта.

https://github.com/instructkr/claw-code

Я думаю это шиза + копирайт так не работает + скоро удалят

Читать полностью…

Борис опять

Короче я давно написал статью на РБК. Сегодня она наконец вышла и я узнал, что она доступна только по подписке. Даже я не могу прочитать, что там

😳

Читать полностью…

Борис опять

🤖 Хабр статья: поучаствовал в RAG челлендже

Помните, я рассказывал про юридический AI-челлендж ARLC 2026? Так вот, я в нём поучаствовал

В соревновании нужно было строить RAG-пайплайн поверх корпуса судебных решений и законов: находить нужные страницы, извлекать ответы, давать точные ссылки. Соло, с Claude Code в качестве напарника

Раньше я не разбирался в RAG. За 5 дней и 17 итераций прошёл путь от 0.034 до 0.791. А потом вышел в финал – и папйлайн, который отлично работал на 30 документах, потерял 42% на 300 документах

Сложно сказать с таким скором, что я в нем разобрался, но точно стало лучше

Описал весь опыт участия в статье на Хабре:

• Полная архитектура с кодом
• Математика F-beta, которая перевернула стратегию
• 3 регрессии, которые научили больше, чем все успехи
• Честный разбор работы с Claude Code на соревновании
• 88 USD на API за всё соревнование

Буду благодарен за лайки, комментарии и сохранения на Хабре – это продвинет статью в рекомендациях:)

🔗 Ссылка: https://habr.com/ru/articles/1014758/

Пишите в комментах, если тоже участвовали! 👉

@tagir_analyzes

Читать полностью…

Борис опять

🌸ГиперАгенты, или вперед к Open-Ended Exploration🌸
#nlp #nlp_papers

Что будет, если дать агентам полную свободу модифицировать самих себя?
Наконец-то выпускаю долгожданную статью, где я побыла уже не соавтором, а научным руководителем.
Вместе с Jenny Zhang, автором Darwin Gödel Machine , выпускаем HyperAgents — open-ended self-improvement для агентов, на многих задачах сразу

🌸TL;DR
HyperAgents — это пример системы, где агент улучшает самого себя итеративно, от промптов до кода.
При этом, в отличие от Darwin Gödel Machine, мы пошли дальше и сделали multi-task objective:
— агент должен улучшать сам себя из поколения в поколение, и делать это одновременно на многих задачах сразу.

Улучшения возможны в обеих группах доменов:
— verifiable rewards: кодинг (Polyglot), математика (IMO), симуляции в робототехнике (Genesis)
— unverifiable rewards: рецензирование статей (Apres)

🌸Пайплайн

Как и в первой версии DGM, агент вносит модификацию — и затем оценивает ее успешность на основе результатов: в данном случае на бенчмарках, тестах и тд.
Модификации образуют граф версий, который можно контролировать в git.

В системе всегда работает цепочка из двух агентов: есть мета-агент и агент, который выполняет задачи.
Мета-агент опирается на результаты выполнения задач и вносит изменения и в себя, и в агента-работника одновременно.

Гиперагентов можно использовать с разными моделями: Claude-4.5-sonnet, O4-mini, GPT-4o

🌸Почему это работает: Абляционные исследования

Как должна выглядеть оптимальная система агента, чтобы поощрять открыты  поиск новых модификаций?
Как правило, в предыдущих работах, если агенту и позволяется что-то модицифировать, то только в определнных рамках и заданных примитивах.
Мы проверили, что будет, если этого избежать: результирующая система — Гиперагенты — оптимизирована под более быстрый поиск новых модификаций — и in-context обучение более эффективному самооулучшению.
Модель в рамках итераций (их может быть хоть 200) начинает лучше понимать, какие изменения стоит вносить.  
Итак, что мы сравниваем:
— HyperAgents (DGM-H): метаагент улучшает сам себя и агента-работника в многозадачной среде
— HyperAgents без самомодификации: метаагент улучшает только агента работника в многозадачной среде, себя оставляет как есть
— HyperAgents без архива предыдущих решений и их результатов: метаагент вносит улвчшения в себя и агента-работника, не опираясь на предыдущие результаты
— Классика, DGM: метаагент изолированно улучшает агента-работника, на всех задачах и кастомно по одной задаче. 

🟣HyperAgents (DGM-H) демонстрирует более динамичный рост общего перформанса на всех задачах — плюс, улучшения, полученные таким способам на одних доменах, переносятся в улучшения на других.

🌸Учимся самоулучшаться

Мы вводим новую метрику, чтобы определить способность мета-агента вносит успешные улучшения: imp@50 (по аналогии с pass@50)
🟣Именно в рамках итеративного процесса самоулучшения у мета-агента в конце эксперимента существенно вырастает imp@50 в сравнении со стартовым состоянием (0 --> 0.63).
🟣Агент обрастает тулзами для поддержания памяти, трекинга изменений, отслеживания тенденций в результатах.


🟣Arxiv https://arxiv.org/abs/2603.19461
🟣Github https://github.com/facebookresearch/HyperAgents
🟣HF papers: https://huggingface.co/papers/2603.19461
🟣AlphArxiv https://www.alphaxiv.org/abs/2603.19461

Читать полностью…

Борис опять

#дайджест

Дайджест AI/ML за неделю 16–22 марта 2026

Nvidia: GTC week 2026
Дженсен три дня подряд что-то анонсировал не щадя куртку. Поэтому Nvidia на этой неделе сожрала пол дайджеста.

Groq 3 LPX - первый продукт после покупки Groq за ~$20B. Инференс-чип: 1.2 PFLOPS FP8, 500MB SRAM. Рэк из 256 штук обещает 35x throughput Blackwell NVL72 на триллион-параметровых моделях при $45/M токенов. Для Китая готовят отдельный вариант на май - инференс в обход экспортных ограничений на GPU, Дженсен уже получил лицензию от Трампа. Блогпост
DLSS 5 - вместо апскейлинга теперь нейрорендеринг. Нейросеть берет цвет и motion vectors из движка и генерирует физически корректное освещение, тени и материалы в реалтайме. Различает кожу, волосы, воду, металл, стекло. Только RTX 50xx, осень 2026. Блогпост
GWM-1 - Runway и Nvidia показали General World Models на чипах Vera Rubin. Реалтайм HD-видео с задержкой 100мс. Три варианта: Avatars (говорящие головы), Robotics (песочница для роботов), Worlds (бесконечные миры). Avatars уже можно потестить. Блогпост
Nemotron-Cascade 2
30B MoE с 3B активных параметров. Cascade RL + дистилляция из нескольких учителей по доменам. AIME 2025 - 92.4, IMO 2025 - золото (79.3%), IOI и ICPC - тоже золото. Второй опенсорс после DeepSeek-V3.2-Speciale, собравший золото на всех трех олимпиадах, но в 20 раз меньше.
Cтатья, HF

OpenAI: GPT-5.4 mini и nano
Через две недели после старшей модели вышли маленькие версии. Mini: $0.75/$4.50, контекст 400K, нативный vision, SWE-Bench Pro 54.4%, OSWorld-Verified 72.1% - на уровне полной GPT-5.4 по computer use. Nano: $0.20/$1.25, API-only, ~200 т/с, для классификации и субагентов. Nano дешевле Gemini Flash-Lite, можно описать 76 000 фото за $52. По APEX-Agents от Mercor mini (24.5%) обходит Sonnet 4.6 (23.7%) при сильно меньшей цене.
Блогпост

Cursor: Composer 2

Вторая "собственная" модель Cursor для кодинга. Terminal-Bench 2.0: бьет Opus 4.6 (61.7 vs 58.0), проигрывает GPT-5.4 (75.1). Цена $0.5/$2.5, fast-версия $1.5/$7.5 - в 7 раз дешевле Opus за сравнимое качество. Из забавного, выяснилось что это пост-трейн Kimi 2.5, о чем Cursor тактично умолчали.
Блогпост

Менее значительные релизы:
MiniMax: M2.7 - модель которая участвует в собственной оптимизации: 100+ автономных циклов RL, +30% перформанс. SWE-Pro 56.22%, $0.30/$1.20. Блогпост
Xiaomi: MiMo-V2-Pro - 1T параметров (42B активных), 1M контекст. Тайно тестировалась на OpenRouter под кодовым именем "Hunter Alpha". AI Intelligence Index #8 в мире. Блогпост
Microsoft: MAI-Image-2 - генератор картинок, третье место на Image Arena. Только text-to-image, без редактирования, без image2image. Просто text2image в 2026 году. Блогпост
Midjourney: V8 Alpha - генерация в 5x быстрее, нативный 2K, но альфа сырая. V7 пока лучше, народ (который еще помнит кто это такие) не в восторге. Анонс
Mistral: Leanstral - опенсорс 120B/6B для формальной верификации кода на Lean 4. Блогпост
Mistral: Forge - платформа для тренировки корпоративных LLM с нуля на своих данных. Полный цикл: претрейн, SFT, DPO, RL. Блогпост
Naver: Seoul World Model - мечтали ли вы в 13 об игре чтобы было как гта, но там ваш город и в свой подъезд зайти можно? Пока вы мечтали Naver впихнули Сеул в 2B DiT на базе Cosmos Predict 2.5. 15 fps на одной H100, тренировали на 24 H100. Можно промптить Годзиллу и наводнения. Пейпер, GitHub
Adobe: Firefly Custom Models - теперь можно обучать Firefly на своих работах. Блогпост
ElevenLabs: Music Marketplace - маркетплейс нейродегенеративной музыки внутри ElevenCreative. Блогпост

Читать полностью…

Борис опять

🙄

Ищем нестандартные способы попасть в топ-10

В общем на Kaggle проходит то самое соревнование по построению кибер-гулагов из щитпоста "не стройте кибер-гулаги за 15к призовых": https://www.kaggle.com/competitions/leonardo-airborne-object-recognition-challenge/discussion

Приятно видеть, что сообщество не захотело размечать фото трупов, администрация Kaggle вмешалась и соревнование сейчас на паузе.

Читать полностью…

Борис опять

Причем иногда модель думает по одному вектору, а ты по другому, в итоге когда ты ей говоришь "напиши Х", то она пишет ХУ, а ты добавляешь Й, то получается хуй

Читать полностью…

Борис опять

Вот сколько вы стоите (но не для меня)

Читать полностью…
Subscribe to a channel