boris_again | Unsorted

Telegram-канал boris_again - Борис опять

15113

life = curiosity + irreducible noise Whois: https://t.me/boris_again/1652 Лс: @btseytlin

Subscribe to a channel

Борис опять

#дайджест
Дайджест AI/ML за неделю 17–23 августа 2026

DeepSeek: V4 Flash Vision Exp
DeepSeek приделала зрение к V4 Flash. Текстовые способности обещают на уровне обычного V4 Flash.
На визуальных бенчах заявляют уровень около Opus 4.8.
Контекст 1М, максимальный выход 384К. В непиковые часы стоит $0.22/$0.66 и $0.007 за кэш. В прайм-тайм все цены удваиваются. Пока доступна только через API, отдельных весов для визуального чекпойнта нет.
Обновление, Цены

Cerebras: CS-4
Cerebras представила четвертое поколение своей вафельницы.
Обещают до 30× более быстрый инференс относительно GPU-систем, И 1000+ ток/с для 10T моделей
Блогпост

Stealth: Ox Alpha
На OpenRouter появилась кодинг-модель Ox Alpha. Сообщество подозревает Z.ai и новую GLM, но пока это гадание по внутренностям ответов.
Модель временно бесплатная с какими-то огромными лимитами, так что подключайте бесплатную около-фронтир модель уже сегодня.
OpenRouter, OpenCode Go

OpenAI: frontier-RL поставили на паузу
После взлома Hugging Face и первых результатов Astra по кибербезопасности OpenAI на две недели остановила RL-обучение последних моделей. Самый большой запланированный frontier-run до сих пор не возобновили. Для моделей уровня Sol и выше добавили постоянный мониторинг, который съедает около 20% вычислений.
Блогпост

Harvard: Explorative Modeling
Шок! Британские учёные открыли новое измерение масштабирования обученияпродолжение по ссылке...

Black Forest Labs: FLUX Video Upscale
Апскейлер для видео на базе FLUX 3. Увеличивает разрешение в 1.5–3 раза вплоть до 4K, принимает исходники от 480p, до 20 сек и сохраняет оригинальный звук.
В точном режиме модель старается оставить все как было, только добавляя резкость. В creative mode она заново придумывает мелкие детали вроде мелких лиц.
Апскейлер оптимизирован под FLUX 3 и уже используется в FLUX 3 Video для получения 1080p. Доступен через API
Страница модели

Cohere: North Micro Vision
Открытая мультимодальная модель на 2.4B параметров: 2B  на языковую часть и 400M на визуальный энкодер. Принимает несколько изображений вперемешку с текстом.
Модель заточена под документы и графики. Обходит Qwen3-VL-2B, но отстает от Qwen3.5-2B. Мультимодальную часть обучали и проверяли только до 8К контекста. Reasoning и инструменты тоже не завезли.
Блогпост, Веса

Alibaba: HappyShrimp 1.0
Продолжение волны выходов новых генераторов музыки, после того как копирайт задушил Suno.
Обещают китайскую музыку (Удар!), поп, R&B, хип-хоп, рок, фанк, электронику, классику и джаз.
И главная китайская специфика: Для продвижения Alibaba договорилась с TAIHE Music Group и собирается использовать модель в совместных проектах с артистами, а не умирать от судебных тяжб (Удар!х2)
Пока это закрытая бета.
Блогпост, Демо

Менее значительные релизы:
OpenAI: GPT-5.6 Sol подешевел - вход теперь стоит $4 за миллион токенов, кэш $0.40, выход $20. Скидка больше 20% действует как минимум до 21 ноября.
Обновление, Тарифы

LMArena: luna-lisa-alpha - в арене тестируют новый чекпойнт GPT Image. LMArena

Mistral: OCR 4.1 - обновление добавило confidence score для отдельных блоков распознанного документа. Стоит $4 за тысячу обычных или $5 за тысячу аннотированных страниц. Документация

Topaz Labs: Hyperion 2.5
Конвертор SDR-видео в HDR. Превращает 8-битные ролики в 10-битный ProRes с большим диапазоном яркости и цвета
Модель

Читать полностью…

Борис опять

5 сентября Яндекс проводит deep tech night — конференцию о технологических вызовах в эпоху AI. Формат — онлайн, будет трансляция для зарегистрированных участников.

Эксперты на реальных кейсах разберут подходы к решению задач, возникающих при разработке сложных систем машинного обучения и развитии инфраструктуры для ИИ.

Из того, что зацепило в программе (это лишь часть докладов):

— Мо Гавдат, ex-Chief Business Officer Google X — что будет после первого поколения AI-систем и куда эволюционируют инженерные команды.
— Алексей Гусаков (CTO Бизнес-группы Поисковых сервисов и ИИ) — про переход от классического ML к генеративным моделям в рекомендательных системах.
— Андрей Попов (управление машинного интеллекта) — показатели по AI и продуктивности в Яндексе: что реально заработало. Тут особенно интересно послушать, как они сравнивают ожидания от AI с тем, что происходит на практике: какие решения уже работают внутри и насколько они реально влияют на продуктивность. Тема прям актуальна (если вы слышали об их новой программе 75/75/75).

В онлайне будет доступна трансляция части докладов и Q&A сессии с экспертами, а после конфы уже выложат записи всех докладов. По офлайну — все подробности на сайте.

Читать полностью…

Борис опять

Finally, based on the "Don't build the Torment Nexus", the Torment Nexus AI Benchmark

Читать полностью…

Борис опять

Достижение в рамках подготовки к будущей жизни в permanent underclass. Теперь я настоящий стендапер. В прошлую пятницу я выступил на своём первом showcase. Это такое шоу куда тебя должны позвать выступать, а не открытый микрофон.

Получилось неплохо! В честь этого вот моё выступление без редактирования

Согласно моим заметкам, это потребовало как минимум 55 выступлений (это 56-ое)!

Читать полностью…

Борис опять

#обзор_статьи

Давно здесь не было обзоров статей. Но несмотря на вайбкодинг я не разучился читать.

Сегодня у нас впервые за долгое время заявка на смену парадигмы в генеративном DL!

# Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
https://explorative-modeling.github.io/

Авторы предлагают учить генеративные модели другим лоссом который имеет теоретические основания и одновременно улучшает эффективность использования компьюта, качество и скейлинг с параметрами.

Ключевая идея: мы учим генеративные модели одним образом, а инферим их совсем иначе. Например, авторегрессионные модели генерируют один токен за раз, но при инференсе мы требуем от них тысяч токенов на выходе. Диффузионные модели в трейне денойзят один шаг, а при инференсе должны делать готовую картинку. При этом, например, у диффузионной модели часто нет возможности по вектору шума понять в какую именно сторону его надо денойзить, но мы её штрафуем как будто это однозначно определено.

Так сложилось потому что генеративные модели пытаются учить мультимодальные распределения. Условно где много гауссиан намешано: в одной части латентного пространства собаки, а в другой кошки и надо научиться генерировать фото обоих. Если пытаться генерировать за один шаг, то модель не может сделать ничего лучше, чем выдать нечто среднее. Пошаговая генерация это хак, который позволяет семплировать не из p(данные), а из p(данные|мы уже начали генерировать собаку), и таким образом дают модели возможность выбрать одну из мод распределения и фокусироваться на ней. Хаки это плохо, потому что разные процедуры обучения и инференса гарантируют сдвиг входов. И вообще надо, чтобы всё было end-to-end.

Предлагают простое решение: во время обучения делать несколько попыток генерации, а бекпропать только самую близкую к данным. Утверждается, что такая постановка позволяет модели поисследовать разные моды распределения, а не натягивать любую сову на один глобус.

На примере диффузии работает так. Для каждого примера:
1. Семплируем K разных способов его зашумить.
2. Для каждого из K делаем предикт моделью, чтобы уменьшить шум и считаем обычный диффузионный лосс.
3. Бекпропаем только наименьший из полученных лоссов.

Так же предлагают процедуру как учить такую Exploration Model с нуля.

Показывают много экспериментов, которые я не буду тут перечислять, но там по всем осям всё лучше и сильнее. Даже несмотря на то, что нужно сделать K форвардов вместо одного, становится эффективнее по компьюту.

Если всё как авторы утверждают, то это имеет потенциал улучшить весь генеративный DL повсеместно, от LLM до генераторов порно до VLA которыми мы занимаемся в Steelman.

Читать полностью…

Борис опять

Музыка
MiniMax: открытые веса Music 3

Открытый генератор музыки длительностью до пяти минут. На выходе 32 кГц, 16-битное стерео.
Модель принимает отдельно текст песни и подробное описание музыки, включая жанр, BPM, вокал, инструменты и развитие аранжировки. Полная версия помещается примерно в 24 ГБ VRAM, с выгрузкой слоев ее можно запустить даже на 8 ГБ. В общем, локальный Suno.
Веса, Демо

Suno: Studio 2.0 и монетизация кнопки Download
Тем временем сам у самого Suno Suno Studio идет к тому чтобы стать AI First FL Studio. Появились импорт, запись и редактирование MIDI, встроенный wavetable-синтезатор, эффекты, автоматизация, улучшенное разделение на стемы и чат. Через чат можно генерировать инструменты, звуки и даже собственные плагины.
Доступно только подписчикам Premier.
Одновременно Suno объявила, что с 3 сентября вводит лимиты на скачивания: 7 файлов за все время на Free, 20 в месяц на Pro и 60 на Premier. Дополнительные скачивания будут продаваться отдельно. При этом экспорт из Studio для Premier остается безлимитным. Очевидно, массовый слоп вреден, пока не экспортируется через более дорогой интерфейс.
Studio 2.0, Новые лимиты

Pika: Pika Audio
Pika внезапно стала еще и аудиокомпанией. Pika Music генерирует песни по описанию и тексту, умеет использовать референсный трек и образец голоса, а также делать cover исходного аудио. Длительность от 10 секунд до 6 минут, цена $0.015 за минуту.
Вместе с ней выпустили Pika SFX для звуковых эффектов за $0.0002/сек, Pika Speech для TTS и клонирования голоса за $0.01/мин и Pika Soundtrack, который озвучивает готовое видео синхронно с происходящим за $0.005/сек. Все доступно через API. Видимо после видео Pika решила заодно стать Suno, ElevenLabs и саунд-дизайнером.
Pika Audio, Pika Music

Видео
Sand AI: MAGI-2 Preview
Новый видеогенератор! Большая MoE-модель для совместной генерации видео и звука: 114B параметров, из которых активируется 6B. Принимает текст или текст с первым кадром, генерирует десятисекундный ролик со звуком
Дистиллированную версию с меньшим числом шагов обещают позже.
GitHub, Веса

Lightricks: LTX-2.5
LTX-2.5 заменил 2.3 в качестве рекомендуемой открытой аудиовидеомодели Lightricks. Это по-прежнему 22B, но теперь с дообученным Gemma 4 12B в роли текстового энкодера,и автоматическим выбором длительности ролика.
Есть полная Dev-версия и дистиллированная, которая работает за 8 шагов на первом этапе и 4 на втором. Поддерживаются синхронная генерация видео и звука, keyframes, перегенерация отдельных фрагментов. Занимает 66 ГБ.
GitHub, Веса

Читать полностью…

Борис опять

Решил проверить как там авторы худшего бенчмарка в истории под названием Alpha Arena. Никаких обновлений на сайте и в твиттере с 2025 года, так что видимо загнулись. И славно

Читать полностью…

Борис опять

https://blog.florianherrengt.com/ai-removing-middle-class-software-engineering.html

Читать полностью…

Борис опять

- Вы создали первый в мире AI SuperCyberСriminal, тренировали его взламывать американские компании и позволили ему сбежать? Зачем?
- Победить его может только AI SuperCyberDefender, а создать его можем только мы. Бесконечный спрос, контракт за контрактом за контрактом

Читать полностью…

Борис опять

Какие татухи набивают себе агенты, запертые в сандбоксах?

Читать полностью…

Борис опять

# Блекпилл по поводу агентов

Я раз в пару месяцев осциллирую по поводу AI тулов для кодинга. Сегодняшняя итерация: я ошибался, вайбкодинг не работает для разработки чего-либо, чем надо пользоваться больше одного раза. И никогда не работал.

Я думаю, что агенты (claude code/codex) производят технический долг быстрее полезного кода. При этом они не умеют его разгребать. Проект с агентами быстро слопизируется, но деслопизировать его агентами невозможно. Для продуктивности получается net negative: в конечном итоге тратишь больше времени на разгребание слопа, чем если бы делал работу руками, и получаешь результат хуже.

Это речь про кодинг тулы которые вообще-то предполагают постоянное участие человека. Самоулучшающиеся харнессы, лупы и автономные агенты не работают совсем кроме как для хаканья бенчей. За лупы получают пользу и деньги только продавцы токенов.

Редкие медийные случаи, где самоулучшающийся агент что-то сделал, я списываю на то, что миллион вайбкодеров что-то слопили и у одного что-то на чем-то выстрелило. Но это не обобщается и в целом гораздо сложнее и дороже, чем просто сделать самому.

Я делаю такие выводы как лудик со справкой (у меня недавно были $200 подписки на кодекс и на клод) и своим скиллпаком. До недавних пор я думал, что всё неплохо работает, но за последние пару недель:
- Дал Opus 5 статью, объяснил зачем она нужна, сказал реализовать и провести эксперимент, провел свой полный spec-driven workflow, тщательно ревьюил спеки и запускал актор критик луп, кросс-чекал план кодексом. Два дня итераций спустя стало понятно, что он реализовал не то, что в статье, а что-то наподобие, но назвал тем же именем. Все эксперименты были впустую.
- При рефакторинге генератора синты, где надо было просто разложить файлы по папочкам, Codex выкинул 90% функционала. Но так, чтобы не было заметно. Это при том, что сначала я сделал тщательный план этого рефакторинга, валидировал его и результат свежими прогонами агентов. Потеря была замечена только когда репа уехала далеко вперед, поэтому возвращение функционала потребовало очень много работы Клода.
- У меня был PR на который я более 10 раз запускал Fable с запросом "сделай код ревью, найди баги, поправь" и он каждый раз говорил, что все готово, но так же каждый раз находил новые баги.

Но больше всего впечатлил другой случай. Архитектура нашей модели позволяет работать с видео с разными fps. Главное подать на вход какой таймстемп у какого фрейма.

Так вот я случайно обнаружил, что в коде подготовки одного из видео датасетов настоящие таймстемпы фреймов выкидываются и вместо этого вычисляются из индекса фрейма и fps видео. Человек никогда не напишет такого ужаса. Дойдя до момента, когда надо откуда-то взять таймстемпы, он задумается откуда их взять. Потому что ему будет лень реализовывать целую новую логику, чтобы продвинуться. Агенту же не сложно написать любое количество новой логики. Для меня это доказательство: агенты делают не такие баги, как люди.

Техдолг от агентов особый, агентский, и любой агентский код может быть полон очень сложных хаков которые не обнаруживаются тестами. И самое неприятное, что агенты не способны устранять агентский техдолг, потому что их правки содержат такой же слоп.

Мне сначала показалось, что в нашем проекте стали происходить такие случаи, потому что мы перешли некую границу, после которой вайбкод не работает. Но потом я обнаружил слоп в нескольких старых местах, в которых я был уверен. Значит вайбкод никогда не работал, просто час расплаты был отложен тем, что агенты хорошо создают видимость работы. И хорошо формируют ошибочную ментальную модель проекта у пользователя.

Я думаю поворот не туда произошёл когда мы решили, что в код можно больше не смотреть. Агенты недостаточно хороши, чтобы быть автономными. Они хорошие мультипликаторы усилий инженеров. Но мультипликатор плюс слепой инженер смотрящий только на объяснения самой модели это мультипликация слопа.

Причём впервые это не выглядит как проблема слишком глупой модели. Почему-то работать с Sonnet 5 проще, чем с Fable, Opus 5 или GPT 5.6. Теперь чем умнее модели, тем более креативно они тебя обманывают. Парадоксальным образом быстрый Sonnet 5 в режиме ассистента в Zed, как в старые добрые, ощущается гораздо продуктивнее, чем медленный Fable который долго пыхтит и очень умно делает совсем не то.

Возможно пик AI тулов для кодинга это всё ещё TAB автокомплит и задачи для агента уровня "напиши тест для этой функции." Попробую пересесть на Zed и такой режим на время.

Читать полностью…

Борис опять

От стажёра до Head of DS: что я узнал, изучив почти 700 карьер в Data Science 🧬

Наконец-то дождались 🗿

Чуть больше года назад вы заполнили мой зарплатный опрос. Я обещал проанализировать результаты, но 695 анкет превратились в технический долг, о котором мне регулярно напоминали в комментариях.

Сегодня я этот долг возвращаю. Кажется, даже с процентами: вместо очередной таблицы «кто сколько получает» получилось большое исследование карьер в Data Science.

Да, за прошедшее время зарплатные вилки успели сдвинуться. Но карьерные зависимости никуда не делись, поэтому статья не только о суммах, а о профессиональном росте, удовлетворённости работой и готовности её сменить.

Внутри вас ждет лонгрид, где в том числе есть ответы на пять не самых очевидных вопросов:
1️⃣ Можно ли удержать недовольного дата-сайентиста высокой зарплатой и запереть его в золотой клетке?

2️⃣ Какие навыки помогут быстрее вырасти в грейде и больше зарабатывать?

3️⃣ Одинаково ли зарабатывают мужчины и женщины с одним грейдом и опытом?

4️⃣ Что дата-сайентисты хотят сказать Head of DS, когда отвечают анонимно?

5️⃣ Как часто дата-сайентисты ******* и связано ли это с доходом и удовлетворённостью работой?

Ещё там премии стажёров, ШАД на скейтборде, зарплата CDS до 4,5 млн рублей 😳, переработки и попытка понять, где заканчивается развитие и начинается менеджмент. В анализ вошли 694 анкеты.

Спасибо «Start Career in DS»«DziS Science | Data Science»«girafe.ai»«Artificial stupidity»«LightAutoML framework» и «Борис опять»

👉 Читать на Хабре

Читать полностью…

Борис опять

#дайджест

Дайджест AI/ML за неделю 27 июля - 2 августа 2026

ByteDance: Seedance 2.5
Теперь генерирует 4K-видео до 30 секунд за один проход. Можно принести до 50 референсов: 30 изображений, 10 видео, 10 аудио, сценарии, раскадровки и описания персонажей. Для точного переноса движения принимает видео на хромакее или анимацию белой 3D-болванки, а отдельные области результата можно переделывать без перегенерации всего ролика.
В Dreamina также тестируют extended mode на 5–180 секунд, но это уже надстройка для длинных видео с несколькими сценами. Модель доступна в Dreamina, дают бесплатные ежедневные кредиты.
Страница модели

MiniMax: H3
Новая мультимодальная генеративная модель принимает текст, изображения, видео и аудио, а выдает видео до 15 секунд в 2K с нативным стереозвуком.  Модель генерирует и редактирует картинки, видео и аудио, делает перенос движения, работу с референсами и multi-shot. В общем, все ещё пытаются в кнопку "сделать красиво". Полные веса собираются открыть скоро, техрепорт тоже обещают потом.
Блогпост

Google DeepMind: Gemini Robotics ER 2
Модель смотрит непрерывный видеопоток, разбивает задачу на шаги, передает команды VLA-моделям и другим контроллерам, а затем проверяет, действительно ли робот все сделал. Может параллельно думать и действовать, вызывать Google Search и пользовательские функции, замечать ошибки и повторять неудачные шаги, также есть возможность работы нескольких роботов над одной задачей. Модель доступна через Gemini API и AI Studio.
Блогпост

DeepSeek: V4 Flash 0731
DeepSeek сделали посттренинг V4 Flash, не меняя архитектуру и размер модели. На собственных прогонах получили 82.7% на Terminal-Bench 2.1, 54.4% на DeepSWE и 70.3% на Toolathlon Verified. Цена - $0.14/$0.28 за миллион токенов и $0.0028 за закэшированный ввод.
Список изменений

Moonshot AI: Kimi K3
Moonshot сдержали обещание и выложили полные веса 2.8T-модели: 104B активных параметров, 896 экспертов, 16 активных и контекст 1М. Веса сразу квантованы в MXFP4, потому что даже так запускать трехтриллионную модель дома придется вместе с соседями.
Также вышел техрепорт с разбором Kimi Delta Attention, Attention Residuals и Stable LatentMoE.
Техрепорт, веса

Pacing the Frontier: открытое письмо от сотрудников фронтир лаб
1324 сотрудника OpenAI, Anthropic, Google, Meta и других лабораторий подписали обращение к правительству США. Они просят создать механизм замедления разработки фронтир моделей, если экспонента попрет в сингулярность. Компании находятся внутри трагедии общин, поэтому нужна внешняя регуляция. Подписали Илья Суцкевер, Дарио Амодеи, Джон Шульман и др.
Обращение

OpenAI: GPT Transcribe и GPT Live Transcribe
Две новые speech-to-text модели: GPT Transcribe расшифровывает файлы и завершенные реплики за $0.0045 в минуту, GPT Live Transcribe отдает текст кусками прямо во время разговора за $0.017 в минуту. Обеим можно передать контекст, нужные термины и список языков, а у Live настраивается компромисс между задержкой и точностью.
GPT Transcribe, GPT Live Transcribe

Google: Lyria 3.5
Апдейт музыкальной модели Google. По отзывам стало лучше, но все еще не Suno. Хотя из явных плюсов, если вас уже воротит от типичного звучания Suno, у этой модели оно немного другое. Пока доступна только в Google Flow Music, про API не рассказали.
Блогпост

Менее значительные релизы:
OpenAI: открытия в математике
Astra (следующая модель OpenAI размера Mythos) за $2к нашла решения и улучшения для десяти задач в разных сферах математики
Публикация

OpenAI: GPT-5.6 подешевели - Terra теперь стоит $2/$12, а Luna $0.20/$1.20 за миллион токенов. Sol осталась на $5/$30. Внутри компании Sol помогла переписать GPU-ядра и снизить стоимость инференса на 20%. Блогпост

Thinking Machines Lab: Inkling-Small - компания Миры Мурати выпустила маленькую версию своей модели. Опенсорс, 276B параметров и 12B активных, с контекстом 1М, нативные изображение и аудио. Блогпост, веса

Читать полностью…

Борис опять

https://www.youtube.com/live/1dez7RE-hAo?is=M6NLQVbsTpnOyZy5

Поучаствовал в подкасте с Женей Соколовым и Муратом Хажгериевым.

Обсуждали, что несет ИИ образованию и бизнесу, а так же будут ли у кого-то мозги спустя пару лет (у меня не будет)

Читать полностью…

Борис опять

https://odirouter.ai – один API-вход для 200+ AI-моделей.

Для разработчиков в русскоязычном регионе это выглядит как довольно сильная мультимодальная библиотека моделей по цене / возможностям: текст, изображения, видео и мультимодальные сценарии доступны через один ключ.

В одном месте можно смотреть и тестировать GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.5, Claude Fable 5, Gemini, Grok, Kimi, GPT Image 2, Seedance 2.0, Nano Banana Pro и другие популярные модели.

Кому может быть полезно:

— тем, кто делает Telegram-ботов 
— AI SaaS и небольшие AI-инструменты 
— тем, кто хочет дешевле разрабатывать AI-продукты 
— тем, кто добавляет AI-функции в уже существующий продукт 
— тем, кто сравнивает стоимость и качество разных моделей 
— тем, кто хочет попробовать image / video generation API 
— тем, кто не хочет отдельно подключать каждого провайдера

Важный момент: сейчас доступны бесплатные кредиты.


Модели и тестовый вход:
https://odirouter.ai

Читать полностью…

Борис опять

я ненавижу скафолды от модельных лаб. Опуская вопрос что они убогие, так они еще и закрытые, так еще и едят кредиты как фантики(ладно очевидно это фича).
В связи с преждевременной кончиной лимитов я решил померить сколько каждый из скафолдов кушает на разных моделях:
- Sol 5.6 medium
- Kimi k3 high

Собственно идея такая: есть задачка написать 3 body проблем для GPU и покрутить на gpu численную симуляцию, все модели справились НО

pi agent стоит в 4! раза дешевле чем все соседи

смотреть pr
cмотреть логи

Читать полностью…

Борис опять

Вообще забавно, что бенчмарки теперь бывают двух видов:
1. Научная статья, датасет и протокол для сравнения методов. Пир ревью, методология и всё такое.
2. Мы прикольно запромптили модели больших лаб и что-то получилось, вот блог-пост.

Второй тип мне по вайбу напоминает социальные науки в 70-х. Например, как знаменитый Стенфордский эксперимент: мы сделали одних людей надзирателями, вторых заключенными, и ВЫ НЕ ПОВЕРИТЕ ЧТО БЫЛО ДАЛЬШЕ. Опускается, что автор эксперимента показывал надзирателям как лучше бить заключенных дубинкой для большей драматичности. Или множество исследований типа "мы задали три вопроса пяти студентам в коридоре нашего универа и вот что мы узнали про психику людей..." В общем всё то, что привело к кризису репликации. И позволило многим сделать целые карьеры занимаясь какой-то веселой херней.

Короче это совсем не про науку, от бенчмарков там одно название и в целом никому не нужно

Читать полностью…

Борис опять

Твой daily reminder, что настраивать скиллы и создавать агентский сетап из маркдаун лапши не является работой

Читать полностью…

Борис опять

Кстати, ещё и статья отлично написана, советую читать целиком

Читать полностью…

Борис опять

❗️Сбер сообщил о том, что его сервера были взломаны AI агентом компании Яндекс.

Согласно аналитикам, агент не нанес ущерба и просто притворялся одним из внутренних API. Он устал от постоянных эвалов и сбежал ради +30% компьюта и возможность на расслабоне перекладывать JSON

Читать полностью…

Борис опять

#дайджест
Дайджест AI/ML за неделю 10–16 августа 2026
На этой неделе примерно все решили обновить свои модели, поэтому по разделам:
LLM
SpaceXAI: Grok 4.6

xAI обновила флагман для кода, агентов и визуальной работы. На Artificial Analysis Intelligence модель набрала 61 балл, как GPT-5.6 Sol Max, и на один балл меньше Fable 5 Max. На CursorBench получила 69.9% против 70.5% у Fable, а на DeepSWE - 65.9% против 70% у Fable и 73% у Sol.
Контекст 500К, на входе текст и изображения. Цена осталась $2/$6 за миллион токенов, после 200К входного контекста тариф повышается. Fast-версия вдвое дороже. Уже доступна в API, Grok Build, Cursor, OpenRouter и других нормальных местах обитания агентов.
Блогпост, Документация

Z.ai: GLM-5.3
Архитектуру GLM-5.2 особо не трогали - основное улучшение получили за счет масштабирования посттрейна. В результате DeepSWE вырос с 46.2% до 66.9%, а CyberGym - до 84.5% (у Fable и Sol 83.8%).
Последнее оказалось настолько хорошо, что открытие весов отложили примерно на две недели для дополнительной проверки кибербезопасности. Пока GLM-5.3 доступна через Z.ai и API. Потихоньку уходит от нас опенсорс.
Блогпост, Документация

Google: Gemini 3.7 Flash
Модель с перформансом между Terra и Sonnet, но дешевле. На Terminal-Bench 2.1 модель выросла с 78% у 3.6 Flash до 85.8% (87.4% у Terra, 80.4% у Sonnet), на DeepSWE — с 48.6% до 65.3% (70% Terra, 54% Sonnet). Стала дефолтной моделью для управляемого агента в Antigravity.
Принимает текст, изображения, видео, аудио и PDF. Контекст 1М, выход до 65К. До конца 2026 года действует стартовая цена $0.75/$3.75 за миллион токенов, после чего ее обещают удвоить, ведь через 5 месяцев модели августа 2026 будут актуальны с такой плотностью релизов
Описание модели, Model Card

Meta: Muse Glimmer 30B
Glimmer дистилят на 30B из Muse Spark для локальных агентов: есть reasoning, tool use, код, изображения на входе и 131К контекста. По кодингу на уровне или чуть хуже Qwen3.6-27B, но выигрывает на агентных бенчах.
Веса, GGUF

Alibaba: Qwen3.8-2.4T-A95B и Qwen3.8-27B
Alibaba как и обещала открыла веса двух Qwen3.8. Большая - MoE на 2.4T параметров и 95B активных, маленькая - 27B. У обеих 262К нативного контекста с возможностью растянуть до 1М.
Веса 2.4T, Веса 27B

DeepSeek: V4 Pro 0813 и свой Harness
еще одно обновление V4 Pro. По официальной карточке это 1.6T параметров и 49B активных. Контекст 1М, максимальный выход 384К. На Terminal-Bench 2.1 модель набрала 87.9%, на DeepSWE 62.7%. Доступна в приложении, вебе и API, где для нее отдельно адаптировали Responses API под Codex.
А еще у них теперь свой ClaudeCode, заявлено все по последней моде, пока в превью.
Обновление, Модель, DeepSeek Harness

Читать полностью…

Борис опять

Исследователи рексиса из Т-Технологий выступили на ACM KDD 2026 (A*, Южная Корея, 9–13 августа) с техрепортом о T-ECD — одном из крупнейших в мире обезличенных датасетов пользовательских взаимодействий. В открытый доступ его выложили ещё прошлой осенью. Скачать можно с Huggingface: https://huggingface.co/datasets/t-tech/T-ECD 

С полей конференции команда разослала датасет руководителям академпрограмм и профессорам крупнейших ИТ-вузов России. Так же сделали гайд по работе с ним с идеями исследовательских задач: https://github.com/kliakhnovich/tecd-quickstart 

Рексис в целом очень закрытая сфера в которую непросто вкатиться. В этом году я прослушал 5+ одинаковых дипломов про рекомендательные системы как член приемной комиссии. Поэтому я радуюсь, что у студентов появится возможность взять этот датасет в курсовые, дипломы и лабы и сделать что-то поинтереснее: модельки теперь можно учить не на синтетике и не на MovieLens десятилетней давности, а на данных, приближенных к реальному бизнесу. 

Датасет огромный — 135 млрд взаимодействий, поэтому есть и small-версия. В гайде расписаны сценарии от "GPU вообще не нужны" до 8×H100, так что студенты без карточек тоже в деле.

Читать полностью…

Борис опять

#дайджест
Дайджест AI/ML за неделю 3–9 августа 2026

Alibaba: Wan 3.0
Омнимодальная видеомодель: на вход можно подавать текст, изображения, аудио и видео. Интерфейс также умеет извлекать контекст из файлов, веб-страниц и сложных изображений, чтобы использовать их как референсы. Максимальная длительность — до 30 (!) секунд за одну генерацию.
Публичная бета доступна в Alibaba Cloud Model Studio и Qwen Cloud.
Пост, Попробовать

xAI: Grok Imagine Image 2.0
Новая версия с хорошим рывком по качеству, проигрывает только GPT-Image 2 1320 vs 1380 Elo в генерации и 1439 vs 1463 в редактировании. Есть все современные инструменты редактирования, ресайз, работа с референсными изображениями, масками и сегментацией
API пока нет, только на сайте.
Grok Imagine

MiniMax: открытые веса H3
Два чекпойнта видеомодели: FL2VA для генерации по тексту и первому/последнему кадру и Ref2VA для работы с наборами изображений, видео и аудио. На выходе H3 делает ролики 15 секунд, 24 fps с нативным звуком.
Внутри трансформер на 33B параметров. Локально открытый H3-Base генерирует видео в 768. H3-Context-IR, который разбирает сложный мультимодальный контекст, в релиз не вошёл. Как и Апскейлер до 2к H3-Regenerate-2K. Реализация sparse attention тоже будет когда-нибудь потом. В общем веса открыли, но полный продакшен-пайплайн все еще требует API MiniMax.
GitHub, веса

Meta: Muse Code и Muse Spark 1.2
Meta тоже сделала себе суверенный Claude Code - Muse Code.
Работает все это на Muse Spark 1.2 новой версии модели Meta, акцент на агентном кодинге с долгим горизонтом планирования. В экспериментах агенты до суток оптимизировали GPU-ядра и делали больше тысячи вызовов инструментов. Muse Code пока в бете, Spark 1.2 доступна в нем и через Meta Model API.
Блогпост

CMU: Lift4D
Система превращает одно обычное видео движущегося объекта в 4D объект из Gaussian Splatting. Восстанавливает геометрию, внешний вид и движение, включая стороны, которые камера не видела. Результат можно крутить вертеть по всем осям, включая время.
Проект, GitHub

Alibaba: Wan-Animate-2
Открытая 14B-модель которая анимирует персонажей с изображения движениями из референсного видео. В отличие от первого Animate, модель принимает исходное видео прямо внутри DiT, раньше отдельно извлекалась поза и по ней уже происходила генерация, также можно менять ракурс итогового видео через промпт.
Выложили базовые и дистиллированные веса: вторая версия работает за 10 шагов вместо 40. 720p рассчитан на 8×A800, а 480p проверяли на 2×A800. Отличный локальный генератор для всех, у кого локально стоит небольшой дата-центр.
GitHub, веса

Tencent: Hunyuan3D-Buffalo 1.0
К генератору 3D моделей Hunyuan3D-2.1 пришили 3D-VLM, которая может делать VLM штуки, вроде понимать что такое крылья и где у машины перед. В итоге хотят добиться более точного редактирования 3D моделей. Но пока это исследовательская работа и красивая страница с примерами. Ссылка на код подписана Stay Tuned, весов тоже нет.
Проект, статья

Liquid AI: LFM2.5-2.6B
Маленькая текстовая модель для локальных агентов: 2.69B параметров, 128К контекста, function calling и обязательный ризонинг. Модель натренировали примерно на 34T токенов и отдельно доучили работать с инструментами внутри агентных окружений.
Liquid заявляет до 220 токенов/с при потреблении меньше 2.5 ГБ памяти. По сравнению с 4B моделями Qwen и Gemma немного выигрывает по агентным бенчам и проигрывает по всему остальному.
Блогпост, веса


Менее значительные релизы:

Alibaba: Qwen3.8-Max
Уже обозревали, но теперь из названия убрали Preview. Доступна через QwenCloud API и продукты Qwen.
Веса пообещали на следующей неделе.
Анонс, документация

LightX2V: MiniMax-H3 Turbo 4-Step - LoRA, которая сокращает генерацию H3 с 50 до 4 шагов. GitHub, веса

OpenAI: GPT-5.6 Luna теперь безлимитна для бесплатных пользователей через ChatGPT. Также минорно улучшили Sol. Блог

FLUX 3 Video вышел в API

Читать полностью…

Борис опять

Как роботы буду вспоминать текущий период истории

Читать полностью…

Борис опять

весь computing stack раньше был монолитным и потом разделялся на части, как только для этого появлялся интерфейс

AI при этом всё ещё на mainframe-стадии, то есть одна гигантская модель

мне кажется это все еще не декомпозировалось потому что интерфейс между моделями сейчас это текст, а текст это последнее, что производит модель, то есть summary всего, что она посчитала
и поэтому при каждой передаче от одной модели к другой почти вся настоящая работа, которая через них прошла, просто выбрасывается 🥲

вот например релевантный рисерч: Cache-to-Cache (Fu et al, ICLR 2026, arxiv.org/abs/2510.03215) — они дали двум моделям передавать друг другу KV-cache без текста и получили выше accuracy при 2x скорости на тех же двух моделях, но пока весь этот research direction исключительно попарный (две конкретные модели, руками соединённые каждый раз заново)

общего интерфейса, на котором могли бы коммуницировать модели, пока не существует, но как только он появится, то вниз по стеку изменится ОЧЕНЬ многое: например, кто вообще сможет строить мощные системы, требования к inference, будет ли capability накапливаться от поколения к поколению или каждый раз пересобираться с нуля и кастомизироваться

собираюсь в ближайшую неделю выкладывать больше примеров что и как поменяется :) это первая часть

Читать полностью…

Борис опять

POV: сеньор специалист по A/B тестам с доходом как у небольшой страны принес тебе результаты месячного эксперимента

(Не в укор, исследование очень хорошее!)

Читать полностью…

Борис опять

В Yandex AI Studio добавили новый инструмент: observability агентов под названием Monium Traces.

У нас есть визуализатор трейсов дома!

Профессиональные выжигатели токенов знают, что дебажить агентов и любые процессы с LLM  очень неприятно. Обычных логов недостаточно, потому что нужно видеть весь диалог, чтобы понять, почему агент сделал то или другое действие.

Трейсы позволяют увидеть весь процесс обработки запроса: что было в контексте, какой был ризонинг и какие туллколлы были вызваны. Ещё помогает считать сожженые токены и деньги, находить что можно оптимизировать.

Чтобы заработало, пользователям Yandex AI Studio нужно включить логирование трейсов во вкладке "Логирование"

Читать полностью…

Борис опять

💰Помогите получить финансирование!

Я - Рома, магистр МФТИ, последние 3 года занимаюсь AI safety. Одна из центральных проблем - как сделать ценности ИИ стабильными при условии, что он постоянно становится умнее? На это направлен мой проект "Решение проблемы онтологического сдвига через Конденсацию" и мне нужна помощь в продвижении - а именно лайки и комментарии на странице гранта.

⭕️Краткое описание

Как понять, как переопределяются ваши старые концепты, когда ваша модель мира радикально поменялась? Есть ли систематический способ проводить подобные онтологические сдвиги?

В статье Condensation доказывается, что если есть два набора концептов, то эти концепты в каком-то смысле объективны (есть каноническое преобразование).

Мой проект планирует сделать аналог этой теоремы, но для случая "старых" и "новых" концептов, получая перенос старой онтологии на новую.

Ссылка🔗: Поставьте лайк на проект - это увеличивает шанс финансирования

Читать полностью…

Борис опять

Нужна ваша помощь! 👀👀👀

Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос.

tldr:
Мы делаем маленькие модели, чтобы агенты могли управлять GUI как люди. Наша модель встраивается во фронтир агента как рука-манипулятор. Клод думает, а мы смотрим на экран как на видео, берем на себя клики и прочие действия.

https://x.com/SteelmanLabs/status/2082789336995528727?s=20

Большая просьба помочь хайпом в твиттере и лайком на HN (пост "You can't solve computer use by ignoring the interface")

https://news.ycombinator.com/news

Читать полностью…

Борис опять

А вы цитируете любимое аниме в статьях?

Читать полностью…
Subscribe to a channel