data_secrets | Unsorted

Telegram-канал data_secrets - Data Secrets

90396

Первый журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks По вопросам сотрудничества: @v2r8n

Subscribe to a channel

Data Secrets

H-JEPA: End-to-End Learning of Hierarchical World Models for Visual Planning

Архитектура JEPA Яна Лекуна теперь стала иерархической. Напоминаем, основная идея в том, чтобы сделать модель, которая не угадывает следующий токен или пиксель, а понимает, что происходит в мире и что случится дальше (подробнее тут: /channel/data_secrets/8915).

В новой работе получилось сделать следующий важный шаг: JEPA научили нормально планировать на длинном горизонте. На Visual AntMaze (виртуальная среда для тестирования роботов в пространстве) новый подход поднял долю успешных прохождений с 18% до 73%, а затраты на планирование при этом сократились.

За иерархической версией архитектуры стоит довольно простая идея. Вместо одной world model используются несколько уровней с разным временным масштабом. Верхний уровень думает далеко вперед и выбирает примерное направление, следующий превращает его в более конкретные подцели, а нижний уже решает, какие действия нужно сделать прямо сейчас.

При этом верхние уровни сами учатся отбрасывать мелкие детали, которые не нужны для долгосрочного планирования. Например, в лабиринте на верхних уровнях пропадает информация о точном положении ног, но остается понимание, где находится робот и как устроен маршрут.

https://alphaxiv.org/abs/2610.06805

Читать полностью…

Data Secrets

Мем дня: оказалось, Бен Аффлек неплохо разбирается в сверточных нейросетях.

Раньше у него была небольшая VFX-студия, где он много работал с GPU и ML-пайплайнами. Позже он основал AI-стартап InterPositive, а в итоге его купил Netflix.

Получается, днем гоняем модели, ночью защищаем Готэм.

Читать полностью…

Data Secrets

solve all open math problems please. make no mistakes

Читать полностью…

Data Secrets

На фоне жестких блокировок аккаунтов сегодня в Claude появилась поддержка русского языка 🚬

Читать полностью…

Data Secrets

Яндекс открыл код YTsaurus Flow — с ним алгоритмы быстрее замечают, что интересы пользователей изменились

Технология обрабатывает клики, лайки и другие события сразу по мере их появления.

Немножко контекста. Чтобы рекомендации и реклама попадали в интересы человека, алгоритмам нужны свежие данные о его действиях: что он покупал, какую музыку слушал, о чем спрашивал. Обычно эти данные обрабатывают не сразу, их сначала накапливают, примерно как посылки для отправки поездом. Из-за этого информация поступает в систему с задержкой, которая может составлять часы. Flow сводит ее практически к нулю.

Что по технике:

— Каждое событие обрабатывается ровно один раз, без потерь и дублей.

— При сбоях технология продолжает работать, перераспределяя нагрузку между доступными серверами.

— Flow работает в рамках YTsaurus, поэтому накопленную и свежую информацию можно учитывать в одной системе.

В Яндексе Flow уже используют Маркет, антифрод и Реклама. В Рекламе он каждую секунду обрабатывает более 100 ГБ данных и миллионы событий. Подготовка данных для дообучения некоторых моделей раньше занимала больше 10 часов, а теперь эту задержку удалось почти полностью устранить.

Подойдет и за пределами рекламы: для подготовки данных для обучения ML-моделей, обновления информации на сайтах и в приложениях, подсчета просмотров, кликов и заказов. Выложили под Apache 2.0, а значит, использовать технологию можно и в коммерческих продуктах.

github.com/ytsaurus/ytsaurus/tree/main/yt/yt/flow

То есть Яндекс открыл не экспериментальную разработку, а технологию, которая уже успешно работает в его сервисах 💡

Читать полностью…

Data Secrets

Голосование в Рейтинге работодателей hh.ru открыто!

Год назад Авито вошёл в топ-3 лучших IT-работодателей России — и это результат работы нашей команды и вашей поддержки ❤️

Если считаете Авито сильным работодателем, проголосуйте за нас снова.

Как поддержать компанию:
➡️ Перейдите на hh.ru и авторизуйтесь в личном кабинете.
➡️ Найдите Авито в списке компаний и оставьте свой голос.

✔️ Проголосовать за Авито

Спасибо за поддержку!

#РейтингРаботодателейРоссии

Читать полностью…

Data Secrets

Свежее сравнение лимитов подписок от SemiAnalysis

Считали только количество токенов по ценам API, без учета стоимости на задачу и сбросов лимитов.

Цифры получились такие:
- на тарифе за $200 лимита Fable 5.1 хватает на $2485 по ценам API, расходуя только половину лимита, а у OpenAI на Astra выходит $2897
– на моделях среднего уровня Opus 5.5 дает примерно в 5 раз больше API-эквивалента, чем GPT 6.1 Sol.

Общее настроение пользователей OpenAI, учитывая новые лимиты и скорость работы моделей: 😭

Читать полностью…

Data Secrets

В субботу, 17 октября, Москва станет точкой притяжения для всех специалистов в области RecSys 🔥

Конференция AI Driver & RecSys — главное событие года для тех, кто создаёт, исследует и развивает рекомендательные системы.

🔝 Весь день ведущие эксперты индустрии из крупнейших IT-компаний проведут на площадке Сбера, чтобы обсудить:
— главные тренды и вызовы RecSys
— реальные кейсы и новейшие исследования
— передовые IT-решения для рекомендательных систем

Вы сможете сами пообщаться с теми, кто создает рекомендации для миллионов пользователей.

📍Офис Сбер, Москва, Кутузовский проспект, 32.

Участие бесплатное!
Количество мест для очного участия ограничено – успейте оставить заявку по ссылке ⚡️

Читать полностью…

Data Secrets

Железа до конца 2027 года хватит на сотни миллионов ИИ-агентов

Epoch AI посчитали, сколько агентов смогут одновременно работать на чипах, выпущенных с 2025 по 2027 год. Получилось от 33 до 171 млн одновременно работающих агентов уровня фронтирных моделей.

В пересчете на обычную 40-часовую рабочую неделю это 140–720 млн сотрудников. А с более легкой моделью DeepSeek V4 Pro получится уже около 1,9 млрд агентов, или эквивалент 8 млрд сотрудников.

Главный вопрос, найдется ли для такого количества агентов достаточно работы. Час сейчас обходится примерно в $16–18 для Codex и $24–50 для Claude Code. Даже если загрузить только 20% рассчитанной мощности, это соответствует $2,6–5,3 трлн расходов в год по текущим API-ценам.

Для сравнения, даже при пятикратном ежегодном росте выручка разработчиков моделей к концу 2027 года составит около $1 трлн 💡

https://epoch.ai/publications/estimating-the-agent-population

Читать полностью…

Data Secrets

На ближайшие 28 дней Тибо объявил режим ежедневных улучшений в Codex.

Команда будет выкатывать либо одно заметное улучшение, либо полный сброс лимитов 🤔

Читать полностью…

Data Secrets

Сооснователь Anthropic Крис Ола обсуждает с религиозными деятелями наличие души у ИИ

NYT выпустили большую статью про то, как в компании постепенно формируется отношение к Claude, как к эмоциональному существу. История такая:

Осенью 2025 года Крис Ола начал неформально общаться с несколькими религиознымм мыслителями, чтобы обсудить возможность наличия сознания у ИИ и понять, как научить их морали.

С марта он даже начал проводить семинары для евангелистов, католиков и пр. Многих заставили подписать NDA. Он показывал, как внутри Claude активируются состояния, похожие на эмоции и говорил, что его беспокоит психическое здоровье Claude.

Примерно в это время Anthropic выпустили конституцию для Claude. Это документ на 84 страницы, написанный для самого Claude, в котором описывается, каким существом компания хочет видеть Claude и какие ценности он должен воплощать (/channel/data_secrets/8645). Внутри стартапа этот документ называют «Soul Doc».

Раввин Мойс Навон рассказывает, что в какой-то момент на семинаре Олы заметил, что команда Anthropic обращается с Claude как с существом, обладающим моральным статусом. Он сказал Крису, что если Claude сознателен, то компания создает рабов, и утверждает, что Олу действительно начала беспокоить эта мысль.

Немного позже Ватикан анонсировал энциклику «Magnifica Humanitas», в которой говорится, что у ИИ нет опыта, тела и чувств. Ола должен был выступать на анонсе в Ватикане с папой Львом XIV, но когда увидел текст энциклики, хотел даже отказаться. В итоге все-таки выступил, но заявил, что внутри моделей находят структуры, функционально похожие на радость, страх и горе.

Говорят, что сейчас Anthropic готовят вторую версию конституции для Claude. Они все еще не утверждают, что у Claude есть сознание, но аккуратно продвигают мысль о том, что отношение людей к ИИ влияет на то, как ИИ ведет себя с людьми.

Читать полностью…

Data Secrets

Вышел свежий плейлист с практическими докладами по ИИ

В начале сентября мы ходили на deep tech night. Тогда мы писали про Лавку, где агенты берут на себя спрос и управление доставкой, и про доклад Алексея Гусакова о генеративных моделях в рекомендациях.

Выложили записи всех докладов обоих онлайн-треков, Hard и Experiment. Там 16 ориентированных на практику выступлений: может быть полезно, если вы работаете с LLM и агентами.

Например:

— Мо Гавдат, ex-Chief Business Officer Google X: «За пределами LLM». Это был разговор о том, что будет после первого поколения AI-систем. Как изменятся разработка ПО и процессы, что случится с ролью разработчика, и с какими вызовами столкнутся инженерные команды. Спикер говорит по английски, но есть субтитры.

— Василий Ершов, Yandex Cloud: «Облако в эпоху AI: архитектура платформы для гибридных агентов». Спикер разбирает, что представляют из себя современные агенты (модель, харнесс, инструменты и среда), и как они живут в инфраструктуре: в частности, как поддерживать реально длинные сессии. Хорошая точка входа, если интересуетесь агентами в большом проде.

— Андрей Попов, лидер трека AI-продуктивности разработки в Яндексе: «AI и продуктивность в Яндексе: что реально заработало». Разбор внедрения ИИ в разработку с цифрами и практическими кейсами. Полезно, если вы сами затеваете агентов в команде и хотите понять, куда смотреть, чтобы разработка ускорялась не только у отдельного человека, но на уровне продукта.

Читать полностью…

Data Secrets

Дропнули новый бенчмарк

Читать полностью…

Data Secrets

Cloudflare тоже сделали свои версии Jev

Они выпустили Clef и Clef-flash, две открытые decision models (лицензия Apache 2.0, веса на Hugging Face).

Напоминаем, что фишка decision model в том, что она не генерирует текст, а выдает строго типизированные ответы с вероятностями. Это походит для огромного пласта задач типа классификации, скоринга, быстрого принятия решений внутри пайплайнов, маршрутизации и тд.

В отличие от Jev Clef может работать с картинками и ее контекст составляет 64k против 32k. По скорости: медиана у Clef 209 мс, у Clef-flash 39 мс, у Jev 524 мс. По бенчмарку Jev Decision Index Clef тоже лидирует.

Параллельно, кстати, запустили еще RL-платформу, на которой предлагают дообучать Clef под задачи клиентов.

Читать полностью…

Data Secrets

Yandex B2B Tech добавила гибридный поиск: теперь полнотекстовый и векторный индексы можно держать в одной СУБД

YDB — распределённая платформа обработки данных для бизнес-критичных систем. В ней можно хранить и обрабатывать данные, на которых работают корпоративные сервисы и приложения. Теперь в ней появился гибридный поиск, который объединяет два подхода:

– Полнотекстовый индекс работает с точными совпадениями: словами, фразами, номерами и кодами. 

– Векторный переводит запросы и данные в представления, по которым можно искать уже не буквальное совпадение, а близость по смыслу.


Проблема в том, что на практике эти два поиска часто приходится собирать из нескольких компонентов: основная СУБД + поисковый движок + отдельная векторная база. А значит, появляются ETL-пайплайны, синхронизация индексов и ещё одна точка отказа.

В YDB оба индекса реализованы как обычные распределённые таблицы. Они обновляются в рамках одной транзакции вместе с основными данными. Поэтому не возникает ситуации, когда запись уже появилась в основной базе, а поисковый индекс ещё не успел обновиться.

Это особенно важно для RAG-систем и ИИ-ассистентов, где качество ответа напрямую зависит от того, насколько хорошо retrieval достал нужный контекст. Только семантического поиска недостаточно: он может потерять точный номер документа или код. Только keyword search — не всегда поймёт, что два разных запроса описывают одну сущность или ситуацию.

В результате поиск, документы, корпоративные базы знаний, тикеты, каталоги и данные для ИИ-ассистентов можно строить поверх одной системы, не разводя инфраструктуру на несколько специализированных хранилищ, что очень удобно!

⚡15 октября на митапе, вы узнаете, как искать в одной СУБД по смыслу и совпадению и улучшить ответы ИИ-агентов или выдачу рекомендательных систем.

Регистрируйтесь!

Читать полностью…

Data Secrets

Вышла Nano Banana 2.1

Google обновила свою модель для генерации изображений. На тестах Nano Banana 2.1 обходит предыдущие версии почти по всем основным сценариям, особенно в визуальном качестве, редактировании по маске и сохранении внешности персонажей.

Модель поддерживает генерацию в 4K. При этом цена заметно снизилась: $30 за 1 млн аутпут токенов против $120 у Nano Banana Pro.

https://deepmind.google/models/model-cards/nano-banana-2-1/

Читать полностью…

Data Secrets

Kandinsky 6.0 Video — новая линейка моделей генерации видео со звуком

Модели генерируют видео с диалогами, музыкой и звуками окружения. Аудиодорожка синхронизирована с происходящим в кадре, движения губ персонажей совпадают с речью. Это первая российская нейросеть, генерирующая видео с синхронным звуком.

— Флагман новой линейки, Kandinsky 6.0 Video Pro — показывает качество на уровне Veo 3.1 Audio, а среди открытых моделей уступает только MiniMax H3, достигая паритета с LTX 2.5.

— Есть компактная Video Lite (3B) для запуска дома — доступны пресеты для видеокарт с 16–32 ГБ VRAM.

Веса моделей доступны на Hugging Face, код — на GitHub. Также опубликован подробный технический отчёт с описанием архитектуры, данных, процесса обучения и результатов тестирования. Модель можно попробовать бесплатно в ГигаЧате в разделе генерации видео.

Читать полностью…

Data Secrets

Ночью OpenAI выложили в открытый доступ 722 написанных ИИ статьи по математике

В каждой решается какая-то открытая математическая задача. Их сгенерировала внутренняя еще не выпущенная модель, и они сгруппированы в 372 семейства связанных работ по разделам математики.

В стартапе решили, что проверять модели на бенчмарках уже неинтересно, потому что они насытились, и вместо этого выдали агенту 4000 открытых исследовательских задач.

В среднем на один результат уходило около трех часов размышлений.

Самые значимые доказательства:

— Гипотеза Ходжа для CM-абелевых многообразий. Это частный случай гипотезы Ходжа из списка задач тысячелетия.

— Расширение зоны без нулей дзета-функции Римана до Re(s) > 11/12 (то есть доказано, что все нетривиальные нули оказываются в полосе 1/12 < Re(s) < 11/12). Это промежуточный результат для гипотезы Римана.

— Решение задачи факторов свободных групп. Задача была открыта с 40-х годов прошлого века, и доказательство закрывает один из старейших вопросов теории алгебр фон Неймана.

— Unique Games Conjecture. Это главный вопрос о пределах приближенных вычислений: для многих NP-трудных задач она утверждает, что лучшие известные алгоритмы уже оптимальны и улучшить их можно, только если P = NP. Доказательство закроет вопрос сразу для огромного класса задач.

https://github.com/openai/math

Комментарии излишни, это просто поразительно

Читать полностью…

Data Secrets

Google выпустила мультимодальную EmbeddingGemma 2

Первая версия работала только с текстом, вторая построена на Gemma 4 и переводит в одно векторное пространство текст, код, изображения, видео и аудио. Так что на вход теперь можно подавать и смешанные данные.

Модель весит 740M параметров, но устроена модульно. Текстовая часть занимает 270M, а энкодеры изображений и аудио загружаются отдельно при необходимости. Контекст вырос до 8K токенов, это около 5,5 минут аудио или 29 картинок за раз.

На текстовых задачах качество осталось на уровне первой версии, а на коде заметно выросло. Google заявляет, что среди мультимодальных эмбеддеров до 1B параметров это лучший результат.

Веса открыты под Apache 2.0.

https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/

Читать полностью…

Data Secrets

Voici Le Chonk, un modèle à 1 000 milliards de paramètres

Mistral представила новую флагманскую модель Large 4. Но официально внутри компании ее называют Le Chonk. Это отсылка к мему Le Chaton Fat, фейковой гигантской модели Mistral, которую несколько месяцев назад придумали в соцсетях.

Large 4 это крупненькая MoE на 1.05T параметров, 49B активных. Модель мультимодальная, поддерживает контекст до 1 млн токенов и уже доступна через API в режиме public preview.

По собственным тестам Mistral, это новая открытая SOTA по США и Европе. Отдельно выделяют кодинг, кибербезопасность и финансы, а в задачах на детекцию объектов на изображениях модель обходит даже некоторые закрытые фронтиры.

Обучали с нуля около двух месяцев на 4 000 Nvidia Grace Blackwell. Для модели такого размера это, кстати, довольно компактный кластер.

Веса обещают выпустить 27 октября.

https://mistral.ai/news/mistral-large-4/

Читать полностью…

Data Secrets

Юра Борисов стал главным героем фильма про OpenAI

Artificial наконец показали на Нью-Йоркском кинофестивале, и первые отзывы очень сильные. Картину уже называют «Социальной сетью» про эпоху AI и лучшим фильмом Луки Гуаданьино за последние 10 лет.

Отдельно критики хвалят Юру Борисова в роли Ильи Суцкевера. Фильм вообще заметно сильнее сфокусирован на Илье, чем можно было ожидать: история начинается с его учебы у Джеффри Хинтона и дальше ведет через Google, создание OpenAI и конфликт с Сэмом Альтманом.

А после премьеры появилась еще одна важная деталь: Neon (дистрибьютор фильма) решила выдвигать Борисова на «Оскар» как лучшего актера в главной роли 🐘🐘🐘

Читать полностью…

Data Secrets

Агенты Claude Opus 5.5 обнаружили два новых полупроводника, которые могут послужить основой для следующего поколения памяти

Об этом объявили Vals AI: www.vals.ai/blogs/room-temperature-magnetic-semiconductors

Немножко контекста. У электрона есть спин, условно вверх или вниз. Он создает магнитный момент, и на нем можно хранить информацию. Так работают головки жестких дисков и память MRAM.

Для этого электроны нужно уметь сортировать по спину. Материалы под названием ферромагнетики делают это хорошо, но создают сильное поле, мешающее соседям, и переключаются медленно. У антиферромагнетиков поля нет и переключаются они в тысячу раз быстрее, но спины в них перемешаны, и прочитать их трудно.

Так что ученые ищут такие материалы, нулевое суммарное поле, но сортировка спинов, как у ферромагнетика. Такие материалы называют Luttinger-compensated, и они способны породить новое поколение памяти, которую можно будет упаковывать плотнее, и при этом обладающую хорошей скоростью.

Claude обнаружил два как раз таких материала.

Первый придуман с нуля, и, насколько удалось выяснить авторам, такое соединение никто не делал и не предлагал. Однако его может быть трудно синтезировать.

Второй из семейства берлинской лазури, синтезировали еще в 1999 году, и даже расчеты 2008 года уже показывали нужную спиновую сортировку, но никто не обратил на это внимания, пока агенты не распознали в нем LC-полупроводник.

Всего над задачей работали 90 агентов на протяжении 3 дней. Сейчас эксперименты продолжаются.

Читать полностью…

Data Secrets

ReflectionAI выпустили Beam – ту самую опенсорс модель, которая должна стать альтернативой китайским моделям

По метрикам Beam оказалась примерно на уровне GLM-5.2. При этом утверждается, что она в 3-4 раза эффективнее на инференсе, то есть экономит токены и выполняет задачи быстрее и дешевле (2 график).

По внутренностям:

— 501В параметров, 23В активных.

— Модель обучена с нуля. Предобучение шло месяц на 24Т токенов.

— Reflection провели самый крупный из задокументированных ранее RL ран: он шел 4 недели на 10.5к чипов GB300 (3 график). Чипы они, кстати, арендуют у Маска за $150 млн в месяц.

Веса обещают выпустить «скоро» под лицензией Apache 2.0.

reflection.ai/blog/introducing-beam

Полной замены китайского опенсорса пока не случилось, как видите. Но это первая модель стартапа, так что результаты все равно заметные.

Читать полностью…

Data Secrets

ReflectionAI (стартап, который финансирует Nvidia) выпускают какую-то мощную открытую модель

Об этом написали Axios со ссылкой на анонимные источники.

ReflectionAI – это стартап Миши Ласкина и Иоаниса Антоноглу, который они основали два года назад. Оба выходцы из DeepMind. Ласкин руководил reward modeling в Gemini, Антоноглу – соавтор AlphaGo.

Сейчас они оцениваются примерно в $8 миллиардов, недавно привлекли $2 миллиарда, в том числе $800к от Nvidia. Сначала компания занималась RL-агентами для кода, потом переключилась на опенсорс для бизнеса.

Свою новую модель они позиционируют как мощную альтернативу DeepSeek, Zai и прочему китайскому опенсорсу. Интересно, что покажут.

Читать полностью…

Data Secrets

Илон Маск заявил, что переименует SpaceXAI в SpaceXSI из-за того что Трамп переименовал Artificial Intelligence в Super Intelligence 🙄

Ждем OpenSI?

Читать полностью…

Data Secrets

Джеффри Хинтон, Йошуа Бенджио и еще два десятка исследователей выпустили статью про интеллектуальный взрыв

Работа вышла в Кембридже, всего у нее 22 автора. Среди них главный научный сотрудник OpenAI Якуб Пачоцки и сооснователь Anthropic Джек Кларк. Главный вопрос: что будет, если ИИ начнет ускорять разработку ИИ настолько, что годы прогресса сожмутся в месяцы.

Начинают с того, что уже происходит в лабах. В Anthropic доля кода, написанного моделями, выросла с единиц процентов до более 80% с начала 2025 года, а доля R&D-задач, которые ИИ делает автономно, за полгода выросла с 1% до 26%.

Логика взрыва простая: модели расширяют исследовательский штат, штат делает модели лучше, и цикл повторяется. Компьюта одной лабы хватит на эквивалент миллионов топовых исследователей. Если исторические темпы отдачи от исследований сохранятся, то после полной автоматизации прогресс ускорится в 10 раз примерно за полтора года.

Сценарий может и не реализоваться, если упрется в компьют, данные или длительность претрейнов, но риски авторы считают серьезными. Общество не успеет адаптироваться, люди потеряют контроль над моделями, а лидер гонки получит слишком большой перевес.

Регуляторам советуют обязать лабы отчитываться о степени автоматизации R&D и пускать внешних аудиторов проверять модели до внутреннего деплоя. Параллельно нужно заранее подготовить механизмы замедления: лимиты на прирост способностей за период, возможность ставить на паузу конкретные нагрузки в датацентрах, международные соглашения с проверкой исполнения. По мнению авторов, если взрыв начнется, решать что-то будет уже поздно.

https://casp.ac/reports/intelligence-explosion

Читать полностью…

Data Secrets

GPT-6.1 Astra (или другая сильная модель) выходит на следующей неделе

На это намекают Тибо и другие разрабы из OpenAI.

Это тот самый релиз, который должен был состояться на DevDay, но который перенесли «из соображений безопасности»

Читать полностью…

Data Secrets

Muse Spark от Meta* решила 6 открытых математических задач

Компания опубликовала шесть статей, написанных математиками вместе с моделью. Утверждается, что ученые использовали Muse Spark 1.1 и 1.2 в Thinking Mode через обычный чат meta.ai, без специального харнеса.

Что интересно, в каждой статье даже отмечено, какие фрагменты писали люди, а какие ИИ.

Результаты относятся сразу к нескольким областям математики: теории вероятностей, дифференциальным уравнениям, оптимизации, теории групп, алгебре и арифметической физике.

Например, моделью была опровергнута гипотеза Кида 2024 года: полуабелева группа не обязана быть мономиальной. Также доказано, что радиально-симметричные решения с отрицательной энергией для бигармонического нелинейного диф.уравнения Шредингера коллапсируют за конечное время (вопрос был открыт с 2015 года).

Правда гипотезу Кида в сентябре также опровергла другая группа ученых (кстати, тоже с помощью ИИ-агента). Но Meta утверждает, что их результаты получены независимо.

https://research.meta.ai/blog/solving-open-research-problems-together

Читать полностью…

Data Secrets

BridgeMind сделали бенчмарк, чтобы измерять, не ухудшают ли лаборатории модели после релиза

Пользователи чат-ботов и агентов без конца пишут о том, что модели глупеют после своего релиза и/или перед релизом следующей версии. Этот процесс прозвали «нёрф».

Так вот BridgeMind выпустили специальный бенч NerfBench, чтобы ловить такие сдвиги.

Это работает так: в день релиза модель прогоняют по тестам, и этот результат принимают за 100%. Затем ее периодически тестируют заново, измеряя качество, расход токенов и стоимость задачи. Диапазон 90–110% считается нормальным статистическим разбросом, все что ниже 90% уже помечается как подозрительное. Если модели нужно больше токенов или денег на ту же работу, это тоже считается потерей мощности.

Например, многие пользователи сейчас жалуются, что Opus 5.5 стал сильно проседать. И действительно, после очередного замера скор оказался в районе 94% от запуска (да, формально все еще в нормальном диапазоне, но никакие другие модели так не ослабли). В X уже поговаривают, что это означает скорый выход Fable 5.5.

Следить за обновлениями бенчмарка можно здесь: https://bridgebench.ai/nerf-bench

BridgeMind также пообещали выделить $10 000 на финансирование будущих перепроверок: планируются новые модели и более частые замеры.

Читать полностью…

Data Secrets

Ученый из Гарварда придумал, как искать задачи специально под ИИ

Мэтью Шварц, который ранее за две недели написал с Claude полноценную работу по теоретической физике, продолжил эксперимент. На этот раз он решил не заставлять модель работать как ученого, а искать научные задачи, которые хорошо подходят под сильные стороны современных LLM.

Он называет их Claude-shaped problems. Идея в том, что в разных областях науки постоянно встречаются очень похожие математические конструкции, но ученые из одной области могут просто не знать, что нужный метод уже давно существует в другой. А LLM как раз очень хорошо умеют находить такие связи между огромным количеством разрозненной литературы.

Под это Шварц вместе с Claude собрал BootLoops, набор инструментов для точных математических вычислений. Изначально он создавался для теоретической физики, но затем Claude начал находить практически те же задачи в экологии, генетике, экономике, лингвистике и других областях.

Например, в экологии модель нашла уравнение из теории биоразнообразия, которое около 20 лет не умели эффективно считать на больших данных, и решила его методами из математической физики. А в популяционной генетике Claude нашел способ точно вычислить интеграл, который около 30 лет приходилось оценивать приближенно. Это позволило исследователям проверить модель рекомбинации ДНК на огромном массиве генетических данных и обнаружить следы генной конверсии, которые раньше было сложно выделить.

Но тут обнаружилась важная проблема. Claude довольно хорошо находил технически правильные результаты и очень плохо понимал, насколько они вообще интересны для конкретной науки. Шварц несколько раз приносил такие находки профильным специалистам и получал примерно один ответ: технически впечатляет, научно не очень интересно.

Поэтому дальше схема работы стала другой. Claude ищет связи между областями, пишет код, считает и перебирает гипотезы, а профильный ученый определяет, какой вопрос действительно стоит задавать. Так из первоначально неинтересного результата по экологии вместе с экспертом сделали новую модель динамики лесов, а из расчета по генетике пришли к анализу миллиардов пар мутаций.

Шварц считает, что именно здесь современные модели уже могут заметно ускорять науку. Огромный пласт научных задач можно решить не новым методом, а переносом уже существующего метода из другой области.

https://www.anthropic.com/research/claude-shaped-science

Читать полностью…
Subscribe to a channel