90396
Первый журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks По вопросам сотрудничества: @v2r8n
😎 GoCloud Tech 2026:
регистрация открыта
Этой осенью Cloud․ru снова собирает ИТ-специалистов, чтобы вместе обсудить, как строить платформы и сервисы в эпоху ИИ.
В программе три трека:
▶️Инфраструктура
▶️Разработка
▶️Данные и ML
▶️Технозоны, где можно изучить устройство сервисов и познакомиться с их создателями
▶️Воркшопы, где можно собрать решение под руководством экспертов
▶️Лаборатория карьеры, где можно получить консультацию экспертов
Исследователи из Meta* предложили дать моделям полный контроль над собственным контекстом
Обычно контекст агента устроен довольно просто: старый контекст + новый ответ -> новый контекст. История постепенно растет, а когда становится слишком большой, ее приходится отдельно сжимать или чистить.
В Context Language Models (CLM) авторы предлагают вообще убрать заранее заданную логику управления контекстом и дать модели возможность самой переписывать собственную историю.
Технически весь текущий контекст хранится в обычном файле, к которому у модели есть доступ через Bash. Она может в любой момент удалить ненужные сообщения, заменить большой кусок истории короткой заметкой, сохранить важный результат дословно или полностью перестроить содержимое. После каждого изменения файл становится новым контекстом модели.
При этом никаких правил о том, как именно управлять историей, модели не дают. В экспериментах агенты сами начинали заводить внутри контекста пометки, писать функции для удаления старых результатов поиска и собирать компактные таблицы с состоянием других агентов. Например, в одном из тестов модель за 163 редактирования удерживала рабочий контекст в пределах 6–8K токенов.
Авторы пошли дальше и попробовали отдельно обучить модель этому навыку через RL. После обучения Qwen3.5-9B на BrowseComp-Plus выросла с 28.8% до 42.5%, при этом на вычисления ушло на 38.8% меньше, чем у обученного тем же способом бейзлайна с обычной суммаризацией.
Произвольное редактирование контекста, правда, ломает обычное кеширование. Если изменить что-то в середине истории, все состояния после этого места формально приходится считать заново. Для этого авторы сделали Suffix Cache Reuse: для неизменившихся частей контекста продолжают использовать старый KV-cache, даже если текст перед ними поменялся. В экспериментах это сократило серверные вычисления еще примерно на 35% без заметной потери качества.
На длинных задачах разница становится уже довольно большой. На 12-часовом EdgeBench CLM получил на 5% больше баллов при сокращении объема вычислений на 59%. В 24-часовом тесте на оптимизацию кода CLM при том же вычислительном бюджете показал на 65% лучший результат, чем бейзлайн.
И все это работает поверх обычных LLM, без изменения архитектуры самой модели.
Код | Статья
ИИ все чаще пишет код сам. Тогда чем теперь занимается разработчик?
На конфе Яндекса по образованию YaC/e говорили о том, как теперь учить айтишников: часть задач уже можно отдать нейронке, но понимать, как все работает вместе, все равно придется самому.
Если кратко, нужны три навыка:
— Разговаривать с ИИ на одном языке. Понимать устройство технологий, контекст, RAG и работу языковых моделей;
— Видеть ограничения технологий, которые требуют инженерной доработки;
— Смотреть на задачу не только как разработчик, но и как аналитик и продакт — пройти мысленно путь от идеи до конечного результата и видеть проект целиком.
Поэтому ИТ-универам предлагают готовить «архитекторов сложных систем». Больше внимания — математике, физике и естественно-научному мышлению: такая база помогает быстрее разобраться с новой задачей.
Стек поменяется. А разобраться, что именно ты построил вместе с ИИ, все равно придется.
Gemini 4 Argon, сводка:
— По бенчмам все супермощно, на многих тестах это новая SOTA, включая DeepSWE
— Попробовать пока нельзя, уже по классике выдают на тесты только кибербезопасникам. Далее раскапывать начнут с Google AI Ultra
— Сначала будет действовать introductory pricing $2/$10, затем будет повышение, но цена все равно будет ощутимо ниже той же Astra
— Эта модель может выдать до 1 млн токенов в одном ответе: прежний лимит составлял 64к токенов
— Внутри Google Argon уже помогал искать более эффективные квантовые схемы, оптимизировал потребление памяти в датацентрах и использовался для масштабной миграции кодовой базы на десятки тысяч строк с C++ на Rust
Google доказали что они еще живы, ура!
Anthropic призывают ограничить GLM-5.3
В стартапе протестировали модель на способности в области поиске уязвимостей, и их главный тезис такой: способности к автономной разработке эксплойтов, которые пять месяцев назад были только у Claude Mythos Preview, теперь есть в открытой модели, причем без серьезных ограничений на злоупотребление. "Так делать нельзя, айайай".
— На бенчмарке ExploitBench (эксплуатация известных уязвимостей в V8) GLM-5.3 довела дело до работающего эксплойта в 50 из 410 попыток, а Mythos Preview в 56.
— На внутреннем бенчмарке Anthropic по бинарной эксплуатации результат 4% против 6% у Mythos. Предыдущие модели, вроде Claude Opus 4.6 и GLM-5.2, там не справились ни разу.
— Всего за 8 часов модель нашла в JS-движке популярного браузера неизвестные уязвимости и собрала из них эксплойт для кражи файлов. Это потребовало 20 минут внимания человека + примерно $20 по тарифам API.
При этом исследователи утверждают, что защиты от вредоносных запросов у модели почти нет. Из коробки она формально отказывается от явно вредных запросов, но обойти это просто: Anthropic это удалось в 92% случаев с помощью банальных джейлбрейков, и в 100% случаев после абляции, то есть удаления механизма отказов из весов.
Авторы напрямую не пишут, что подобные модели надо ограничить, но "слегка" намекают, что, по их мнению, правительства должны проводить safety-тесты мощных моделей, а разработчикам стоит уделять больше внимания безопасности. И, естественно, между строк они напоминают, что вот они-то молодцы, и дают доступ к Mythos 5.1 только проверенным специалистам, и вообще Claude умничка и не ведется на злые джейлбрейки злых хакеров 😇
Забавно, кстати, что пост этот Anthropic выложили именно в день, когда в Белом Доме все американские лидеры подписали соглашение о контроле ИИ с Трампом
DeepSeek вместе с Huawei разрабатывают альтернативу CUDA
Компании выложили в опенсорс набор инструментов для чипов Huawei Ascend. Сейчас это главные китайские AI-ускорители, на которые переходят все их стартапы. Большая проблема с переходом на новое железо заключается в софте: вся индустрия 10+ лет писала все под CUDA от Nvidia, и теперь Китаю предстоит восстановить то же самое для своих чипов.
Собственно, этим DeepSeek и занимается. В частности, они выпустили в опенсорс Ascend-версии своих фирменных библиотек, на которых держатся ее собственные модели: DeepGEMM (умножение матриц), DeepEP (связь между чипами для MoE-моделей), FlashMLA (attention) и еще несколько. API у них такая же, как у Nvidia-версий, поэтому код с Nvidia переезжает почти без переписывания.
Весь этот стек работает на TileLang: это тоже китайский проект. DeepSeek утверждает, что язык компактнее CUDA, а все TileLang-ядра, на которых она обучает свои модели, уже работают на Ascend.
Понятно, что это замена не всего стека CUDA, а только написания ядер, но направление понятное: Китай методично закрывает зависимость от Nvidia на всех уровнях.
После презентации нового агента Dots от OpenAI домен dot.com начал перенаправлять пользователей на страницу Grok Bot.
Компания Маска приобрела домен еще в июле, задолго до анонса. Было ли это совпадением или заранее спланированным троллингом, пока неизвестно 🍷
Герой дня – Дарио Амодеи на свежем репортаже из Белого Дома, где техлидеры обсуждали контроль ИИ
(Да, на этот раз его позвали)
Еще из интересного – plugin extensions
Это платформа, на которой можно будет находить, создавать и шерить плагины для ChatGPT. Если раньше плагины представляли из себя в основном просто интеграции, то теперь это могут быть целые микроприложения внутри ChatGPT. Выглядят они как интерактивные панели в боковом меню.
Все релизы с DevDay: https://openai.com/ru-RU/index/devday-2026-recap/
Читать полностью…
Запустили Agent API
Это та же технология и харнесс, на которых построен Codex и Dots, и теперь ее можно использовать в ваших продуктах. Поддерживается даже Computer Use.
Следующий релиз – ChatGPT Space: рабочее пространство для команд людей и агентов
Можно тегать и коллег, и ваших Dots, работать над общими проектами, создавать общие чаты, и, конечно, делегировать агентам задачи.
Через пол часа начинается DevDay OpenAI
Что ждем:
1. Always-on агент «o» (он же Aeon, он же dots)
2. Новая подписка за 500 долларов с доступом к тарифу Ultrafast (смешно будет, если помимо скорости в ней будут все те же лимиты, что до понижения были в Pro за 200)
3. GPT-6 Cyber и еще несколько продуктов, связанных с безопасностью (по большей части b2b, скорее всего)
В общей сложности стартап наобещал 20+ новинок. Будем постить в режиме лайв.
Пользователи встретили новость о сокращении подписки не очень радушно 🙃
Читать полностью…
OpenAI пытаются задобрить пользователей после понижения лимитов
Напоминаем, что стартап на днях объявил, что в подписке за 200 долларов пользователи теперь будут получать не 20х, а всего 10х лимитов, объяснив это тем, что модели стали эффективнее использовать токены.
Естественно, это вызвало волну недовольств. И, видимо, чтобы как-то сгладить ситуацию, всем действующим подписчикам Pro 200 выдали аж 62 500 бесплатных кредитов API на аккаунт (это примерно $2500). Их можно тратить до конца года.
А лучше бы оставили квоты как было…
OpenAI обнаружила массовую кампанию по дистилляции своих моделей
Не так давно Anthropic утверждали, что Moonshot подменяли ответы Kimi ответами Claude (/channel/data_secrets/9895), а теперь со своим расследованием вышли OpenAI.
Компания обнаружила массовую попытку вытащить скрытые рассуждения своих моделей. В пике за два дня прошло 16 000 таких запросов с более чем 4 000 аккаунтов.
При этом шифрование никто не взламывал: CoT просто переносили из одного диалога в другой и просили модель воспроизвести его обычным текстом. Подробнее про эту архитектурную дыру мы писали тут: /channel/data_secrets/9719.
OpenAI не утверждает, что за всем этим стояла Moonshot. Но основной кластер активности компания связывает с разработчиками Kimi, а происходящее считает попыткой дистилляции своих моделей.
После расследования OpenAI закрыли возможность переносить такие зашифрованные блоки между пользователями и рабочими пространствами, усилили проверки аккаунтов и добавили отдельную защиту от вывода скрытых рассуждений. Результатами расследования также поделились с другими AI-лабораториями и властями.
https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign/
FigureAI заставляют своих роботов предыдущего поколения бросаться в лаву, чтобы избавиться от них
В конце августа CEO стартапа объявил, что роботов Figure 02 утилизируют (потому что с началом разработки новой версии гуманоида в штаб-квартире начинает заканчиваться место) и спросил у подписчиков в X, как лучше это сделать.
На что в комменты пришел Арнольд Шварцнеггер и ответил ему: «Вы должны их расплавить».
Figure не растерялись и не только последовали этому совету, но и пригласили Шварцнегера поучаствовать. Вчера они выпустили эпичный ролик, в котором роботы бросаются в ковш в расплавленной сталью и повторяют знаменитую сцену из Терминатора с высунутым вверх большим пальцем.
Роботов специально обучали автономно сбрасываться вниз. Для этого в симуляции натренировали новую модель по движениям каскадеров, а затем заставляли роботов прыгать со второго этажа на воздушные подушки.
Кстати, всю операцию пришлось проводить в Финляндии, потому что ни один литейный завод в США и Мексике не взял на плавку роботов с литий-ионными батареями.
Из полученного металла Figure сделают ограниченную серию памятных сувениров.
Что, простите?
Google только что вернулся в гонку с новой моделью, которая превосходит Astra и Fable 5.1
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
Каждую осень у бизнеса просыпается спрос на подрядчиков – бухгалтеров, юристов, маркетологов, дизайнеров, разработчиков и других фрилансеров. Для тех, кто оказывает такие услуги, это сезон, когда стоит активнее искать заказчиков — вопрос только где.
Ответ – Авито Услуги. По данным внутреннего исследования платформы, ежемесячно услуги там ищут 37,3 млн человек, и из них 7 млн – с деловыми задачами, то есть уже с конкретным запросом и бюджетом. Платформа позволяет заказчику и исполнителю быстро и просто найти друг друга.
— Начать довольно просто. Оформляете профиль, размещаете объявление и описываете, какие задачи можете решить, указав прайс-лист, портфолио и другие немаловажные детали.
— Инструменты продвижения уже встроены в площадку: обучающие материалы, персональный менеджер и личный кабинет с аналитикой, где видно, что ищут прямо сейчас.
В части категорий доступен безопасный сценарий сделки: условия фиксируются заранее, оплата резервируется и списывается только после приемки работы.
Если оставить заявку на сайте, менеджер Авито Услуг бесплатно поможет с оформлением профиля и объявления и начислит до 10 000 бонусов на продвижение
Т-Технологии показали на ACM RecSys 2026 три инструмента для рекомендаций, и все они в опенсорсе
Рекомендательные системы часто упираются в нехватку данных. В новом сервисе у пользователя нет истории, а у редких товаров почти нет взаимодействий. Это называется холодным стартом.
Исследователи Т-Технологий занялись этой проблемой и сделали три инструмента, нацеленных на ее решение: фреймворк Perseus, библиотеку Scikit-Rank и метод ScaL³AE.
Работы команда на днях представила на ACM RecSys 2026. Это конференция уровня A по рекомендательным системам, которая проходит в Миннеаполисе, США.
— Perseus решает проблему разрозненных данных внутри экосистемы. Например, человек покупает в «Шопинге», получает кэшбэк, пишет в поддержку и тд, но при этом в каждом сервисе о нем своя обрывочная история. Perseus собирает все эти действия в одну последовательность и обучает на ней нейросеть, так что даже новый сервис сразу знает клиента.
На собственных данных T-ECD качество рекомендаций выросло на 16-39% в зависимости от домена. При этом Perseus универсален, и применить его можно почти в любом продукте. Подробнее про этот фреймворк мы писали здесь: /channel/data_secrets/9576.
— Библиотека Scikit-Rank закрывает другую боль. Даже если вы сделали отличную нейросеть для ранжирования и она уверенно прошла тесты, встроить ее в текущий пайплайн отдельная головная боль: код приходится переписывать чуть ли не с нуля. Scikit-Rank снимает эту проблему тем, что ведет себя как обычная модель из scikit-learn. Ее можно поставить в паре с Perseus: он подбирает кандидатов, Scikit-Rank их ранжирует, и оба этапа рекомендательной системы становятся нейросетевыми. При этом по качеству она не хуже XGBoost, LightGBM и CatBoost, а на рекомендации новостей заметно их обходит.
— ScaL³AE нужен для каталогов, где по многим товарам мало данных о взаимодействиях. Он подтягивает описания товаров от языковых моделей и при этом работает на каталогах промышленного масштаба, в то время как предыдущая версия этого метода упиралась в память.
Каждую из этих разработок сообщество может щупать и переиспользовать: открытый код Perseus и ScaL³AE лежит на GitHub, Scikit-Rank доступен на PyPI, плюс есть интерактивное демо в Google Colab.
Кстати, по итогу этой встречи ИИ-лидеры подписали добровольное соглашение о контроле
В нем написано, что они обязуются ввести внутренний контроль, внутреннюю команду надзора, внешние аудиты и независимый наблюдательный совет.
Никаких санкций за нарушение соглашения нет. Трамп на вопрос, обязательно ли оно, ответил, что оно «морально» обязывающее.
Также на этой встрече Трамп подписал указ, по которому федеральные ведомства в официальных материалах теперь должны говорить «Super Intelligence» («SI») вместо «AI».
Ну вот и все, презентация подошла к концу. В сухом остатке имеем:
— Новую GPT-6.1 Sol
— Агентов Dots, которые работают круглосуточно над вашими задачами
— Подписку для миллионеров за 500 долларов, и режим Astra Ultrafast, который доступен только в ней
— Несколько прикольных обновлений для разработчиков, включая Agent API, Jev на основе Luna, обновленный Codex Cloud и Codex Security Cloud
— И самое приятное: ресет от Тибо
Тибо выдали специальную кнопку для ресетов (фото от @Futuris) 🤣
Один он уже выдал!
Еще для разработчиков:
– Прокачали Codex Cloud. Теперь сессия не будет прерываться, когда вы закрываете ноутбук!
– Выпустили Decisions API: Jev на основе Luna (не украли, а вдохновились). Если кратко, это система для супер-быстрого принятия решений, которая возвращает один из предопределенных ответов вместе с оценкой уверенности. Нужно для таких сценариев, как классификация контента, маршрутизация запросов или выбор следующего действия агента. Классификация нового поколения.
Наконец-то выпустили Ultrafast мод: обещают 300 токенов в секунду
Но... он будет только в том самом тарифе за 500 долларов. В нем также будет в 25 раз больше лимитов, чем в Plus.
Пока на DevDay рассказывают про Space, там уже выкатили GPT-6.1 Sol
https://openai.com/ru-RU/index/introducing-gpt-6-1-sol/
OpenAI релизнули Dots – always-on агентов на основе Astra
Это агенты, которые работают постоянно и сопровождают вас во всех рабочих процессах. Им можно делегировать длинные задачи и все, что связано с кодом, компьютером и браузером. Можно дать ему коннектор к Codex и любым приложениям.
Скоро с Dots агентами можно будет также общаться в мессенджерах и даже по телефону
Для тех, кто выводит ИИ в прод: 12 ноября в Москве пройдет MWS Cloud Day 2026
Это уже вторая конференция MWS Cloud. Теперь речь пойдет про облака, ИИ, безопасность и про то, какая инфраструктура нужна, когда ИИ из экспериментов переезжает в реальные продукты.
В программе три трека и 20 докладов от экспертов: от гибридного мультиоблака и отказоустойчивости до мультитенантного инференса и корпоративного AI в 2027 году 😎
Можно прийти офлайн или подключиться онлайн, регистрация тут.
OpenAI возвращает Pro за $200
С завтрашнего дня снова можно будет оформить Pro за $200. Вместе с этим OpenAI меняет расчет использования: в пересчете на стоимость API новая подписка будет давать примерно в два раза меньше старой. При этом пятичасовые лимиты возвращать не будут.
OpenAI объясняет изменение тем, что сами модели становятся дешевле и эффективнее. Например, новые GPT-6 Sol и Luna вышли с ценами API в два раза ниже предыдущих, поэтому даже при меньшем лимите в долларах компания обещает, что фактически на подписке получится сделать больше работы, чем месяц назад.
Завтра к Pro также добавят новые возможности, которые вообще не будут расходовать лимиты. Что именно это будет, пока не раскрывают.