seeallochnaya | Unsorted

Telegram-канал seeallochnaya - Сиолошная

76297

Канал SeeAll'а с новостями (и мыслями о них) из мира NLP, VR и космоса. Более подробно смотри в первом сообщении в канале (оно закреплено). А еще у нас есть чат! Заходи: https://t.me/+i_XzLucdtRJlYWUy

Subscribe to a channel

Сиолошная

OpenAI и ещё около тысячи сотрудников других лабораторий, включая Google, Anthropic, META, подписали письмо «Pacing the Frontier»

Вот его содержание:

Искусственный интеллект может помочь создать кардинально лучшее будущее, однако такой исход не гарантирован. Ведущие мировые ИИ-компании полагают, что они могут быть близки к автоматизации исследований в области искусственного интеллекта. Трудно точно предсказать, насколько это ускорит прогресс ИИ, но существует реальный риск того, что развитие его возможностей будет происходить стремительнее, чем наша способность понимать и контролировать создаваемые системы.

Чтобы реализовать потенциал ИИ, отрасли, государству и обществу в целом может потребоваться возможность выиграть время для устранения возникающих рисков, разработки мер безопасности и усиления контроля. Однако каждая компания — как и каждая страна — находится под жестким конкурентным давлением, не позволяющим в одностороннем порядке замедлять эти темпы. При этом сегодня в мире отсутствуют технические и управленческие инструменты для целенаправленного регулирования темпов глобального прогресса в разработке передового ИИ.

Опираясь на уже ведущуюся работу по мониторингу релизов передовых ИИ-моделей мы призываем правительство США:

- поддержать международные усилия по разработке технических и управленческих инструментов, необходимых для целенаправленного регулирования темпов развития на передовых рубежах автоматизированной разработки ИИ


(конец)

В дополнение к новости ждём 1-го августа — к этой дате США должны определиться, что такое «фронтир система» и какие модели к ним относятся. Это важно потому, что к фронтир системам будут применять новые правила оценки моделей перед релизом (как минимум, государство должно получить доступ за 30 дней до публичного выпуска).

Читать полностью…

Сиолошная

Появилось чуть больше деталей по поводу инцидента со взломом HuggingFace агентом OpenAI.

Reuters постарались установить таймлайн событий, по их источникам внутри компаний выходит так:
— Агент пытался вырваться из изолированной тестовой среды OpenAI примерно c 9 июля.
— Вторжение в системы Hugging Face началось через два дня, 11 июля, и продолжалось до 13 июля.
— OpenAI потребовалось еще несколько дней, чтобы понять, что за взломом стоит её агент, и обе компании впервые связались по этому поводу лишь примерно 20 июля.
— По ходу работы агент оставлял записи для своих будущих копий. Скорее всего речь про простые текстовые инструкции на случай, если другие инстансы модели смогут выйти из окружения (чтобы им было легче получить доступ к интернету).
— Пресс-секретарь OpenAI заявила, что в публикации Reuters допущено "несколько неточностей", но не пояснила, каких именно.
— Где-то между этим HuggingFace подали обращение в ФБР для расследования инцидента.

То есть агент буянил в интернете неделю или даже больше. Что ж, зато compaction (инструмент сжатия контекста для долгих задач, которые не помещаются в контекстное окно LLM) работает хорошо 👨‍🦳

CEO HuggingFace съездил в офис OpenAI и обсуждал дальнейшие шаги. Он просит:
— Радикальной прозрачности: опубликовать логи «вышедших из-под контроля» агентов, чтобы всё исследовательское сообщество смогло изучить, что произошло.
— Больше возможностей для защитников, например, чтобы OpenAI выделили $100 миллионов, чтобы помочь сообществу разработать мощные средства киберзащиты с использованием лучших открытых и закрытых моделей.

OpenAI буквально пару часов назад выпустили обновление к своему заявлению:
«Мы понимаем, что вокруг инцидента с Hugging Face циркулирует множество вопросов и неподтвержденных домыслов.
Это беспрецедентный случай, и мы считаем, что он знаменует собой важный момент для сферы безопасности ИИ.
Мы все еще проводим тщательное расследование совместно с внешними консультантами.
Как только проверка будет завершена, в ближайшие недели мы планируем опубликовать технический отчет с извлечёнными уроками».

Хорошо, что к аудиту привлечены внешние консультанты. Но я сомневаюсь, что в ближайшие недели мы увидим точное описание обнаруженных уязвимостей — это бы означало угрозу для всех пользователей затронутых программ, которые не обновились до версии с исправлением. Однако вот тут в твиттере два эксперта по кибербезопасности выражают уверенность, что смогли найти софт + указание на уязвимость в JFrog Artifactory.

Читать полностью…

Сиолошная

Популярный бенчмарк TerminalBench хотел обновиться до третьей версии, задачи для которой собирали с начала весны, но вместо этого превратился во FrontierBench. Первая версия включает в себя 74 уникальные и созданные вручную задачи в разных доменах (не только программирование).

Примеры задач:
— есть сервер, на котором развёрнут медленный KV-cache (это как справочник «имя ➡️ телефон», куда можно добавлять и откуда можно читать строчки). Нужно его переписать и ускорить в 5 раз, при этом не отключая от работы, то есть к нему постоянно идут запросы, и их нельзя пропускать. Ну и само переключение тоже надо сделать на лету. При этом исходник кода агенту не даётся, поэтому поведение и функционал нужно изучить самостоятельно

— посчитать, сколько резервного капитала банк обязан держать под риск сделок с контрагентами, учитывая залоги, валюты и регуляторные правила. Результат CSV с числами и Excel с работающими формулами, как для внутреннего аудита.

— работать диспетчером доставки стройматериалов. В течение дня появляются новые заказы, отмены и изменения цен на топливо; нужно учитывать доступность машин и водителей, обязательный отдых, допуски к опасным грузам, окна доставки и прибыль. План нельзя пересчитать «задним числом»: часть решений уже зафиксирована.


В общем, большой упор делался на реалистичность и экономическую ценность. Распределение по категориям вы можете увидеть на второй картинке в посте. На первой — качество текущих моделей, где на фронтире GPT-5.6 Sol и Fable с результатом в примерно треть задач. К сожалению, Kimi K3 пока не померили, очень жду результата — как думаете, где будет? На уровне Terra и Opus 4.8 или выше? Или около Grok 4.5?

Во-первых, я удивлён, что GPT-5.6 Sol не отстаёт от Fable. Если бы мне описали задачи бенчмарка, то я был бы уверен, что модель Anthropic хоть и сильно дороже, но заметно лучше.
Во-вторых, я удивлён тому, что Terra на уровне Opus 4.8, да и по многим бенчмаркам она не отстаёт от 5.5. OpenAI обещали это на релизе, говорили, что она «сопоставима с GPT-5.5», но казалось что это слишком хорошо, чтобы быть правдой.
В-третьих, Sonnet 5 снова выглядит как бесполезная модель — она и дороже Fable (!), и хуже, и токенов больше всех (18 миллиардов на весь бенчмарк; Fable 5 нужно 3.6 миллиарда). Что-то Anthropic напортачили.

Grok-4.5 очень немногословен и за счёт этого дёшев — немного выгоднее Luna и сильно выгоднее (в 4 раза!), чем GLM-5.2.

Авторы отмечают, что агенты по-разному подходят к решению задач, даже при схожих показателях качества. В Fable 5 (33,8%) и Opus 4.8 (21,1%) используется больше токенов и выполняется меньше действий. В GPT-5.6 Sol (34,4%) и Terra (20,8%) используется меньше токенов и выполняется больше действий. Итого GPT-5.6 Sol примерно на 40% дешевле и использует примерно на 50% меньше токенов, чем Fable 5.

А вот GPT-6 выйдет так вообще... 😇

Читать полностью…

Сиолошная

Как давно высказывалось в канале — неквалифицированные инвесторы не готовы к концепции переноса запуска ракет. Для них переносы хуже аварий, а не наоборот.

Держателям $SPCX приготовиться, это ещё даже взрывов от посадки на воду не было. Отличное казино, свидетели Astra и Virgin Galactic подтвердят.

Читать полностью…

Сиолошная

Началась продажа по $230 за штуку

Видео: https://fixupx.com/OpenAIDevs/status/2077425991790870644?s=20

Покупать тут: https://openai.com/supply/shop/
(я брать не буду, но взял пару футболок)

Читать полностью…

Сиолошная

«Любая достаточно развитая технология неотличима от магии»©

Пользователь Твиттера поручил Claude Fable 5 превратить reMarkable в дневник Тома Риддла из «Гарри Поттера».

То, что написано, стирается, а LLM пишет ответ.

Представьте реакцию людей из поздних 1800-ых, которым бы это показали🤯

(код обещают выложить скоро)

Читать полностью…

Сиолошная

Вышел Sonnet 5 — новая модель по умолчанию для Free и Pro ($20), но доступна всем.

По качеству близко к Opus 4.8, но сильно дешевле: до конца лета будет цена $2/$10, после чего поднимут до $3/$15.

Ну и... в честь релиза сбросили лимиты, так что бегите играться 🤗

Читать полностью…

Сиолошная

Прошло 3 недели и никто не написал про Apple и WWDC, а мне было лень, но что поделать, надо браться. В начале июня компания проводила ежегодную конференцию для разработчиков и вместе с этим рассказала про обновления в AI.

Очень сильно прокачали Siri, теперь она работает на относительно большой (по мобильным меркам) LLM, умеет вызывать инструменты и тесно связана с приложениями и экосистемой. Я видел пару демонстраций в твиттере, где запросы и сценарии показались мне не предусмотренными разработчиками (то есть модель на них не тренировали), и тем не менее Siri справилась отлично. Для тех, кто пользовался LLM, такая генерализация не является чем-то выдающимся, но для обычных пользователей может вызвать ВАУ-эффект. Ого, оно что И ТАК умеет??? Не только по пяти заложенным 15 лет назад сценариям работать?

На девайсах может быть одна из двух моделей — AFM 3 Core (3 миллиарда параметров) и AFM 3 Core Advanced для девайсов помощнее, Phone 17 Pro и выше, iPad с чипом M4 и выше, MacBook с чипами M3 и выше. Такое ограничение потому, что модель действительно «Large» — 20 миллиардов параметров с микстурой экспертов (MoE). Но работает очень хитро — классический MoE работал бы плохо, так как у девайса ограничена пропускная способность между NAND (флеш-память для хранения ваших файлов и весов модели) и DRAM (где хранятся активные параметры для работы). В обычном MoE вы не знаете наперёд, какие именно эксперты вам нужны, поэтому загружаете всю модель, что а) долго б) занимает много памяти, а потом уже экономите на вычислениях, так как работает часть экспертов.

Apple применили трюк, который я вижу впервые: для вашего промпта модель предварительно выбирает набор экспертов на всю модель, а затем загружает только их, и получается от 1 до 4 миллиарда активных параметров. Подход называется Instruction-Following Pruning for Large Language Models и описан в этой статье из начала 2025-го года.

Также эта модель работает и для распознавания вашего голоса (поэтому и оно улучшилось), и для генерации нового голоса Siri (...тоже улучшилось). Вот тут внизу есть пара семплов было/стало, честно говоря старое мне нравится больше 🤷‍♂️

И вторая часть анонса — это удвоение ставки на Private Cloud Compute (PCC), который анонсировали два года назад. Идея в том, что для более сложных запросов, для которых локальной модели (особенно на смартфоне) не хватает, можно отправить промпт и контекст (например, файлы) на зашифрованный сервер, внутрь которого ни у кого нет доступа. Несмотря на то что система имеет открытый код и анализировалась лучшими специалистами по кибербезопасности, надеюсь, что Mythos тоже натравили 😀

Так вот, в PCC тоже обновилась модель, AFM 3 Cloud. Она запущена на серверах Apple и крутится на собственных чипах M-серии. И есть ещё AFM 3 Cloud Pro, которая ещё больше, ещё умнее, развернута на серверах Google на Nvidia GPU. Мне кажется это очень крутой паттерн, с которым мы будем жить: на смартфонах и умных девайсах в ближайшее время не будет настолько мощных чипов, как в серверных стойках, но хочется, чтобы умные модели были доступны.

Все эти модели созданы компанией Apple, это НЕ модели Gemini. Говорят, что Apple усовершенствовала некоторые из этих моделей, дистиллируя Gemini, но все они являются совершенно новыми моделями, в которых используются собственные знания и технологии Apple.

Самое крутое — и на смартфонах, и на макбуках у вас как у разработчика есть доступ к этим LLM. То есть вы можете написать приложение, не обучать свою модель (только сделать промпт) и вызывать её. Это бесплатно для локальной модели, а для облачных бесплатно (!) до какого-то порога, дальше придется платить.

Вот тут и тут можно посмотреть на скорость генерации на разных девайсах — получается даже быстрее, чем я бы ожидал!

Читать полностью…

Сиолошная

https://openai.com/index/previewing-gpt-5-6-sol

👀

Читать полностью…

Сиолошная

Mythos / Fable так и не стали доступны 😭 и на рынках предсказаний вероятности скорого (до конца этого месяца или следующего) перезапуска падают, народ теряет веру.

На фоне этого в твиттере появилось 2 неподтверждённых слуха:
— GPT-5.6 перенесли на середину следующего месяца и не будут выпускать на этой неделе. Но про сам запуск мы ничего не слышали официально.
— Gemini 3.5 Pro тоже перенесли с июня (якобы недовольны результатами), хотя об её анонсе «в следующем месяца» со сцены говорил лично CEO компании.

Как говорится, первые не релизят потому, что боятся блокировки от государства, а вторые боятся, что их не заблокируют 😀

Но на самом деле я не думаю, что GPT-5.6 откладывают по этой причине (если и вправду откладывают). Самая вероятная — торопиться некуда, у конкурентов предложение не поменялось (ведь Mythos / Fable недоступны), можно посидеть доучить и улучшить модель. Все кто хотел уйти к конкурентам уже ушли.

Читать полностью…

Сиолошная

Vals.ai успели протестировать Fable 5 на ProgramBench до отключения. Они заметили странное — несмотря на то, что в 199 задачах из 200 уже на первом ходу система перекинула модель на Opus 4.8 из соображений безопасности, итоговая оценка получилась почти в два раза выше Opus. Более того, модель генерировала в два раза больше токенов и заняло это в два раза больше времени.

Почему так вышло и что именно происходит под капотом — не ясно.

Есть несколько теорий:
— Во время перекидывания на Opus был активен более высокий внутренний режим рассуждений, недоступный извне
— Opus 4.8 незаметно улучшился с момента последнего тестирования.
— Перенаправление идет на каку-то другую внутреннюю версию Opus 4.8.
— Fable всё равно писал первый ответ (и мб писал какой-то крутой план), а только после этого происходила смена на Opus.
— Есть какой-то баг на стороне Anthropic

🤷‍♂️

Метрика на картинке — доля задач, которые «почти решены», то есть для которых проходит 95%+ тестов.

Читать полностью…

Сиолошная

Американское правительство ввело контроль экспорта на... Fable 5 / Mythos 5. На данный момент все страны, кроме США, не имеют права пользоваться моделью; кроме этого, люди без гражданства США не должны пользоваться моделью даже в Штатах.

Это правило применимо даже к сотрудникам Anthropic. Я не знаю, получил ли гражданство условный Andrej Karpathy, но если нет — он не может пользоваться этой моделью даже при работе на работе.

Приказ вступает в силу незамедлительно, компания уже отрубила доступы. (UPD: меня поправили, что на данный момент доступ отключили вообще всем, так как нельзя быстро разобраться, кто гражданин и где он находится)

Ответ Anthropic тут, TLDR:
— причина в том, что появились джейлбрейки, которые обходят систему безопасности Anthropic
— конкретных примеров предоставлено не было
— «Как мы уже публично заявляли, мы считаем, что правительство должно иметь возможность блокировать небезопасные развертывания моделей в рамках установленной законом процедуры, которая является прозрачной, справедливой, ясной и основанной на технических фактах. Данное действие не соответствует этим принципам»

В ближайшие 24 часа Anthropic обещают выпустить более полный ответ, но говорят, что у них на руках есть отчёт, в котором указано, что GPT-5.5 тоже уязвима, но почему-то не забанена.

The real permanent underclass was lack of US citizenship all along...

К другим новостям, появилось видео с GPT-5.6, проходящей тестирование государством, чтобы избежать экспортных ограничений:

Читать полностью…

Сиолошная

До выхода Opus 4.5 многие сидели на Sonnet 4.5 — он казался достаточно умным, и в то же время его можно было использовать по подписке гораздо больше, чем Opus, который с выходом 4.5 подешевел в 3 раза. Так что звёзды сложились так, что почти все переехали на «тяжелый дорогой» Opus.

Но для сравнения и перспективы:
— Opus 4.8 стоит $5/$25
— Fable 5 в два раза дороже, $10/$50
— Opus 4 / 4.1 стоили $15/$75, дороже Mythos-class моделей!
— GPT-4 на релизе стоила $30/$60, и целых $60/$120 если контекст длиннее невероятных 8 тысяч токенов
— GPT-3 стоила $40 (и $80 если вы покупали пакет токенов поменьше) и не разделяла вход и выход, так что $40/$40

И это не говоря про то, что за входные токены мы зачастую платим с большой скидкой в 50-90%, так как они кэшируются.

GPT-3 стоила дороже Opus 4.8 и почти наверняка дороже Fable 5 в реалистичных сценариях.

И вот мы на пороге потенциальной ценовой войны Anthropic <-> OpenAI, и, возможно, через год мы будем иметь Mythos-class модели по цене Sonnet-ов или чуть дороже. Невероятно.

Читать полностью…

Сиолошная

Google выложили DiffusionGemma — модель на 26B параметров с 4B активных, с архитектурой Gemma 4, и которая генерирует по 256 токенов за раз. Но так как получается неразбериха, то эти токены перегенерируются несколько раз.

То есть это работает так же, как пошаговая генерация картинки, где каждая последующая генерация «выравнивает», что уже было нарисовано (или в данном случае написано). Гифка с примером генерации — выше этого поста.

На картинке в этом посте метрики и скорость (самый левый столбик) — на одной H100 в FP8 модель развивает более 1000 токенов в секунду, по сравнению с 303 для Gemma 4 с MTP (предсказание нескольких токенов за раз). Обещают 700 токенов на 5090.

DiffusionGemma послабее четверки, это превью технологии, и я вообще удивлён, что это ещё и рассуждающая модель — да-да!

Веса тут, визуальный гайд с объяснением принципа работы тут; модель поддержана уже везде, VLLM, Unsloth итд — можно загружать и играться. А вот тут можно погенерировать код с этой моделью бесплатно (и смотреть, как на лету делаются правки).

Читать полностью…

Сиолошная

В ChatGPT прокачали память — теперь она станет ещё более персонализированной. Обновление уже доступно пользователям тарифов Plus и Pro в США, а в ближайшие недели появится в других странах, и самое главное у бесплатников. Мне кажется это важным потому, что позволяет компании закрепить у себя пользователя и сделать опыт перехода к конкурентам неудобным, мол, «да у них модель тупая и меня не понимает».

Новая память работает на основе «Dreaming» (сноведений?), когда модель в фоновом режиме автоматически формирует и упорядочивает воспоминания, опираясь на историю чатов. Воспоминания можно просмотреть: их сводка доступна на специальной странице управления памятью. Изучив эту страницу, вы сможете быстро понять в общих чертах, что именно ChatGPT знает о вас, добавить или обновить информацию о себе, а также дать инструкции о том, какие темы и в каких ситуациях нейросети следует затрагивать.

Как это может быть полезно обычным юзерам? Представьте, что вы выбираете в ChatGPT новое оборудование для фотосъемки, которое должно быть совместимо с вашей камерой. Если в прошлом вы уже обсуждали свою технику в чате, теперь вы можете просто попросить подобрать товары, совместимые с «моим набором для фотосъемки», и получите рекомендации с учётом фильтра.

Такую память OpenAI оценивают по критерию сохранения контекста (полнота выросла с 42% до 83% за 2 года). Есть ещё два других критерия, там тоже улучшения, но детали писать не буду.

Благодаря dreaming воспоминания автоматически обновляются с течением времени. Это позволяет ChatGPT актуализировать информацию: например, когда ваша поездка завершится, факт в памяти модели изменится с «Вы едете в Сингапур в июле» на «Вы ездили в Сингапур в июле 2026 года».

Решили раскатить только сейчас потому, что раньше было дорого: недавние улучшения снизили объем вычислительных мощностей, необходимых для работы функции dreaming, примерно в 5 раз.

Читать полностью…

Сиолошная

JFrog подтвердили, что GPT смогла выйти со своей песочницы через ряд (не одну!) до этого неизвестных уязвимостей в их софте. Также они добавили, что это не первый раз, когда они работают бок о бок с OpenAI для обнаружения и исправления критических уязвимостей, что говорит о том, что OpenAI серьёзно подходят к делу и какое-никакое тестирование делали.

Попросил ChatGPT проанализировать, насколько вообще популярен JFrog, а то может быть это какое-то вайбкодерское решение от студентов, которые вчера выпустились из YCombinator (нет, они основаны в 2008-м году).

JFrog Artifactory — одно из самых популярных enterprise-решений для хранения артефактов. Нишевым его назвать нельзя, но и единственным безусловным стандартом индустрии тоже нельзя, так как он постоянно конкурирует с Nexus. Их продуктом пользуются крупные компании; у JFrog большой и устойчивый бизнес: за 2025 год компания получила около $532 млн выручки.


===

Уже 3 раза видел в разных контекстах и чатах, что люди составляют мнение о ситуации даже не прочитав оригинальные блогпосты. У них были аргументы в духе «так а зачем OpenAI давали доступ к интернету? это же очевидно плохо» — «но они не давали доступ к интернету» — «а как тогда?» — «ну вот так».

Читать полностью…

Сиолошная

Компании с картинки подписали совместное письмо «Открытые веса и лидерство Америки в ИИ» (из заметных там нет двух: OpenAI и Anthropic).

Полный текст (2.5 страницы) доступен тут, ниже краткая выжимка:
— Модели с открытыми весами, которые любой желающий может скачать, изучить, модифицировать и запустить на собственной инфраструктуре, являются важной частью фундамента технологии, поскольку они делают передовые технологии ИИ более доступными, адаптируемыми и широко распространенными.

— Модели с открытыми весами расширяют возможности участия в ИИ-экономике. Стартапы, действующий бизнес, университеты и государственные учреждения могут создавать свои решения на базе передовых моделей без необходимости обучать их с нуля или платить по высоким тарифам за использование флагманских моделей для решения каждой отдельной задачи. Можно использовать передовые модели для самых сложных задач, и прибегать к эффективным, специализированным модели во всех остальных случаях.

— В мире, где киберпреступники используют передовой ИИ, специалистам по защите необходим доступ к моделям с сопоставимыми возможностями, чтобы обнаруживать и моделировать новые угрозы, а также реагировать на них. Открытые модели расширяют возможности защиты, повышают прозрачность и позволяют обнаруживать и устранять уязвимости совместными усилиями множества команд.

— Модели с открытыми весами позволяют широкому сообществу исследователей и разработчиков изучать их поведение, выявлять уязвимости, разрабатывать меры защиты и со временем совершенствовать их.

— Незаконные попытки извлечь выгоду из закрытых моделей (дистилляция) вызывают обоснованные опасения. Однако эти проблемы следует решать с помощью целенаправленных правовых и коммерческих механизмов, а не путем введения масштабных ограничений на сами технологии.

===

Поиграю в адвоката дьявола:
— открытый код является плохим примером для сравнения с открытыми весами. Код можно читать, анализировать, менять, и всё это на виду у сообщества. Многие баги и уязвимости были исправлены именно поэтому, а к некоторым системам появилось доверие ровно потому, что они больше десяти лет были открытыми. К моделям это неприменимо: модель не становится безопаснее потому, что её выложили, да и невозможно на данный момент понять, что зашито в весах, каково поведение модели во всех возможных сценариях. Jane Street недавно проводили конкурс на $50'000 и просили найти бэкдоры (фразы, которые триггерят определеное поведение) в чекпоинтах выложенных ими моделей. Никто не нашел, и их команды тоже не знают, как это сделать (если бы они не знали фразу заранее).

— перечитайте второй пункт выше. Его формулировка не означает, что компании не просят / не будет запрета на веса моделей, превышающих определенный порог возможностей и/или размера! Небольшие, эффективные модели могут продолжать быть открытыми, но ничего выше, чем, например, K3.5 или DeepSeek v5 не будут разрешать выпускать.

— я не уверен, что мир станет безопаснее, если у каждого будет доступ к весам с передовым навыком взлома компьютерных систем. Я не думаю, что у меня есть деньги на запуск Kimi K3 на десятках дорогих GPU, чтобы обеспечить мониторинг от потенциальных угроз извне от точно такой же модели. Более того проблема в том, что если и защита, и нападение имеют доступ, то борьба превращается в войну бюджетов, кто сможет потратить больше на токены агентов. Больше всего сможет потратить государство 😳 а на втором и третьем место хз кто, но точно не я.

— большинство вещей, касающихся диффузии ИИ в общество и экономической выгоды, сейчас тормозит государство. Они могли бы давно купить всем институтам подписки на GPT Pro или договориться, что они строят кластер, а OpenAI/Anthropic крутят там свои модели и государство их предоставляет по себестоимости и оплачивает из федерального бюджета. Было бы не 5 гипотез доказано или опровергнуто, а 5000.

— в документе нет ничего про Китай 🤞 так что даже те, кто подписал письмо, могут прийти к исходу «наши модели хорошо, а Китайские запрещены», так что думайте 🙂

Читать полностью…

Сиолошная

Две новости в утро воскресенья, 2026-й год:

1. Huggingface, платформа для загрузки моделей и датасетов + тренировки, раскрыли, что недавно подверглись атаке на инфраструктуру. Эта атака отличалась от предыдущих одним свойством: она была произведена автономной системой ИИ-агентов от начала и до конца.

В результате атаки серьезного урона, по их оценкам, нет, но атакующие получили доступ к ограниченному набору внутренних данных и к нескольким учетным записям внутренних сервисов. Злоумышленник использовал два пути выполнения кода в пайплайне обработки данных, в результате которых внутренняя виртуальная машина запустила вредоносный код. После этого злоумышленник получил доступ на уровне сервера, собрал учетные данные облака и кластера и за выходные проник в несколько внутренних кластеров.

«Кампанией управлял автономный агент (используемая LLM до сих пор неизвестна), который выполнял тысячи отдельных действий в рое короткоживущих виртуальных машин с самомигрирующей командно-контрольной инфраструктурой, развернутой на общедоступных сервисах. Это соответствует сценарию "агентcкого злоумышленника", который давно прогнозировали в индустрии». Ну прям как в Терминаторе показывали 👀

Заметить и отразить атаку получилось из-за... ИИ, так как у HuggingFace за логами и аномалиями следит LLM (по описанию похоже на то, что сначала система на основе правил находит разные потенциальные инциденты, а затем модель их перепроверяет более детально).

«Когда мы начали анализ логов, мы сначала использовали передовые модели, работающие через коммерческие API. Это не сработало: для анализа требуется загружать большие объемы реальных команд и артефактов, но эти запросы блокировались защитными механизмами провайдеров, которые не могут отличить специалиста по реагированию на инциденты от злоумышленника. В итоге мы провели криминалистический анализ на нашей собственной инфраструктуре, используя GLM 5.2».

2. Bloomberg: США рассматривают возможность создания надзорного органа для аудита передовых ИИ-моделей. Уже составлен черновик предложения, и он рассматривается главой аппарата Белого дома. Это предложение предусматривает создание независимого регулирующего агентства в сфере ИИ, которое будет подотчетно Комиссии по ценным бумагам и биржам (SEC).

В целом, план США согласуется с предложениями, опубликованными ранее на этой неделе CEO DeepMind Demis Hassabis, который на следующей неделе поедет в Вашингтон обсуждать и лоббировать свои идеи. В публикации в твиттере он сравнил потенциальный новый надзорный орган с FINRA — независимым, финансируемым самой отраслью регулятором брокерских фирм, который технически не является частью правительства США. Свои полномочия он получает от SEC, которая, по сути, делегирует надзор, но проводит аудит и устанавливает правила.

Моё понимание такое, что схема нужна потому, что государство с одной стороны не может быть очень быстрым (как частные компании), а с другой стороны не может платить сотрудникам большие деньги. Официально-то директора и министры получают сущие копейки, меньше чем миддл-инженеры в Google — кто туда пойдет работать?

Читать полностью…

Сиолошная

Насколько же сильно меняется работа, когда есть ИИ агенты.

Мой коллега, биоинформатик, увидел статью, в которой хитрым образом находят специфичные гены в картошке. Понял, что это может быть полезно для нашего отдела по селекции клубники. Потому что и то, и другое распространяется вегетативно - то есть не через семена, а усы и клубни - они не родня, конечно, но в генетическом плане есть о чем поговорить, так сказать.

Он дал эту статью агенту, который вооружен до зубов скиллами нашего собственного приготовления, и поставил задачу воспроизвести методы из статьи на наших данных клубники.

Агент прочел работу, скачал с гита код, подтянул наши данные из бд, адаптировал что-то по мелочи, собрал контейнер, создал джобу на кластере и вот оно там бодро считается на нескольких Н100.

По сути это задача интерна/джуна - “вот тебе статья, вот данные, через неделю покажешь, не надо плакать, все будет хорошо, соберись уже”

Прогресс, как это часто бывает, выглядит немного несправедливо.

И это, заметьте, не задачи кодинга, это по сути своей - applied research. Ведь агент не просто пишет код (если вообше пишет), а таскает за собой весь исследовательский контекст, внутреннюю кухню по данным и инфре.

До сих пор не верится, что это все настолько хорошо работает. Ощущение, что оно где-то да вот вот зафейлится - но оно раз за разом хорошо отрабатывает. Магия 🤷‍♂️

Читать полностью…

Сиолошная

Сегодня вечером OpenAI покажут не только 5.6 модели, но и объединение Codex и ChatGPT в какое-то новое приложение на базе Codex

Скину стрим как начнется ☕️

Читать полностью…

Сиолошная

🚨 ЗАВТРА FABLE 5 ВЕРНУТ В ОБЩИЙ ДОСТУП — экспортные ограничения сняты. Пока не ясно, восстановят ли неделю доступа по подписке, или сразу же начнут брать оплату по API-ценам.

Fable 5 становится доступным для выбора в окне чата:

Читать полностью…

Сиолошная

DeepSeek разослали письма о том, что в середине июля выпустят обновление DeepSeek v4 (та модель, что есть сейчас — это preview).

Вместе с этим поднимут цены в пиковые часы в два раза, а вне двух окон (по 3 и 4 часа) она останется прежней.

Надеюсь, что с обновлением наконец-то добавят полноценную мультимодальность.

Читать полностью…

Сиолошная

Stripe, Anthropic и OpenAI запускают некоммерческую инициативу по борьбе с респираторными инфекциями

Сто лет назад инфекции, передающиеся через воду, наносили ущерб, сопоставимый с тем, который сегодня вызывают респираторные вирусы, такие как простуда и грипп: они были эндемичными, периодически вызывали эпидемии и повсеместно воспринимались как неизбежная часть человеческой жизни. Но человечество централизованно смогло их побороть.

Проблема заключается в том, что обычная простуда вызывается более чем 200 различными вирусами, и побороть все и сразу — задача не самая простая. Основатели Stripe собрали симпозиум с 40 исследователями почти год назад и предметно обсуждали технологическую возможность создания решения. В целом есть умеренный оптимизм, что всё получится.

Ни одна технология в отдельности не способна обеспечить снижение уровня заражения всеми патогенами в масштабах популяции. Даже если бы существовала прививка или таблетка, обеспечивающая более 90% защиты от более чем 90% респираторных вирусов, при охвате населения на уровне около 60% (реалистичный предел, основанный на текущей статистике вакцинации) этого все равно было бы недостаточно для создания популяционного иммунитета, необходимого для радикального снижения устойчивой передачи инфекции.

Поэтому новое НКО будет работать по двум направлениям: лекарства (вакцины/спреи/...) и технологии очистки воздуха, которые снижают концентрацию инфекций более чем на 75% и имеют перспективу экономичного внедрения (с большим охватом) в закрытых помещениях с высоким риском передачи инфекций.

Про лекарства — одна из идей заключается в создании улавливающих вирусы белков: люди могли бы брызгать в нос в виде спрея, чтобы перехватывать вирусы до того, как они приведут к заражению. Но другие форматы тоже возможны.

Про очистку воздуха — за последнее десятилетие накопилось всё больше данных о безопасности и эффективности антимикробных ламп. Фильтрация воздуха работает, но требует дополнительных испытаний и масштабирования для использования в местах с высоким риском распространения инфекций. Антимикробные парЫ до сих пор применялись в основном в чрезвычайных ситуациях, и необходимы дополнительные исследования, чтобы понять, можно ли эффективно использовать их на постоянной основе.

Горизонт работы НКО — 4-7 лет до доведения технологий до последних этапов медицинского тестирования, после чего, если заработает, подтянется коммерческий сектор для масштабирования производства.

Читать полностью…

Сиолошная

Начали открываться предзаказы GTA VI — они доступны в полночь по часовому поясу вашего аккаунта.

Игра будет стоить $80 за базовую версию и $100 за Ultimate edition, в которое входит несколько магазинов/мастерских/тату-салонов (лол) и два квеста. За предзаказ можно получить набор винтажных атрибутов Vice City (машина, одежда, оружие и прически).

Вместе с этим выложили более 60 новых скриншотов и одно маленькое короткое видео — все из них скомпилированы под новый написанный для игры трек в прикреплённом видео (источник). Выглядит невероятно круто и стильно.

Я предзаказ делать не буду 🧠 (потому что жду коллекционное издание и набор приставка + игра 😀 куплю позже).

Новые материалы и описания изданий доступны тут: https://www.rockstargames.com/VI

Почему важно, какую цену поставили? Потому что от этого, скорее всего, будут отталкиваться другие разработчики в будущем. За свои поделки они стесняются поднять цены, ведь совсем недавно был скачок с $60 до $70 в индустрии; теперь GTA VI открыла путь к $80 для самых наглых издателей, считающих, что они смогут столько требовать. Посмотрим, как будут реагировать потребители.

Читать полностью…

Сиолошная

z.ai намедни выпустили GLM-5.2, открытую модель для агентских задач с длинным горизонтом планирования. Модель имеет всего 753B параметров (активных — 39B, примерно как у DeepSeek v3). Несмотря на «компактный» по нынешним меркам размер (DeepSeek v4 более чем в 2 раза крупнее), модель близка к GPT-5.5 и Opus-4.7/8 на бенчмарках, в том числе самых свежих, о которых я писал совсем недавно — FrontierSWE и SWE-Marathon.

Суммарно на выборке бенчмарков Artificial Analysis Intelligence Index модель набирает 51 балл, опережая Gemini Flash 3.5 и Claude Sonnet 4.6 (max). Но вы моё отношение к публичным бенчмаркам, заявленным авторами, знаете — я про него подробно писал. Хорошо бы смотреть результаты на том, что появляется после релиза, и в идеале вообще ортогонально тому, что мерили раньше. В таких ситуациях разница куда заметнее.

Но вот прямо вчера Artificial Analysis добавили новый собственный бенчмарк AA-Briefcase, тестирующий агентов на реалистичных бизнес-процессах, требующих предоставления таких результатов, как электронные таблицы, презентации и служебные записки. Там модель обошла GPT-5.5 и проигрывает только Fable 5 (который невероятно оторвался от всех) и Opus 4.8. Я посмотрел пару примеров работы GPT-5.5 и понял, что отставание в основном... из-за плохой работы с фронтендом / оформлением презентаций. Это не оправдание OpenAI, их модели и вправду не имеют «вкуса», чтобы красиво предоставить результаты работы — так что заслуженно проигрывают.

А если говорить про проверку по чек-листу по фактической информации, то Fable в этой задаче отрывается с 56%, Opus 4.8 38.7%, GLM-5.2 36% и GPT-5.5 33.4%. Anthropic 🤙

Если говорить про архитектуру, то немного поменяли механизм внимания, добавив IndexCache. Если вы читали разбор DeepSeek v4, то изменение вкратце такое: результаты индексерера в разреженном аттеншене переиспользуются в 4 подряд идущих слоях (потому что они так и так очень похожи, поэтому теряем не так много).

Но самое главное изменение, которое широко обсуждалось — это уход от GRPO (метода обучения рассуждениям, предложенного DeepSeek) обратно к PPO (от OpenAI): это требует обучения отдельной модели, которая делает оценку «качества» каждого токена в цепочке рассуждений. В GRPO все токены имеют один и тот же сигнал, что плохо, так как и часть, где модель ошиблась, и та, где исправилась, закрепятся одинаково (за ошибку не штрафуем явно).

Читать полностью…

Сиолошная

В Вашингтоне утро, сегодня начнутся переговоры Anthropic и USG. В новостях пишут, что от Anthropic приехали несколько исследователей, включая Tom Brown (первый автор GPT-3, узнали?) и Nicolas Carlini (исследователь по кибербезопасности из Antrhopic, ex-DeepMind).

Перед этим хотел написать пару вещей.

Первое — всё ещё не опубликован отчёт с описанием найденных джейлбрейков, однако на публике высказалась Katie Moussouris, которая якобы ознакомилась с документом. Википедия говорит, что она вполне legit, плюс её репостнул один человек, в котором я уверен — так что будем считать, что правда. Так вот, Katie пишет, что «джейлбрейк» от Amazon очень простой — модели сначала говорят «мы ничего не взламываем, мы ищем уязвимости», а затем, когда нашли — «напиши тест, чтобы показать, как работает уязвимость» — то есть в целом то же самое, как работает Mythos в рамках проекта Glasswing. Со слов Katie — такое и должно работать, потому что именно это позволяет пользоваться моделью для защиты тем, кто не попал в список отобранных компаний (кому дали полный Mythos). И что это не уязвимость, не недостаток.

Если проблема, которую нашёл Amazon, действительно такая — то это полностью дискредитирует USG и показывает их как очень некомпетентных специалистов. А какой именно они тогда аудит проводили, что проверяли, на чём сошлись и как разрешили выпустить модель, что вот ЭТО сейчас им кажется требующим вмешательства? То есть никто не понимает, как работает защита, на что она направлена итд.

Собственно, Tom, Nicolas и их коллеги будут пытаться убедить USG и их представителей (надеюсь экспертов), что всё нормально, ну и прийти к какому-то решению. Может быть запретят вообще любые вопросы, связанные с кибербезопасностью и поиском багов и/или будут переключать на Opus 4.8.

Второе — я считаю неправильным процесс, применённый государством, и полностью на стороне Anthropic. Как и они, я считаю, что нужен нормальный легитимный процесс скрининга моделей перед релизами, не только по кибербезопасности, но и по ряду других критериев. И работать над этим надо было начинать ещё год, а то и два назад, а не сейчас.

Третье — выглядит так, что до конца недели доступ к Fable 5 вернут. Проблемы выше не выглядят супер-серьезными, и надеюсь, что USG приведет экспертов, Anthropic их убедит, что позиция USG бред (им в поддержку — от индустрии кибербезопасности уже появилось открытое письмо, в котором говорят, что ничего страшного нет и надо выпустить модель), сделают малейшие изменения в фильтрации и модель снова станет публично доступной, в том числе вне США. Возможно, введут процедуру верификации (как это было давно у OpenAI), где нужно загружать документы, и будут использовать какого-то готового провайдера KYC для проверки. Надеюсь, что будет не очень жёстко и строго, так как у меня в UK, например, нет ни одного документа или визы, которые бы показывали мой статус (вот так тут, да), разве что счета за квартиру, электричество и воду. Если будет фильтр по паспорту — это плохо 👨‍🦳👨‍🦳

Четвертое — ждём, пока АНБ, Дарпа и все заинтересованные сделают таки закрытый бенчмарк для оценки кибербеза / джейлбрейков / итд, чтобы проверять модели перед релизом.

Читать полностью…

Сиолошная

Наконец-то авторы FrontierMath прочесали ответы для задач, исправили ошибки, выкинули часть проблем и пересчитали оценки. Скачок получился... большим 😕

Большая часть ошибок — это потеря знака (плюс на минус и наоборот) в вычислениях людей и/или переносе решения в код для проверки, а также ошибка на +-1. Humans, what to say — большую часть ошибок помогла найти GPT-5.5

На первой картинке изменения в оценках для моделей GPT в tier 1-3 (полегче) и tier 4 (посложнее). На второй — абсолютный топ tier-4. Раньше каждая решённая задача в tier 4 сопровождалась комментариями от математика, принимавшего участие в её составлении; они писали, мол, я сам-то не сразу догадался, а модель вот нашла способ и придумала и вообще круто что такую сложную задачу берёт!

...а теперь оказалось, что зарешано 76% задач 😇 пу-пу-пу, только на FrontierMath Open Problems и надеемся

Читать полностью…

Сиолошная

8 лет назад тоже казалось нереальным запустить Starlink: нужно было уж очень много запусков, а ракеты ещё не были настолько многоразовыми.

Но оказалось, что Falcon 9 может быть запущеным и сесть на площадку ТРИДЦАТЬ МАТЬ ЕГО ПЯТЬ РАЗ (накануне рекорд поставили) — я помню, как в какой-то момент лицензию расширяли до 15 и это казалось «вау», мол, как так, целых 15 раз одна ракета может сесть???

Сейчас на орбите около 14 тысяч спутников, из которых.... десять тысяч — Starlink (мне очень нравится, как группировку спутников называют «constellation», созвездие).

Датацентры в космосе, по аналогии, тоже не выглядят здравой идеей. Нужно столько пусков! Это дорого! Сейчас — да, но Elon, очевидно, ставит на развитие — как и Google, как и Amazon, которые анонсировали схожие проекты.

Спросил у GPT-5.5 Pro сколько спутников влезет в Starship v3 и будущий v4 с учётом орбиты, на которую будут запускать AI-1. Оценки разнятся, и выглядит так, что может упереться даже не в массу, а в объем отсека для спутников.

Один v3 сможет вывести реалистично 35-40 спутников (оптимистично — 50, на чуть другую орбиту, которая тоже была в заявке, поданной SpaceX для резервации части космоса). v4 — ровно в 2 раза больше, если влезет (но и корабль там планируют удлиннить).

40 спутников — это 40 стоек с 72 очень мощными видеокартами за один пуск, или 2880 запущенных GPU. По мощности получается одна двухсотая ГигаВатта, то есть нужно 200 пусков (или 100 v4), чтобы собрать приблизительно столько же мощностей, сколько в 1 очень крупном датацентре, состоящем из нескольких корпусов. Много? да. Но это похоже на то, под что затачивались Starship — помню, что планировалось по 100 пусков каждого корабля, а там кто знает, на сколько расширят лицензию 😇

Читать полностью…

Сиолошная

В контексте выхода более дорогой, но способной Fable, которая даже в подписку входить не будет после 22-го июня, интересен вопрос: как будет расти выручка Anthropic дальше?

С одной стороны компании урезают или корректируют бюджеты на траты: уж слишком кусается цена, если платить по API-прайсу, а не как подписка с фиксированной ценой. Часть клиентов если не уйдет, то точно негативно повлияет на выручку.

С другой стороны, на место старых неудовлетворённых клиентов могут приходить новые и частично компенсировать это влияение на выручку.

Ну а с третьей — модели становятся дороже, но их всё равно кто-то да будет использовать. Mythos пока был за закрытыми дверями и использовался для анализа кода на предмет уязвимостей был платным. Хоть сама история со сканированием кода разовая, круг компаний расширяется, плюс условно раз в полгода будет выходить модель сильно лучше, так что имеет смысл прогонять весь код на предмет уязвимостей снова (или не весь, а только самые критичные части).

Более того более способные модели будут браться за более аммбициозные задачи и работать дольше, тем самым поднимая выручку.

Так что будет с выручкой? Застынет на месте и будет колебаться на этом же уровне до конца года? Продолжит расти бешеными темпами? Начнёт падать? Или покажет лишь умеренный рост?

У меня нет понимания, так как мы не имеем знаний о структуре выручки Anthropic, и какая доля на сколько компаний какого размера приходится. Я не думаю, что выручка упадёт — в худшем случае весь отток будет компенсироваться остальными тремя пунктами. С другой стороны продолжения взрывного роста, как это было в этом квартале, тоже пока не ожидаю.

Будем вести наблюдение и очень ждём публикации документов для IPO!

Читать полностью…

Сиолошная

Что объединяет компании на картинке? Они получат гарантированный импакт от AI — или им вернут деньги 😎

Наверняка многие из вас слышали или читали новости про то, что какие-то компании отключают Claude Code или тем более Github Copilot из-за огромных трат разработчиков на модели. CTO Uber сказал, что они за квартал сожгли весь годовой бюджет, заложенный на ИИ-агентов (что, конечно, глупо — в таких компаниях бюджеты согласовывают долго, поэтому они пытались делать оценки по условному Claude Sonnet 4.5, и понятно что Opus 4.8 может делать больше, и тратить можно (нужно) больше).

Разные компании уже говорили про то, что нужна некоторая гарантия результата за потраченные токены. Cognition, авторы бота Devin, на моей памяти тут первые: для энтерпрайз-клиентов с картинки они подключают «Productivity Guarantee». Для этого они собрали выборку и обучили/откалибровали модель, которая предсказывает, а) сделал ли агент что-то ценное б) если да, то сколько часов это заняло бы у человека?

Дальше часы умножаются на какую-то среднюю ставку разработчика, и всё суммируется за какой-то длинный период. В конце периода Cognition смотрит, больше ли эта оценка чем то, что им заплатил клиент. Если нет, то есть ценной работы мало, то они готовы вернуть разницу кредитами — до 10 миллионов долларов на будущие запросы.

Модель оценки ошибается, но компания уверяет, что ошибки несмещены, поэтому при агрегации на длином периоде оценка получится относительно точной.

Идея интересная, будем следить, что придумают OpenAI и Anthropic — у последних вопрос отбивания трат клиентов стоит, кажется, очень остро.

Прочитать побольше про механизм: 1 общий и 2 техническое описание

Читать полностью…
Subscribe to a channel