Qwen3.8-27B на DGX Spark: обогнал Sonnet 5 в PAC-1 и стал быстрее.
Ваш покорный слуга искал способ, как усокрить работу модели. 12-18 токенов в секунду, это конечно очень мало. Плюс есть префилл, хочется немного быстрее получать результат.
Нашёл инструкцию на официальном форуме https://forums.developer.nvidia.com/t/qwen3-8-27b-at-34-38-tok-s-on-dgx-spark-open-source-one-command-setup-sglang-nvfp4-dspark/380257
Это вариант спекулятивного декодинга, когда для предсказания токенов берётся отдельная модель.
📏 Что по статистике
Автор приводит свои замеры:
llama - 27 т/с
vLLM - 24 т/с
SGLang - 34 т/с
Я решил что хочу 34 т/с и пошёл тестировать.
На русском языке получилась деградация, но если работать с кодом или JSON будет очень приятный рост. Прикладываю статистику.
⚠️ Проблема с шиной никуда не девается
Префил по прежнему долгий, на длинных инструкциях первого токена прийдется ждать прилично, но всё равно быстрее чем префилл на vLLM.
Первый токен за 250 мс, а не за 1500 для русского текста.
🔥 Прогнал PAC-1 и модель обошла Опус
Когда начал тестировать генерацию JSON и программирование, то впервые увидел 72 и 44 ток/с. На Nvidia DGX Spark это очень круто. Решил запустить бенч PAC-1 и модель обогнала Opus 4.8.
Скорость прогона обошла наивный запуск без декодинга в 2 раза: уходило по 100 минут на прогон, но это всё равно долго в сравнении с Qwen 3.6 35b a3b. Но взаимодействие в задачах кодинга стало приятнее.
😀 Забавно, что код на питоне генерируется быстрее кода на TypeScript (см. скриншоты)
В канун возвращения пятичасовых лимитов Codex вышло интервью Тибо.
Конкретно в моем кейсе именно пятичасовые лимиты являются причиной вылета в экстра юз в Claude. В результате расходы на Антропик у меня больше 200 баксов. Так что ждём, что расходы на Codex тоже вылезут за пределы лимиты подписки.
Yandex Ecom Open Air: Алиса, агентная коммерция и ставка Яндекса
Сходил на Yandex Ecom Open Air. Агентная коммерция — главный лейтмотив дня, про неё говорили и с большой сцены, делали прогнозы. Был ещё обзор Яндекс.КИТ, но мы с вами интересуемся агентами, поэтому поговорим про неё.
🤦🏻♂️ Отдельная ирония: заявку, в которой я указал, что связан с рынком ИИ, на этот фестиваль отклонили.
1️⃣ Что показали по Алисе AI
Ассистенту обещают прокачать память о пользователе, ризонинг и вызов инструментов. Идеальный сценарий, чтобы агент искал за пределами пользовательского запроса. Предлагал лучшие альтернативы. Надеюсь это не будет очередным засильем нестрогого рекламного таргетинга.
2️⃣ Модели у экосистем
Со сцены прозвучало наблюдение: на западе модели принадлежат независимым компаниям, в России — экосистемам. Отдельным пунктом шёл большой объём данных о пользователях как преимущество.
Для качества подбора данные и правда преимущество. Вопрос в том, кому принадлежит ассистент и нет ли конфликта интересов между пользователем и владельцем агента. Для качества подбора данные и правда преимущество.
Яндекс владеет моделью, Маркетом, платежом, доставкой и рассрочкой. Маркировка рекламы уже есть, а вот маркировку агентных рекомендаций пока не придумали, получаем вопрос доверия.
🤔 Моё скромное мнение
Наблюдая за стараниями Яндекса в популяризации агентного екома, ваш покорный слуга уверен в популяризации потребления через ИИ-агентов. Разработчикам MCP стоит готовиться к поддержке всех возможных протоколов, так как у нас уже есть большое разнообразие идей от разных игороков. Скромные прогнозы Data Insights — 11% российского екома у агентов к 2032 году.
Что думаете вы? Уже делали покупки через ИИ-агентов? Доверили бы выбор каких-нибудь товаров ИИ?
----
Поляков считает — AI, код и кейсы
Qwen3.8-27B на DGX Spark: балл как у Sonnet 5, скорость как у стажёра
Гоняю новую dense-модель Qwen на коробке под столом. Результаты противоречивые ровно настолько, чтобы о них стоило написать.
🏆 Агентный бенчмарк: вровень с фронтиром
Прогнал PAC1 — набор из 43 агентных задач. Qwen3.8-27B в режиме reasoning xhigh выдал 90,7%. Ровно столько же, сколько Claude Sonnet 5. Больше, чем у DeepSeek V4 Pro на 1,6 триллиона параметров (89,9%).
И это всего лишь 27 миллиардов параметров. Локально. Без интернета.
🐌 А теперь цена
Sonnet 5 прошёл бенч за 27,8 минуты. Qwen3.8-27B — за 3,4 часа. Скорость генерации — 10 ток/с. Прикрутил спекулятивный декодинг MTP-3, стало 18 ток/с.
Первая мысль была «криво настроил, надо тюнить дальше». Потом прикинул по формуле — оказалось, виновата шина:
📐 макс. ток/с = пропускная способность памяти / размер активных весов
🤔 Переключение Контура засекла только модель с ризонингом — интересно, почему? Но каждый раз путалась в показаниях: то описывала включение, то отключение. Как будто дробление на кадры происходит случайным образом. Видимо, тумблер размером 40 пикселей — это шум для EVS при нарезке кадров на токены.
Скилл нужен даже когда у вас уже есть MCP и CLI
В прошлом посте рассказал про анатомию скилла. И вот мы уже пишем в нашем агентстве скиллы профессионально, вроде бы все всё поняли. Но внезапно приходит разработчик и спрашивает:
🙋🏻♂️ Вообще я слышал, что сейчас надо всё упаковывать в CLI, почему мы делаем эти скиллы для управления Яндекс.Директом а не MCP/CLI-утилиты.
doctor.py: проверяет установлен ли crawl4ai, скачан ли браузер, отвечает ли целевой домен.
Субагенты вместо скиллов: ходим по кругу управления агентами
Настраивал OpenClaw на Mac Mini и понял неочевидную вещь: для домашнего бота скиллы — это перебор.
🏠 Проблема со скиллами
Реальный пример. У меня скилл для заказа гостевых пропусков в УК. Он должен поддерживать задержки через lock-файлы, работать с несколькими модулями приложения. Добавляю загрузку квитанций — надо обновлять скиллы и на виртуалке, и на Mac Mini.
Потом добавляешь скилл для ВкусВилл, для стрижки в ТопГане, для парковки — и ты уже менеджер по поддержке скиллов. CI/CD для домашнего бота. Серьёзно?
🤖 Решение: агент-специалист
Тут меня осенило, что гораздо проще создать субагента со своим воркспейсом и контекстом. «Швейцар» отвечает за дом: пропуска, паркинг, новости УК. «Парикмахер» — за запись на стрижку. Главный агент просто делегирует:
sessions_spawn(agentId="barber",
task="Запиши на стрижку в ТопГан")
💡 Поддерживать одного агента-специалиста проще, чем синхронизировать пять копий скилла. Агент живёт в одном месте, любой бот его вызывает
"agents": {
"list": [
{ "id": "main", "default": true,
"subagents": {
"allowAgents": ["doorman", "barber"]
}},
{ "id": "doorman",
"workspace": "~/.openclaw/workspace-doorman" },
{ "id": "barber",
"workspace": "~/.openclaw/workspace-barber" }
]
}
🤔 Конечно было бы полезнее, если бы платформа предложила какую-нибудь CLI для пользователей. Если есть контакты топов из YClients — познакомьте, давайте сделаем агентный инструмент для записи в салоны.
Мак Мини, 100 рублей в неделю и никаких ограничений с лимитами для OpenClaw
Когда настраивал Мак Мини как агентную машину, понял, что хочу три вещи: никакой аффилиации с моими основными аккаунтами, никаких проблем с РКН и такой IP, который ни разу не светился в моих запросах к провайдерам.
Логика простая: если кто-то мониторит злоупотребления подписками, мой основной аккаунт вообще не должен быть рядом с этой историей.
🛠️ Инструмент: CLIProxyAPI
Нашел CLIProxyAPI — API-шлюз, который оборачивает CLI-клиенты (Claude Code, Codex, Gemini CLI) в совместимый с OpenAI/Anthropic API-интерфейс. Развернул его на виртуальном сервере в район Лос-Анджелеса.
Главная фича — «карусель» аккаунтов: добавляешь несколько файлов авторизации, и шлюз раздаёт запросы по кругу. Ни один аккаунт не перегружается.
🤔 Правда мне кажется, что за один и тот же кеш в запросах с разными ключами можно и спалиться.
Неделя в Claude Cowork: что я понял про офисных агентов
Решил провести эксперимент — замкнуть все рабочие процессы на Cowork. Именно офисную рутину: аккаунтинг проектов, запросы клиентам, работу в MS Word, Excel, DataLens. Вот прям вообще не использовать, все задачи решать в коворке. В начале было больно.
Почему Cowork, а не Claude Code? Ищу форму идеального офисного агента — где ломается логика и нужны руки, что предолжить добавить в ValeDesk — я верю в опенсорс обвязки.
🔥 Три инсайта
1️⃣ Скиллов нужно на порядок больше, чем кажется. БД, Битрикс24, DataLens и т. д. — каждый процесс требует своего скилла. Жду, когда компании начнут выпускать CLI-обёртки, как Google Workspace.
😀 Сначала все делали сайты/интерфесы как не в себя — теперь будут делать CLI.
env -u CLAUDECODE) — в терминале спавнишь субагента со своими агентами, а в Cowork нельзя. Всегда по правилам Антропика.
Google выпустил CLI для всех офисных программ — со скиллами для агентов
Кстати, если вы пропустили: Google наконец выкатил единый CLI для всех своих офисных приложений — Диск, Gmail, Календарь, Таблицы, Докумерты и остальных. Репозиторий сразу содержит 100+ скиллов для агентов.
🔑 Что это значит на практике
Раньше, чтобы агент работал с вашим Google Drive или почтой, приходилось самому писать скилл или искать чей-то MCP-сервер. Разбираться в API, получать ключи, обходить лимиты. Теперь компания-владелец сервиса сама предоставляет готовый агентный интерфейс.
Вопрос авторизации решается через авторизацию самой утилиты: gws auth setup, один раз логинишься — и агент получает доступ ко всему.
Примечательно, что не забыли и про OpenClaw — в README отдельная секция с инструкцией по подключению скиллов к нему.
📢 Яндекс, ваш ход
Представьте: единый CLI для Директа, Метрики и Wordstat со скиллами для агентов. Сейчас каждый пишет свои обёртки, мучается с токенами и лимитами. А мог бы быть ydx direct campaigns list — и агент сам смотрит кампании.
💡 Тренд: компании-владельцы API сами создают агентные интерфейсы к своим продуктам. Во-первых, так можно влиять на пользовательский опыт, во-вторых снизить нагрузку и неудачные вызовы.
Подписываюсь под словами Паши.
Почти все платформы сейчас поддерживают бережное отношение к контексту и динамическую подгрузку: скиллы, вложенные правила для субдиректорий, path-based фильтры.
Для AGENTS.md оставляем только генеральные правила, общие для любой задачи проекта. Остальное разруливаем скиллами и вложенными правилами.
У вас есть скиллы. Как собрать из них агента?
Вижу один и тот же вопрос: «У меня набор SKILL.md — как дальше? Завернуть в ТГ-бот, дать API модели и пусть работает?»
Да, примерно так. Можно попытаться написать своё решение, можно взять готовое — но на выходе получится примерно одно и то же: рантайм, изоляция сессий, разрешения для команд, sandbox. Эти паттерны уже реализованы в двух популярных open-source решениях:
🔸 OpenClaw (https://github.com/openclaw/openclaw) — TypeScript, 22+ канала, 13 700+ скиллов в реестре. ~1 ГБ RAM, зато из коробки всё: голос, heartbeat, веб-поиск, браузер.
🔸 ZeroClaw (https://github.com/zeroclaw-labs/zeroclaw) — Rust, бинарник 8,8 МБ, <5 МБ RAM, старт за 10 мс.
Оба работают со скиллами в папках, но форматы отличаются. OpenClaw читает SKILL.md с YAML-фронтматтером, ZeroClaw — либо SKILL.toml (манифест), либо простой SKILL.md без фронтматтера (description берётся из первой строки). При переносе скиллов из OpenClaw в ZeroClaw — убирайте `---`-блок или конвертируйте в SKILL.toml.
👥 «Бот путает контексты разных юзеров»
Одна строчка в конфиге OpenClaw:
"session": { "dmScope": "per-channel-peer" }
agents.list, каждый со своим USER.md и SOUL.md. Подробности — в документации по сессиям.[autonomy] в конфиге:
allowed_commands = ["curl", "git", "ls", "cat"]
block_high_risk_commands = true
git pull, но не rm -rf /. Опасные действия можно привязать к TOTP-подтверждению.
2. Как выиграть в AI безумии обычным людям
Пост в первую очередь для не технических специалистов. Картинка постепенно сходится, многим уже рассказывал лично, давайте сюда тоже напишем.
Ключи от новой эпохи агентов будут у людей, в которых совпадут две суперсилы. Не одна, а именно две. И это не только про разработчиков - вообще про любую профессию.
Первая суперсила - ваш опыт.
Ваши 5, 10, 15 лет в профессии. То, что вы заработали потом и кровью и что нельзя скачать, посмотреть на ютубе или прочитать за выходные.
Например, вы лучше всех умеете проводить маркетинговые кампании. Или анализировать финансовые отчёты и сразу видеть, где у компании больное место. Или строить стратегию развития отдела техподдержки на следующий год. Или вы талантливый менеджер проектов, и умеете запускать проекты в срок. Возьмите абсолютно любую прикладную профессию - если вы разбираетесь в ней, это уже огромное преимущество.
Вторая суперсила - AI-флюенси (AI-Fluency/AI-Native)
Тут люди обычно думают, что это про промтинг в ChatGPT. Нет, это другое.
AI-флюенси - это умение общаться с агентами на их языке и добиваться нужного результата итеративно, а не сдаваться после первого плохого ответа. Это умение писать скиллы под свои задачи - инструкции для агента, которые заставляют его делать именно то, что нужно вам, а не то, что он сам придумал. И в целом - понимание того, как агенты устроены: что такое контекст, почему он ограничен, как работает память, что такое тулзы. Ведь локальный агент, это не волшебная коробочка, а просто машина с не самым сложным движком внутри.
Почему важны оба компонента?
Выпускникам вузов только предстоит накопить тот самый опыт, а времени на это сейчас катастрофически мало. Опытный специалист без AI хорош в своём деле, но его коллега с агентами делает ту же работу кратно быстрее. А человек, у которого есть и то, и другое, знает как выглядит правильный результат, раскладывает сложные части своей работы в скиллы, управляет командой агентов и постепенно уходит в отрыв, еще и ускоряясь по мере роста качества моделей.
Лёха, что конкретно делать?
В этом месте обычно появляется ссылка на курс за 50к, но все намного проще. Даже никакого IQ выше 120 не нужно. Единственное, что от вас потребуется - время. Честно, не мало времени: это месяцы проб и ошибок. Но в конце вы обгоните 90% опытных людей в своей профессии просто потому, что освоили то, что большинство боится или хочет даже попробовать. Никакие деньги и курсы на ютубе вас не сделают AI-Fluent, только время и упорство.
1. Скачайте Codex App (ссылка) - у него есть стартовый бесплатный лимит, а потом даже если нет карты, можно покупать аккаунты за 350р на таких сайтах. Единственное, что будет нужно - VPN.
2. Возьмите один процесс из своей работы или жизни, обсудите с агентом, пусть у него что-то получится с вашей помощью - проанализировать отчет, создать презентацию, написать статус за неделю по проекту на основании дейли статусов.
3. Скажите: "теперь помоги написать для этой задачи скилл". Он напишет вместе с вами. Затем скажите "установи этот скилл", и начинайте делегировать ему задачу. Не справился - улучшайте скилл итерационно, пока агент не начнёт делать эту часть вашей работы нормально. Скилл (SKILL.md) - это просто текстовый файлик с описанием процесса и пачка скриптов, по сути дистилляция вашего опыта.
4. Начинайте копить именно вашу личную базу скиллов, она вам пригодится, где бы вы не оказались. Агентские фреймворки будут улучшаться, а ваши скиллы вы сможете просто переносить из одного в другой, включая и отключая по желанию.
5. В ближайшем будущем нас всех ждёт трансформация от выполнения работы руками к делегированию её агентам и присматриванию за этой виртуальной командой. Но туда не попасть, пропустив шаги из списка выше.
Вот и весь секрет.
Так что крутые ребята на опыте - не грустите, для вас открылся золотой век.
#aifirst
ИИ, как способ диприсерчить скидки в российских магазинах
В продолжение темы отечественной агентной коммерции нашел способ находить скидки за счет маркетинга Алисы.
Запускаем поиск «Найти дешевле» в приложении Алиса AI и если выпадут партнеры подключившие Яндекс Пэй — будет скидка. Проверил на поиске диктофона, получил крупную скидку от рестора.
💸 На Авито его же можно найти за 20 000₽, но зато Рестор.
🤦🏻♂️ Из минусов, обязательно дать ссылку на товар, простым текстом Алиса не принимает запросы. Это конечно не очень агентно, но простительно.
Три протокола агентной коммерции: кто кого контролирует
За полгода появились три протокола, позволяющие ИИ покупать товары от имени человека: ACP от OpenAI и Stripe (сентябрь 2025), UCP от Google и Shopify (январь 2026), и вчера — YCP от Яндекса. Плюс десятки MCP-серверов для отдельных магазинов (вроде ВкусВилл).
Когда я вижу новый протокол, я не читаю пресс-релиз. Я смотрю на роли: кто покупатель, кто продавец, а главное — кто между ними и сколько власти у каждого.
🎭 Роли в агентной коммерции
В обычном e-commerce всё просто: покупатель и продавец. В агентном — между ними появляются посредники:
🔸 AI-провайдер — чей ИИ общается с покупателем (ChatGPT, Gemini, Алиса)
🔸 Платёжный провайдер — кто проводит деньги (Stripe, Yandex Pay, Visa)
🔸 Платформа — где живёт магазин (Shopify, KIT, 1С-Битрикс)
🔸 Владелец протокола — кто написал правила игры
🔸 Разработчик агента — кто-то кто создал своего агента поверх протокола
И вот тут начинается самое интересное.
🔍 Кто совмещает роли
В ACP роли формально разнесены: OpenAI делает ИИ, Stripe — платежи, Shopify — платформу. Спека открыта (Apache 2.0). Но нюанс: Instant Checkout в ChatGPT — только для одобренных партнёров, платёжный токен пока только через Stripe, а механизма discovery для внешних агентов ещё не существует. Спека открытая, канал — «по приглашениям».
В UCP Google разделил роли сильнее: 4 транспорта (REST, MCP, A2A, крипто-мандаты), 20+ партнёров включая Visa и Mastercard. Мерчант публикует манифест на /.well-known/ucp — это как robots.txt, только для ИИ-покупателей (пример https://store.moma.org/.well-known/ucp). Архитектурно — самый открытый. Но в продакшне пока тоже только Google AI Mode.
В YCP Яндекс — одновременно AI-провайдер (Алиса), платёжка (Yandex Pay), платформа (KIT) И владелец протокола. Четыре роли в одном. Спека закрыта, MCP не поддерживается, внешних агентов нет даже в теории.
💡 Все три протокола — lock-in, вопрос лишь в жёсткости замка. YCP — железный засов (только Алиса). ACP — дверь открыта, но на защелке. UCP — ближе всех к реальной открытости, но пока тоже один работающий канал.
🎯 Вот главный гэп: все три протокола заточены под связку «продавец → ИИ → покупатель». Но никто не строит протокол от лица покупателя — чтобы мой агент ходил по магазинам с моими требованиями и договаривался на моих условиях. Пока ближе всех к этому UCP с его Agent-to-Agent транспортом, но реализаций я пока не видел.
Похоже, Cowork станет моим новым Экселем, когда исполнят фичреквест
Anthropic добавили планировщик задач в Claude Cowork. И кажется, что часть моей, и не только моей, рутины теперь уйдёт. Правда в начале надо дождаться, чтобы они добавили отложенные задачи, я отправил фичрекверст: https://github.com/anthropics/claude-code/issues/28952
Без этого самый удобный кейс пока будет работать как сжигатель токенов, думаю это не на руку ни Антропикам, ни пользователям подписок. Об этом ниже.
🗓️ Моя боль
Каждый месяц 25 числа я должен аппрувить или составить медиаплан на будущий период. Ритуал: открыть DataLens, посмотреть как шли кампании, проверить сезонность, оценить куда движется рынок, свести всё в таблицу.
Я давно подрядил под это Claude Code. Минус — его надо запускать руками. И да, я ни разу не настроил cron на своём макбуке. Наверное, я просто люблю интерфейсы.
Теперь всё проще: /schedule в Cowork — и Claude сам каждый месяц пишет черновик медиаплана, подсвечивает рыночные инсайты и делает ревью по динамике. Ковырять дашборды теперь требуется реже.
💡 К слову ежемесячного выполнения не завезли, чтобы его достичь надо добавлять в еженедельную проверку, является ли текущая неделя последней в месяце с каскадом сложных формул для коротких недель.
CLAUDE.md, ту же папку открыл в Cowork, все навыки на месте, у меня теперь готовый агент аудитор медиапланов.💡 Для таких задач элементарно ложится фидбек-луп: пусть Claude пишет результаты и заметки в файл, и корректирует при замечаниях пользователя. При следующем запуске он учтёт ваши правки. Обучение агента происходит через файл.
Вышло первое большое видеоинтервью с Тибо Соттио — тем самым человеком из OpenAI, который нажимает кнопку сброса лимитов Codex. Я сделал полный перевод и саммари:
Кратко о главном из разговора с Мэттью Берманом:
— Тибо пришёл в OpenAI из DeepMind, где за год до ChatGPT уже был внутренний чат-продукт, который Google побоялась выпускать. Его вывод: культура решает
— у OpenAI исследования и продукт проектируются вместе, а идеи доводятся до релиза очень быстро.
— Слияние ChatGPT и Codex не маркетинговый ход: будущие модели сами требуют объединения. Цель — персональный AGI с интерфейсом, который подстраивается под человека. «Вы и ваша мама будете пользоваться одним и тем же продуктом».
— Сбросы лимитов начались как компенсация за сбои, а не как акция. Решение не согласуется ни с маркетингом, ни с финансами: «я могу нажать кнопку, когда почувствую, что это правильно». И да, физическая кнопка существует.
— Luna подешевела на 80%, потому что фронтирные модели оптимизируют инфраструктуру, на которой сами работают. Тибо называет это формой рекурсивного самоулучшения. Скорость ответов за три месяца выросла примерно на 60%.
— Режим ultra fast (до 14× быстрее) внутри OpenAI выдают не всем: мощности резервируют для клиентов, а внутри он нужен при инцидентах. Через год-два такие скорости станут почти стандартом.
— «Через два-три месяца Codex покажется примитивным»: следующему поколению моделей тесен ноутбук — облачные агенты, параллельная работа, голос.
В статье — саммари подробнее и полный перевод всего интервью: от культуры OpenAI и конкуренции с Anthropic до паузы в обучении фронтирных моделей и СДВГ Тибо.
👉 Первое большое интервью Тибо Соттио из OpenAI: саммари и полный перевод
Был нормальный SEO-спец, познакомился с ИИ, стал ужасным
У меня в Металлик и Ко есть команда SEO-специалистов на аутсорсе, которые медленно прокачивали довольно «сложный» сайт к росту трафика. За 2 года органический трафик стал x3 вообще без переделки структуры (с 2 800 до 10 000 визитов). Поэтому считаю их молодцами и периодически хвалю.
🔗 Сложный сайт: metallik.ru
Ребята реально поняли, что сайт нестандартный, придумали, как ему добавить «магазинности», создали категории тегов товарам, информационные статьи: у сайта растёт Share of Voice. Короче, всё вроде красиво.
Но вот к ним в руки попал ИИ (я узнал его по первой строчке в техзадании по антитезе) — и понеслась.
🤦🏻♂️ На что я прифигел
Прилетает рекомендация на доработку раздела профнастила, а там просто лендинг на 26 экранов с отзывами и энциклопедией профлиста.
Выглядит всё нормально и профессионально. Прям убедительно. Таблица, в которой написано, что людям нужны отзывы, они их ищут (лол, что в Гугле) и надо такой экран обязательно. Рядом ответы на главные вопросы, в том числе про снеговые нагрузки. Это очень важно для качественного сайта. И таких 26 экранов.
Но прикол в том, что нормальный человек под каждым пунктом будет спорить:
— 26 экранов на листинге товаров? Это же дофигища, вы куда?
— Отзывы у себя на сайте продавец модерирует сам, доверия к ним меньше, чем к карточке в Яндексе. Отдельный экран под них на листинге — точно не первое, что стоит делать.
— Ребята, у нас вообще-то интернет-магазин на шаблонах, а не лендинг: для нас исправление одной категории профлиста эквивалентно исправлению всех категорий на сайте.
И можно продолжать долго. Короче, проблема ИИ в продвижении в том, что он представляет собой кальку всего успешного успеха, который только можно встретить.
⚠️ На моём опыте есть ряд сфер, где ИИ ужасен
Раньше я любил говорить, что у ИИ есть три области, в которых он из коробки очень плох:
1. ИИ-агенты
2. Реклама в интернете
3. Сайты на PHP
Теперь к списку хочется добавить SEO. В целом эти проблемы предсказуемы и легко объяснимы:
ИИ-агенты, способы их конфигурации, настройки и построение обвязок — это тема 2025–2026 годов. В интернете пока мало материалов на этот счёт, поэтому ИИ часто использует устаревшие идеи.
Реклама в интернете — достаточно старая отрасль, но вся состоит из материалов про успешный успех: как компания-подрядчик включила ретаргетинг/автостратегию/размещения у микроблогеров и какая-то метрика полетела.
Сайты на PHP и материалы, связанные с ними, полны примеров плохих экспериментов и неудачных решений.
SEO туда же. Ключевая мысль тут, что в таких областях надо дополнительно отгружать в ИИ свои знания и свою доменную экспертизу. Какие действия работают, что в рекламе хорошо, как мы пишем и делаем сайты на PHP. Не надеяться на то, что кто-то натренировал ИИ на идеальную рекламу. Не натренировал.
🚀 Сначала отгружаем свою экспертизу и уже на неё зовём ИИ
Прежде чем просить рекомендации, я кладу в контекст четыре вещи: как устроен проект, что физически нельзя поменять, что мы уже пробовали и с каким результатом, по каким правилам принимаем решения. Для «Металлик и Ко» второй пункт звучит буквально так: правка одной категории равна правке всех категорий сразу.
С таким брифом лендинг на 26 экранов просто не рождается. ИИ видит ограничение платформы и предлагает то, что можно раскатить на весь каталог, — а это как раз то, за что я хвалил ребят два года.
🎯 ИИ не знает вашу отрасль. Он знает, как о ней принято писать в интернете. Поэтому и сыпется ровно там, где публичные материалы состоят из кейсов «включили автостратегию — и всё полетело».
Вайбкодер и вайб-дизайнер — это разные люди, и жаль
Весной я писал, что профессия верстальщика сайтов попала под давление: сайт теперь собирается за вечер. Три месяца спустя я насмотрелся на результаты и хочу вам пожаловаться.
🍪 Кейс 1. Баннер согласий, который съел статистику
Клиенту переделали сайт. Фирменная черта исполнителя — выкатывать сразу в продакшен: сайт ему проверил GPT-5.6 Sol и сказал, что всё хорошо.
Сразу после выкладки — деградация трафика в Метрике. Оказалось, модель заодно провела терраформирование сайта под европейскую юрисдикцию (GDPR): повесила плашку согласий, которая блокирует Метрику и Calltouch до акцепта.
Проблемы две.
1️⃣ Юридическая. Требование «не грузить счётчики до согласия» — это ePrivacy и GDPR. В 152-ФЗ такой нормы нет, но есть пункт про «явное согласие», который всё портит, разбираемся.
У бизнеса есть законный интерес: считать окупаемость рекламы, отбивать спам, понимать, где ломается сайт. При этом мы не звоним человеку без спроса и не отдаём аудиторию третьим лицам.
Я предлагаю рассуждать про куки с позиции борьбы со спамом: капча — тоже кука. Заблокировали сторонние — тонем в спаме.
Формулировка, которая закрывает вопрос:
🔑 Мы используем файлы cookie, Яндекс Метрику и Yandex SmartCaptcha для анализа посещаемости, противодействия спаму и улучшения работы сайта. Обработка осуществляется в целях реализации законных интересов оператора на основании п. 7 ч. 1 ст. 6 Федерального закона № 152-ФЗ «О персональных данных». Подробнее — в Политике обработки персональных данных.
site-config.js вместо констант**site-config.js, который подменяет захардкоженные значения в готовом HTML. Вместо одного места для правок стало два. Хотели уменьшить сложность, что Codex её увеличил. Забыл поправить исходник — в поиске висит старая цена, потому что роботы поисковых систем не любят java script.⚡ Вайбкодер разбирается в логике продукта и умеет остановить агента. Вайб-дизайнер оценивает результат по картинке и похвале от модели.
Туту проводит хакатон: хороший способ познакомиться с командой
Помните я рассказывал, что запустили MCP для сервиса путешествий Туту. Самый популярный запрос в личку по итогам анонса был про то, как я нашел проект и договорился с командой. Ответ простой, команду я уже знал, прототип приготовил за вечер. Сделал демо, оно зашло.
Вчера Туту анонсировали хакатон с призами: https://hackathon2026.tutu.ru
Призы символические — деньги на покупку внутри сервиса. Но принципиально это предложение почелленджить интересные идеи для тревел-сервиса на живом API компании.
🙋🏻♂️ Сижу в жюри, буду оценивать решения
Ваш покорный слуга приглашён в качестве судьи. На прошлой неделе проходило аналогичное мероприятие со студентами центрального университета. Лично мне зашло два решения. Одни ребята сделали ассистента, который управлял фильтрами на сайте (как Elevenlabs у себя), другие сделали Тиндер предлоджений.
🚀 Если бы я участвовал в таком челлендже, я бы наверное сделал тиндер-механику в целом для тревела. Типа поле ввода: путешествие на двоих с семьёй и варианты, которые обучаются в зависимости от сделанных человеком лайков. Тут отлично вписываются и агенты и рексис и спецпроекты для маркетинга.
Сложные задачи для OpenClaw, учим делегировать
Когда в чатах писали, что OpenClaw не тащит сложные задачи, я не придавал значения. Ну мало ли, модель не та, окружение кривое. Пока сам не попробовал.
🦞 Попробовал, признаю, долгоиграющие задачи сломаны
Развернул инстанс на Mac Mini, дал серьёзную задачу: рисерч на YouTube, отбор роликов-кандидатов по правилам, скачивание, транскрибация, обработка скиллом. Пять шагов, каждый из которых сам по себе сложный и/или долгий.
Краб стал бесполезен. Согласовывал в Telegram планы, чем отвлекал, а когда стал работать, то постоянно упирался в таймауты, задаче нужно пара часов. Если не указать таймаут (по умолчанию 0), агент зависает в сессии навсегда и становится бесплезным для других вопросов. Короче сессии привязанные к чату — перебор.
Стал думать что делать, ковырял документация, попробовал Lobster и HZL. Для линейных пайплайнов — ок. Для сложных задач — бесполезно. Хотя HZL как межсессионное хранилище — удобно.
⚡ Момент истины
Тут я отчётливо почувствовал, насколько гибче привычные Cowork, Claude Code или Codex. Они берут задачу и делают. Без согласований, без «давай я тебе план покажу» или «тут я сомневаюсь». Могут хоть по несколько часов работать.
Идея: не заставлять краба делать сложное самому, а научить делегировать кодинг агенту. Причем сами кодинг агенты поддерживаются как тулы. Вот я и пришел к главному выводу.
🦞 Лучшая клешня — та, которая знает, как вызвать Codex.
Cron Guided Reasoning (CGR).TOOL.mdМетрика, Wordstat), картинки (fal.ai, mermaid, matplotlib и д), публикации (Telegraph). Каждый со своим набором скиллов.cwd не работает с Codex. Чинится избыточными инструкциями. Отправил issue в репо OpenClaw, баг подтвержден и уже есть PR, фикс будет в обновлении.
1M контекст в Claude — сожжёт лимиты или нет?
Anthropic дал миллион токенов контекстного окна по умолчанию всем подписчикам на Opus 4.6. Раньше Claude Code компактил контекст при приближении к лимиту ~200K (на самом деле 130), сжимая историю в резюме. Теперь можно тащить сессию целиком.
🤔 Такой ход как будто указывает на условный проигрыш Anthropic в битве за компакт. Codex производит его эффективнее, держит инструкции в диалоге, не останавливаясь на принудительные сжатия.
💡 Тёплый кэш превращает 1M контекст почти в бесплатный: платите только за новые токены хода. Дорогой только вывод модели.
👨💻 Я проверил, да, расходуется чуть быстрее, но не критично, я и так не выкручивал недельные лимиты на своей подписке Max. После компакции модель резко деградировала.
CLAUDE_CODE_DISABLE_1M_CONTEXT=1cache_control.
Во все тяжкие: Mac Mini как сервер для ботов
Ладно, я это сделал. Mac Mini M4 (16/512) для Telegram-ботов. Чтобы стоял в комнате, молча работал
🤷 Что не сделаешь, чтобы на стрижку и массаж через бота записываться.
🔭 Сейчас к Даше должны прийти подруги и спросить: «А что? Саша абьюзер?»
Как я публикую диприсерчи Клода в Telegram Instant View за 10 секунд
Представьте: Клод только что отработал глубокое исследование — с таблицами, диаграммами, кодом. Хочется поделиться с подписчиками не куском текста, а нормальной статьёй с Instant View.
Открываете Telegra.ph и начинается ад: форматируете заголовки, загружаете картинки на сторонний хостинг, вручную вставляете ссылки, чистите таблицы... Час работы на материал, который Клод сделал за 3 минуты.
Когда подписчик @Amovcharenko написал мне про апи от Телеграфа, я решил, что проблему можно решить раз и навсегда.
🛠️ Telegraph Publisher: скилл для Claude Code
Написал скилл, который превращает любой диприсерч в готовую статью Telegraph одной командой. Клод сам:
🔸 Загружает изображения через GitHub CDN (jsDelivr) — постоянные ссылки, не ломаются
🔸 Конвертирует Mermaid и PlantUML диаграммы прямо в картинки
🔸 Форматирует таблицы в monospace-блоки — читаются даже на мобильном (если немного колонок)
🔸 Управляет ссылками и якорями
🔸 При удалении статьи каскадно чистит все связанные медиафайлы из репозитория
💡 Ключевой хак: токен Telegraph хранится в cookie tph_token в браузере. Его можно извлечь через DevTools → Application → Cookies и передать скиллу — тогда все статьи автоматически появятся в вашем аккаунте, а не создадутся на чужом.
Вокруг AGENTS.md и всяких "универсальных" файлов для агентов в последнее время как-то слишком много разговоров. Особенно забавно это выглядит на фоне того, что рядом уже начали появляться вполне трезвые наблюдения о том, что польза таких файлов слегка преувеличена.
Например, у @gonzo_ML был хороший разбор статьи Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents? (arxiv:2602.11988). Если совсем кратко, то вывод там неприятный, но логичный - автоматически сгенерированные контекстные файлы на уровне репозитория часто не помогают, а скорее мешают. Они снижают долю успешно решённых задач и одновременно увеличивают стоимость инференса. Модель вместо решения задачи уходит в блуждание по кодовой базе и бесконечное "изучение архитектуры", порождая галюнчики.
Из свеженького, что меня побудило написать этот пост:
- в мой любимый KodaCode добавили поддержку SKILLS.md, и AGENTS.md
- @max_about_ai была здравая мысль про документацию в эпоху AI
- а у @countwithsasha был пост про то, как вообще собирать агента из скиллов
То есть с моей точки зрения рынок постепенно обрастает всем этим зоопарком форматов, манифестов и "магических" markdown-файлов.
Но лично мне вся эта практика с одним условным большим `AGENTS.md` на 10к токенов кажется порочной.
AGENTS.md? Разработчику точно нет. Агенту тоже не особо. Зато очень выгодно вендору, который продаёт доступ к моделям по API. Чем больше токенов вы стабильно прокидываете в каждый запрос, тем больше вы тратите токенов, тем больше зарабатывает вендор.AGENTS.md вы получаете управляемую систему контекста с дюжиной небольших файлов, из которых подтягивается только то, что действительно относится к текущему файлу, текущей задаче или текущему этапу работы.Не "один файл, в котором описана вся подноготная проекта", а "набор маленьких правил, каждое из которых отвечает за свою область".
.cursor/rules/, как ссылаться из них на документацию и почему такой формат удобнее в реальных проектах, а вот тут ещё один пост, где я показывал как использовать правила, документацию и TDD/BDD-подход в связке с агентом.
Скилл Метрики, часть 2: проверяем гипотезу SEO-команды за 2 минуты
Сначала выложил скилл Яндекс.Метрики. На следующий день получил кейс, ради которого он и создавался.
На зуме с SEO-командой одного из моих регулярных проектов специалист высказал смелое предположение:
— Оптимизация заголовков карточек товаров — пустая трата времени, результат не меняется, топ заполнен маркетплейсами.
Прошлой весной мы переделали заголовки по профнастилу, и нужно было быстро понять — дало это что-то или нет. Идеально, прям на зуме.
Задача: отделить эффект от наших действий от сезонного роста спроса. Классическая аналитическая работа минут на 30 — выгрузить трафик из Метрики, спрос из Вордстата, нормировать, сравнить динамику.
🔍 Дальше было демо Cowork
Если интересно, я могу выложить фрагмент видео.
Я просто написал один промпт. Claude подключил оба скилла — Метрику и Вордстат — и выстроил методологию:
1️⃣ Вытащил помесячную органику по страницам входа категории профнастил из Метрики
2️⃣ Забрал динамику спроса «профнастил» из Вордстата за тот же период
3️⃣ Нормировал обе серии и сравнил темпы роста
📊 Результат
Честно говоря, я бы долго щелкал по вкладкам интерфейса Яндекс.Метрики, чтобы получить нужные срезы и фильтры. У навыка в Claude Cowork ушло пара минут.
Когда я попросил сравнить с Вордстатом — то еще через пару минут получил аналитику сезонного влияния, оказалось было что-то кроме сезонности (оптимизация заголовков).
По запросу Claude также разделил каталог и статьи: товарные карточки дали 154 конверсии (CR 1,2%), статьи — ноль прямых заказов. Но тут же объяснил, что в модели атрибуции к последнему значимому переходу вклад статей в верх воронки может быть не виден — нужны ассоциированные конверсии.
Ключевое, это скорость получения аналитики по сравнению с ручным подходом.
🔗 Ссылки
Скилл Метрики: GitHub
Скилл Вордстата: GitHub
Если у вас тоже были задачи в Метрике, которые тратили много времени — приходите в комментарии, затестим через скилл.
----
Поляков считает — AI, код и кейсы
Скилл для Claude: аудит трафика через Яндекс.Метрику
Сегодня пришёл новый проект на рекламу, нужно было оценить историю: какие каналы работали, где конверсии, что с органикой. Открыл Метрику и поймал себя на мысли, что делаю одно и то же в сотый раз: счётчики, цели, источники, помесячная разбивка. Упаковал рутину в скилл.
🔍 Что умеет
8 скриптов, которые покрывают базовый аудит: список счётчиков, метаданные, цели, трафик по источникам, конверсии по целям, UTM-разбивка, поисковые системы. Плюс произвольные отчёты через любые метрики из API (пока не проверял).
Claude получает промпт вида «оцени статистику яндекс метрики — что работает, что нет», сам подключается к Метрике собирает данные и выдаёт анализ.
🧩 Минутка извращений: кеш для экономии контекстного окна
Главная проблема скиллов, где скрипты + внешнее API — они засоряют контекстное окно. Каждый ответ API может занять тысячи токенов. Поэтому:
🔸 Счётчики, цели и метаданные кешируются в TSV/JSON и переиспользуются между запросами
🔸 Отчёты кешируются по хешу параметров (counter + даты + фильтры). Повторный запрос за тот же период не тратит ни токенов, ни квоту API
🔸 Вывод ограничен 30 строками — полные данные уходят в CSV, а Claude видит только шапку
🔸 Если date2 = сегодня, кеш пропускается — данные ещё копятся
💡 Принцип: скилл должен экономить контекстное окно так же, как код экономит память. Чем меньше мусора в контексте — тем точнее анализ.
isRobot='No' по дефолту, хотя может быть в эру агентной коммерции, пора отключать
На 100% согласен с Алексеем.
Я это вижу в каждом консалтинговом проекте: основной затык при внедрении ИИ — не модели, не API, не бюджеты. А то, что команда не может внятно описать, как она принимает решения. Бизнес-процесс живёт в головах, а не на бумаге.
Люди, которые научатся дистиллировать свой опыт в скиллы для агентов, окажутся незаменимыми. Именно незаменимыми — потому что скилл без эксперта устаревает, обрастает ошибками и беклогом.
Шер-парад февраля 2026: что уносят себе, а что приводит подписчиков
В январе я начал мерить контент процентом шеринга от просмотров — сколько людей «унесли» пост себе или коллеге. Февраль — второй замер. 23 поста, 58 000 просмотров, 2 400 пересылок.
🥉 Третье место: код ревью — два ИИ лучше, чем один
Пост про скилл, где Claude пишет код, а Codex его ревьюит. Делал как таблетку от ошибок Claude Code, в итоге пользуюсь каждый день, а сам скилл прокачался и в ревью и в поддержке git worktree.
133 шера на 1 555 просмотров — 8,6%
🥈 Второе место: аудит рекламных кампаний через Claude
Продолжение истории с Вордстатом — загружаешь Excel из Директа, Claude находит дыры в семантике: упущенный спрос. Благодаря хитрому алгоритму получается круче чем у людей. Группы обрабатываются параллельно через субагентов, 13 групп за 3 минуты.
🪙 Ксатати пост про Вордстат пробил 1000 сохранений, кажется это может быть как «серебряная кнопка телеграм»
💡 Все три победителя — open-source скиллы. Не обзоры, не мнения, не новости. Инструменты, которые можно забрать и использовать прямо сейчас. Формула не изменилась с января. Аудитория сохраняет себе то, что может пригодиться в работе.
В полку фанатов Codex маленький праздник: завезли тул для вопросов
Еще codex spark модели принесли всем подписчикам, раньше были доступны долько тем, кто платит $200, но сейчс не об этом.
Раньше функционал вопрсов к пользователю был доступен только в plan-режиме, а в обычном нет. Для примера AskUserQuestionTool в Claude Сode доступен всегда.
🔓 Что изменилось
В версии 0.106.0 request_user_input наконец включили в обычный режим работы. Началось всё с issue #10384 — наш соотечественник месяц назад попросил эту фичу и вот ее реализовали.
Чтобы включить, нужен feature flag:
codex features enable default_mode_request_user_input
codex review (рассказывал тут). 🚀 С момента выхода поста скилл для ревью сильно прокачался: стал точнее ревьювить и научился даже в git worktree.
Claude Code теперь работает с телефона. Забываем несколько опенсорс проектов
Позавчера жаловался в чатах: бесит, что мои локальные сессии Claude Code не видны в приложении на вкладке Code. Не ну бред же. Codex давно запустил GUI с обзором сессий.
Вчера Anthropic выкатил Remote Control. Пока Research Preview только для Max-пользователей. Короче готовили ответ пожирнее.
🔧 Что за Remote Control
Набираешь /remote-control в терминале — и твоя локальная сессия становится доступна через веб или мобильное приложение во вкладке Code. Там создается какая-то ссылка, но всё и так доступно в приложениях сразу. Ссылка требует авторизации. С чужого логина не проверял.
Сессия продолжает работать на твоей машине. Файлы, MCP-серверы, конфиги — всё на месте. Телефон — просто окно в локальный терминал.
💡 До вчерашнего дня для этого был целый зоопарк решений. Самый популярный — Happy, некоторые юзали Termius, но это извращения, конечно.
🖥️ Вот куда надо использовать Mac MIni, короче.