countwithsasha | Unsorted

Telegram-канал countwithsasha - Поляков считает: AI, код и кейсы

4455

Subscribe to a channel

Поляков считает: AI, код и кейсы

Qwen3.8-27B на DGX Spark: обогнал Sonnet 5 в PAC-1 и стал быстрее.

Ваш покорный слуга искал способ, как усокрить работу модели. 12-18 токенов в секунду, это конечно очень мало. Плюс есть префилл, хочется немного быстрее получать результат.

Нашёл инструкцию на официальном форуме https://forums.developer.nvidia.com/t/qwen3-8-27b-at-34-38-tok-s-on-dgx-spark-open-source-one-command-setup-sglang-nvfp4-dspark/380257

Это вариант спекулятивного декодинга, когда для предсказания токенов берётся отдельная модель.

📏 Что по статистике

Автор приводит свои замеры:

llama - 27 т/с
vLLM - 24 т/с
SGLang - 34 т/с


Я решил что хочу 34 т/с и пошёл тестировать.

На русском языке получилась деградация, но если работать с кодом или JSON будет очень приятный рост. Прикладываю статистику.

⚠️ Проблема с шиной никуда не девается

Префил по прежнему долгий, на длинных инструкциях первого токена прийдется ждать прилично, но всё равно быстрее чем префилл на vLLM.
Первый токен за 250 мс, а не за 1500 для русского текста.

🔥 Прогнал PAC-1 и модель обошла Опус

Когда начал тестировать генерацию JSON и программирование, то впервые увидел 72 и 44 ток/с. На Nvidia DGX Spark это очень круто. Решил запустить бенч PAC-1 и модель обогнала Opus 4.8.

Скорость прогона обошла наивный запуск без декодинга в 2 раза: уходило по 100 минут на прогон, но это всё равно долго в сравнении с Qwen 3.6 35b a3b. Но взаимодействие в задачах кодинга стало приятнее.

😀 Забавно, что код на питоне генерируется быстрее кода на TypeScript (см. скриншоты)


🙋🏻‍♂️ А что по бизнес задачам?

У рекламных агентств есть неприятная задачка: отчётность по маркировке рекламы в ОРД. Нельзя сказать, что она прям сложгная, у меня давно есть скилл, который позволяет клод опусу создавать таблицы для загрузки.
Но в этот раз я отдал эту задачку агенту на Pi у которого под капотом был Qwen 3.8 27B, и он справился. Правда за 30 минут.

Кто уже тестил на маленькую модель Qwen на бизнес задачах? Как результаты?

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

В канун возвращения пятичасовых лимитов Codex вышло интервью Тибо.

Конкретно в моем кейсе именно пятичасовые лимиты являются причиной вылета в экстра юз в Claude. В результате расходы на Антропик у меня больше 200 баксов. Так что ждём, что расходы на Codex тоже вылезут за пределы лимиты подписки.

Читать полностью…

Поляков считает: AI, код и кейсы

Yandex Ecom Open Air: Алиса, агентная коммерция и ставка Яндекса

Сходил на Yandex Ecom Open Air. Агентная коммерция — главный лейтмотив дня, про неё говорили и с большой сцены, делали прогнозы. Был ещё обзор Яндекс.КИТ, но мы с вами интересуемся агентами, поэтому поговорим про неё.

🤦🏻‍♂️ Отдельная ирония: заявку, в которой я указал, что связан с рынком ИИ, на этот фестиваль отклонили.

1️⃣ Что показали по Алисе AI

Ассистенту обещают прокачать память о пользователе, ризонинг и вызов инструментов. Идеальный сценарий, чтобы агент искал за пределами пользовательского запроса. Предлагал лучшие альтернативы. Надеюсь это не будет очередным засильем нестрогого рекламного таргетинга.

2️⃣ Модели у экосистем

Со сцены прозвучало наблюдение: на западе модели принадлежат независимым компаниям, в России — экосистемам. Отдельным пунктом шёл большой объём данных о пользователях как преимущество.

Для качества подбора данные и правда преимущество. Вопрос в том, кому принадлежит ассистент и нет ли конфликта интересов между пользователем и владельцем агента. Для качества подбора данные и правда преимущество.

Яндекс владеет моделью, Маркетом, платежом, доставкой и рассрочкой. Маркировка рекламы уже есть, а вот маркировку агентных рекомендаций пока не придумали, получаем вопрос доверия.

🤔 Моё скромное мнение

Наблюдая за стараниями Яндекса в популяризации агентного екома, ваш покорный слуга уверен в популяризации потребления через ИИ-агентов. Разработчикам MCP стоит готовиться к поддержке всех возможных протоколов, так как у нас уже есть большое разнообразие идей от разных игороков. Скромные прогнозы Data Insights — 11% российского екома у агентов к 2032 году.

Что думаете вы? Уже делали покупки через ИИ-агентов? Доверили бы выбор каких-нибудь товаров ИИ?

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Qwen3.8-27B на DGX Spark: балл как у Sonnet 5, скорость как у стажёра

Гоняю новую dense-модель Qwen на коробке под столом. Результаты противоречивые ровно настолько, чтобы о них стоило написать.

🏆 Агентный бенчмарк: вровень с фронтиром

Прогнал PAC1 — набор из 43 агентных задач. Qwen3.8-27B в режиме reasoning xhigh выдал 90,7%. Ровно столько же, сколько Claude Sonnet 5. Больше, чем у DeepSeek V4 Pro на 1,6 триллиона параметров (89,9%).

И это всего лишь 27 миллиардов параметров. Локально. Без интернета.

🐌 А теперь цена

Sonnet 5 прошёл бенч за 27,8 минуты. Qwen3.8-27B — за 3,4 часа. Скорость генерации — 10 ток/с. Прикрутил спекулятивный декодинг MTP-3, стало 18 ток/с.

Первая мысль была «криво настроил, надо тюнить дальше». Потом прикинул по формуле — оказалось, виновата шина:

📐 макс. ток/с = пропускная способность памяти / размер активных весов


Каждый токен требует вычитать все активные веса из памяти. Заново. У DGX Spark шина 273 ГБ/с, NVFP4-чекпоинт весит 26,4 ГБ. Делим — потолок ~10 ток/сек. Ровно то, что я и видел до спекулятивки.

Для контраста: Qwen3.6-35B-A3B на том же железе даёт 75 ток/с. Модель больше, но это MoE — активны 3B из 35B, читается два гигабайта вместо двадцати шести.

👁 Видео: описывает отлично, понимает плохо

Второй тест — скормил 28-секундную запись экрана. Сценарий: скроллю до расширения Контур, включаю его, двигаю анимированного персонажа, выключаю обратно.

🔸 Без ризонинга (ответ за 28 с) — подробнейшее описание интерфейса: Chrome, страница расширений, список плагинов, мультяшный персонаж, текст тултипа. Действий модель не разобрала вообще. Как будто ей дали скриншот, а не видео.

🔸 С ризонингом (94 с, втрое дольше) — появился пошаговый разбор с выводами о намерениях пользователя. Выглядит убедительно. И неверно.

🤔 Переключение Контура засекла только модель с ризонингом — интересно, почему? Но каждый раз путалась в показаниях: то описывала включение, то отключение. Как будто дробление на кадры происходит случайным образом. Видимо, тумблер размером 40 пикселей — это шум для EVS при нарезке кадров на токены.


Кстати, стоит помнить, что Qwen3-VL сэмплит видео на 2 fps, то есть если будем пытаться делать скиллы по скринкасту, плотность действий на экране должна быть низкой, а темп медленным.

🗺️ Копии интерфейсов по скриншоту — прекрасно

Третий тест — сгенерировал в ChatGPT картинку «хиро-блок сайта» и попросил Qwen сверстать её в HTML. Получилось очень близко к оригиналу.

В одном из прогонов референс был с картинками. Модель сама сообразила, откуда их взять, и подставила сервис моковых изображений. Похоже, интерфейсы уже сейчас можно генерировать огромными партиями на небольших локальных моделях.

🧾 Что в итоге, где затестить и сколько стоит

Если говорить о запуске на локальном мини-ПК вроде DGX Spark, Qwen3.8-27B — отличная модель, но очень медленная. Для задач, где важен результат, а не время отклика — ночные прогоны, батчи, автономные агенты — это лучшее, что сегодня можно поставить локально.

Для интерактива терпения не хватит. Поэтому тут выручают провайдеры:

• У нас в РФ эту модель уже поднял Валера — ребята затащили скорость 256 ток/сек
• На OpenRouter — 3 доллара за миллион выходных токенов, но Throughput 16 ток/сек настораживает
• Вот бы дождаться раздачи на cloud.cerebras.ai — там это будет выглядеть сверхбыстрой магией по 500 ток/с.

Интересно, когда мы сможем тянуть такие модели прям на локальном железе? Кто что думает?

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Скилл нужен даже когда у вас уже есть MCP и CLI

В прошлом посте рассказал про анатомию скилла. И вот мы уже пишем в нашем агентстве скиллы профессионально, вроде бы все всё поняли. Но внезапно приходит разработчик и спрашивает:

🙋🏻‍♂️ Вообще я слышал, что сейчас надо всё упаковывать в CLI, почему мы делаем эти скиллы для управления Яндекс.Директом а не MCP/CLI-утилиты.


И этот пост ответ на все подобные вопросы.

TL;DR. На самом деле никакого выбора и нет.

🎯 Скилл не конкурирует с MCP и CLI

Скилл — регламент, который их оркестрирует. Он может оркестрировать и MCP и CLI и собственные скрипты. Все перечисленные сущности отвечают «чем делать». Скилл — «когда, в каком порядке, с какими проверками, что если сломалось».

Поэтому он нужен всегда: и когда подключён MCP, и когда кто-то развернул и поддерживает CLI и когда ничего из этого нет.

⚙️ Кто есть кто для новеньких

MCP — это способ передать модели набор инструментов, чтобы работать с каким-то сервисом. Допустим у интернет-магазина MCP будет содержать способы поиска товаров, способ проверки наличия, будет декларировать модели как она должна к нему обращаться и какой ответ ждать.

⛳️ Когда полезен? Если целевое API часто меняется и контролировать соответствие скриптов спецификации сложно. Чем плох? Тем что все описания инструментов всегда лежат в системном промпте — то есть занимают контекст с первой секунды.

CLI — это утилита, чтобы работать с некоторым внешним сервисом через командную строку. У нее тоже есть описание синтаксиса через -help. Но компания должна поддерживать утилиту (как Гугл)

⛳️ Когда полезен? Вообще не видим в контексте когда установлен, ничего не засоряет. Чем плох? В облачные рантаймы его не положить. И версия на стороне пользователя может отставать от авторской — результаты работы скилла будут отличаться у разных людей.

🧩 Два паттерна, которые логично использовать

🩺 Проверка окружения (doctor). Скилл должен честно сказать «работать не могу» до того, как начал ломиться в неработающий инструмент. В моём SEO-скилле первый шагdoctor.py: проверяет установлен ли crawl4ai, скачан ли браузер, отвечает ли целевой домен.

🪂 Изящная деградация Дизайн скилла должен учитывать отсутствие подключенного MCP или CLI:

Ремарка: Обычно я рассуждаю о скиллах, как о свободно распространяемых фрагментах, которые могут оказаться в любом окружении. И окружение может не содержать утилит, на которых скилл построен.

Любой скилл зависит от внешних инструментов — MCP, CLI, скриптов, сети. Получается дизайн должен учитывать, что в конкретном рантайме чего-то может не оказаться. Варианты поведения: честно сообщить об ошибке, переключиться на запасной компонент, попросить пользователя доустановить нужное.

Скилл без деградации и с зависимостями — это обещание, что у всех пользователей будет идентичный рантайм. Такого не бывает.

Наверное стоит рассказать про то, как эти паттерны живут вместе с кучей инстансов OpenClaw у которых окружение может очень сильно различаться и нужен скилл конфигуратор.

Если у вас есть мысли / опыт по организации скиллов и обвязок, делитесь в комментариях.

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Субагенты вместо скиллов: ходим по кругу управления агентами

Настраивал OpenClaw на Mac Mini и понял неочевидную вещь: для домашнего бота скиллы — это перебор.

🏠 Проблема со скиллами

Реальный пример. У меня скилл для заказа гостевых пропусков в УК. Он должен поддерживать задержки через lock-файлы, работать с несколькими модулями приложения. Добавляю загрузку квитанций — надо обновлять скиллы и на виртуалке, и на Mac Mini.

Потом добавляешь скилл для ВкусВилл, для стрижки в ТопГане, для парковки — и ты уже менеджер по поддержке скиллов. CI/CD для домашнего бота. Серьёзно?

🤖 Решение: агент-специалист

Тут меня осенило, что гораздо проще создать субагента со своим воркспейсом и контекстом. «Швейцар» отвечает за дом: пропуска, паркинг, новости УК. «Парикмахер» — за запись на стрижку. Главный агент просто делегирует:


sessions_spawn(agentId="barber",
task="Запиши на стрижку в ТопГан")


Субагент выполнил, вернул результат — всё.

💡 Поддерживать одного агента-специалиста проще, чем синхронизировать пять копий скилла. Агент живёт в одном месте, любой бот его вызывает

.

⚙️ Конфиг


"agents": {
"list": [
{ "id": "main", "default": true,
"subagents": {
"allowAgents": ["doorman", "barber"]
}},
{ "id": "doorman",
"workspace": "~/.openclaw/workspace-doorman" },
{ "id": "barber",
"workspace": "~/.openclaw/workspace-barber" }
]
}


Мне нужен «Парикмахер», Даше — агент для массажа. Добавляешь { "id": "massage" } — и оба бота записывают нас через YCLIENTS.

✂️ YCLIENTS через браузер

Отдельное открытие: YCLIENTS с зашифрованным API элементарно управляется через агентный браузер дефолтный для OpenClaw.

Самое главное просто найти веб-страницу на которой крутится массажный салон или барбершом. Есть ограничения по работе с календарем, но ближайшие слоты для специалистов найти элементарно (идентификаторы специалистов тоже надо вытаскивать из URL).

🤔 Конечно было бы полезнее, если бы платформа предложила какую-нибудь CLI для пользователей. Если есть контакты топов из YClients — познакомьте, давайте сделаем агентный инструмент для записи в салоны.


🎯 Итого

Скиллы хороши для атомарных задач: API-вызовы, парсинг, генерация. Но когда нужен контекст, состояние и несколько шагов — субагент надёжнее и проще в поддержке.

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Мак Мини, 100 рублей в неделю и никаких ограничений с лимитами для OpenClaw

Когда настраивал Мак Мини как агентную машину, понял, что хочу три вещи: никакой аффилиации с моими основными аккаунтами, никаких проблем с РКН и такой IP, который ни разу не светился в моих запросах к провайдерам.

Логика простая: если кто-то мониторит злоупотребления подписками, мой основной аккаунт вообще не должен быть рядом с этой историей.

🛠️ Инструмент: CLIProxyAPI

Нашел CLIProxyAPI — API-шлюз, который оборачивает CLI-клиенты (Claude Code, Codex, Gemini CLI) в совместимый с OpenAI/Anthropic API-интерфейс. Развернул его на виртуальном сервере в район Лос-Анджелеса.

Главная фича — «карусель» аккаунтов: добавляешь несколько файлов авторизации, и шлюз раздаёт запросы по кругу. Ни один аккаунт не перегружается.

🤔 Правда мне кажется, что за один и тот же кеш в запросах с разными ключами можно и спалиться.

💰 Схема: подписки OpenAI по 50 рублей

Беру по две штуки в неделю — это ~100 рублей. На случай если какой-то заблокируют. Ну и в целом хочу понять жизнеспособность.

OpenClaw на Мак Мини просто стучится на кастомный провайдер, а там все те же gpt 5.4 c одноразовых аккаунтов.

Что в итоге:

🔸 Мой основной аккаунт полностью изолирован
🔸 Трафик не идет напрямую к OpenAI с этой машины
🔸 Карусель между аккаунтами — лимиты не упираются в потолок
🔸 Стоимость: ~400 рублей в месяц за учетки + хостинг 100 рублей

Посмотрим, как долго проживет такая схема. Пока работает.
Хочу чтобы новые аккаунты заводил сам бот) Автоматизация.

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Неделя в Claude Cowork: что я понял про офисных агентов

Решил провести эксперимент — замкнуть все рабочие процессы на Cowork. Именно офисную рутину: аккаунтинг проектов, запросы клиентам, работу в MS Word, Excel, DataLens. Вот прям вообще не использовать, все задачи решать в коворке. В начале было больно.

Почему Cowork, а не Claude Code? Ищу форму идеального офисного агента — где ломается логика и нужны руки, что предолжить добавить в ValeDesk — я верю в опенсорс обвязки.

🔥 Три инсайта

1️⃣ Скиллов нужно на порядок больше, чем кажется. БД, Битрикс24, DataLens и т. д. — каждый процесс требует своего скилла. Жду, когда компании начнут выпускать CLI-обёртки, как Google Workspace.

😀 Сначала все делали сайты/интерфесы как не в себя — теперь будут делать CLI.


2️⃣ Skill Creator прокачался. Теперь умеет измерять эффективность скиллов: показывает, как LLM справляется без скилла и со скиллом. На моих задачах скилл оказался нужен везде — ни одного кейса, где модель справилась бы сама.

3️⃣ Мышление меняется. Перестаёшь думать «что я делаю сейчас» и начинаешь — «какой следующий шаг, чтобы агент проснулся и выполнил его». Ты проектируешь цепочку, а не делаешь работу.

😤 Четыре главных минуса, почему пока Cowork отстой

1️⃣ Cowork расходится с Claude Code. Нельзя перевыставить флаги окружения (типа env -u CLAUDECODE) — в терминале спавнишь субагента со своими агентами, а в Cowork нельзя. Всегда по правилам Антропика.

2️⃣ Нельзя создать задачу из задачи. Запланированный таск не может породить дочерний. Нашёл проблему, хочешь новые задчи, возвращайся в родительский/новый диалог и доноси контекст руками, проси создать новые таски. Создал Issue

3️⃣ Нет задач на N раз. «Проверяй кампании раз в неделю, три раза» — нельзя. Либо бесконечный повтор, либо совсем разовый. Issue

4️⃣ Нет хуков по событиям. Хочется дёрнуть агента по триггеру — хоть внутри сендбокса. Это решило бы пункты 2 и 3. Агентный цикл ломается на ручном фидбеке. Ведь запланированные задачи они обычно не изолированы, они подразумевают корректировки стратегии. Issue

💬 Пока работал, пришла идея: SaaS-скилл для управления Яндекс.Директом по подписке (через OAuth в CLI). Как думете есть спрос, или каждому проще написать свой?

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Google выпустил CLI для всех офисных программ — со скиллами для агентов

Кстати, если вы пропустили: Google наконец выкатил единый CLI для всех своих офисных приложений — Диск, Gmail, Календарь, Таблицы, Докумерты и остальных. Репозиторий сразу содержит 100+ скиллов для агентов.

🔑 Что это значит на практике

Раньше, чтобы агент работал с вашим Google Drive или почтой, приходилось самому писать скилл или искать чей-то MCP-сервер. Разбираться в API, получать ключи, обходить лимиты. Теперь компания-владелец сервиса сама предоставляет готовый агентный интерфейс.

Вопрос авторизации решается через авторизацию самой утилиты: gws auth setup, один раз логинишься — и агент получает доступ ко всему.

Примечательно, что не забыли и про OpenClaw — в README отдельная секция с инструкцией по подключению скиллов к нему.

📢 Яндекс, ваш ход

Представьте: единый CLI для Директа, Метрики и Wordstat со скиллами для агентов. Сейчас каждый пишет свои обёртки, мучается с токенами и лимитами. А мог бы быть ydx direct campaigns list — и агент сам смотрит кампании.

💡 Тренд: компании-владельцы API сами создают агентные интерфейсы к своим продуктам. Во-первых, так можно влиять на пользовательский опыт, во-вторых снизить нагрузку и неудачные вызовы.


Репозиторий: https://github.com/googleworkspace/cli

-----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Подписываюсь под словами Паши.

Почти все платформы сейчас поддерживают бережное отношение к контексту и динамическую подгрузку: скиллы, вложенные правила для субдиректорий, path-based фильтры.

Для AGENTS.md оставляем только генеральные правила, общие для любой задачи проекта. Остальное разруливаем скиллами и вложенными правилами.​​​​​​​​​​​​​​​​

Читать полностью…

Поляков считает: AI, код и кейсы

У вас есть скиллы. Как собрать из них агента?

Вижу один и тот же вопрос: «У меня набор SKILL.md — как дальше? Завернуть в ТГ-бот, дать API модели и пусть работает?»

Да, примерно так. Можно попытаться написать своё решение, можно взять готовое — но на выходе получится примерно одно и то же: рантайм, изоляция сессий, разрешения для команд, sandbox. Эти паттерны уже реализованы в двух популярных open-source решениях:

🔸 OpenClaw (https://github.com/openclaw/openclaw) — TypeScript, 22+ канала, 13 700+ скиллов в реестре. ~1 ГБ RAM, зато из коробки всё: голос, heartbeat, веб-поиск, браузер.

🔸 ZeroClaw (https://github.com/zeroclaw-labs/zeroclaw) — Rust, бинарник 8,8 МБ, <5 МБ RAM, старт за 10 мс.

Оба работают со скиллами в папках, но форматы отличаются. OpenClaw читает SKILL.md с YAML-фронтматтером, ZeroClaw — либо SKILL.toml (манифест), либо простой SKILL.md без фронтматтера (description берётся из первой строки). При переносе скиллов из OpenClaw в ZeroClaw — убирайте `---`-блок или конвертируйте в SKILL.toml.

👥 «Бот путает контексты разных юзеров»

Одна строчка в конфиге OpenClaw:


"session": { "dmScope": "per-channel-peer" }


Скиллы общие — состояние изолировано, но не md-файлы.
Нужны отдельные «мозги» (свой стиль, своя память)? Создаёте несколько агентов через agents.list, каждый со своим USER.md и SOUL.md. Подробности — в документации по сессиям.

Подход ZeroClaw к многопользовательности — отдельные агенты. И это реально работает: при <5 МБ RAM на агента можно поднять 10-20 штук на одном VPS. Каждый со своим config.toml, своим workspace, своей памятью. Короче новый пользователь, новый краб.

💡 Принцип: скиллы шарим, диалоговый контекст изолируем. Для полной изоляции (память, файлы) — разводите по отдельным агентам через agents.list.

🔒 «А как запретить боту опасные действия?»

В OpenClaw — sandbox(Docker-изоляция) + Tool Policy (allow/deny по инструментам) + exec-разрешения.

В ZeroClaw — секция [autonomy] в конфиге:


allowed_commands = ["curl", "git", "ls", "cat"]
block_high_risk_commands = true


Бот выполнит git pull, но не rm -rf /. Опасные действия можно привязать к TOTP-подтверждению.

«Каждый раз заходить на сервер руками?»

Нет. Подключаете SSH-скилл к Claude Code/Codex — и агент сам заходит на сервер, читает логи, правит конфиг и перезапускает сервис.

Цикл замыкается: один агент администрирует другого. Вы только формулируете задачу.

🔧 Гайд по развёртыванию OpenClaw-бота + ВкусВилл — конфиги, cron, секреты, ВкусВилл, голосовые сообщения. Можно скормить кодинг-агенту целиком, чтобы все вам настроил.

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

2. Как выиграть в AI безумии обычным людям

Пост в первую очередь для не технических специалистов. Картинка постепенно сходится, многим уже рассказывал лично, давайте сюда тоже напишем.

Ключи от новой эпохи агентов будут у людей, в которых совпадут две суперсилы. Не одна, а именно две. И это не только про разработчиков - вообще про любую профессию.

Первая суперсила - ваш опыт.

Ваши 5, 10, 15 лет в профессии. То, что вы заработали потом и кровью и что нельзя скачать, посмотреть на ютубе или прочитать за выходные.

Например, вы лучше всех умеете проводить маркетинговые кампании. Или анализировать финансовые отчёты и сразу видеть, где у компании больное место. Или строить стратегию развития отдела техподдержки на следующий год. Или вы талантливый менеджер проектов, и умеете запускать проекты в срок. Возьмите абсолютно любую прикладную профессию - если вы разбираетесь в ней, это уже огромное преимущество.

Вторая суперсила - AI-флюенси (AI-Fluency/AI-Native)

Тут люди обычно думают, что это про промтинг в ChatGPT. Нет, это другое.

AI-флюенси - это умение общаться с агентами на их языке и добиваться нужного результата итеративно, а не сдаваться после первого плохого ответа. Это умение писать скиллы под свои задачи - инструкции для агента, которые заставляют его делать именно то, что нужно вам, а не то, что он сам придумал. И в целом - понимание того, как агенты устроены: что такое контекст, почему он ограничен, как работает память, что такое тулзы. Ведь локальный агент, это не волшебная коробочка, а просто машина с не самым сложным движком внутри.

Почему важны оба компонента?

Выпускникам вузов только предстоит накопить тот самый опыт, а времени на это сейчас катастрофически мало. Опытный специалист без AI хорош в своём деле, но его коллега с агентами делает ту же работу кратно быстрее. А человек, у которого есть и то, и другое, знает как выглядит правильный результат, раскладывает сложные части своей работы в скиллы, управляет командой агентов и постепенно уходит в отрыв, еще и ускоряясь по мере роста качества моделей.

Лёха, что конкретно делать?

В этом месте обычно появляется ссылка на курс за 50к, но все намного проще. Даже никакого IQ выше 120 не нужно. Единственное, что от вас потребуется - время. Честно, не мало времени: это месяцы проб и ошибок. Но в конце вы обгоните 90% опытных людей в своей профессии просто потому, что освоили то, что большинство боится или хочет даже попробовать. Никакие деньги и курсы на ютубе вас не сделают AI-Fluent, только время и упорство.

1. Скачайте Codex App (ссылка) - у него есть стартовый бесплатный лимит, а потом даже если нет карты, можно покупать аккаунты за 350р на таких сайтах. Единственное, что будет нужно - VPN.

2. Возьмите один процесс из своей работы или жизни, обсудите с агентом, пусть у него что-то получится с вашей помощью - проанализировать отчет, создать презентацию, написать статус за неделю по проекту на основании дейли статусов.

3. Скажите: "теперь помоги написать для этой задачи скилл". Он напишет вместе с вами. Затем скажите "установи этот скилл", и начинайте делегировать ему задачу. Не справился - улучшайте скилл итерационно, пока агент не начнёт делать эту часть вашей работы нормально. Скилл (SKILL.md) - это просто текстовый файлик с описанием процесса и пачка скриптов, по сути дистилляция вашего опыта.

4. Начинайте копить именно вашу личную базу скиллов, она вам пригодится, где бы вы не оказались. Агентские фреймворки будут улучшаться, а ваши скиллы вы сможете просто переносить из одного в другой, включая и отключая по желанию.

5. В ближайшем будущем нас всех ждёт трансформация от выполнения работы руками к делегированию её агентам и присматриванию за этой виртуальной командой. Но туда не попасть, пропустив шаги из списка выше.

Вот и весь секрет.

Так что крутые ребята на опыте - не грустите, для вас открылся золотой век.

#aifirst

Читать полностью…

Поляков считает: AI, код и кейсы

ИИ, как способ диприсерчить скидки в российских магазинах

В продолжение темы отечественной агентной коммерции нашел способ находить скидки за счет маркетинга Алисы.

Запускаем поиск «Найти дешевле» в приложении Алиса AI и если выпадут партнеры подключившие Яндекс Пэй — будет скидка. Проверил на поиске диктофона, получил крупную скидку от рестора.

💸 На Авито его же можно найти за 20 000₽, но зато Рестор.


🎁 Маркетинг оплачивает скидки

По всей видимости Яндекс делает ставку на популяризацию агентного потребления и субсидирует продажи.

Позже скидки сократят или уберут, но пока есть смысл использовать.

🤦🏻‍♂️ Из минусов, обязательно дать ссылку на товар, простым текстом Алиса не принимает запросы. Это конечно не очень агентно, но простительно.


Затестил на поиске AirPods, которые покупал недавно на семью у постоянного продавца по 20 тысяч рублей за штуку. Алиса нашла за 17, хоть и без персональной скидки.

Короче инструмент рабочий, если планируете покупку гаджетов или техники, не теряйте.

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Три протокола агентной коммерции: кто кого контролирует

За полгода появились три протокола, позволяющие ИИ покупать товары от имени человека: ACP от OpenAI и Stripe (сентябрь 2025), UCP от Google и Shopify (январь 2026), и вчера — YCP от Яндекса. Плюс десятки MCP-серверов для отдельных магазинов (вроде ВкусВилл).

Когда я вижу новый протокол, я не читаю пресс-релиз. Я смотрю на роли: кто покупатель, кто продавец, а главное — кто между ними и сколько власти у каждого.

🎭 Роли в агентной коммерции

В обычном e-commerce всё просто: покупатель и продавец. В агентном — между ними появляются посредники:

🔸 AI-провайдер — чей ИИ общается с покупателем (ChatGPT, Gemini, Алиса)
🔸 Платёжный провайдер — кто проводит деньги (Stripe, Yandex Pay, Visa)
🔸 Платформа — где живёт магазин (Shopify, KIT, 1С-Битрикс)
🔸 Владелец протокола — кто написал правила игры
🔸 Разработчик агента — кто-то кто создал своего агента поверх протокола

И вот тут начинается самое интересное.

🔍 Кто совмещает роли

В ACP роли формально разнесены: OpenAI делает ИИ, Stripe — платежи, Shopify — платформу. Спека открыта (Apache 2.0). Но нюанс: Instant Checkout в ChatGPT — только для одобренных партнёров, платёжный токен пока только через Stripe, а механизма discovery для внешних агентов ещё не существует. Спека открытая, канал — «по приглашениям».

В UCP Google разделил роли сильнее: 4 транспорта (REST, MCP, A2A, крипто-мандаты), 20+ партнёров включая Visa и Mastercard. Мерчант публикует манифест на /.well-known/ucp — это как robots.txt, только для ИИ-покупателей (пример https://store.moma.org/.well-known/ucp). Архитектурно — самый открытый. Но в продакшне пока тоже только Google AI Mode.

В YCP Яндекс — одновременно AI-провайдер (Алиса), платёжка (Yandex Pay), платформа (KIT) И владелец протокола. Четыре роли в одном. Спека закрыта, MCP не поддерживается, внешних агентов нет даже в теории.

💡 Все три протокола — lock-in, вопрос лишь в жёсткости замка. YCP — железный засов (только Алиса). ACP — дверь открыта, но на защелке. UCP — ближе всех к реальной открытости, но пока тоже один работающий канал.


Три вопроса, которые всё решают

1️⃣ Могу ли я подключить своего бота?
ACP — спека открыта, но в продакшне работает только ChatGPT, и мерчанты сертифицированы под него. UCP — архитектурно да (четыре транспорта, Agent-to-Agent), но в дикой природе тоже пока один канал. YCP — нет, только Алиса. По факту ни один протокол сегодня не даёт тебе взять спеку и запустить своего shopping-агента «из коробки».

2️⃣ Могу ли я влиять на то, как ИИ выбирает мой товар?
ACP вообще не покрывает discovery — только чекаут. UCP даёт мерчанту манифест возможностей. А в YCP Алиса сама решает: у неё агент «Найти дешевле», индикаторы цен и персональные скидки. Продавец не контролирует ранжирование.

3️⃣ А если я — не продавец, а покупатель-гик?
Допустим, я хочу агента для себя. Который покупает продукты по моим правилам, а не по правилам рекомендательной системы.

ACP и UCP теоретически это позволяют — спеки открыты, бери и пиши. На практике — discovery нет, оплата только через определенную платежную систему, работающих примеров ноль. YCP — даже теоретически не подключить.

А ведь еще предстоит решить вопрос возврата заказов (доступен только в UCP), работы с отзывами, ограничением возможностей скрапинга контента.

🎯 Вот главный гэп: все три протокола заточены под связку «продавец → ИИ → покупатель». Но никто не строит протокол от лица покупателя — чтобы мой агент ходил по магазинам с моими требованиями и договаривался на моих условиях. Пока ближе всех к этому UCP с его Agent-to-Agent транспортом, но реализаций я пока не видел.


А вы ждёте агентную коммерцию? И что важнее — чтобы подключение было гарантированно простым, или чтобы можно было гибко настроить под себя?

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Похоже, Cowork станет моим новым Экселем, когда исполнят фичреквест

Anthropic добавили планировщик задач в Claude Cowork. И кажется, что часть моей, и не только моей, рутины теперь уйдёт. Правда в начале надо дождаться, чтобы они добавили отложенные задачи, я отправил фичрекверст: https://github.com/anthropics/claude-code/issues/28952
Без этого самый удобный кейс пока будет работать как сжигатель токенов, думаю это не на руку ни Антропикам, ни пользователям подписок. Об этом ниже.

🗓️ Моя боль

Каждый месяц 25 числа я должен аппрувить или составить медиаплан на будущий период. Ритуал: открыть DataLens, посмотреть как шли кампании, проверить сезонность, оценить куда движется рынок, свести всё в таблицу.

Я давно подрядил под это Claude Code. Минус — его надо запускать руками. И да, я ни разу не настроил cron на своём макбуке. Наверное, я просто люблю интерфейсы.

Теперь всё проще: /schedule в Cowork — и Claude сам каждый месяц пишет черновик медиаплана, подсвечивает рыночные инсайты и делает ревью по динамике. Ковырять дашборды теперь требуется реже.

💡 К слову ежемесячного выполнения не завезли, чтобы его достичь надо добавлять в еженедельную проверку, является ли текущая неделя последней в месяце с каскадом сложных формул для коротких недель.


⚙️ Как устроено

Создал пользователя с правами на чтение статистики в базе данных, один раз прошелся через Claude Code в проверку с ним по шагам и попросил создать из этого CLAUDE.md, ту же папку открыл в Cowork, все навыки на месте, у меня теперь готовый агент аудитор медиапланов.

Из ограничений: задачи выполняются только при открытой крышке ноутбука и запущенном Claude Desktop. Если ноут спал в момент запуска — задача запустится автоматически (по крайней мере так обещают), когда откроете приложение. Пропущенные запуски видны в истории.

💡 Для таких задач элементарно ложится фидбек-луп: пусть Claude пишет результаты и заметки в файл, и корректирует при замечаниях пользователя. При следующем запуске он учтёт ваши правки. Обучение агента происходит через файл.


🔭 Что дальше

Я решил, что круто было бы сделать контроль вех в рекламе: проверить куда движется проект, статистика, метрики и принимать режения по расписанию. Раньше это тоже было, но требовало самоорганизации. Правда пока приходится костылить тот самый кейс с проверкой текущей даты.

Осталось научить сотрудников заполнять через Cowork Excel — и ручная рутина с медиапланированием уйдёт окончательно.

А если смотреть шире — именно запланированные задачи делают Cowork не «ещё одним чатом с ИИ», а реальным рабочим инструментом. Правда OpenClawd пока функциональнее с позиции планироващика.

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Вышло первое большое видеоинтервью с Тибо Соттио — тем самым человеком из OpenAI, который нажимает кнопку сброса лимитов Codex. Я сделал полный перевод и саммари:

Кратко о главном из разговора с Мэттью Берманом:

— Тибо пришёл в OpenAI из DeepMind, где за год до ChatGPT уже был внутренний чат-продукт, который Google побоялась выпускать. Его вывод: культура решает

— у OpenAI исследования и продукт проектируются вместе, а идеи доводятся до релиза очень быстро.

— Слияние ChatGPT и Codex не маркетинговый ход: будущие модели сами требуют объединения. Цель — персональный AGI с интерфейсом, который подстраивается под человека. «Вы и ваша мама будете пользоваться одним и тем же продуктом».

— Сбросы лимитов начались как компенсация за сбои, а не как акция. Решение не согласуется ни с маркетингом, ни с финансами: «я могу нажать кнопку, когда почувствую, что это правильно». И да, физическая кнопка существует.

— Luna подешевела на 80%, потому что фронтирные модели оптимизируют инфраструктуру, на которой сами работают. Тибо называет это формой рекурсивного самоулучшения. Скорость ответов за три месяца выросла примерно на 60%.

— Режим ultra fast (до 14× быстрее) внутри OpenAI выдают не всем: мощности резервируют для клиентов, а внутри он нужен при инцидентах. Через год-два такие скорости станут почти стандартом.

— «Через два-три месяца Codex покажется примитивным»: следующему поколению моделей тесен ноутбук — облачные агенты, параллельная работа, голос.

В статье — саммари подробнее и полный перевод всего интервью: от культуры OpenAI и конкуренции с Anthropic до паузы в обучении фронтирных моделей и СДВГ Тибо.

👉 Первое большое интервью Тибо Соттио из OpenAI: саммари и полный перевод

Читать полностью…

Поляков считает: AI, код и кейсы

Был нормальный SEO-спец, познакомился с ИИ, стал ужасным

У меня в Металлик и Ко есть команда SEO-специалистов на аутсорсе, которые медленно прокачивали довольно «сложный» сайт к росту трафика. За 2 года органический трафик стал x3 вообще без переделки структуры (с 2 800 до 10 000 визитов). Поэтому считаю их молодцами и периодически хвалю.

🔗 Сложный сайт: metallik.ru

Ребята реально поняли, что сайт нестандартный, придумали, как ему добавить «магазинности», создали категории тегов товарам, информационные статьи: у сайта растёт Share of Voice. Короче, всё вроде красиво.

Но вот к ним в руки попал ИИ (я узнал его по первой строчке в техзадании по антитезе) — и понеслась.

🤦🏻‍♂️ На что я прифигел

Прилетает рекомендация на доработку раздела профнастила, а там просто лендинг на 26 экранов с отзывами и энциклопедией профлиста.

Выглядит всё нормально и профессионально. Прям убедительно. Таблица, в которой написано, что людям нужны отзывы, они их ищут (лол, что в Гугле) и надо такой экран обязательно. Рядом ответы на главные вопросы, в том числе про снеговые нагрузки. Это очень важно для качественного сайта. И таких 26 экранов.

Но прикол в том, что нормальный человек под каждым пунктом будет спорить:

— 26 экранов на листинге товаров? Это же дофигища, вы куда?
— Отзывы у себя на сайте продавец модерирует сам, доверия к ним меньше, чем к карточке в Яндексе. Отдельный экран под них на листинге — точно не первое, что стоит делать.
— Ребята, у нас вообще-то интернет-магазин на шаблонах, а не лендинг: для нас исправление одной категории профлиста эквивалентно исправлению всех категорий на сайте.


И можно продолжать долго. Короче, проблема ИИ в продвижении в том, что он представляет собой кальку всего успешного успеха, который только можно встретить.

⚠️ На моём опыте есть ряд сфер, где ИИ ужасен

Раньше я любил говорить, что у ИИ есть три области, в которых он из коробки очень плох:

1. ИИ-агенты
2. Реклама в интернете
3. Сайты на PHP

Теперь к списку хочется добавить SEO. В целом эти проблемы предсказуемы и легко объяснимы:

ИИ-агенты, способы их конфигурации, настройки и построение обвязок — это тема 2025–2026 годов. В интернете пока мало материалов на этот счёт, поэтому ИИ часто использует устаревшие идеи.

Реклама в интернете — достаточно старая отрасль, но вся состоит из материалов про успешный успех: как компания-подрядчик включила ретаргетинг/автостратегию/размещения у микроблогеров и какая-то метрика полетела.

Сайты на PHP и материалы, связанные с ними, полны примеров плохих экспериментов и неудачных решений.

SEO туда же. Ключевая мысль тут, что в таких областях надо дополнительно отгружать в ИИ свои знания и свою доменную экспертизу. Какие действия работают, что в рекламе хорошо, как мы пишем и делаем сайты на PHP. Не надеяться на то, что кто-то натренировал ИИ на идеальную рекламу. Не натренировал.

🚀 Сначала отгружаем свою экспертизу и уже на неё зовём ИИ

Прежде чем просить рекомендации, я кладу в контекст четыре вещи: как устроен проект, что физически нельзя поменять, что мы уже пробовали и с каким результатом, по каким правилам принимаем решения. Для «Металлик и Ко» второй пункт звучит буквально так: правка одной категории равна правке всех категорий сразу.

С таким брифом лендинг на 26 экранов просто не рождается. ИИ видит ограничение платформы и предлагает то, что можно раскатить на весь каталог, — а это как раз то, за что я хвалил ребят два года.

🎯 ИИ не знает вашу отрасль. Он знает, как о ней принято писать в интернете. Поэтому и сыпется ровно там, где публичные материалы состоят из кейсов «включили автостратегию — и всё полетело».


А у вас какая область, где ИИ из коробки выдаёт красивую чушь? И что вы кладёте в контекст, чтобы он перестал?

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Вайбкодер и вайб-дизайнер — это разные люди, и жаль

Весной я писал, что профессия верстальщика сайтов попала под давление: сайт теперь собирается за вечер. Три месяца спустя я насмотрелся на результаты и хочу вам пожаловаться.

🍪 Кейс 1. Баннер согласий, который съел статистику

Клиенту переделали сайт. Фирменная черта исполнителя — выкатывать сразу в продакшен: сайт ему проверил GPT-5.6 Sol и сказал, что всё хорошо.

Сразу после выкладки — деградация трафика в Метрике. Оказалось, модель заодно провела терраформирование сайта под европейскую юрисдикцию (GDPR): повесила плашку согласий, которая блокирует Метрику и Calltouch до акцепта.

Проблемы две.

1️⃣ Юридическая. Требование «не грузить счётчики до согласия» — это ePrivacy и GDPR. В 152-ФЗ такой нормы нет, но есть пункт про «явное согласие», который всё портит, разбираемся.

У бизнеса есть законный интерес: считать окупаемость рекламы, отбивать спам, понимать, где ломается сайт. При этом мы не звоним человеку без спроса и не отдаём аудиторию третьим лицам.

Я предлагаю рассуждать про куки с позиции борьбы со спамом: капча — тоже кука. Заблокировали сторонние — тонем в спаме.

Формулировка, которая закрывает вопрос:

🔑 Мы используем файлы cookie, Яндекс Метрику и Yandex SmartCaptcha для анализа посещаемости, противодействия спаму и улучшения работы сайта. Обработка осуществляется в целях реализации законных интересов оператора на основании п. 7 ч. 1 ст. 6 Федерального закона № 152-ФЗ «О персональных данных». Подробнее — в Политике обработки персональных данных.


2️⃣ Денежная. Счётчик молчит — автостратегии Директа недосчитываются конверсий и учатся на обрубленной выборке. Результат — падает доходность бизнеса. Аналогичным образом происходит изменение статистических факторов ранжирования в органическом поиске.

🧩 **Кейс 2. site-config.js вместо констант**

Здесь я был принимающей стороной. Попросил фрилансера вынести телефон, цену и прочее в строковые константы лендинга, чтобы правки не растекались по файлам.

Получил site-config.js, который подменяет захардкоженные значения в готовом HTML. Вместо одного места для правок стало два. Хотели уменьшить сложность, что Codex её увеличил. Забыл поправить исходник — в поиске висит старая цена, потому что роботы поисковых систем не любят java script.

Отдельно про «робот всё отрендерит». Рендерят так неохотно, что капец.

Google ставит JS-страницы во вторую волну: у неприоритетных доменов очередь тянется неделями. Яндекс держит рендеринг в бете с 2022 года.

LLM-краулеры не рендерят в принципе. Vercel и MERJ разобрали 500+ млн запросов GPTBot — ни одного исполнения JS.
Цена, подставленная джаваскриптом, для ChatGPT и Perplexity просто не существует.

🎯 К чему я веду

В обоих кейсах код рабочий и симпатичный. Всё выглядит в высшей мере профессионоально и красиво.
Сломалось понимание контекста: чья юрисдикция, откуда приходят деньги, кто читает страницу кроме человека.

⚡ Вайбкодер разбирается в логике продукта и умеет остановить агента. Вайб-дизайнер оценивает результат по картинке и похвале от модели.



📚 Где брать базу

Сейчас будет похоже на нативку, но я правда вспоминал этот курс за несколько дней до анонса. В прошлом году моя жена Даша прошла «Вайбкодинг на максималках» Глеба Кудрявцева.

Первые занятия там — про то, что такое программа, язык программирования, зачем нужны Git и Docker. И только потом «давайте сделаем прикольно». Ровно позавчера рассказывая про шишки набитые об красивые лендинги я вспоминал курс Глеба и говорил, как круто, что он учит базе и объясняет подводные камни.

Очень кстати, что очередной поток стартует 20 августа. Есть бесплатная первая лекция, а промокод GLEB3 даёт ещё 10% сверх цены на лендинге.

А теперь предлагаю повспоминать косяки, которые вам принесли GPT Sol, вкатившийся вайбкодер или разработчик. Пишите в комментариях.

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Туту проводит хакатон: хороший способ познакомиться с командой

Помните я рассказывал, что запустили MCP для сервиса путешествий Туту. Самый популярный запрос в личку по итогам анонса был про то, как я нашел проект и договорился с командой. Ответ простой, команду я уже знал, прототип приготовил за вечер. Сделал демо, оно зашло.

Вчера Туту анонсировали хакатон с призами: https://hackathon2026.tutu.ru

Призы символические — деньги на покупку внутри сервиса. Но принципиально это предложение почелленджить интересные идеи для тревел-сервиса на живом API компании.

🙋🏻‍♂️ Сижу в жюри, буду оценивать решения

Ваш покорный слуга приглашён в качестве судьи. На прошлой неделе проходило аналогичное мероприятие со студентами центрального университета. Лично мне зашло два решения. Одни ребята сделали ассистента, который управлял фильтрами на сайте (как Elevenlabs у себя), другие сделали Тиндер предлоджений.

🚀 Если бы я участвовал в таком челлендже, я бы наверное сделал тиндер-механику в целом для тревела. Типа поле ввода: путешествие на двоих с семьёй и варианты, которые обучаются в зависимости от сделанных человеком лайков. Тут отлично вписываются и агенты и рексис и спецпроекты для маркетинга.


🤔 Кому бы я советовал принять участие

Если интересуетесь карьерой в тревелтехе, ИИ-агентами, в т.ч. как владелец продукта — хакатон однозначно для вас.

Кроме призов организаторы совершенно точно заинтересованы в формировании кадрового резерва + с удовольствием реализуют вместе интересные проекты.

Если собираетесь участвовать — напишите в комментариях, в какую сторону копаете: подбор поездки, интерфейсное решение или свой агент поверх MCP.

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Сложные задачи для OpenClaw, учим делегировать

Когда в чатах писали, что OpenClaw не тащит сложные задачи, я не придавал значения. Ну мало ли, модель не та, окружение кривое. Пока сам не попробовал.

🦞 Попробовал, признаю, долгоиграющие задачи сломаны

Развернул инстанс на Mac Mini, дал серьёзную задачу: рисерч на YouTube, отбор роликов-кандидатов по правилам, скачивание, транскрибация, обработка скиллом. Пять шагов, каждый из которых сам по себе сложный и/или долгий.

Краб стал бесполезен. Согласовывал в Telegram планы, чем отвлекал, а когда стал работать, то постоянно упирался в таймауты, задаче нужно пара часов. Если не указать таймаут (по умолчанию 0), агент зависает в сессии навсегда и становится бесплезным для других вопросов. Короче сессии привязанные к чату — перебор.

Стал думать что делать, ковырял документация, попробовал Lobster и HZL. Для линейных пайплайнов — ок. Для сложных задач — бесполезно. Хотя HZL как межсессионное хранилище — удобно.

Момент истины

Тут я отчётливо почувствовал, насколько гибче привычные Cowork, Claude Code или Codex. Они берут задачу и делают. Без согласований, без «давай я тебе план покажу» или «тут я сомневаюсь». Могут хоть по несколько часов работать.

Идея: не заставлять краба делать сложное самому, а научить делегировать кодинг агенту. Причем сами кодинг агенты поддерживаются как тулы. Вот я и пришел к главному выводу.

🦞 Лучшая клешня — та, которая знает, как вызвать Codex.


А назвал я это в шутку Cron Guided Reasoning (CGR).

🔧 Вот что придумал

Через плагин ACP краб запускает кодинг-агентов как one-shot задачи. Сессия не удерживается, работает фоновый процесс. Добавляем cron — бот будет проверять запущенную сессию регулярно. Фактически описание запуска cron + доступные codex рабочие области со скиллами и становятся наполнение TOOL.md

Схема:

1️⃣ Даёшь крабу задачу — он запускает Codex в отдельном воркспейсе

2️⃣ Ставит cron «проверить через N минут»

3️⃣ Кидаешь следующую задачу — краб запустит ещё один Codex параллельно

4️⃣ Cron будит краба, он проверяет статус одной задачи и отчитывается в Telegram

Вместо одного тупящего агента — оркестратор с параллельными Codex-сессиями. Завёл воркспейсы: аналитика (Метрика, Wordstat), картинки (fal.ai, mermaid, matplotlib и д), публикации (Telegraph). Каждый со своим набором скиллов.

⚠️ Грабли

Если сбросить сессию, cron-задачи остаются и кидают нерелевантную фигню. Решение — HZL как хранилище задач, переживающее сессию. Краб при старте читает HZL и понимает, что актуально.

Ещё баг в acpx: параметр cwd не работает с Codex. Чинится избыточными инструкциями. Отправил issue в репо OpenClaw, баг подтвержден и уже есть PR, фикс будет в обновлении.

🎯 Итого

OpenClaw — отличный роутер и точка входа через мессенджеры. Но не замена для кодинг агентов. А вот как универсальный интерфейс для управления агентами с любого устройства — уже неплохо.

Если находили какие-то еще интересные фишки для улучшения OpenClaw — пишите в комментариях.

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

1M контекст в Claude — сожжёт лимиты или нет?

Anthropic дал миллион токенов контекстного окна по умолчанию всем подписчикам на Opus 4.6. Раньше Claude Code компактил контекст при приближении к лимиту ~200K (на самом деле 130), сжимая историю в резюме. Теперь можно тащить сессию целиком.

🤔 Такой ход как будто указывает на условный проигрыш Anthropic в битве за компакт. Codex производит его эффективнее, держит инструкции в диалоге, не останавливаясь на принудительные сжатия.


Миллион контекста звучит дорого? Я посчитал — и поработал, дошёл до двух компактизаций на
миллионе. Ниже по качеству.

🔍 Как устроен кэш и почему он решает

Каждый ход агента — повторный вызов модели со всем контекстом. Без кэша вы платите за все 500K на каждом шаге. Кэш промптов позволяет «перечитывать» старое почти бесплатно.

На подписке Cache Read не стоит кредитов вообще, если верить исследованию https://she-llac.com/claude-limits. На API — 10% цены. Cache Write на подписке без наценки, на API — 1,25×.

💡 Тёплый кэш превращает 1M контекст почти в бесплатный: платите только за новые токены хода. Дорогой только вывод модели.


Ловушка: кэш живёт 5 минут

Ушёл за кофе — кэш мёртв. Можно за отдельную плату получить долгоживущий кеш. Но по дефолту 5 минут. При 1M на 80-м ходу ходу моего экспермента — делаем перезапись 480K токенов — только один запрос будет стоить $2,5 при оплате за API.

📊 Расчёт: подписка, 120 ходов, одинаковые паузы

Когда говорим, что дороже, это значит, что лимиты будут улетать быстрее.

🔸 0 пауз (агент в потоке): 1M тратит 0,9× от компакции — дешевле.

🔸 1 пауза: ~1× — безубыточность. Одного перерыва хватает, чтобы съесть всё преимущество.

🔸 5 пауз (всё еще нереальная работа): 1,4× от компакции.

🔸 20 пауз (я работаю приблизительно так): 2,26× раз быстрее будут улетать лимиты.

👨‍💻 Я проверил, да, расходуется чуть быстрее, но не критично, я и так не выкручивал недельные лимиты на своей подписке Max. После компакции модель резко деградировала.


🔸 На API: 1M всегда дороже — от 1,8× до 2,5×.

🔑 Что делать

1️⃣ На подписке + Claude Code непрерывно — 1M выгоднее. Не выключайте.

2️⃣ Если работаете с перерывами или через сторонние АПИ без 1М, можно вернуть 200K:
CLAUDE_CODE_DISABLE_1M_CONTEXT=1

3️⃣ На API без кэша 1M — экономическая катастрофа. Проверьте cache_control.

В целом, мне кажется, что ход правильный — если не можешь обыграть конкурента в компактизации, дай пользователям супер большой контекст.

Уже пробовали 1М? Какие ощущения? Быстрее подписка кончается?

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Во все тяжкие: Mac Mini как сервер для ботов

Ладно, я это сделал. Mac Mini M4 (16/512) для Telegram-ботов. Чтобы стоял в комнате, молча работал

🤷 Что не сделаешь, чтобы на стрижку и массаж через бота записываться.


Старый бот пока живёт на виртуалке, тут хочу поднять нового. План такой:

🔸 Автопереключение на резервный ключ
🔸 Отдельный аккаунт iCloud, приглашённый в Family — общие папки для всех членов семьи, чтобы бот мог обрабатывать файлы
🔸 Два инстанса клешни — основной и запасной (запасной будет легальных API ключах антропика)
🔸 Собираюсь абьюзить подписку OpenAI, так что буду покупать по 50 рублей аккаунты.
🔸 Сервис мониторинга API-ключа OpenAI: если ловим бан — хук и нотификация пользователю прямо в чат

🔭 Сейчас к Даше должны прийти подруги и спросить: «А что? Саша абьюзер?»


Делитесь опытом

Кто как живёт с этим:

🔸 Как решаете ротацию API-ключей при блокировке? Пул ключей, автоматический перевыпуск, или ручками?
🔸 Какую модель крутите в своих ботах?
🔸 Где покупаете аккаунты?
🔸 Какие сценарии автоматизировали — бытовые, рабочие?
🔸 Какого бота развернули? Опен/Зиро/Пикакло?

У меня пока пик автоматизации — проверка доставки «Вкусвилла» и заказ пропусков через API управляющей компании.

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Как я публикую диприсерчи Клода в Telegram Instant View за 10 секунд

Представьте: Клод только что отработал глубокое исследование — с таблицами, диаграммами, кодом. Хочется поделиться с подписчиками не куском текста, а нормальной статьёй с Instant View.

Открываете Telegra.ph и начинается ад: форматируете заголовки, загружаете картинки на сторонний хостинг, вручную вставляете ссылки, чистите таблицы... Час работы на материал, который Клод сделал за 3 минуты.

Когда подписчик @Amovcharenko написал мне про апи от Телеграфа, я решил, что проблему можно решить раз и навсегда.

🛠️ Telegraph Publisher: скилл для Claude Code

Написал скилл, который превращает любой диприсерч в готовую статью Telegraph одной командой. Клод сам:

🔸 Загружает изображения через GitHub CDN (jsDelivr) — постоянные ссылки, не ломаются
🔸 Конвертирует Mermaid и PlantUML диаграммы прямо в картинки
🔸 Форматирует таблицы в monospace-блоки — читаются даже на мобильном (если немного колонок)
🔸 Управляет ссылками и якорями
🔸 При удалении статьи каскадно чистит все связанные медиафайлы из репозитория

💡 Ключевой хак: токен Telegraph хранится в cookie tph_token в браузере. Его можно извлечь через DevTools → Application → Cookies и передать скиллу — тогда все статьи автоматически появятся в вашем аккаунте, а не создадутся на чужом.


🗂️ Фишки

Вся медиа хранится в публичном GitHub-репо, раздаётся через jsDelivr CDN. Для каждой статьи скилл ведёт манифест: какие файлы загружены, какие SHA. Решили удалить материал — команда github_delete_page_assets вычистит картинки из репо для этого материала.

Автосплит: если материал не влезает в лимит 64 KB Telegraph API, скилл режет его на части и создаёт индексную страницу со ссылками.

⚙️ Что нужно для работы

— Публичный GitHub-репо (только для медиа, не мешайте с кодом)
— Fine-grained PAT с доступом только к этому репо
— Токен Telegraph из браузера

Код скилла — в репозитории https://github.com/artwist-polyakov/polyakov-claude-skills/tree/main/plugins/telegraph-publisher/skills/telegraph-publisher

Если знаете удобные способы, чтобы шерить контент из LLM в паблик — дайте знать)

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Вокруг AGENTS.md и всяких "универсальных" файлов для агентов в последнее время как-то слишком много разговоров. Особенно забавно это выглядит на фоне того, что рядом уже начали появляться вполне трезвые наблюдения о том, что польза таких файлов слегка преувеличена.

Например, у @gonzo_ML был хороший разбор статьи Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents? (arxiv:2602.11988). Если совсем кратко, то вывод там неприятный, но логичный - автоматически сгенерированные контекстные файлы на уровне репозитория часто не помогают, а скорее мешают. Они снижают долю успешно решённых задач и одновременно увеличивают стоимость инференса. Модель вместо решения задачи уходит в блуждание по кодовой базе и бесконечное "изучение архитектуры", порождая галюнчики.

Из свеженького, что меня побудило написать этот пост:
- в мой любимый KodaCode добавили поддержку SKILLS.md, и AGENTS.md
- @max_about_ai была здравая мысль про документацию в эпоху AI
- а у @countwithsasha был пост про то, как вообще собирать агента из скиллов

То есть с моей точки зрения рынок постепенно обрастает всем этим зоопарком форматов, манифестов и "магических" markdown-файлов.

Но лично мне вся эта практика с одним условным большим `AGENTS.md` на 10к токенов кажется порочной.


Проблема не в том, что агенту не нужен контекст (без контекста, увы, никак). Проблема в том, что люди пытаются запихнуть в один файл вообще всё подряд - архитектуру, команды запуска, ограничения, стили кодинга, особенности тестирования, бизнес-логику, карту директорий, описание CI, правила коммитов, правила работы с миграциями, требования к безопасности и ещё сверху тысячу строк "полезных пояснений". В итоге на каждом запросе в контекст летят тысячи, а на сложных проектах и десятки тысяч токенов текста, большая часть из которых в конкретный момент просто не нужна.

И вот тут у меня каждый раз возникает простой вопрос - а кому вообще выгодна эта мода на огромные универсальные AGENTS.md? Разработчику точно нет. Агенту тоже не особо. Зато очень выгодно вендору, который продаёт доступ к моделям по API. Чем больше токенов вы стабильно прокидываете в каждый запрос, тем больше вы тратите токенов, тем больше зарабатывает вендор.

Поэтому на мой взгляд куда более практичный путь давно уже показал Cursor со своими Cursor Rules. Не потому что это какой-то идеальный формат, а потому что там хотя бы немного подумали над логикой динамического наполнения контекста в процессе работы кодового агента.

В Cursor правила можно дробить на небольшие, специализированные и адресные кусочки. Какие-то применять всегда, какие-то только по glob-маскам, какие-то подключать вручную, какие-то держать на уровне монорепы, а какие-то внутри конкретного подпроекта. То есть вместо одного аморфного AGENTS.md вы получаете управляемую систему контекста с дюжиной небольших файлов, из которых подтягивается только то, что действительно относится к текущему файлу, текущей задаче или текущему этапу работы.

Не "один файл, в котором описана вся подноготная проекта", а "набор маленьких правил, каждое из которых отвечает за свою область".


Чуть более подробно почитать про Cursor Rules можете тут, там я рассказываю как раскладывать правила по .cursor/rules/, как ссылаться из них на документацию и почему такой формат удобнее в реальных проектах, а вот тут ещё один пост, где я показывал как использовать правила, документацию и TDD/BDD-подход в связке с агентом.

Подытожу, документация агентам нужна, правила нужны, скиллы нужны, но всё это должно быть модульным, иначе вместо управляемого контекста вы просто сжигаете токены.

Читать полностью…

Поляков считает: AI, код и кейсы

Скилл Метрики, часть 2: проверяем гипотезу SEO-команды за 2 минуты

Сначала выложил скилл Яндекс.Метрики. На следующий день получил кейс, ради которого он и создавался.

На зуме с SEO-командой одного из моих регулярных проектов специалист высказал смелое предположение:

— Оптимизация заголовков карточек товаров — пустая трата времени, результат не меняется, топ заполнен маркетплейсами.

Прошлой весной мы переделали заголовки по профнастилу, и нужно было быстро понять — дало это что-то или нет. Идеально, прям на зуме.

Задача: отделить эффект от наших действий от сезонного роста спроса. Классическая аналитическая работа минут на 30 — выгрузить трафик из Метрики, спрос из Вордстата, нормировать, сравнить динамику.

🔍 Дальше было демо Cowork

Если интересно, я могу выложить фрагмент видео.
Я просто написал один промпт. Claude подключил оба скилла — Метрику и Вордстат — и выстроил методологию:

1️⃣ Вытащил помесячную органику по страницам входа категории профнастил из Метрики
2️⃣ Забрал динамику спроса «профнастил» из Вордстата за тот же период
3️⃣ Нормировал обе серии и сравнил темпы роста

📊 Результат

Честно говоря, я бы долго щелкал по вкладкам интерфейса Яндекс.Метрики, чтобы получить нужные срезы и фильтры. У навыка в Claude Cowork ушло пара минут.

Когда я попросил сравнить с Вордстатом — то еще через пару минут получил аналитику сезонного влияния, оказалось было что-то кроме сезонности (оптимизация заголовков).

По запросу Claude также разделил каталог и статьи: товарные карточки дали 154 конверсии (CR 1,2%), статьи — ноль прямых заказов. Но тут же объяснил, что в модели атрибуции к последнему значимому переходу вклад статей в верх воронки может быть не виден — нужны ассоциированные конверсии.

Ключевое, это скорость получения аналитики по сравнению с ручным подходом.

🔗 Ссылки

Скилл Метрики: GitHub
Скилл Вордстата: GitHub

Если у вас тоже были задачи в Метрике, которые тратили много времени — приходите в комментарии, затестим через скилл.

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Скилл для Claude: аудит трафика через Яндекс.Метрику

Сегодня пришёл новый проект на рекламу, нужно было оценить историю: какие каналы работали, где конверсии, что с органикой. Открыл Метрику и поймал себя на мысли, что делаю одно и то же в сотый раз: счётчики, цели, источники, помесячная разбивка. Упаковал рутину в скилл.

🔍 Что умеет

8 скриптов, которые покрывают базовый аудит: список счётчиков, метаданные, цели, трафик по источникам, конверсии по целям, UTM-разбивка, поисковые системы. Плюс произвольные отчёты через любые метрики из API (пока не проверял).

Claude получает промпт вида «оцени статистику яндекс метрики — что работает, что нет», сам подключается к Метрике собирает данные и выдаёт анализ.

🧩 Минутка извращений: кеш для экономии контекстного окна

Главная проблема скиллов, где скрипты + внешнее API — они засоряют контекстное окно. Каждый ответ API может занять тысячи токенов. Поэтому:

🔸 Счётчики, цели и метаданные кешируются в TSV/JSON и переиспользуются между запросами
🔸 Отчёты кешируются по хешу параметров (counter + даты + фильтры). Повторный запрос за тот же период не тратит ни токенов, ни квоту API
🔸 Вывод ограничен 30 строками — полные данные уходят в CSV, а Claude видит только шапку
🔸 Если date2 = сегодня, кеш пропускается — данные ещё копятся

💡 Принцип: скилл должен экономить контекстное окно так же, как код экономит память. Чем меньше мусора в контексте — тем точнее анализ.


⚙️ Детали реализации

🔸 По умолчанию без сэмплирования
🔸 Фильтр isRobot='No' по дефолту, хотя может быть в эру агентной коммерции, пора отключать
🔸 Автоматический ретрай при 429 с Retry-After + случайный jitter
🔸 Скилл работает в любом окружении, включая контейнеры Claude
🔸 Схема работы: счётчики → выбор проекта → цели → выбор конверсионных → сохранение конфига → отчёты

📊 Пример из первого аудита

На новом проекте Claude за 3 минуты собрал картину, которую вручную я ковырял бы минут 30: реклама в Директе приносила трафик, но почти без конверсий — 95% шло на главную без посадочных. Зато органика выросла в 11 раз за полгода с конверсией 3-8%. Прямой трафик оказался эффективнее рекламного в десятки раз.

Один промпт и сразу отчет.

🔗 Как подключить

Нужен OAuth-токен Яндекса с правом metrika:read. Настройка проще, чем у скилла Вордстатаинструкция в README.

Код: GitHub

API Метрики большая — пока реализованы базовые отчёты. Кто хочет добавить экспертизы — приходите в личку или в PR. Хочется сделать функцональный скилл.

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

На 100% согласен с Алексеем.

Я это вижу в каждом консалтинговом проекте: основной затык при внедрении ИИ — не модели, не API, не бюджеты. А то, что команда не может внятно описать, как она принимает решения. Бизнес-процесс живёт в головах, а не на бумаге.

Люди, которые научатся дистиллировать свой опыт в скиллы для агентов, окажутся незаменимыми. Именно незаменимыми — потому что скилл без эксперта устаревает, обрастает ошибками и беклогом.

Читать полностью…

Поляков считает: AI, код и кейсы

Шер-парад февраля 2026: что уносят себе, а что приводит подписчиков

В январе я начал мерить контент процентом шеринга от просмотров — сколько людей «унесли» пост себе или коллеге. Февраль — второй замер. 23 поста, 58 000 просмотров, 2 400 пересылок.

🥉 Третье место: код ревью — два ИИ лучше, чем один

Пост про скилл, где Claude пишет код, а Codex его ревьюит. Делал как таблетку от ошибок Claude Code, в итоге пользуюсь каждый день, а сам скилл прокачался и в ревью и в поддержке git worktree.

133 шера на 1 555 просмотров — 8,6%

🥈 Второе место: аудит рекламных кампаний через Claude

Продолжение истории с Вордстатом — загружаешь Excel из Директа, Claude находит дыры в семантике: упущенный спрос. Благодаря хитрому алгоритму получается круче чем у людей. Группы обрабатываются параллельно через субагентов, 13 групп за 3 минуты.

🪙 Ксатати пост про Вордстат пробил 1000 сохранений, кажется это может быть как «серебряная кнопка телеграм»


200 шеров на 2 287 просмотров — 8,7%

🥇 Первое место: парсинг выдачи Яндекса

Скилл, который родился из вопросов после доклада на ROИИ. Парсит топ Яндекса через Search API v2 — позиции, сниппеты, домены. В связке с Вордстатом и скрапером — конкурентный анализ за один промпт.

186 шеров на 1 967 просмотров — 9,5%

💡 Все три победителя — open-source скиллы. Не обзоры, не мнения, не новости. Инструменты, которые можно забрать и использовать прямо сейчас. Формула не изменилась с января. Аудитория сохраняет себе то, что может пригодиться в работе.


🦄 Отдельная номинация: рекорд по охвату

Пост про бота ВкусВилл — абсолютный чемпион февраля по масштабу: 818 пересылок и 13 392 просмотра. Всего 6,1% сохранений, но в абсолютных числах это больше, чем весь топ-3 вместе взятый.

Бытовая автоматизация понятна всем — не только разработчикам и директологам. «ИИ заказывает продукты» захватывает популярную в 2026 агентную коммерцию. Именно этот пост привёл больше всего новых подписчиков в феврале.

🔮 Что дальше

Скиллы — ядро контента, ВкусВилл показал силу бытовых кейсов для роста. Буду миксовать:

🔸 Генератор тактики рекламирования на основе скиллов аудита
🔸 Связка Вордстат + поиск + скрапер в один «маркетинговый комбайн»
🔸 Больше бытовой автоматизации — она приводит новых читателей

Если есть идеи для скиллов, исследований или автоматизации — предлагайте, попробую рассказать в канале

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

В полку фанатов Codex маленький праздник: завезли тул для вопросов

Еще codex spark модели принесли всем подписчикам, раньше были доступны долько тем, кто платит $200, но сейчс не об этом.

Раньше функционал вопрсов к пользователю был доступен только в plan-режиме, а в обычном нет. Для примера AskUserQuestionTool в Claude Сode доступен всегда.

🔓 Что изменилось

В версии 0.106.0 request_user_input наконец включили в обычный режим работы. Началось всё с issue #10384 — наш соотечественник месяц назад попросил эту фичу и вот ее реализовали.

Чтобы включить, нужен feature flag:


codex features enable default_mode_request_user_input


После этого агент сможет задавать вопросы прямо во время выполнения задачи, а не только на этапе планирования. Сам тул называется functions.request_user_input

⚙️ Мой кейс

Лично я использую Codex как ревьювера через кастомный скилл codex review (рассказывал тут).

🚀 С момента выхода поста скилл для ревью сильно прокачался: стал точнее ревьювить и научился даже в git worktree.


Раньше агент мог только смотреть код и давать фидбэк. Теперь появилась возможность проводить более глубокую инициализацию сессии — агент спрашивает про контекст изменений, приоритеты, ограничения. Может подвестить неявную логику или достать неочевидные знания.

----

Поляков считает — AI, код и кейсы

Читать полностью…

Поляков считает: AI, код и кейсы

Claude Code теперь работает с телефона. Забываем несколько опенсорс проектов

Позавчера жаловался в чатах: бесит, что мои локальные сессии Claude Code не видны в приложении на вкладке Code. Не ну бред же. Codex давно запустил GUI с обзором сессий.

Вчера Anthropic выкатил Remote Control. Пока Research Preview только для Max-пользователей. Короче готовили ответ пожирнее.

🔧 Что за Remote Control

Набираешь /remote-control в терминале — и твоя локальная сессия становится доступна через веб или мобильное приложение во вкладке Code. Там создается какая-то ссылка, но всё и так доступно в приложениях сразу. Ссылка требует авторизации. С чужого логина не проверял.

Сессия продолжает работать на твоей машине. Файлы, MCP-серверы, конфиги — всё на месте. Телефон — просто окно в локальный терминал.

💡 До вчерашнего дня для этого был целый зоопарк решений. Самый популярный — Happy, некоторые юзали Termius, но это извращения, конечно.


🚀 Что реально круто

🔸 Запуск дочерних сессий через agent-deck — спавнишь команду агентов, пока гуляешь без создания ремоут сессии.
🔸 Расширение Chrome доступно — Claude тестирует и парсит в браузере на маке. Важно чтобы не было несколько окон.
🔸 Любые Антропик-подобные модели — с GLM эта штука тоже работает.
🔸 Удаленные сессии не обрабатывают команды к терминалу, которые через ! — это очень хорошо, не получится случайно дать портал в свою машину.

Ограничение: макбук не должен спать

Процесс Claude живёт в терминале у пользователя. Если уснет: API-запросы протухнут, MCP-соединения порвутся. При пробуждении CLI оживёт, но активные запросы придётся повторить.

🖥️ Вот куда надо использовать Mac MIni, короче.


⚙️ Что хочу еще протестить

Если у вас несколько учёток — попробуйте открыть сессию в CC одной учётной записи, а по ссылке авторизоваться из другой, интересно выдаст ли ошибку или ссылка — прямой путь в ваш терминал.

----

Поляков считает — AI, код и кейсы

Читать полностью…
Subscribe to a channel