aostrikov_ai_agents | Unsorted

Telegram-канал aostrikov_ai_agents - Остриков пилит агентов

4865

Занимаюсь разработкой AI-агентов и рассказываю про это вам. Чатик: https://t.me/aostrikov_agents_chat С рекламой сразу в /dev/null Личка: @aostrikov

Subscribe to a channel

Остриков пилит агентов

Коля, я правильно понимаю что:

1. нужно купить очки с дополненной реальностью

2. скачать твою прошивку, которая дает зрение Хищника

3. купить метательный диск Хищника, который возвращается к тебе

И все, можно идти решать любые вопросики в МФЦ?

Читать полностью…

Остриков пилит агентов

☝🏻☝🏻☝🏻

Настолько люблю Сергея, что буду вообще не задумываясь пиарить его эвенты!

А почему - да потому что они просто топ, был на парочке, они шикарны

🥳🥳🥳

Читать полностью…

Остриков пилит агентов

Еще немного будней разработчиков агентов

Представьте у вас полно агентов в разных странах. И допустим, что агенты отличаются только промтом.

Логично, что у вас есть версионирование агентов, то есть их промтов. И допустим последняя версия - 42, она раскатана на все страны. А еще мы помним, что в команде у нас несколько человек.

Итак, Саша создает 43 версию агента - для обучения пользователей ходьбе на руках в Австралии. Добавляет кучу правок в промпт, оптимизирует, гоняет корзинки, получает версию 43.5, катит её на 15% пользаков в Австралии, ждет прокраса эксперимента.

Но параллельно с ним Тимофей тоже взял 42 за базу, от нее создал 44 версию, которая помогает людям варить минутный рис за 58 секунд. И в итоге у него получилась версия 44.8, которая поехала на 30% Японии.

Саша первый получил зеленый прокрас экспа 💚 и решает раскатить свою 43 (на самом деле 43.5) на всю географию. Берёт и катит, ну кроме 30% Японии - она на 44.8 катается в экспе Тимофея.

Тимофей на след день получает свой зеленый прокрас 💚, и готов катить теперь свои знания на весь мир - людям не только в Японии нужно быть продуктивнее.

Вопрос знатокам - на что Тим попадает? Правильно - на мерж конфликтов промта своего и 43.5. А еще на озеленение всех корзинок плюс своих, на объединенной версии агента. А сыночки-корзиночки еще и флапают иногда, всё по красоте 🍵

К чему это я? Раньше мы мержили лишь код на заливке в транк, теперь ещё мержим промпты агентов, когда катимся на все страны ☕

А также у агентов могут меняться не только промты, у них полно тулов и описаний для них, которые тоже часто меняются 🤡

И нормального интерфейса для резолва конфликтов нет, пока все на чистом вайбе и доверии.

А также системой этой должны уметь пользоваться просто люди из бизнеса, не программеры. И для них все должно быть просто и понятно, без ошибок

———
Я поныл, всем спасибо.

Пойду пинать свою 37.9, в которой упорно не могу научиться убеждать всех, что пора тормознуть с ИИ - но ведь с Дарио сработало…

Читать полностью…

Остриков пилит агентов

https://www.youtube.com/watch?v=ZpL3QsO5A9U

Спокойное, неторопливое и глубокое видео для тех, кто пересобирает у себя в компаниях найм, который раньше работал, но поломался с приходом AI.

Там нет TLDR или списка того, как вам переписать свои секции, ребята просто делятся мыслями, освещают проблемы с разных сторон и думают над решениями.

Понравилась идея про то, что цель интервью как и раньше - собрать максимальное количество флагов для принятия решения, а AI позволяет тебе собрать их больше и быстрее.

Что писать код на бумажке теперь вряд ли стоит, но увидеть как мыслит человек обязательно нужно, чтобы понять кто паре ведущий: кандидат или клод и не нанять meat proxy.

Понравилась идея вместо 3-4 разных этапов сделать одно 2х-часовое интервью где вы на звонке и проходите несколько фаз вместе с AI - проблема, исследование, архитектура, кодинг, деплой, анализ.

Интересную тему затронули про схлопывание ролей, например инженера с менеджером, насколько сильным будет их пересечение и различие, приведет ли это с появлению одной универсальный роли - member of staff, по нашему мастер на все руки.

Такое годно смотреть, если вы уже сделали несколько попыток перестроить найм, новые идеи хорошо лягут на ваши прошлые.

Читать полностью…

Остриков пилит агентов

Помните, у нас несколько недель назад был стрим на Твиче?

Так вот, ребята наконец его доверстали и собрали видосик.

Была там интересная история - кто же мог подумать, что на официальном стриме Яндекса нельзя было говорить про программу Amphetamine?

До сих пор не понимаю, что в ней плохого, суперская программа, позволяет нам вайбкодить без засыпания ноута...

📹 https://youtu.be/UXJIvd02oQQ
📹 https://youtu.be/UXJIvd02oQQ
📹 https://youtu.be/UXJIvd02oQQ

———
Для всех, кто купил курс из прошлого поста, ролик абсолютно бесплатный.

Кто до сих пор думает, решайтесь - с понедельника цены вырастут

Читать полностью…

Остриков пилит агентов

блин опять без книги не обошлось 😄 но скинул все равно, там вроде понятна логика как факты собираются и как потом подсовываются агенту

Читать полностью…

Остриков пилит агентов

Новости, ребят, вышел новый протокол.

Ну как протокол - новый формат файликов в папке:

https://agent-plugins.org/

В октябре прошлого года вышли скиллы и люди их в итоге выкупили. Теперь везде полно разных Skill Store:

- наш отечественный: https://skill-store.ru/
- от Vercel: https://www.skills.sh/
- от Валеры: https://neuraldeep.ru/skills

Даже внутри Яндекса теперь есть свой Skill Store и народ им постоянно пользуется.

Но что делать с MCP?

Обычно descriptions и схемы всех подключённых MCP-тулов харнесс сразу кладёт в контекст. Скиллы устроены хитрее: сначала модель видит только короткие name и description, а полная инструкция подгружается, когда скилл понадобился.

Поэтому ушлые ребята научились вообще не подключать часть MCP постоянно. Вместо этого кладут CLI или API-клиент в scripts скилла, пишут в description, когда этим пользоваться, и получают лучшее от обоих миров: тулы есть, а контекст заранее не съеден.

Плохо что ли? Хорошо!

Так вот, умные дяди из OpenAI, Vercel и прочих компаний решили объединить два лагеря и сделали единый формат упаковки обеих сущностей.

Behold! Agent Plugins! 🙏🏻

Теперь в один пакет можно положить:
- пачку скиллов;
- mcp.json с конфигами MCP-серверов;
- client extensions - любые дополнительные файлы для конкретного харнесса.

Плохо что ли? А зачем?...

В чём смысл такого «пакета умений», если это просто коробка рассыпанных шестерёнок без инструкции по сборке?

Допустим, идея была в том, что ты подключаешь плагин - и модель сразу превращается в волка с Уолл-стрит: проводит интервью через skill1, отрабатывает возражения через skill2, оформляет покупку через MCP1 и пишет в поддержку через MCP2.

Но нет.

В plugin.json есть короткий description, у каждого скилла есть свой description, у MCP-тулов тоже будут свои descriptions. А центрального переносимого PLUGIN.md, который объясняет модели весь продукт целиком - какие задачи он решает, как выбирать сценарий и как собирать skills и MCP в один workflow - в стандарте нет.

Это всё равно придётся прописывать уровнем выше: в инструкциях вашего харнесса, отдельном meta-skill или client extension, который другие клиенты уже не обязаны понимать.

Подгрузятся ли после подключения плагина descriptions и схемы всех MCP-тулов в контекст?

Стандарт этого не определяет. Один харнесс загрузит всё сразу, другой спрячет тулы за tool search, третий подключит MCP только по необходимости.

Как настроите - так и будет.

То есть пока это просто удобная коробка для доставки skills и MCP. Коробка хорошая, но инструкцию по сборке забыли - так бы сказал наш миньон-ревьювер, Захар привет!

Не отдавайте главного архитектора в IKEA.

<пингвин_в_наклоне.jpg>

Читать полностью…

Остриков пилит агентов

@aostrikov для ценителей на всякий случай.

Читать полностью…

Остриков пилит агентов

☝🏻☝🏻☝🏻

Считаю Колю одним из самых сильных AI-спецов в РФ комьюнити, а тут еще и дорогобогатый подкаст в уютной студии вышел

Упираемся в 5-часовой лимит и смотрим 🍿

Читать полностью…

Остриков пилит агентов

Всем от души кто залетел 🤌🏻

Читать полностью…

Остриков пилит агентов

Главная новость прошедшей недели:

Дарио сказал ФАК Ю

... и забанил меня в четверг. Fable, вечная память. Пришлось в спешке пересаживаться на кодекс, благо там есть волшебная кнопка - перенести все из клода.

Главная проблема была в скиллах. За последние несколько месяцев очень глубоко оброс скиллами для внутренних систем, некоторые дублировали друг друга. Часть знаний, компенсирующих разные ошибки, осели в заметках памяти, часть расползлась по CLAUDE.md, часть скиллов не подходили под кодекс.

Переделка скиллов заняла два с половиной дня. Сложность была в том, что для некоторых внутренних систем идеальных скиллов пока не существует. Например, для нашей системы контроля версий есть три скилла с разными сильными и слабыми сторонами. И с тремя разными авторами.

Помогли в итоге три вещи:

- полный анализ кодексом всех скиллов, находящихся в контексте, с безжалостной вычисткой устаревших и не актуальных. Для аудита этого добра использовал прекрасный скилл-кондуктор от @shimaoz

- сравнение всех оставшихся похожих скиллов и вынесение правил про то, какие их части должны использоваться для разных сценариев в новый скилл роутинга (ахаха 😄)

- скан всего контекста на предмет разных подсказок про скиллы (из обрывков памяти и AGENTS.md) и в итоге дистилляция годных знаний в тот же новый скилл роутинга. AGENTS.md оставляем максимально чистым, спасибо Борису за советы

В целом ничего грандиозного, просто получилась хорошая тактическая карта - для каких кейсов использовать какие части скиллов. Неплохой вариант, когда альтернатива - идти в лички к авторам скиллов и договариваться с ними на фиксы.

Короче со временем весь зоопарк скиллов превращается в помойку и нужно убираться. Если вдруг вы знаете, как правильно работать со skill hell, и, возможно, для этого существуют более продвинутые механизмы, пишите.

Что ж, это была славная охота, еще повезло, что Сlaude так долго проработал. По интеллекту 5.6 Sol похож на Opus 5, они хорошо делают задачи, когда им конкретно сказать, что делать. Но творческого полета фантазии, как у Fable, у них всё-таки нет.

———
Думал ещё в этот же пост написать новости и новые сложности по Swarm OS, но он и так раздулся, сделаем отдельный.

За картинку спасибо богу пикчеров @attafitamim

Читать полностью…

Остриков пилит агентов

☝🏼☝🏼☝🏼

годнота, крутейший совет, спасибо ребят

но в CLI небось также удобно, мы не знаем просто...

———
из комментов:

- В cli все гораздо проще, большой текст сложно читать поэтому и не надо, сразу апрув

Читать полностью…

Остриков пилит агентов

Помимо выбора совиньон блана, написал на выходных скилл по поиску небанальных статей про агентов из техноблогов больших компаний:

https://github.com/maddness/agent-research-radar


Пока дебажил, наткнулся на одну неплохую:

https://huggingface.co/blog/allenai/shippy-tech-blog

Ребята написали агента, который отвечает на вопросы по судам в морском пространстве Ганы: сколько в водах кораблей, кто где плавает, какие морские события сейчас идут и прочее.

Хорошая статья, которая в целом показывает на обзорном уровне все современные внутренности ai-агента.

- модель они взяли Opus 4.6, отлично

- харнесс взяли OpenClaw, тут уже можно начать душнить, но если так проще для первой версии - почему нет. В OpenClaw много лишнего, и если вам нужен легкий лаконичный агент, есть варианты лучше (zero, nano, pi)

- у агента более пяти внешних API для получения риалтайм данных, они написали скиллы внутри которых лежат cli. Самый верный способ - до этого пытались собирать запросы в api на лету, но был фон галлюцинаций. В итоге cli закрыли проблемы и упростили тестирование

- изоляцию они сделали на k8s, под каждого пользователя разворачиваются поды с агентом, получаем полную изоляцию. Это самая странная часть, особенно учитывая немаленький образ и ресурсы OpenClaw, тут кажется при большом количестве клиентов будет оверхед. Да и решения типа microVM слышал более легковесные (но в комментах Илья и Пух говорят что нет). Плюс со стороны кажется такая изоляция им не нужна, если все покрыто cli-шками и модель не должна писать код, отключили бы нужные тулы у OpenClaw и всё

- по эвалам хорошо, расписали базовые кейсы, гоняют их в сендбоксе на реальных данных, проверяют использует ли модель тулы, оценивают через судью разные критерии от 0 до 1 с разными весами, получают итоговый скор. Дешево и сердито)

Годное легкое чтиво, минут за 20, уровень начальный-средний.

———
Если кто попробует и будет фидбэк по скилу, кидайте, поправлю

Читать полностью…

Остриков пилит агентов

Заметки чиркаши на полях, часть вторая, продолжаем рубрику

Семь бед - одна новая сессия

Завёл привычку: в любой непонятной ситуации просто задать вопрос клоду. Собрал внутренние тулы и скиллы, чтобы он сам лазил по сервисам, докам, коду и возвращался с ответом, и по заветам Карпатого сложился флоу. Есть сложный вопрос - открываешь голосовуху, надиктовываешь 2-3 минуты мыслей, с чего начать и куда посмотреть - оно уходит копать. Через полчаса-час возвращается и раскладывает всё по полочкам, и вот тут главный челлендж - найти те самые 10-15 минут, чтобы прочитать, осознать и дать следующий шаг.

В параллель получается держать 3-4 контекста, но часов с 12 начинаются встречи, и вернуться к клоду выходит ближе к вечеру - нет времени наподумать. Похоже придётся ставить в календарь пару встреч «Разговоры о важном», иначе агенты простаивают и разгребать начинаешь их ночью... Но чувство всё равно прекрасное, как будто живёшь на скорости x3-x5 и клонировал себя))

Главное - не делегируйте агентам принятие решений, говорите им «копай и возвращайся, подумаем вместе», так шикарно решаются и кодинговые задачи, и не кодинговые. Иначе они такого нарешают, потом пару недель придется разгребать. Процентов 10 запросов летит в fable, все остальные решает 4.8, а теперь пятерка на medium.

Fable 4 Life

Безумно нравится, как Fable работает с задачами, где я сам не знаю, с чего начать: поисследовать несколько систем, понять, как они устроены, придумать, как сделать лучше, прикинуть рефакторинг. Он долго думает, затем раскладывает работу в workflow из нескольких уровней субагентов, и там, где нет очевидного решения, работает лучше всего. Три примера из последнего месяца:

Первый - «прочитай все диалоги агентов по одной из стран за неделю, разложи на удачные и провальные и спроектируй по ним улучшенные критерии для LLM-as-judge». Правильного ответ тут нет, чистый ресёрч. Fable развернул это в 47 субагентов, которые читали диалоги пачками параллельно и сводили выводы, всё вместе - полчаса.

Второй - «разбери архитектуру одного из наших сервисов, найди весь бойлерплейт и предложи декларативный фреймворк вместо копипасты». Сначала 9 агентов на карту кода, потом прогон из 12 агентов и 8 фаз, который написал по ней детальный RFC.

Третий - архитектурная развилка «переносить ли логику наших воркфлоу из внешнего оркестратора в код сервиса». Восемь агентов, два часа, на выходе разбор с плюсами, минусами и ценой каждого варианта.

И результаты, с которыми он возвращается прям радуют, остается лишь минимальное кол-во итераций для дошлифовки.

Swarm OS

Решил попробовать написать центральный агентский мозг нашего контура. Мы пилим агентов, которые общаются с исполнителями разных профессий и помогают им по жизни, ставим A/B-эксперименты смотрим, какие прокрашиваются. Решил собрать агента, у которого на руках все ниточки: очередь с пул-реквестами, весь наш код, read-only базу с данными, конфиги экспериментов, дашборды и ещё пять-шесть источников, вплоть до транскрибаций стендапов и архитектурных сессий (да да да, все шутки про мам с дейликов - собственность агента).

В итоге у агента почти все аспекты жизни контура, спросить можно что угодно: кто больше пул-реквестов залил на прошлой неделе, что нужно успеть дожать до конца августа, в каких странах и на каких сегментах стоит запускаться следующими. Отсюда две вещи:

Первая простая - с вероятностью 99% получится (уже получается) виртуальный ассистент контура, отвечающий на любые вопросы мгновенно.

А вот вторая - челлендж. Мыслящий мозг, который сам анализирует происходящее и подсказывает следующие шаги: поменять эксперимент, разобрать результаты, сказать что мы забыли, или изменить продуктовые фокусы сентября, потому что у него есть предложение лучше. То есть отдать агенту часть процессов, которые сейчас держатся на плечах кожаных, ну а через какое-то время он, конечно, станет главным в контуре, а мы - прислугой.

Если кто-то делал похожее, напишите в комменты, а ещё лучше расскажите, где будет фиаско - за максимально точное предсказание будущего что-нибудь подарю (и даже не ссылку на лучший в мире скилл)

Читать полностью…

Остриков пилит агентов

Материтесь ли вы на работе?

Умный дядька Нассим Талеб в книге «Рискуя собственной шкурой» (та, что вышла после «Чёрных лебедей») формулирует: если человек говорит формальностями, весь такой вежливый, извиняется на каждом шагу - ему плевать на проект. Шкура не горит. А где ставки настоящие, там матерятся.

Зайдите в кабину пилота: «уважаемый Вадим Сергеевич, мы падаем, поднимите, пожалуйста, руль» - ага, ну, конечно! Загляните в операционную, или к строителям, которым платят, чтобы кран ни на кого не упал.

Именно поэтому я запилил скилл POHUY, а не ради шуточек - режим идиоматического русского мата для агентов. Агент перестаёт мямлить «the deployment failed because the environment variable...» а прямо докладывает: «деплой наебнулся...». Сегодня доделал v2: шкала состояний, словарь со сценами применения, evals. Работает как часы - экономит вам нервы, а не токены

====

Дальше по апдейтам


IVA теперь обновляется плавненько. Пишете ей /update - она накатывает улучшения и сохраняет все ваши правки. Кастомизируйте её сколько хотите, обновления ничего не затирают. Заодно навёл красоту UX

====

И превью, про которое скоро будет отдельный пост: скилл MENTOR . Он читает историю ваших сессий в Claude Code и Codex и показывает, что не так в вашей работе с агентами: что строите, где теряете время, что чинить.

Зачем я делаю MENTOR - в компаниях сейчас решают, кого увольнять из-за AI. Уволишь джунов - сеньоры разленятся. Уволишь сеньоров - некому учить джунов. Мне милее второй вариант: пусть сеньоры идут отдыхать, а учит нейронка с моим скиллом POHUY - один в один как сеньор. Сейчас готово процентов двадцать от задуманного Ментора, работаю дальше.

====

Теперь просьба

У меня здесь 6000 подписчиков. Зайдите на GitHub. пожалуйста, - пройди те по ссылкам и поставьте звёзды. Если нет аккаунта - регистрация занимает два шага.

Огоньки в телеграме греют, но другие люди находят мои проекты по звёздам на гитхабе. Мне нужна ваша поддержка.

Поставьте звезду, я вас очень прошу. Это важно.

Спасибо

@aimastersme

Читать полностью…

Остриков пилит агентов

Я уже неделю не могу дописать важный пост про SynthID – метку о том, что контент сгенерирован, которую провайдеры зашивают в картинки (а с недавнего времени еще и в аудио и даже текст), а главное, про мои тесты её удаления

Так вот, пока серьёзные посты ждут своей очереди, вот вам несерьёзный – увидел в рилсе девочку, которая себе сделала такое, как на видео. Меня пробило ностальгией, скинул ссылку на рилс опусу, сказал, повтори, только чтобы все чисто в браузере работало

Через 3 минуты все было готово. Мозгу очевидно, что это не рокет сайенс уже давно, но чисто на уровне ощущений – очень приятно, что то, на что у меня 9 лет назад ушло несколько месяцев, сейчас можно сделать за три минуты и оно будет даже более залипательным

Поиграться самим тут

Кстати, если у кого-то есть оригинальные идеи, как использовать mediapipe (это готовый набор примитивов для on-device hand и face трэккинга) не только для забавных демок – поделитесь в комментах

Читать полностью…

Остриков пилит агентов

Открытая встреча в пятницу: проект с агентами от идеи до кода

Обычно созваниваемся закрытым кругом в Power Users, в этот раз открываем двери для всех.

Коротко расскажу про Assistant Development и Product Development Lifecycle: как писать PRD и спецификации, чтобы агент понял с первого раза, какие скиллы брать, как делать ресёрч, кого читать. Покажу свой новый плагин Code Quality github.com/smixs/code-quality - он не даёт агентам рапортовать «всё готово» при красных тестах.

Дальше вопросы на любые темы.

📅 Пятница, 25 сентября, 16:00 Минск/Москва, 18:00 Ташкент
👉 Google Meet
🗓 Добавить в календарь

@aimastersme

Читать полностью…

Остриков пилит агентов

Ребят, нужна небольшая прожарка 😐

(готовьтесь, много текста)

По поводу будущей архитектуры наших продуктовых агентов. Мы немного начинали штормить в чатике, но можно обсудить отдельным постом.

Уже полгода наша команда пилит агентов для разных этапов воронки водителя: привлечение, работа с активными и возвращение после оттока. На каждом этапе свой агент с большим промптом и примерно 10-15 тулами во внутренние сервисы.

Агент регистрации знает всё про этот этап и помогает людям, которые ещё не были водителями. Агент возвращения отвечает на вопросы про заработок и рассказывает, что изменилось, пока человек не катал.

У каждого есть эвалы и слои промпта под разные страны. Качество диалогов измеряем оффлайн и следим, чтобы оно не падало. Агенты просыпаются по внешним триггерам: связка «триггер → агент → страна» определяет, кто пойдёт общаться с водителем.

Пока всё работает, но проблемки уже начинаются.


Плохое будущее

Тулы и промпты сейчас сильно пересекаются. Например, расчёт заработка нужен всем трём агентам: спросить про деньги может любой водитель. В промптах нет чёткого разделения по темам, между странами они совпадают на 40–60%, но тюним мы их независимо.

Боюсь, через несколько месяцев получим адский месс: агенты повторяют друг друга на 80%, всё переплетено, поддерживать невозможно. Плюс тулов станет на пару десятков больше, пу пу пу…


Хорошее будущее, первый вариант

Год назад я бы без раздумий сделал оркестратора и 10 сабагентов. Один отвечает за заработок, другой знает приложение, третий умеет общаться с техподдержкой. Так закрываем все важные темы для водителя.

Оркестратор разбивает запрос, отправляет части сабагентам и собирает ответ. У каждого сабагента свой промпт, тулы и эвалы под его область.

Особых минусов пока не вижу. Разве что придётся постоянно решать, куда класть новые умения и когда заводить ещё одного сабагента. Например субсидии и бонусы - это заработок или программа лояльности?

Но сейчас середина 2026-го, и кажется, есть более каноничный способ.


Хорошее будущее, второй вариант

Один агент и 30-40 скиллов. В количестве себя не ограничиваем, вложенные структуры не плодим - держим плоский список.

В промпте оставляем базу: роль, цель и формат общения. Глубокие знания и разбор конкретных ситуаций уносим в скиллы. Эвалы всех агентов объединяем.

Очень простая схема для работы как по внутренним триггерам, так и по началу диалога от лица водителя по любой рандомной теме.

На прошлой неделе решили идти этим путём. Сначала сольём двух агентов, а если эксперимент удастся - вольем и третьего.


Где будет жопа? Чего мы не видим?

Пока кажется, что расход токенов снизится: вместо цикла оркестратора и сабагентов - выбор скилла и работа по сценарию. Контексты у нас почти пустые: несколько минут общения, потом пауза на пару дней. В новый диалог подтягиваем лишь историю прошлого, факты из памяти и нужные скиллы.

Новые фичи тоже должно быть проще добавлять: легче решить, расширить текущий скилл или написать новый.

Но есть опасения. Возможно, повесимся тюнить эвалы: добавим 25-й скилл, и начнёт разваливаться то, что отлично работало с 24. Возможно, с ростом числа скиллов модели начнут галлюцинировать, даже самые мощные, к которым у нас есть доступ.

Про аналитику еще были сомнения - раньше перформанс можно было мерить по разным агентам, а теперь придется переходить на анализ по триггерам/сегментам аудитории.

Ну и главное: рассказывать, что мы пишем десяток агентов, куда более секси, чем говорить, что пишем одного 😁

Если точно понимаете, что решение ошибочное и скоро нас всех уволят, не держите в себе!

Читать полностью…

Остриков пилит агентов

А у нас снова конференция

Practical ML Conf - 19 сентября, следующая суббота

https://pmlconf.yandex.ru

Хардкорная конфа про ML, совсем не про агентов.

- Лёша, зачем ты тащишь сюда конфу не про агентов? - спросите вы.

Давайте думать, кому будет интересно:

- вы пришли из классического ML, читали Ian Goodfellow, знаете кто такой Andrew Ng и ухмыляетесь над новой волной инженеров ИИ-агентов, которые месяц назад поняли что такое контекст и тулы и уже хотят 500к

- Валера Бабушкин таки продал вам Machine Learning System Design, вы его прочитали и теперь не терпится показать всей тусовке, какой вы крутой

- вы всё-таки за агентов, но для развития поглядываете в смежные области плюс любите хардкор

🍆🍆🍆


Теперь без шуток - порылся с программе и просто от себя напишу что кажется самым интересным:

- кишки и архитектура модели для системы восприятия автономного автомобиля, как они улучшили обзор и перешли на MV2DFusion (Иван Лунев)

- как работает модель управления всем телом гуманоидного робота, с эмуляцией базовых движений: ходьба, наклоны, приседания, упражнения из качалки (Андрей Маношин)

- Ouroboros - наш слоняра! Организаторы поймали автора известного агента и Антон Разжигаев расскажет про его внутрянку, петлю самоулучшения, и как они обходит Claude Code по бенчмаркам

- стриминговый перевод речи: как вообще он устроен, как складывается из ASR и LLM для перевода, как тюнить задержку против качества (Вилиана Девбунова)

- про Computer-Use агентов, которых никто не любит (ибо медленно) - как они работают, как не рассыпаются на долгих сценариях, как их обучать и какие грабли ребята собрали (Артемий Голиков)

- ... и еще штук 15 докладов


Ну что, оказывается и про LLM и даже про агентов есть, не одним ML-хардкором единым.

Да и доклады это лишь небольшой кусочек конфы, главное вайб и общение, но это вы и так знаете.

https://pmlconf.yandex.ru

———
Организаторы обещали подарить IPhone Duo если приведу 5к человек, не подведите братцы 💪🏻

Читать полностью…

Остриков пилит агентов

Так, охотники за лимитами, 5 сентября намечается ещё одна конференция - deep tech night:

https://deeptechnight.ru/

Это большая конференция Яндекса о том, что происходит, когда AI доезжает до настоящих продуктов, инфраструктуры и физических операций.

Из спикеров я лично знаком со Стасом Макеевым, CTO Лавки. Он будет рассказывать про их империю агентов, которая уже управляет кусочками реального мира: спросом, остатками, поставками, сборкой и доставкой.

Про что ещё поговорят:

- про Physical AI и почему собрать робота, который не нарушает три закона Азимова, сильно проще, чем научить его догонять Тибо и выбивать из него ресет

- как AI меняет профессию разработчика: ускорение на 50% или всё-таки полная перестройка команд? И сколько подписок по $200 теперь нужно одному инженеру

- как собирать долгоживущие сессии агентов в облаке и проектировать интерфейсы для агентских продуктов

- про NPU, инференс-фреймворки, RL-инфраструктуру, новые рекомендательные системы и прочую инженерную духоту 🤌🏻

Основной формат конференции - онлайн. Можно подключиться к трекам Hard и Experiment, а ещё поучаствовать в Q&A со спикерами.

Можно попытать счастья и оставить заявку на офлайн:
https://deeptechnight.ru/offline

Он пройдёт в московском офисе Яндекса, формат invite-only, а мест совсем немного.

Чисто от меня рекомендация - залетайте. Спикеры и темы топ, внутри компании сейчас идёт очень активный движ в эту сторону.

Хороший шанс послушать не пересказ новостей, а истории из первых рук, насколько просто строить и тащить ИИ-шечку в прод.

👇🏼👇🏼👇🏼

https://deeptechnight.ru/

☝🏼☝🏼☝🏼

———
Тибо и Борис Черный тоже приглашены. Если доедут, будет шанс сфотографироваться и предъявить за баны

Читать полностью…

Остриков пилит агентов

Мало кто знает, но Нил Дракманн не сам придумал концовку The Last of Us.

Вариант, где Джоэл спасает Элли от светлячков, был начисто слизан с реальной истории. В реале как раз Пух спасал Осинару, отбиваясь от наемников, которые хотели исследовать её модель памяти, именно этим и вдохновлялся Нил.

Но ещё меньше народу знает, что есть альтернативная ветка происходящего. В этой ветке Пух, к сожалению, не успел спасти Осинару. Мерзкие иследователи добрались до неё и чтобы спасти человечество от агентов, разложили её память на атомы.

Так и появилась вторая книга от издательского дома «Дизрапт» 👇🏼👇🏼👇🏼

В этой книге детально разбирается, как устроена память агента - нити памяти, границы доступа, разные слои.

———
Если для вас это кажется полным бредом, это не значит что у Острикова началась деменция.

Все эти шуточки-прибауточки лишь часть лора нашего чатика, в котором обитает много интересных персонажей и историй.

Осинара - наша добрая фея, ювелирно созданная Пухом на движке Eve, допиленная и улучшенная, а в книге ниже - её модель памяти.

https://github.com/nyxandro/osinara

Поболтать с ней можно в чатике.

Ну а Пух, если кто не знает, это наш бессменный старожил чата, генерал словесных баталий, чемпион по количеству комментариев во всех русских чатах AI-комьюнити и просто отличный человек - @nyxandro

Автор уже двух книжек. И даже telegram-канал имеется: /channel/AiHubFeed

Всё, закругляемся. Книга ниже 👇🏼👇🏼👇🏼

Читать полностью…

Остриков пилит агентов

Более спокойная версия, без матюков. Можно скинуть и маме, и тому, кто только начинает разбираться в агентах.

Только потом не удивляйтесь, если мама напишет харнесс лучше вашего.

Читать полностью…

Остриков пилит агентов

Однажды у пачки AI-инфлюенсеров резко закончились подписки, Tibo не порадовал ребят ресетом и они пошли трогать траву.

Трогали на лужайках, трогали в парках, трогали в контактных зоопарках и постепенно судьба привела их в лес.

В лесу они разожгли костер, набили свои трубки и долго и упорно спорили по разным аспектам AI.

- что такое модель и что такое контекст?
- а что такое агенты и что такое тулзы, скиллы и мсп?

- сколько субагентов смогут написать луп из семи харнессов?

Казалось бы, простые вопросы, но эти ребята курили трубки до самого раннего утра и спорили, спорили, спорили.

Но они не знали, что всё это время в кустах сидел Пух со включенным микрофоном и записывал все их разговоры.

А потом он пошел домой, включил клода, скормил ему записи и все тайные, секретные, но родные для ребят истории улетели в контекст модели.

Случилась глобальная протечка базы. И родилась книга.

———
Ну а если по-простому, перед вами квинтэссенция полугода переписок в нашем чатике, скормленная Пухом в клод и дистиллированная в книгу.

Книгу, за которой уже начинает охотиться O’Reilly, Манн Иванов и Фербер и все лучшие издательские дома нового света, не зная что она была написана под воздействием самого душевного скилла.

Но для вас эта книга бесплатна. Пока.
На след неделе будет 15к

👇🏻👇🏼👇🏽

Читать полностью…

Остриков пилит агентов

Вышел первый серьезный подкаст со мной

Получилось очень живо и плотно по темам. Обсуждали скиллы, безопасность и сложности внедрения в компании

Классно, что получилось обсудить много микро-деталей, которые обычно не влезают в тг посты. На чилловый просмотр под пиво/чай/прогулку – самое оно

00:01:47 - Бизнесу часто не нужен отдельный кастомный AI-продукт
00:16:56 - Люди не могут рассказать, как именно делают свою работу, а агенту, как и сотруднику, нужен онбординг
00:24:39 - Полностью автоматические системы регулярно проваливаются
00:36:43 - Доступ в терминал делает агента гибким, но усложняет контроль. Ценность смещается от производства результата к ответственности за него
00:47:08 - Корпоративная инерция и Shadow AI
01:01:40 - Слабые места моделей; Как быстрее всего учиться строить ИИ продукты
01:17:10 - Разрыв между лидерами и остальными. Внедрять ИИ важно не только из-за роста производительности в моменте

📱 Смотреть полную версию

Бтв, нарезку выше сделал агент с нуля, но с одним небольшим хаком, угадаете каким?

Читать полностью…

Остриков пилит агентов

👨‍💻 Прямо сейчас встречаемся на балконе на крыше офиса, чтобы поразгонять про ИИ — если он теперь пишет код, то что делает разработчик?

Узнаем на стриме — вместе с Лешей Остриковым, руководителем разработки в одной из команд Яндекса, а еще мастером по AI агентам.

https://www.twitch.tv/yandex
https://www.twitch.tv/yandex
https://www.twitch.tv/yandex

Читать полностью…

Остриков пилит агентов

Наш братишка Саша Поляков оказался в жюри ИИ-хакатона, который устраивает Туту

И он зазывает всех небезразличных принять участие в написании агентов или обычных решений на основе их MCP-протокола.

Плюс много-много-много. Такие ивенты - это чуть ли не лучшая возможность получить опыт и закрепить его. Гораздо лучше, чем посмотреть миллион видео или прочитать 10 статей

Можно участвовать в одиночку, можно командами. Сам ивент пройдет 19 августа. 20 августа финалисты будут пичить свои продукты, а 21 - награждение.

Главный приз - 3 макс подписки на Сlaude Сode (шутка, аналог), ну, до момента. Отличный приз, до момента, пока вас не забанили (я до сих пор не могу пережить вчерашнюю душевную травму..)

Читать полностью…

Остриков пилит агентов

Способ ответа на вопросы в Codex App

Рекомендую :)

кстати, можно ещё и голосом надиктовывать заметки

подсмотрел у @etechlead

Лайк, репост,
✔️ Тимур Хахалев про AI Coding, подписывайтесь!

Читать полностью…

Остриков пилит агентов

Ладно ребят, раз уж тут все свои, вот она РЕАЛЬНАЯ ПОЛЬЗА от применения ИИ

Читать полностью…

Остриков пилит агентов

☝🏻☝🏻☝🏻

Давайте поддержим Сергея

Исконно русский caveman с национальной душой и характером родился всего лишь пару дней назад, но уже успел завоевать любовь нашего чата

Ставим звезды, не жалеем:
https://github.com/smixs/pohuy

По пользе скилл может посоревноваться с T-Stonks от Пуха (вилла пока в жестком минусе, но мы её все равно купим, ждем отскока)

Зачем нужны звезды вы спросите? Понятно зачем - они позволят новому бриллианту податься на конкурс лучших решений от Антропика, и повторить успех скилла для оптимизации префикс кеша от Сережи Нотевского, который получил полгода x20 🔥

А не дадут подписку, ну и POHUY

Читать полностью…

Остриков пилит агентов

Закончилась конфа, прошло топово

Были еще два интересных доклада, в одном рассказывали про эволюцию их нового ассистента - Таю, и детально разбирали как улучшали её сценарий ассистента по шоппингу.

Прикольно было то, что начинали они с обычного ReAct агента (понимает хотелку, серчит веб, дает результаты), но процент полезных советов был около 40%

И затем начались месяцы улучшений - первый фронт был по улчшению качества рекомендаций. Корзинки, LLM ranking, доп данные не только из веба, но и из внутреннего маркетплейса, режим доуточнений деталей - в итоге они получили 80% качества

Ну все, победа? Фиг там, вместе с качеством у них выросла latency ответа с 30 до 90 секунд, и люди просто перестали дожидаться. И начался второй крестовый поход за улучшением скорости ответа: переход на другие критерии, параллельный поиск во время уточнения деталей, быстрый поиск по Т-шоппингу, оптимизации ранжирования.

В итоге дотюнили latency до 28 сек, не уронив качество. Реально интересными были именно шаги оптимизаций, и детали того что сработало, как выйдет доклад рекомендую глянуть

Пощупать можно тут:
https://taya-ai.ru

———
Меня неожиданно оформили как СМИ 😄, но камеру для репортажей не выдали, приходится по старинке буковками

Читать полностью…
Subscribe to a channel