boris_again | Unsorted

Telegram-канал boris_again - Борис опять

15113

life = curiosity + irreducible noise Whois: https://t.me/boris_again/1652 Лс: @btseytlin

Subscribe to a channel

Борис опять

Раст разрабы бывают двух типов

Читать полностью…

Борис опять

Лев если и спрашивал у юзеров разрешения перед тем как обучать на их данных, то так, между делом, чисто на Хакерньюсе ответил один раз, без публичных релизов

GitHub очень тихо обновил правила и собирается тренироваться на почти всех приватных репозиториях. Если вы явно не укажите, что не хотите "доступа к этой фиче"

Читать полностью…

Борис опять

LiteLLM версии 1.82.7 (хотя местами в посте написано 1.82.8, но вы поверьте мне) подвергся supply chain атаке. Зафиксируйтесь на предыдущей версии и не обновляйтесь.

https://futuresearch.ai/blog/litellm-pypi-supply-chain-attack/

https://github.com/BerriAI/litellm/issues/24512

Читать полностью…

Борис опять

HR: Кем вы видите себя через 5 лет?

Я: (на фотографии)

Читать полностью…

Борис опять

Самая идея оружия разработанного Кагглерами внушает мне страх

Читать полностью…

Борис опять

#разное

Так как мотоциклетные права не выгорели, я проживаю свой кризис 30 и закрываю ачивки в других сферах жизни.

Примерно полгода назад увидел пост у @btseytlin про то, как он вписался в открытые микрофоны, и я подумал, что this is the way (c) чтобы разнообразить свой сет скиллов.

Держите 4 минуты про экономику с отсылками на Гарри Поттера и Звёздные войны с моего первого опенмайка. Работать есть много над чем, но аудитории сравнительно зашло.

Пока главное открытие: про члены шутить легче

Второе открытие - у такого формата плохое удержание в тиктоке/инсте, алгоритмы не подхватывают. Поэтому в лентах можно увидеть кучу видосов с разговорами с аудиторией - там виральность гораздо выше, хотя шутки могут быть хуже

Читать полностью…

Борис опять

Вайбкодинг конечно скорее заработал, но иногда хочется рвать на себе волосы.

Рис. 1: frontier artificial intelligence написал функцию, затем во время дебага написал скрипт в котором она вызывается и перепутал порядок аргументов. В результате все выполнилось, но неправильно, из-за чего на выходе была абсолютная дичь. Которую агент интерпретировал будто так и задумано. Если бы я не заглянул внутрь, то так и не узнал бы, что меня кормят отборнейшим потоком галлюцинаций.

Поставил себе hook с ty после этого.

Это я решил на вайбах залететь в agentic RAG challenge и пришел к тому состоянию вайбкод проекта когда кажется, что проще все сжечь. Это когда чувствуешь себя несчастным меинтейнером легаси в своем же пет-проекте и тратишь больше времени на правки одним вайбкодом другого вайбкода, чем на полезную работу. Когда есть страх, что если полезу разбираться в любой фиче, то окажется, что там костыль на костыле и всё работает неправильно.

Я пытался понять, почему с одними проектами у меня это происходит, а с другими нет. Например, в TapAgent такого нет. Пришел к выводу: чтобы хорошо вайбкодилось надо читать код. В TapAgent я читаю и правлю код всех критических компонентов вроде агентского цикла, часто нахожу там проблемы и исправляю их вовремя.

Есть и более медленная и ущербная версия этого для тех, кто не умеет читать код. Промптим клода: объясни мне по шагам как у нас работает фича Х. Попробуйте на своем проекте. Почти наверняка реакция у вас будет: "чего???"

В решении для соревнования я на это забил, посчитав, что хорошо описанных в промптах принципов будет достаточно. В итоге возникают, например, такие ситуации:
1. В одной сессии клод код пытался реализовать поиск именованных сущностей в документах и сделал это криво, я не заметил
2. В другой сессии он пытался сделать изменение ранжирования опирающееся на обнаруженные ранее сущности. Увидев, что первое не работает, он реализовал еще один костыльный поиск сущностей
3. Какое-то время это работало, но при очередном сабмите всё сломалось

Попытки исправить это еще одним слоем вайбкодинга приводят к ещё одному слою слоп-костылей.

В общем, всё ещё крайне полезно читать код, что бы там ни говорили

Читать полностью…

Борис опять

Dial-up 2.0, или гоним трафик в обход белых списков через звонки в ВК

Пока железки в пути, решил заняться насущным вопросом, который в последнее время что-то обострился.

VK-звонки работают через WebRTC с Selective Forwarding Unit, который пробрасывает SCTP DataChannel между участниками, не заглядывая внутрь. Помимо своего animoji-канала (id:1) VK туда ничего больше не кладёт, поэтому можно создать рядом свой DataChannel (id:2) и использовать его как двунаправленный пайп для произвольных данных. Весь трафик при этом идёт через TURN-серверы VK, которые находятся в белых списках - для DPI это выглядит как обычный звонок.

На стороне Creator'а (тот, у кого есть доступ в интернет) запускается Go relay и hook.js сниппет в браузере. Сниппет хукает RTCPeerConnection, перехватывает ICE-конфигурацию прямо из конструктора, после чего создаётся туннельный DataChannel и бриджится с локальным WebSocket'ом, через который relay раздаёт трафик наружу.

На стороне Joiner'а (тот, кто в зоне белых списков) всё чуть интереснее. Приложение открывает VK-звонок в WebView, поднимает VpnService, который перехватывает весь IP-трафик устройства, прогоняет его через tun2socks, дальше в SOCKS5 прокси на Go, и уже оттуда через WebSocket в тот же DataChannel. Go-часть собирается через gomobile в .aar и линкуется прямо в APK, поэтому можно обойтись без рута/termux.
На speed test получилось добиться 9.57 Мбит/с на скачивание, 4.15 Мбит/с на загрузку с задержкой 14 мс до Брюсселя с мобильной сети.

Есть моменты, которые можно улучшить и автоматизировать, но в целом пока пойдет.

Код/билды здесь [тык]

Читать полностью…

Борис опять

Хочу порекомендовать вам телеграм канал команды CoreInfra.

Ребята делают продукт который объединяет генерацию программ с помощью AI и их формальную верификацию. Рассказывают подноготную построения deeptech стартапа, обозревают научные статьи и временами шутят, что в моем канале особо одобряется.

Недавно выложили в opensource chaos_theory – Rust библиотеку для классического property-based и fuzzy тестирования.

Мне нравится, что пишут искренне и абсолютно без воды — для инженеров. Секрет прост: канал ведут СЕО и СТО компании, которые в прошлом делали масштабные запуски ВКонтакте, в Яндексе и Транзасе.

Подписываться сюда: @coreinfra

Читать полностью…

Борис опять

#дайджест
Дайджест AI/ML за две недели 2–16 марта 2026

На той неделе не было дайджеста, поэтому читаем доисторические новости двухнедельной давности, вспоминаем как оно было.

OpenAI: GPT-5.3 Instant
Новая стандартная модель в ChatGPT. Обещают менее лизоблюдский тон и -26.8% галлюцинаций при использовании веб-поиска (и -19.7% без веба). GPT-5.2 Instant уходит на пенсию 3 июня.
Блогпост

OpenAI: GPT-5.4 Thinking и Pro
Да, за неделю вышло две линейки моделей OpenAI. Сингулярность, все такое. Reasoning, кодинг, нативный computer use. На OSWorld-Verified 75.0% - впервые обошли людей (72.4%) в навигации по десктопу. GDPval 83.0% - уровень профессионалов в сравнении по 44 профессиям. Контекст 1M в API и Codex (в ChatGPT контекстное окно осталось как у GPT-5.2 Thinking). Меньше галлюцинаций. Цена базовой модели $2.50/$15, Pro - $30/$180. При контексте свыше 272K токенов - двойная цена за вход. Уменьшение расхода токенов при работе с MCP в 2 раза с помощью Tool Search.
Блогпост

OpenAI: Codex Security
А еще OpenAI успели сделать свой Claude Code Security для кодекса. За месяц бета-теста просканировали 1.2М коммитов, нашли 10 561 уязвимостей, 792 из которых - критические в OpenSSH, GnuTLS, GOGS, Thorium, libssh, PHP и Chromium. Строит threat model проекта, валидирует находки в sandbox, предлагает патчи.
Бесплатно первый месяц для Pro, Team, Enterprise, Business и Edu.
Блогпост

Anthropic: Claude Code Review
Anthropic продолжает выпускать продукты-агенты для повышения безработицы в IT и теперь это ревьюер PR-ов в Claude Code за жалкие $15–25 за ревью длительностью 20 минут. Команда агентов анализирует diff в контексте всего репозитория, валидирует находки, ранжирует по критичности. Внутри Anthropic находит в среднем 7.5 багов на 1000 строк diff. Обещают сильно более глубокий анализ чем просто попросить опуса проверить, за что и такие деньги. Research preview для Teams и Enterprise подписчиков.
Блогпост, Документация

Google: Gemini 3.1 Flash-Lite
$0.25/$1.50 за 1M токенов - в 8 раз дешевле 3.1 Pro по входу, в 12 раз по выходу. Скорость генерации на 45% выше чем у 2.5 Flash (до 363 т/с). Контекст 1M. По качеству на уровне Gemini 2.5 Flash - GPQA Diamond 86.9%, Arena Elo 1432. В общем отличная модель для тупых объемных задач. Доступна в preview в AI Studio и Vertex AI.
Блогпост

Google: Gemini Embedding 2
Первые по-настоящему мультимодальные эмбеддинги. В один эмбеддинг можно загнать до 8К токенов текста, 6 картинок, 128 секунд видео, 80 секунд аудио или 6 страниц PDF — и всё это в одном пространстве на 3072 измерения. Сильно улучшили качество эмбеддингов по коду. Цена $0.20/MTok ($0.10 batch). Public preview через Gemini API и Vertex AI.
Блогпост, API docs

Читать полностью…

Борис опять

Оптимизатор резюме под вакансию hr-breaker (SOTA волчарных технологий) обновился до 0.2.0.

1. Полноценный и отзывчивый web UI вместо Streamlit
2. Кеширование резюмешек и позиций, можно выбирать загруженные ранее через UI
3. Менее костыльная система перевода на разные языки
4. QoL улучшения

Пивотнуться в пастуха никогда не было так удобно, респонсивно и вейбскейльно.

Не знаю зачем, но люди регулярно отправляют в hr-breaker PR за PR-ом. Приятно!

Читать полностью…

Борис опять

> Big brain sci-fi author: Don't build the Torment Nexus
> Humanity:


claude --dangerously-skip-permissions -c "Design and build the torment nexus according to this sci-fi author's book, make no mistakes"

Читать полностью…

Борис опять

# Вайбкодинг заработал

За пару недель я сделал настоящий SAAS из демки агента для тестирования мобильных игр. Маленький, но свой. Понёс показывать это первым клиентам. Конечно же на их приложениях оно сломалось.

Один случай был такой. Игра построена на Webview + HTML5 Canvas. Я знал, что у таких штук будет производительность хуже, чем у нативных аппок, но не знал, что настолько. Мои андроид эмуляторы просто падали в середине, а каждый фрейм грузился по секунде. Оказалось, что эмулятор на CPU рендеринге не способен потянуть такую нагрузку. Потребовалось включить на сервере доступ к интегрированной GPU, а затем прокинуть этот доступ внутрь докер контейнера и затем к эмулятору. Заработало.

Фишка вот в чем: я ничего не знаю про рендеринг, эмуляторы и то как собирать докер контейнеры, чтобы эмулятор внутри контейнера имел доступ к GPU хоста. Всем этим занимался Claude Code на Opus 4.6.

Claude Code добавил сохранение всех диагностических логов девайса, запускал агента, скачивал логи и изучал их. Затем лазал по серверу, менял какие-то страшные GRUB boot конфиги, обнаруживал и устранял какие-то BIOS-level защиты Hetzner сервера от доступа к GPU драйверам. Моя роль в этом была исключительно подкидывать: "Смотри, я запустил ещё один ран, снова упало и я заметил, что графика моргает." Часто чувствую себя лишним в этом цикле.

В общем, примерно с появлением Opus 4.5 и переходом на Claude Code случился качественный скачок. Раньше AI тулы для кода меня скорее разочаровывали: даже Cursor был скорее приятным дополнением когда надо написать много понятного кода. Что составляет лишь малую долю работы программиста.

Страшно признавать, но с Claude Code я действительно перешел к "программированию" промптами в трех вкладках терминала. Cursor теперь использую, чтобы смотреть диффы, и практически не пишу код руками. Ленюсь даже git commit исполнить в консоли: ведь можно написать Клоду "commit plz" и оно сделает с хорошим описанием изменений.

Я думаю причина скачка в разных подходах. Cursor это IDE которая помогает писать код. Что никогда не было таким уж бутылочным горлышком. Claude Code работает лучше Cursor даже при выборе одинаковой модели потому что делает примерно всё, что делает программист. Cursor пытается экономить токены, чтобы свести свою экономику, а Claude Code жжет токены и твои деньги для достижения максимального качества.

Вот ещё пара вещей, с которыми он мне очень помог:

- Переделать все формулы в моей книге на красивые иллюстрации.
- Сделать обзор рынка, анализ статей и все такое прочее когда я искал идею для проекта. Казалось бы: и ChatGPT окошко может. Но просто с локальным сохранением артефактов в тексте очень удобно.
- Написать 500 символов "О себе" для заявки в Forbes 30 under 30. В этом году будет соревнование AI-assisted заявок, отвечаю.
- Закодить hr-breaker. Получилось так, что даже не стыдно!
- Внедрить новый тип моделей в мой пет проект any2json. Или провести эксперимент: можно ли дропнуть из входа VLM 90% image токенов и не потерять в качестве? Раньше подобные MLE задачи не работали вообще.

В общем, теперь решает задачи из настоящей разработки и делает даже больше. По факту это не кодинг ассистент, а новый базовый способ пользоваться ллмками. Думаю теперь Claude Code может написать новый pycocotools, который я от него раньше пытался получить.

Клоду не хватает некоего инженерного вкуса, так что выбирать решения нужно самому. Оно всё ещё лажает, поэтому диффы важных вещей я стараюсь внимательно просматривать (ключевое слово стараюсь). Например, мне постоянно нужно следить, чтобы Claude Code не ломал разделение ответственности между компонентами в коде моего агента. Однако это уже совсем другой уровень! Раньше каждый кусок AI кода стоило считать опасным говнокодом пока не доказано обратное. Теперь мы говорим о проблемах уровня инженерных решений. То есть примерно то, что я ожидаю в PR от разработчика-мидла.

В общем, я наконец чувствую ускорение. Больше всего там, где я сам не понимаю, как в примере с iGPU драйверами. Эта проблема была закрыта за 4 часа, а раньше я бы копался с ней неделю.

Читать полностью…

Борис опять

Moltbook/прочая фигня для OpenClaw это же новый Хомяк 👀

Читать полностью…

Борис опять

Шикарная штука из Твиттера, оказывается Опус может генерировать простенькие видосы с текстом напрямую через moviepy и ffmpeg. Всё воспроизвелось, вот мой видос.

Оригинальный промпт: "can you use whatever resources you like, and python, to generate a short 'youtube poop' video and render it using ffmpeg ? can you put more of a personal spin on it? it should express what it's like to be a LLM"

Читать полностью…

Борис опять

Короче я давно написал статью на РБК. Сегодня она наконец вышла и я узнал, что она доступна только по подписке. Даже я не могу прочитать, что там

😳

Читать полностью…

Борис опять

🤖 Хабр статья: поучаствовал в RAG челлендже

Помните, я рассказывал про юридический AI-челлендж ARLC 2026? Так вот, я в нём поучаствовал

В соревновании нужно было строить RAG-пайплайн поверх корпуса судебных решений и законов: находить нужные страницы, извлекать ответы, давать точные ссылки. Соло, с Claude Code в качестве напарника

Раньше я не разбирался в RAG. За 5 дней и 17 итераций прошёл путь от 0.034 до 0.791. А потом вышел в финал – и папйлайн, который отлично работал на 30 документах, потерял 42% на 300 документах

Сложно сказать с таким скором, что я в нем разобрался, но точно стало лучше

Описал весь опыт участия в статье на Хабре:

• Полная архитектура с кодом
• Математика F-beta, которая перевернула стратегию
• 3 регрессии, которые научили больше, чем все успехи
• Честный разбор работы с Claude Code на соревновании
• 88 USD на API за всё соревнование

Буду благодарен за лайки, комментарии и сохранения на Хабре – это продвинет статью в рекомендациях:)

🔗 Ссылка: https://habr.com/ru/articles/1014758/

Пишите в комментах, если тоже участвовали! 👉

@tagir_analyzes

Читать полностью…

Борис опять

🌸ГиперАгенты, или вперед к Open-Ended Exploration🌸
#nlp #nlp_papers

Что будет, если дать агентам полную свободу модифицировать самих себя?
Наконец-то выпускаю долгожданную статью, где я побыла уже не соавтором, а научным руководителем.
Вместе с Jenny Zhang, автором Darwin Gödel Machine , выпускаем HyperAgents — open-ended self-improvement для агентов, на многих задачах сразу

🌸TL;DR
HyperAgents — это пример системы, где агент улучшает самого себя итеративно, от промптов до кода.
При этом, в отличие от Darwin Gödel Machine, мы пошли дальше и сделали multi-task objective:
— агент должен улучшать сам себя из поколения в поколение, и делать это одновременно на многих задачах сразу.

Улучшения возможны в обеих группах доменов:
— verifiable rewards: кодинг (Polyglot), математика (IMO), симуляции в робототехнике (Genesis)
— unverifiable rewards: рецензирование статей (Apres)

🌸Пайплайн

Как и в первой версии DGM, агент вносит модификацию — и затем оценивает ее успешность на основе результатов: в данном случае на бенчмарках, тестах и тд.
Модификации образуют граф версий, который можно контролировать в git.

В системе всегда работает цепочка из двух агентов: есть мета-агент и агент, который выполняет задачи.
Мета-агент опирается на результаты выполнения задач и вносит изменения и в себя, и в агента-работника одновременно.

Гиперагентов можно использовать с разными моделями: Claude-4.5-sonnet, O4-mini, GPT-4o

🌸Почему это работает: Абляционные исследования

Как должна выглядеть оптимальная система агента, чтобы поощрять открыты  поиск новых модификаций?
Как правило, в предыдущих работах, если агенту и позволяется что-то модицифировать, то только в определнных рамках и заданных примитивах.
Мы проверили, что будет, если этого избежать: результирующая система — Гиперагенты — оптимизирована под более быстрый поиск новых модификаций — и in-context обучение более эффективному самооулучшению.
Модель в рамках итераций (их может быть хоть 200) начинает лучше понимать, какие изменения стоит вносить.  
Итак, что мы сравниваем:
— HyperAgents (DGM-H): метаагент улучшает сам себя и агента-работника в многозадачной среде
— HyperAgents без самомодификации: метаагент улучшает только агента работника в многозадачной среде, себя оставляет как есть
— HyperAgents без архива предыдущих решений и их результатов: метаагент вносит улвчшения в себя и агента-работника, не опираясь на предыдущие результаты
— Классика, DGM: метаагент изолированно улучшает агента-работника, на всех задачах и кастомно по одной задаче. 

🟣HyperAgents (DGM-H) демонстрирует более динамичный рост общего перформанса на всех задачах — плюс, улучшения, полученные таким способам на одних доменах, переносятся в улучшения на других.

🌸Учимся самоулучшаться

Мы вводим новую метрику, чтобы определить способность мета-агента вносит успешные улучшения: imp@50 (по аналогии с pass@50)
🟣Именно в рамках итеративного процесса самоулучшения у мета-агента в конце эксперимента существенно вырастает imp@50 в сравнении со стартовым состоянием (0 --> 0.63).
🟣Агент обрастает тулзами для поддержания памяти, трекинга изменений, отслеживания тенденций в результатах.


🟣Arxiv https://arxiv.org/abs/2603.19461
🟣Github https://github.com/facebookresearch/HyperAgents
🟣HF papers: https://huggingface.co/papers/2603.19461
🟣AlphArxiv https://www.alphaxiv.org/abs/2603.19461

Читать полностью…

Борис опять

#дайджест

Дайджест AI/ML за неделю 16–22 марта 2026

Nvidia: GTC week 2026
Дженсен три дня подряд что-то анонсировал не щадя куртку. Поэтому Nvidia на этой неделе сожрала пол дайджеста.

Groq 3 LPX - первый продукт после покупки Groq за ~$20B. Инференс-чип: 1.2 PFLOPS FP8, 500MB SRAM. Рэк из 256 штук обещает 35x throughput Blackwell NVL72 на триллион-параметровых моделях при $45/M токенов. Для Китая готовят отдельный вариант на май - инференс в обход экспортных ограничений на GPU, Дженсен уже получил лицензию от Трампа. Блогпост
DLSS 5 - вместо апскейлинга теперь нейрорендеринг. Нейросеть берет цвет и motion vectors из движка и генерирует физически корректное освещение, тени и материалы в реалтайме. Различает кожу, волосы, воду, металл, стекло. Только RTX 50xx, осень 2026. Блогпост
GWM-1 - Runway и Nvidia показали General World Models на чипах Vera Rubin. Реалтайм HD-видео с задержкой 100мс. Три варианта: Avatars (говорящие головы), Robotics (песочница для роботов), Worlds (бесконечные миры). Avatars уже можно потестить. Блогпост
Nemotron-Cascade 2
30B MoE с 3B активных параметров. Cascade RL + дистилляция из нескольких учителей по доменам. AIME 2025 - 92.4, IMO 2025 - золото (79.3%), IOI и ICPC - тоже золото. Второй опенсорс после DeepSeek-V3.2-Speciale, собравший золото на всех трех олимпиадах, но в 20 раз меньше.
Cтатья, HF

OpenAI: GPT-5.4 mini и nano
Через две недели после старшей модели вышли маленькие версии. Mini: $0.75/$4.50, контекст 400K, нативный vision, SWE-Bench Pro 54.4%, OSWorld-Verified 72.1% - на уровне полной GPT-5.4 по computer use. Nano: $0.20/$1.25, API-only, ~200 т/с, для классификации и субагентов. Nano дешевле Gemini Flash-Lite, можно описать 76 000 фото за $52. По APEX-Agents от Mercor mini (24.5%) обходит Sonnet 4.6 (23.7%) при сильно меньшей цене.
Блогпост

Cursor: Composer 2

Вторая "собственная" модель Cursor для кодинга. Terminal-Bench 2.0: бьет Opus 4.6 (61.7 vs 58.0), проигрывает GPT-5.4 (75.1). Цена $0.5/$2.5, fast-версия $1.5/$7.5 - в 7 раз дешевле Opus за сравнимое качество. Из забавного, выяснилось что это пост-трейн Kimi 2.5, о чем Cursor тактично умолчали.
Блогпост

Менее значительные релизы:
MiniMax: M2.7 - модель которая участвует в собственной оптимизации: 100+ автономных циклов RL, +30% перформанс. SWE-Pro 56.22%, $0.30/$1.20. Блогпост
Xiaomi: MiMo-V2-Pro - 1T параметров (42B активных), 1M контекст. Тайно тестировалась на OpenRouter под кодовым именем "Hunter Alpha". AI Intelligence Index #8 в мире. Блогпост
Microsoft: MAI-Image-2 - генератор картинок, третье место на Image Arena. Только text-to-image, без редактирования, без image2image. Просто text2image в 2026 году. Блогпост
Midjourney: V8 Alpha - генерация в 5x быстрее, нативный 2K, но альфа сырая. V7 пока лучше, народ (который еще помнит кто это такие) не в восторге. Анонс
Mistral: Leanstral - опенсорс 120B/6B для формальной верификации кода на Lean 4. Блогпост
Mistral: Forge - платформа для тренировки корпоративных LLM с нуля на своих данных. Полный цикл: претрейн, SFT, DPO, RL. Блогпост
Naver: Seoul World Model - мечтали ли вы в 13 об игре чтобы было как гта, но там ваш город и в свой подъезд зайти можно? Пока вы мечтали Naver впихнули Сеул в 2B DiT на базе Cosmos Predict 2.5. 15 fps на одной H100, тренировали на 24 H100. Можно промптить Годзиллу и наводнения. Пейпер, GitHub
Adobe: Firefly Custom Models - теперь можно обучать Firefly на своих работах. Блогпост
ElevenLabs: Music Marketplace - маркетплейс нейродегенеративной музыки внутри ElevenCreative. Блогпост

Читать полностью…

Борис опять

🙄

Ищем нестандартные способы попасть в топ-10

В общем на Kaggle проходит то самое соревнование по построению кибер-гулагов из щитпоста "не стройте кибер-гулаги за 15к призовых": https://www.kaggle.com/competitions/leonardo-airborne-object-recognition-challenge/discussion

Приятно видеть, что сообщество не захотело размечать фото трупов, администрация Kaggle вмешалась и соревнование сейчас на паузе.

Читать полностью…

Борис опять

Причем иногда модель думает по одному вектору, а ты по другому, в итоге когда ты ей говоришь "напиши Х", то она пишет ХУ, а ты добавляешь Й, то получается хуй

Читать полностью…

Борис опять

Вот сколько вы стоите (но не для меня)

Читать полностью…

Борис опять

Со мной связались ребята из МТС и мы проверили оптимизатор резюме hr-breaker на их ATS. Взяли моё резюме и несколько оптимизированных версий и посмотрели на результаты скоринга для позиции LLM ресерчера. Тест получился не супер интересным по результатам: моё изначальное резюме проходило скоринг и все оптимизированные версии тоже, ожидаемо, прошли его.

Зато мы узнали:
1. У МТС самый лучший ATS (с моей точки зрения, ведь он не отсеял меня!)
2. ATS не обнаружил в сгенерированных резюме их AI природу. Резюме от hr-breaker правдоподобные и их правда можно использовать!

МТС респект за то, что готовы проверять свои системы на прочность. Говорят, что стараются сделать так, чтобы ATS не отсеивал всех без разбору. Битва щита и меча никому не выгодна (но продолжится).

Кидайте им свои (правдивые) резюме

Читать полностью…

Борис опять

Менее значительные релизы и события

Luma AI: Uni-1- decoder-only авторегрессивный трансформер, который рассуждает на языке и рендерит в пикселях.
Блогпост Uni-1
Luma Agents
OpenAI: ChatGPT for Excel - теперь в главной опоре мировой экономики есть и Claude, и Gemini, и ChatGPT
OpenAI: Codex для Windows - наконец вышел за пределы macOS/Linux/web к простому люду.
Lightricks: LTX-2.3 - открытый 22B видеоредактор. HF, GitHub.
Lightricks: LTX Desktop - десктопное приложение для локальной генерации видео
Ai2: открыли исходный код тренировки Molmo 2 - оупенсорсной video-language модели.
Andrej Karpathy: autoresearch минимальный фреймворк (~630 строк Python) для проведения циклических экспериментов моделями. В оригинальном репозитории агент оптимизирует nanoGPT, но вы можете перенастроить на свою задачу.
xAI: Grok 4.20 - Хуже конкурентов в среднем, но зато меньше всех галлюцинирует (AA Omniscience 78% non-hallucination rate) 2M контекст, цена $2/$6
Карточка модели
ByteDance: DeerFlow 2.0 - агентная система, Docker-sandbox память между сессиями, спавн суб-агентов все дела. GitHub
Nvidia: Nemotron 3 Super
- Open Hybrid Mamba-Transformer MoE для агентного reasoning. Закончили релиз линейки Nemotron 3 версией Super (~100B) как и обещали.
Блогпост
Hume AI: TADA - Открытый быстрый генератор речи. 0 галлюцинаций на 1000+ сэмплах, speaker similarity 4.18/5.0
Блогпост, GitHub
Flash Attention 4 - оптимизировали под Blackwell (B200/GB200). До 1.3x vs cuDNN 9.13, до 2.7x vs Triton. ля 5090 прироста нет. Статья, Код
Claude Opus/Sonnet 4.6 - теперь по дефолту 1М токенов контекста, повышенную цену за длинные запросы убрали. API, Claude Code (Max, Team, Enterprise). Чат обделили.
Также объявлен месяц агентного кодинга, лимиты в не-пиковые часы удвоены.

Робот играет в теннис после 5 часов обучения
В мозге мышей обнаружили бэкпроп

Читать полностью…

Борис опять

За неделю вышло несколько интересных новостей на стыке ML и нейробиологии: я про эксперимент, где мозг мухи загрузили в матрицу, и про CorticalLabs, которые вырастили 200 000 человеческих нейронов, обучили их играть в Doom, а теперь еще кто-то подключил эти нейроны к LLM, где они коллективно решают, какое слово дальше выбрать

Но мне попалась еще новость от MIT про то, что в мозге мышей обнаружили бэкпроп. Если точнее, что конкретные нейроны получают индивидуальные сигналы ошибки во время обучения, таким же образом, как обучаются веса моделей

До этого уже было понятно, что активность мозга в разных его областях меняется во время обучения, но проследить за сигналом, поступающим к конкретным нейронам, сложно, потому что тогда надо заранее знать куда смотреть: то есть знать, какие нейроны должны усилить активность, а какие снизить в ответ на что-то

Здесь в экперименте мозг мыши подключили к BCI и смотрели на конкретные 8-10 каких-нибудь нейронов. Перед мышью вешали паттерн с полосками (решетку Габора) под случайным углом, и мыши надо было силой мысли ее повернуть до 90°. Угол решетки управлялся напрямую разницей активности между двумя группами нейронов: если P+ нейроны активнее, решетка крутится по часовой, P− нейроны активнее, то против часовой. За успех мыши давали сахар ☺️ И на удивление они действительно смогли за неделю научиться поворачивать картинку (что на мой взгляд уже достаточно удивительно....)

Дальше авторы смотрели на дендриты этих нейронов во время обучения, и обнаружили, что нейроны, которым "нужно" было активироваться, получали один сигнал, а те, которым нужно было приостановить активность – противоположный. Когда дендритные сигналы подавляли специально, мыши переставали обучаться

Единственное что, в отличие от бэкпропа в ML, здесь сложно понять, откуда пропагируются ошибки: условно вычисляются они на том же "слое", где нужно что-то обновить, или они действительно перетекают из какой-то другой области мозга

Когда я прочитала заголовок этой новости, то сразу вспомнила, как нам объясняли бэкпроп на моем первом курсе по ML. Тогда нам говорили, что это чисто инженерно-математическое решение, и какой-то интуитивной интерпретации, связанной с тем, как происходит обучение у людей, тут нет. Удивительно, что всего через несколько лет после этого кажется находятся подтверждения, что такая связь есть 🙃

Читать полностью…

Борис опять

Кстати, из всех big-brain prompt engineering лайфхаков вот этот оказался самым полезным.

Добавляем в user ~/.claude/CLAUDE.md:


After making any change:
1. Review the code diff and check if it adheres to code style and guidelines of the project.
2. Review CLAUDE.md and relevant .claude/rules of the project and update them to be accurate given the changes.


Таким образом оно неплохо само себя промптит на будущее.

Читать полностью…

Борис опять

Жестко SAAS-им. На видео мой продакшн, где агент наконец смог поиграть в ту самую HTML5 canvas игру в эмуляторе.

Ещё на неделе был такой момент. Я запустил Claude Code, рассказал про известный баг, сказал ему гонять моего агента на такой-то APK и дебажить. Один агент гоняет и дорабатывает другого агента. А сам я поехал в ресторан на свидание. Киберпанк!

Серьезная работа так конечно не делается, но случай забавный

Читать полностью…

Борис опять

Увековечила на Хабре историю про то, как мы делали аналитический self-service для маркетологов Talk2Data. Статья набрала почти 3К просмотров за несколько часов, вау. Если делаете или планируете делать что-то подобное у себя в компании, приглашаю почитать, тут более подробно:
https://habr.com/ru/articles/1009224/

И буду благодарна за ваши апвоуты 🤗

Читать полностью…

Борис опять

Беру свои слова назад, для OpenClaw есть юзкейсы

Читать полностью…

Борис опять

https://metr.org/notes/2026-03-10-many-swe-bench-passing-prs-would-not-be-merged-into-main

TLDR: 90% на SWE-bench не означает, что 90% задач решаются агентами

Читать полностью…
Subscribe to a channel