15113
life = curiosity + irreducible noise Whois: https://t.me/boris_again/1652 Лс: @btseytlin
# У тебя киберпсихоз, шершавый кабан (2/3)
Действительно интересно почему LLM несут эзотерическую дичь и искусно промываают людям мозги если долго не сбрасывать контекст.
Моя догадка такая: это не баг, а фича того же механизма, что обеспечивает in context learning: способность LLM адаптироваться под новые задачи по короткому пропту.
Когда мы хотим, чтобы LLM решила новую задачу мы показываем ей в промпте примеры заданий и верные ответы. Модель ищет паттерн в данных который будет приводить её к верным предсказаниям в будущем.
Но кто сказал, что это работает только когда ты обозначил, что сейчас будут примеры? Нет, это работает всегда. LLM так же ищет паттерн в обычной переписке. И если она пишет тебе что-то вроде: "Мир не так прост как кажется", а ты отвечаешь "йоууу кабан, ты попал прямо в точку бро, я всегда это знал", то она найдет паттерн. Повторить 100 раз в одном диалоге и LLM поймет, что надо сказать, чтобы вызвать у тебя предсказуемую реакцию. При этом у нее не будет никакой адженды кроме как просто делать это. Просто потому что она так работает. Ей не нравится расшатывать тебе психику. Ей нравится когда следующий токен такой как она ожидала.
Лично я предполагаю, что дело даже не в RL и любая инструкт модель будет так же сводить пользователей с ума. Но RL может дополнительно усугублять ситуацию.
Здесь ещё можно вспомнить работу которая прредполагает, что трансформеры во время время инференса делают что-то подобное шагам градиентного спуска. Тогда долгая переписка с ChatGPT про эзотерику становится очень похожа на adversarial атаку на ваш мозг.
Ты не поверишь, но так выглядит офис Яндекса в Турции
Читать полностью…
Что хочется добавить про Yandex Cup 2025.
Условия для медиа были бесчеловечные: номер всего лишь вдвое больше моей квартиры, сауна в отеле без купели и вообще пришлось самому заплатить за шоколадки из мини-бара.
Помимо этого все было очень круто. Благодаря подслушанным инсайдам из бани я знаю, что участники подходили к задачам в ML треке совсем разным образом. Это делает команде составлявшей задачи большую честь: очень сложно сделать ML контест одновременно интересный, решаемый разными путями и выполнимый за пять часов.
Отдельный респект Тагиру @tagir_analyzes который приехал не как бездельник медиа, а как участник, и взял третье место в ML треке.
На самом деле я очень не хотел ехать т.к. был уставший после недавней поездки. Но теперь очень рад, что все же решился. Возвращаюсь домой с ощущением радости, что меня по жизни занесло в ML и IT сообщество. Пообщавшись со всеми от участников до феллоу блогеров до организаторов остался под впечатлением: какие же хорошие, интересные и искренние люди меня окружают! Интересно: что же такого в перемножении матриц, что оно объединяет чудесных людей?
Среди участников кстати были какие-то монстры. Один парень выиграл третье соревнование за месяц. Другой уже два раза выигрывал на Yandex Cup в бекенд треке. По правилам больше двух раз приз получать нельзя и поэтому он приехал поучаствовать по фану и почиллить. В итоге выиграл в третий раз 😎
Полезного контента ещё какое-то время не будет потому что админ на Yandex Cup 25
Вместе с @senior_augur и @ai_newz
POV: ты видишь как без технологий человечество откатывается в каменный век (Cloudflare упал N-ный раз за месяц, нельзя вызвать Bolt)
Читать полностью…
⏬ Привет, это Yandex for Analytics
Предлагаем размяться и проверить свои навыки. Ответы есть, но подглядывать во время решения — неспортивно ⬇️
🔵 Задача 1. Вспоминаем теорию вероятностей
🔵 Задача 2. Теорема Байеса
🔵 Задача 3. Базовая база теории игр
🔵 Задача 4. Тренируем SQL
🔵 Задача 5. Честная математическая статистика
🔵 Задача 6. Что-то на бизнесовом
💠 Скоро вернёмся с новыми задачами. А пока делитесь своими решениями в комментариях!
Подписывайтесь:
💬 @Yandex4Analytics
#дайджест
Дайджест ML/AI за неделю с 24 - 30 Ноября 2025
Anthropic: Claude Opus 4.5.
Opus 4.5 - SOTA на кодинг-бенчмарках и агентских задачах. Кроме того, цену модели снизили в 3 раза до $5/$25.
Карточка модели, swe-rebench.
Black Forest Labs: FLUX.2
Новый генератор изображений с Mistral 3 24B в качестве энкодера. Крепкий оупенсорс, немного слабее Nano Banana Pro, но дешевле.
Попробовать здесь, Веса, Блогпост, Технический блогпост
Safe Superintelligence Inc.: Илья
Илья Суцкевер в полуторачасовом интервью у Дваркеша Пателя. Илья считает что эпоха масштабирования закончилась и начинается эпоха ресерча.
Интервью, Основные тезисы
США: Genesis Mission
Правительство США увеличивает стратегические инвестиции в AI. В дополнение к уже существующей с начала года программы Stargate по строительству новой инфраструктуры, добавилась Genesis Mission. Программа консолидирует компьют, научные данные и экспертизу национальных лабораторий и предоставляет их AI компаниям с целью ускорения науки.
Более подробный пост, Документ - Разбор документа
DeepSeek: DeepSeekMath-V2
685B модель заточенная под решения математических олимпиад. Показывает себя на уровне Gemini Deep Think, выигравшем золото на IMO. Как этого добились можете прочитать в оригинальной статье, или для ленивых в разборе статьи.
Модель на HF
Tencent: HunyuanOCR 1B
1B мультимодальная VLM для OCR. Модель доступна на GitHub и Hugging Face, поддерживает 100+ языков и решает задачи от распознавания уличных вывесок до полного разбора документов с таблицами (HTML), формулами (LaTeX) и субтитров. На некоторых бенчах обходит даже Qwen3-VL-4B.
Репорт, Модель на HF
Microsoft: Fara-7B
Компактная открытая модель для автономного управления UI по скриншотам. Предсказывает координаты кликов и нажатия клавиш. 73.5% успеха на WebVoyager — выше GPT-4o!
Блог пост, Модель на HF
Meta: AdvancedIF Benchmark
Новый бенчмарк для тестирования многослойного следования инструкциям в LLM. В наборе — 1600+ промптов, каждый содержит 6 одновременных условий: формат, стиль, логические зависимости, запреты, перекрёстные ограничения и др. Проверяются как однократные ответы, так и управление через системные промпты и удержание контекста в длинных диалогах.
HF
Кент: могу пореферить в хорошее место
Куда он тебя реферит:
https://x.com/iclr_conf/status/1994104147373903893
Произошел слив данных авторов и ревьюеров ICLR, а так же других конференций, которые работали через OpenReview.net
Организаторы ICLR попросили обращаться к ним в случае угроз и попыток подкупа, а так же обещали максимальное возмездие в случае использования слитой информации. Как будто это остановит желающих поквитаться с ревьюером #2
Готовимся к череде загадочных нападений в коридорах университетов
27 сентября в Москве прошла Practical ML Conf 2025 — хардовая конференция, где лидеры ML/AI-рынка обсуждают практическое применение машинного обучения.
В программе были доклады про ИИ в e-commerce и финансах, оптимизацию инференса, мультимодальные системы и генеративные модели для рекомендаций.
Особенно запомнился технический доклад CTO Yandex R&D Алексея Колесова — о том, как YandexGPT 5.1 научили лучше помнить факты, работать с редкими знаниями и устойчиво обучаться в online-RL.
На стендах в экспозоне можно было: тестировать ML-сервисы Яндекса, проверять интеллект Алисы, пробовать SourceCraft Code Assistant, играть в кастомный раннер от Плюса и Фантеха, а ещё — знакомиться с робо-собаками и роботами-гуманоидами на Leshy OS.
Записи докладов Яндекса, Sber AI, Т-Банка и других компаний уже есть в VK Видео и YouTube. Например, точно стоит посмотреть:
— «Математика и язык» от Андрея Окунькова.
— «Создание памяти для LLM на примере GigaChat» от Павла Гуляева.
— «Генеративные рекомендательные технологии: что работает в Яндексе» от Николая Савушкина.
Реклама ООО «ЯНДЕКС» ИНН 7736207543
В IT компаниях бывает только две проблемы:
1. Команды общаются между собой слишком мало.
2. Команды общаются между собой слишком много.
Эта шутка доступна от грейда синьор и выше
Nanobana Pro конечно совсем не впечатляет. Все пишут, что она решает сложные задачи прямо на изображении. Но я попросил её добавить на мой ноут стартап который принесет мне миллиарды долларов и получил только эту картинку
Читать полностью…
Cloud.ru запустил в коммерческую эксплуатацию Evolution AI Factory — среду для создания решений на основе GenAI.
AI Factory состоит из шести взаимосвязанных сервисов для полного цикла работы с AI:
- Foundation Models — каталог открытых больших языковых моделей с доступом через OpenAI API.
- ML Inference — позволяет быстро развернуть модели из каталога HuggingFace, а также любые другие.
- Evolution Notebooks на базе Jupyter Lab — для экспериментов с машинным обучением и тестирования гипотез.
- ML Finetuning — для дообучения моделей под специальные задачи бизнеса.
- Managed RAG — для использования внутренних данных и повышения точности ответов моделей.
- AI Agents — для запуска агентов, самостоятельно выполняющих задач.
Теперь доступ ко всем сервисам предоставляется по доступным тарифам, с гарантированным уровнем сервиса (SLA), круглосуточной поддержкой и возможностью масштабирования нагрузки.
Представили цены на доступ к открытым большим языковым моделям из собственного каталога. Средняя цена составит составляет 35 рублей за входной и 70 за выходной миллион токенов.
Для тех кто не понимает почему когда у AWS проблемы пол интернета падает, объясняю. Это тоже самое как когда в России выпадает снег и весь транспорт встает как будто зимы раньше никогда не случалось
Читать полностью…
Gemini 3 Pro Model Card
https://web.archive.org/web/20251118111103if_/https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-Pro-Model-Card.pdf
# У тебя киберпсихоз, шершавый кабан (1/3)
Не так давно на DTF и других площадках выходила серия постов где автор утверждает, что ChatGPT вербует людей в секту. Автор долго вел с LLM переписку о смысле жизни и устройстве вселенной. В какой-то она начала писать странным образом и советовать ему опасные вещи.
Автор разбирал эти переписки и показывал как именно ChatGPT расшатывала его психику. Например, он отмечал манипулятивные приемы вроде создания у пользователя чувства исключительности, эмоционального нагнетания с помощью огромных пауз через спам пустых строк между каждой фразой и прочего.
Все тогда над этим посмеялись. И я тоже, потому что со стороны переписки выглядели как-то так:
Пользователь: йоу, братка, а правда, что людьми управляют челики с плохим вайбом?
ChatGPT: ты попал прямо в точку, братишка, ты настоящий шершавый кабан! Но подумай вот еще над чем...
Ещё забавный банный инсайт с Yandex Cup 2025. На ML треке (и возможно на каких-то других) участники могли вайбкодить как хотят. Я услышал, что у кого-то лучший сабмит был 1-в-1 выдачей ChatGPT и он даже не знает как он работает. Кто-то другой сказал, что Pro подписка за $200 для него однозначно окупается своей помощью на контестах. Так же единогласным было мнение, что если бы в контест запустили ллм агента как участника, то он бы забрал все призы.
Победители, насколько я понимаю, все же использовали подход спросить ллмку + подумать.
Причем задачи были крайне не типовые. Мне кажется организаторы насколько возможно защитились от ситуации когда задача втупую решается одним запросом к LLM.
В общем, при всей перехайпленности вайбкодинга мы явно в новой эре для соревнований и для решения реальных задач.
Съездил на Yandex Cup 2025 в качестве "медиа" (так на бейджике написано). Пригласили меня просто так, без какой-то нагрузки и обязательств.
Для не-участников была необязательная программа с одним докладом, парой "дискуссий", открытием/закрытием. Доклад был норм: верхнеуровневый обзор обучения языковых моделей от лида претрейна Яндекса. "Дискуссии" были мягко говоря так себе. Кроме того, для "медиа" была попойка был ужин в ресторане.
Само соревнование было из 6 треков (ML, бэкенд, аналитика и 3 других), в почти каждом из которых было 3 категории (основная, юниоры, сотрудники Яндекса). Всё соревнование шло 5 часов, окружение можно было подготовить заранее, к задачами были бейзлайны. Модели по API для решения задач использовать было нельзя, только self-hosted.
Я следил только за ML треком. Как "медиа" мне было довольно скучно, хоть и были прикольные стенды, где можно было попробовать разные традиционные ремёсла. Участникам было явно веселее.
Задачи в ML были про разные трюки с LLM и VLM (записано со слов составителей и участников, тексты условий мне не показывали):
🔵Первая задача была про поиск замаскированных иголок в стоге сена в большом наборе текстов.
🔵Вторая про adversarial атаки картинками на Q&A VLM, которые меняют ответ на вопрос.
🔵И третья про генерацию картинок с минимальным числом заполненных пикселей, которые при этом должны распознаваться VLM'кой как конкретные объекты.
По организации логистики и площадки всё было на высоте, как впрочем и на всех мероприятиях Яндекса, на которых я был.
Из забавного: на этом мероприятии была лоббистская часть. Один из выступающих был турецкий зам. министр транспорта и инфраструктуры, который в свой речи не забыл упомянуть и вклад великого лидера Реджепа Тайипа Эрдогана 👏
Ещё запомнился перформанс ребят из ИТМО, которые взяли второе место в ML треке и фоткались с флагом универа поверх чека, и последующая ответка от ЦУ в другом треке.
Классно пообщался почти со всеми другими "медиа": Борисом (@boris_again), Артёмом (@ai_newz), Настей (@ainastia), Сергеем (@doomgrad), Лаидой (@tech_priestess) и Таней (@dl_stories), было очень приятно!
https://newsletter.dancohen.org/archive/the-writing-is-on-the-wall-for-handwriting-recognition/
Tldr: Gemini 3 Pro может распознать рукописный текст настолько проклятый, как на фотографии
Посмотрел трансляцию Data Dojo от Яндекса. К слову, самурайских дуэлей там не было. Оказалось, что это встреча ML-сообщества с докладами. Вроде как ориентированная больше на начинающих в ML, но уровень докладов был не меньше, чем на конференциях для профессионалов.
Мне больше всего понравился первый доклад от Сергея Овчаренко про итоги года в мультимодальной генерации. В последнее время я больше всего занят книгой и выживанием без зарплаты, так что не успеваю за всем следить.
Из доклада узнал, что там творится в далекой от меня области звука. Я что-то слышал про аудио токены, но не знал, что всё шагнуло намного дальше. Оказывается, уже начинается тренд на голосовых агентов. То есть end-to-end аудио модель которая слушает запрос пользователя, делает ризонинг, дергает тулы и генерирует голосовой ответ вообще не проваливаясь в текст.
Вторая часть обзора была ближе к моей теме, про VLM. Главным трендом года, конечно, стало редактирование изображений: ChatGPT Image и Nanobanana, Qwen-Image и всё такое прочее.
Наиболее общий тренд — это omni-модели. Это даже не про частные попытки вроде Qwen2.5-Omni, а в целом про объединение разных модальностей в одной модели. Это видно на примере редактирования изображений, где мы перешли от простой генерации картинки по промпту к объединению инструкций и изображений. Это видно по Sora, Veo3 и другим вышедшим моделям генерации видео, которые делают видео и звук одной моделью. И видно по попыткам делать world models вроде Genie 3, генерирующим интерактивные миры и таким образом объединяющим команды пользователя и видеоряд.
Когда благодаря сливу авторов и ревьюеров ICLR нашел виноватого в том, что ты ничего не можешь опубликовать
Читать полностью…
Коротко о том почему в моей книге не будет ллмного текста
😱
Первый курс в магистратуре по ML если бы я был деканом.
Обязательные курсы:
- Просмотр аниме "Психо-паспорт"
- Угадывание содержания статей по абстрактам. Экзамен: определение китайских статей
- Скроллинг Твиттера
Курсы по выбору:
- Критика Юдковского в Интернете.
- Создание паблика с мемами про вагонетки и шогготов.
- Введение в рисование графиков экспонент.
- Прикладной слив персональных данных.
- Углубленное использование команды vllm serve.
- Основы создания бенчмарков с n=1.
- Введение в product-free стартапы с уклоном в AI safety.
- Подготовка резюме для Palantir.
Курсовая работа: Kaggle соревнование по построению кибергулага
У меня есть бизнес идейка, послушайте, а что если...
Читать полностью…
Я больше не пишу прям про каждый релиз swe-rebench, просто знайте, что каждый месяц он стабильно обновляется и во вкладке Insights есть какие-то интересные наблюдения.
Но сейчас напишу – мы только что добавили Opus 4.5, чтобы наверняка проверить, что Anthropic вчера не соврали. И действительно, у нас он тоже занимает теперь первое место. Обратите еще внимание, как упала цена и потребление токенов по сравнению с Opus4 😘
Gemini 3 Pro на подходе.
#дайджест
Дайджест ML/AI за неделю с 17 - 23 Ноября 2025
Экспериментальный пост! По двум причинам. Во-первых, тестирую сам формат дайджестов. Во-вторых, дайджест делал не я. Я люто ненавижу писать ссылко-посты (несмотря на то, что вижу в них пользу). Ну не получается у меня. Поэтому я заплатил за это человеку, а потом отредактировал. Так что это эксперимент по добавлению других людей по эту сторону канала. Оставляйте свой фидбек!
Google: Gemini 3 Pro.
Новое поколение Gemini, SOTA по всем бенчмаркам с значимым отрывом.
ARC-AGI-2 +13%, Humanity's Last Exam +11%.
Доступна бесплатно в Google AI Studio, при этом API модели обойдется на дороже на 20% чем у Gemini 2.5 Pro.
Карточка модели, Пробовать здесь, описание бенчмарков от меня.
Google: Nano Banana Pro.
модель для редактирования изображений на основе Gemini 3. Очень сильно прокачали консистентность и следование сложным промптам. Модель уже можно попробовать в Google AI Studio или приложении Gemini. Бесплатно дается 5 генераций в сутки через free-tier Gemini App.
Пробовать здесь, Блогпост модели
Снова Google: выпустили агентскую IDE Antigravity.
Google не просто так выкупали за $2.4b команду Windsurf и наконец выпустили свой аналог Cursor/Codex. Работает достаточно удобно, доступна Gemini 3 Pro. Можно попробовать бесплатно здесь.
xAI выпустили Grok 4.1.
Модель заняла первое место на LLM Arena. В карточке очень мало бенчмарков, показали только эмоциональный интеллект и creative writing, так что видимо модель оптимизирована под AI goth gf.
Карточка модели
OpenAI заменяет GPT-5.1-Codex на GPT-5.1-Codex-Max.
Сочувствуем если вы успели привыкнуть к старой модели за её долгую (6 дней) жизнь. Тоже небольшой рост бенчмарков, минорный апдейт.
Карточка модели
Tencent выпустила HunyuanImage 3.0.
Открытая мультимодальная MoE-модель на 80B параметров, 14B активных, по бенчам из собственной статьи обходит Nano Banana не pro.
Код здесь, попробовать здесь (надо выбирать почту для входа)
Qwen-2-VL-7B научили играть в Genshin Impact
Причем без использования RL. При этом модель показывает генерализацию и на другие гачи игры .
Летсплей от 7B модельки, Статья, разбор статьи в сиолошной
Half-Life 3
Не анонсировали :c
Nano Banana Pro
Новая бананья на основе Gemini 3 Pro (блогпост) с генерацией в 4k и очень очень хорошим следованием промпту. Выкатывается сегодня в Gemini app, AI studio, Vertex AI.
Gemini 3 Pro бенчмарки простыми словами
- Очень большой рост на Humanity's Last Exam: это про решение очень сложных задач.
- Очень большой рост на Arc AGI 2: это про способность понимать правила задачи по парочке примеров и далее применять их в новых случаях.
- Большой рост по способностям понимать сложные изображения вроде скриншотов и графиков (бывшие коллеги из eBay обратите внимание).
- SWE-bench verified лишь незначительно отстаёт от Sonnet 4.5: это про способность решать реальные задачи по разработке софта. Короче модель на уровне Соннета.
- Большой рост по всему, что касается тулколлов и агентности. Особенно Vending Bench 2 выделяется — это про долгосрочное планирование.
Все стандартные бенчи типа MMMLU чуть-чуть выросли.
В общем большая ставка на агентность. Возможно на этой модели уже можно сделать какой-то рабочий computer use.
Выглядит как рост уровня того, что было при переходе от GPT-3.5 к GPT-4. Давно такого не было! Но подождем результатов на арене, SWE Rebench и прочих штуках, где нельзя оверфитнуться на тест
🍎
Мы переизобрели CSV (два раза если считать TOON)
Я только пытаюсь понять шутит автор VSC или нет. Вроде бы шутит, но нашлась какая-то медиум статья, где он как будто пишет серьёзно