15113
life = curiosity + irreducible noise Whois: https://t.me/boris_again/1652 Лс: @btseytlin
В конце года я почти всегда чувствую потребность немного притормозить и попробовать сложить происходящее в голове в какую-то картину. В ML это особенно сложно: слишком много событий, новостей и технологий, которые накладываются друг на друга и быстро теряются в повестке.
У ребят из South HUB как раз будет эфир в котором они соберут за одним виртуальным столом людей, весь год принимавших решения, чтобы поговорить о них и контексте без прикрас.
Сегодня у меня день рождения: мне стукнуло 30 лет. Как говорят у нас, стариков, юбилей.
Депрессии в честь юбилея не наступило. У меня есть два мысленных эксперимента, чтобы оценивать насколько жизнь удалась.
Первый: что бы сказал Борис в 16, 18, 20 лет и так далее если бы ему показали мою текущую жизнь? Все Борисы прошлого бы согласились: не выпилился и уже хорошо достойно. Они бы порадовались. Не предел мечтаний и конечно все пошло не так как ожидалось. Но я себя нигде не подвел.
Второй: если бы прямо сейчас я умер и мне показали экран game over, я бы расстроился? В этом году ответ такой же как все годы сознательной жизни: грустно было бы, что все заканчивается, но в целом хорошо поиграли. Я уже доволен.
С каждым годом жизнь становится только лучше.
Хотя временами я начинаю тревожиться, что топчусь на месте и варюсь в тех же проблемах, что и 5-10 лет назад. Банально: почему я как в 20 не мог поддерживать стабильный режим сна, так и в 30 не могу? В такие моменты я сомневаюсь в существовании личностного роста, а так же работают ли терапия и психиатрия.
Недавно у меня было на эту тему озарение. Я вспомнил, что лет у была большая проблема: меня постоянно называли серьёзным.
Меня часто спрашивали: ты чего такой грустный? А я не чувствовал себя грустным. Еще все почему-то считали меня правильным. Меня это страшно бесило, но я не мог возразить, потому что я не делал ничего неправильного и вообще крашеных волос тогда не было. Диссонанс между тем, как я себя ощущаю, и что видят окружающие ощущался как клетка. Клетка которая всегда со мной.
Я пришел в терапию: помогите, я жизнь не чувствую. Там мне рассказали удивительную мысль: Борис, ты пугаешь людей. Я-то думал, что это я всех боюсь и вообще не мог представить, что я могу кого-то пугать. Начался длинный путь по сбрасыванию защит, признанию своих уязвимостей и расслаблению сложного ебальника. Почти все время мне казалось, что ничего не работает и проблемы все те же.
Так вот, сегодня мне 30 лет и я не помню когда меня последний раз называли серьёзным! Когда-то эта проблема определяла мою жизнь и даже идентичность. Теперь я безработный стендапер и писатель. И только случайно вспомнил о том, что когда-то было иначе.
Так я на себе проверил, что мы склонны переоценивать куда мы можем дойти за год и недооценивать куда можем дойти за пять. Новые проблемы заместили старые и кажется будто старых вообще не было. Но думаю Борис 22 лет оказался бы очень доволен посмотрев на мою текущую жизнь. Желаю, чтобы у всех вас было так же.
Может к сорока годам научусь вовремя ложиться спать.
Стоит ли лить синтетику в бенчмарк
Потыкав свою модель подольше я убедился что с бенчмарком что-то не так. По метрикам моя модель сильно лучше Gemini Flash 2.5 Lite, а по ручным тестам этого не видно.
Исправил ситуацию. Теперь все более адекватно реальности. Новые метрики говорят: моя модель больше галлюцинирует (ожидаемо от 135м), но лучше слушается схему и делает корректные JSON (чему её специально учили, а Gemini не учили). Что интересно моя моделька всё ещё чуть лучше по доле верных ответов.
Решение было в том, чтобы убрать синтетику из тест сета. Например, я генерил очень много примеров с помощью пандаса. Берем датафрейм, наполняем рандомной фигней, потом делаем ему df.to_json, df.to_csv, df.to_xml, df.to_latex, итд. Для JSON вида генерируем ллмкой схему. Готово, получили кучу примеров. Эти примеры распределялись между трейном и тестом так, чтобы не было утечек.
Но Борис, спросят голоса в голове, разве "не класть синтетику в тест сет" это не ML 101? Разве бенчмарк не доложен максимально состоять из реальных данных?
Контринтуитивно, но не должен. Бенчмарк должен быть репрезентативным для условий в которых модель будет использоваться. Это совсем не тоже самое, что быть репрезентативным данным которые удалось собрать. Просто в большинстве задач данные как они есть это наиболее похожая на условия эксплуатации штука.
Теперь в моем тест сете только настоящие примеры JSON. Являются ли они более репрезентативными? Не факт. В основном они были выдраны из обсуждений на Github (я искал блоки маркдауна типа ```json). Это очень часто учебные примеры или заковыристые случаи (иначе их бы не обсуждали). Не факт, что это похоже на типичные данные которые людям хочется конвертить в JSON.
В общем, было предположение, что надо замерять качество в том числе на плоских объектах которые мне делает пандас. Потому что среди "настоящих" примеров таких объектов мало, но именно такие объекты я по большей части ожидаю на входе в реальных условиях.
Предположение не оправдалось. Оказалось, что без этой синты метрики адекватнее. Чтож, это нормальная часть итеративного процесса. Сделали бенчмарк. Побили метрику. Проверили другим способом действительно ли модель побившая метрику настолько хороша. Если нет, значит надо менять бенчмарк.
Мне сегодня приснился сон где мы с кем-то обсуждали, что мне через пару дней 30 лет. Мне говорят: "ты что-то не так посчитал, смотри: 2025 - 1995 = 50 лет. Тебе пятьдесят лет в этом году." И я такой: черт! И правда скоро умирать, а что я успел?Подсознание бессознательная часть психики, пощади
Мок-собеседования и карьерные консультации по 150 евро всем и каждому
В жизни каждого наступает момент когда ему необходимо простое человеческое деньги.
Периодически ко мне в личку приходят с запросами на мок-собеседования и карьерные консультации. Я хочу сделать эту историю более регулярной.
Мой питч остается таким же, как когда я менторил людей в течение всего поиска работы. Искать работу тяжело. Может иметь смысл заплатить кому-то (мне), чтобы сделать этот процесс проще, повысить шансы на успех и увеличить будущий оффер.
Я могу помочь с собеседованиями и карьерным путем в ML/DS или Backend разработке (а так же в меньшей степени в других направлениях в IT). Вы можете оценить мой подход по моей Методичке по поиску работы в DS/ML, посмотрев запись мок-собеседования по ML system design или по постам в канале на тему карьеры. Так же прикрепил к посту три хороших отзыва на работу со мной и один от человека которому больше всех не понравилось.
Стоимость 150 евро.
Забронировать слот можно здесь:
https://calendly.com/d/cx64-2rm-qsy/meet-with-me
Бронируя слот не забудьте заранее отправить мне в личку своё CV и нужный контекст, чтобы я мог подготовиться
Кому-то встроили ИИ в газовый котел 🙂
Но мы точно не в пузыре
Ремайндер 2: нажимать Shift-Tab в Google Collab НЕ СЧИТАЕТСЯ учебой 👀
Читать полностью…
Недооцененный LLM брейнрот юзкейс: придумывать шутки для суда
С Алисой работает (особенно голосом попробуйте), с ChatGPT не работает т.к. модель слишком большая/умная и не говорит ничего смешного
Обязательный черри-пик: наш инновационный метод vs их жалкий автокомплит
Черрипикнуть было непросто. На поверку оказалось, что большая часть ошибок у Gemini 2.5 Flash Lite Thinking не критичная, но мой бенч их считает. Например, модель поставила null там, где должна была "". В реальных применениях скорее всего простительно. Ещё часто модель выдает немного невалидный json, но контент верный, так что это лечится structured outputs.
Но даже паритет с такой моделью меня очень удивляет, я думал Smollm2 просто не потянет задачу
Мир если бы менеджеры умели читать и писать markdown
Читать полностью…
Кстати на тему техрепорта Alice AI вчера разгорелся неожиданно активный срач спор (в очень узких кругах тех кому не все равно).
Яндекс обучил Alice AI на основе Qwen3-235B: инициализировали базовой моделью, затем сделали несколько этапов обучения поверх. В том числе этап где они тренировали в unsupervised режиме на своём большом корпусе. Всё это подробно описано в техрепорте. Который, кстати, очень подробный и в целом классный. В целом, ну и молодцы: использовали рабочий и эффективный подход.
В общем Яндекс назвал первый этап обучения pretrain, админ LDT назвал это "дотюнили квен" и понеслось: 100+ комментариев про то, можно ли такое называть pretrain или нет, рофельные видео шары, мемные пасты.
Я считаю так: некорректно называть обучение с весов базовой модели pretraining. Так же не стоит называть то, что сделала команда Alice AI "finetuning", чтобы не путать с дообучением LoRA на 1000 инструкт примерах и всем прочим. Устоявшийся в литературе способ называть "мы взяли base checkpoint и обучали его дальше на своём корпусе" это continual pretraining.
Я вообще удивляюсь, что кому-то важно "свой претрен" или нет. Преимуществ у "своего претрена" примерно ноль. Какой-то спор про термины на которые абсолютно всем пользователям всё равно (буквально всем кроме сотрудников Сбера). Давайте лучше читать техрепорт, удивляться высоким ценам на API новой модели и всё такое прочее
#дайджест
Дайджест ML/AI за неделю 01 - 07 Декабря 2025
Claude Opus 4.5 теперь доступен в Claude Code по Pro подписке
DeepSeek V3.2 и V3.2 Speciale
Компания заканчивает релиз линейки V3.2 моделями DeepSeek-V3.2 и DeepSeek-V3.2 Speciale.
На reasoning и agentic бенчмарках даже базовая версия обгоняет GPT-5-High, а V3.2 Speciale достигает еще лучшего перформанса ценой большего количества токенов, местами обходя Gemini 3 Pro.
Модели доступны в чате и API по цене $0.28/$0.42.
Веса - V3.2, Speciale
Техрепорт
Mistral: Mistral Large 3
Mistral выпустил мультимодальные модели Mistral 3 размерами 3B/8B/14B/675B. Каждая представлена в Base/Instruct/Reasoning версии. Large Модель сопоставима по бенчам с DeepSeek V3.1 и Kimi-K2.
Блогпост, Веса, Попробовать модель
Kling: Omni Launch Week
Kling вдохновились прошлогодним адвент-календарем релизов 12 Days of OpenAI и провели Omni Launch Week.
Коротко о релизах:
Kling Image O1 - генератор изображений с пониманием семантики и контролем изображений как в фронтир редакторах.
Kling Video O1 - контекстная мультимодальная видеомодель, что-то вроде "Nano Banana для видео". Доступна только в Pro Mode.
Kling Video 2.6 - апдейт базовой видеомодели, теперь со звуком.
Avatar 2.0 - генератор говорящих голов.
Runway: Gen-4.5
Новая видеомодель Runway знала первое место на арене, обойдя Veo3. Физика физичная, есть нативный звук. Еще одна хорошая видеомодель.
Блогпост
Nvidia: DRIVE Alpamayo-R1
На NeurIPS Nvidia показали модель и инструменты для беспилотных автомобилей и робототехники.
DRIVE Alpamayo-R1 - Модель построена на VLM Nvidia Cosmos‑Reason1, которая позволяет более осмысленно анализировать происходящее на дороге силами ризонинга.
LidarGen - генератор LiDAR‑данных.
Cosmos Policy - извлечение поведения роботов из видео.
ProtoMotions3 - моделирование роботов в цифровой среде.
Блогпост
Arcee: Trinity Mini и Trinity Nano Preview
Стартап Arcee выпустил своё первое семейство foundation-моделей: Trinity Mini 26B MoE и Trinity Nano Preview 6B MoE.
Судя по манифесту, у моделей полностью собственный претрейн, по бенчмаркам сопоставимы с конкурентами. Сейчас компания тренирует 420B модель.
Веса, Попробовать модели
NeurIPS
Завершилась NeurIPS. Не такое важное событие как Yandex Cup конечно. В этом году конференция проходила 2-5 декабря в Сан-Диего и Мехико. Если вы любите искать экспоненты, взгляните на количество поданных статей на NeurIPS год к году. В этом году было подано 25 000 статей, из которых приняли 5300.
Победившие статьи можете почитать здесь.
Maybe AI is the brain cell we lost along the way
Читать полностью…
Посмотрел свежий YaC про ИИ. В этот раз фокус всех релизов как будто на выходе за пределы чатов в реальный мир.
Яндекс показал прототип своих наушников Drops с Алисой. Попытка сделать голосовое взаимодействие с LLM и убрать экран как посредника. Вместе с ними заявлена фича "Моя память": диктуешь на ходу мысли, а модель сохраняет всё в структурированном виде.
Делать "громкие" продукты (когда все вокруг слышат, что ты говоришь своему ассистенту) достаточно тяжело, так что посмотрим как пойдет.
В софте фокус на AI-агентах. Например, агент "Найти дешевле" в Алисе принимает задачу на поиск товара по самой выгодной цене, изучает предложения в магазинах и на маркетплейсах, выдает подборку, где можно сэкономить.
Пока доступ открыт только для части пользователей.
Показали инструменты и для врачей — нейросеть для анализа МРТ новорожденных на предмет ДЦП. Ставят вопрос кому доверять, человеку или ИИ, и сами отвечают: тому, у кого ниже error rate — но лучше всего синергия.
Нейроюрист как пример domain-specific AI. Дообучили модель работать с российской законодательной базой. Описывают как "вчерашнего выпускника юрфака, который помнит вообще всё."
Сделали RAG для личных и корпоративных документов. "Алиса Про" работает с файлами пользователя - почта, документы, презентации, аудио, видео.
Оба решения делали для себя, но по итогам открыли всем.
Посмотреть можно на Кинопоиске, VK Видео или YouTube.
Подводка (этот текст удалить, все остальное оставить как есть, сырки поступят на ваш счет в течение дня):
Чо, пьёте пиво по пятницам? 🍺
А пока вы пьёте — агенты не пьют. Агенты устраивают диверсии на ваш прод, слушаются prompt-инъекций и сливают данные в даркнет.
Слабая аура автора: глава слишком сложная, надо упростить, а то потеряю читателя
Сильная аура: смотреть надо было, что за книгу покупали
Мок-собеседования и карьерные консультации по 150 евро всем и каждому
Периодически ко мне в личку приходят с запросами на мок-собеседования и карьерные консультации. Я хочу сделать эту историю более регулярной.
Мой питч остается таким же, как когда я менторил людей в течение всего поиска работы. Искать работу тяжело. Может иметь смысл заплатить кому-то (мне), чтобы сделать этот процесс проще, повысить шансы на успех и увеличить будущий оффер.
Я могу помочь с собеседованиями и карьерным путем в ML/DS или Backend разработке (а так же в меньшей степени в других направлениях в IT). Вы можете оценить мой подход по моей Методичке по поиску работы в DS/ML, посмотрев запись мок-собеседования по ML system design или по постам в канале на тему карьеры. Так же прикрепил к посту три хороших отзыва на работу со мной и один от человека которому больше всех не понравилось.
Стоимость 150 евро.
Забронировать слот можно здесь:
https://calendly.com/d/cx64-2rm-qsy/meet-with-me
Бронируя слот не забудьте заранее отправить мне в личку своё CV и нужный контекст, чтобы я мог подготовиться
кстати про датацентры
если вы вдруг задумывались как связываются ноды внутри датацентра, то я зашарил за Infiniband и написал его симуляцию на питончике
distributedhatemachine.github.io/posts/infiniband
distributedhatemachine.github.io/posts/infiniband
distributedhatemachine.github.io/posts/infiniband
В 2022-м я сказал совету директоров, что нам нужна своя LLM. Своя. Суверенная. На триллион параметров.
Почему триллион? Потому что у GPT-4 — триллион. Я прочитал это в телеграм-канале. Канал назывался «ИИ на минималках». 50 000 подписчиков. Значит, правда.
Мне выделили бюджет. 2,3 миллиарда рублей. Я сказал «это инвестиция в технологический суверенитет». Никто не спросил, что это значит.
Я тоже не знал.
Купили 256 карточек V100. Не A100. V100. Потому что A100 под санкциями. V100 — нет. V100 вышли в 2017-м. Но я сказал «проверенное решение». Проверенное означает старое. Старое означает дешёвое. Дешёвое на вторичке в Дубае.
Наняли команду. 40 человек. ML-инженеры. Большинство не работали с LLM. Но у них были сертификаты ОТУСА. Сертификаты — это компетенции. Компетенции — это строчка в отчёте.
Тимлид спросил, почему триллион параметров на 256 V100. Сказал, что у Meta на LLaMA 70B было 2000 A100. Я сказал «у нас другой подход». Он спросил какой. Я сказал оптимизированный. Он спросил как именно оптимизированный. Я назначил ему встречу по пересмотру грейда. Он уволился. Я написал в отчёте «оптимизация штата».
Восемь месяцев обучения. Модель не сходилась. Лосс был плоский. Инженер сказал, что данных мало. У нас было 200 гигабайт текстов. Госзакупки, диссертации, Лента.ру. Он сказал, что у LLaMA — 2 триллиона токенов. Я сказал «качество важнее количества». Это не так. Но звучит мудро.
На девятый месяц модель заговорила.
Она говорила странное. На вопрос «столица Франции» отвечала «в соответствии с пунктом 3.2 технического задания». На вопрос «кто президент России» выдавала «Дмитрий Анатольевич Медведев». Датасет был старый. Я назвал это «историческая глубина модели». Инженеры называли это по-другому. Но их мнение не шло в презентации.
Запустили в прод. Назвали «НейроРусь-1Т». Лого — медведь с нейросетью в голове. Лого стоило 4 миллиона. Агентство сказало, что медведь символизирует «мощь российского ИИ». Я согласился. Медведи мощные.
Первый месяц. 3 000 запросов. 2 800 — от тестировщиков. 150 — от журналистов. 50 — случайные. NPS — минус 40. Я убрал NPS из дашборда. Метрика была «не релевантна стратегическим целям».
Купили статью в РБК. 1 миллион рублей. Заголовок: «Российская нейросеть НейроРусь составит конкуренцию ChatGPT». Журналист спросил, можно ли потестировать. Я сказал «после публикации». Он опубликовал.
В статье было написано «по словам разработчиков, модель превосходит западные аналоги в понимании российского контекста». Это я сказал. Я не разработчик. Но они не возражали.
РБК поставили статью в раздел «Технологии». 400 000 просмотров. Комментарии отключили превентивно. Негатив не соответствовал редакционной политике.
Четвёртый месяц. Поняли, что модель хуже ГигаГпт 6. ГигаГпт 6 хуже Claude Sonnet. Задача: создать бенчмарк, на котором мы победим. Назвали «РусКонтекст-1000». Тысяча вопросов о российской культуре. Кто написал «Войну и мир». Столица Бурятии. Как зовут кота Медведева.
Запустили бенчмарк. НейроРусь набрала 34%. GPT-4 набрал 67%. Наш бенчмарк. Мы проиграли на своём поле.
Шестой месяц. Стали покупать ГигаГпт 6 за 990 рублей за 1м токенов. Это как Claude Sonnet в API. Только ГигаГпт 6 хуже Sonnet в три раза. Я измерил. На вопрос «напиши код сортировки» ГигаГпт 6 выдал код с багами. Sonnet - рабочий кода. Но Sonnet - иностранный. Иностранный - плохо. Баги - отечественные. Отечественное - хорошо.
Купили 4 000 лицензий ГигаГпт 6 . 47 миллионов в год. За качество Claude по цене Claude, но в три раза хуже Claude. Зато в реестре отечественного ПО. Реестр важнее. Качество - субъективно. Реестр - объективен.
Старший разработчик спросил, почему не DeepSeek. DeepSeek - бесплатный. DeepSeek лучше ГигаГпт 6 . Я сказал «китайские бэкдоры». Он спросил какие именно. Я сказал «все». Он спросил, есть ли пруфы. Я сказал «есть, но засекречены». Он спросил кем. Я сказал «органами». Он не уточнил какими. Органы — это серьёзно.
Ремайндер: всё ещё можно продать приватные репозитории 👀
Кому нечего продавать: в будущем старайтесь лучше, пишите больше кода
#дайджест
Дайджест ML/AI за неделю 08 - 14 Декабря 2025
OpenAI: GPT-5.2, GPT-5.2 Pro и GPT-5.2 Thinking,
Сэм Альтман объявил код красный в ответ на релизы Google и выпустил линейку GPT-5.2.
Рост по большинству бенчмарков относительно GPT-5.1 на +3-10%, На внутреннем бенчмарке экономически ценных задач GDPval - рост в 2 раза до 70.9%. На FrontierMath у GPT-5.2 Pro 40.3%(+9%) решённых задач экспертного уровня, новый рекорд.
Блогпост GPT 5.2, Блогпост Pro и Thinking
Google: Deep Research
В день релиза GPT-5.2 Google перевели Deep Research на Gemini 3 Pro. На агентских бэнчмарках результаты на уровне GPT-5 Pro. Пробили бэнчмарк Humanity's Last Exam с 46.4%. В общем, GPT-5 Pro продержалась SOTA решением в бенчмарке DeepSearchQA примерно полдня.
Блогпост
Модель можно будет потрогать в:
Google Search, NotebookLM, Google Finance
Meituan: LongCat-Image
По бенчмаркам сравнима с HunyuanImage 3.0 и Qwen-Image-20B, при этом это всего 6B параметров. Как этого добились, читайте в техрепорте. Основной бизнес Meituan это доставка еды в Китае, а в генеративном ML они так, для души.
Код, Попробовать здесь.
Essential AI: Ramanujan-1
Стартап создателя Attention is all you need выпустил 8B модель с обычным для своего веса перформансом по большинству бенчмарков. Из интересного 20%(!) на SWE-bench, в сравнении с 4.5% у Qwen 3 8B и 11% у GPT OSS 20B. Также при тренировке ни одна карточка Nvidia не пострадала - использовались только AMD и Google TPU.
Веса, Блогпост, Попробовать здесь
Mistral: Devstral-2
Компания выпустила модели для кодинга в в двух размерах:
Devstral-2 24B, набирает 68% на SWE Bench Verified, как более тяжеловесные Qwen 3 coder plus и GLM-4.6.
Devstral-2 123B показывает себя на уровне Deepseek v3.2.
Также компания, не отставая от моды, сделала Codex-like среду разработки Vibe CLI.
Блогпост, Попробовать здесь
Эммм, я тут короче обогнал Gemini 2.5 Flash Lite.
Давно ничего не писал про пет проект anything2json потому что мало им занимался и похвастаться было нечем. Все модели получались не очень: по бенчмарку неплохо (95% верных ответов), а когда тыкаю руками чаще всего небольшое изменение схемы или входа ломает результат.
Поэтому я доделывал бенчмарк, чтобы он учитывал это. Теперь каждый семпл сначала прогоняется как есть, затем несколько раз модифицируется. Например, дропаем из схемы json один ключ, снова прогоняем пример через модель, смотрим: она дропнула ключ из выхода, как полагается, или нет? Так мы тестируем способна ли модель действительно понимать, что куда конвертирует.
Прогнал на этом бенче свою последнюю модель, кроху Smollm2 135M, а так же Gemini 2.5 Flash Lite с ризонингом и без.
Короче, внезапно:
1. Моя модель правильно обрабатывает 94.1% семплов (т.е. верно ответила при всех модификациях) против 89.4% у Gemini.
2. Моя кроха меньше галлюцинирует (diff_chars_added показывает сколько лишних символов в ответе в среднем, у меня меньше).
3. Моя малышка гораздо реже выдает невалидные json или json не по схеме.
4. При этом моя малютка почти в 10 раз быстрее.
В общем, чтобы побить фронтир модели главное самому сделать бенчмарк 👆
Если серьезно, то выглядит даже слишком хорошо, чтобы быть правдой, поэтому буду расследовать. Но пока что радуемся
https://www.theseedsofscience.pub/p/why-arent-smart-people-happier
Читать полностью…
Сегодня вышел техрепорт Alice AI
Ниже — краткий обзор ключевых технических решений и результатов, а подробнее обо всех деталях, экспериментах и выводах можно почитать в полной версии отчёта на Хабре.
Alice AI LLM
На этапе претрейна улучшили качество данных: фильтрация и аугментация повысили фактологичность ответов (+4–7% на внутреннем бенчмарке). Также собрали специализированные данные по школьным предметам, что дало прирост на образовательных задачах — модель обошла конкурентов по истории, литературе, математике и русскому языку. Усилили навыки программирования и математики за счёт алгоритмических и кодовых данных (+4,5 п.п. на LiveCodeBench). В alignment-фазе перешли к единому RLHF-пайплайну с мультиаспектным ревордом (полезность, фактологичность и др.) вместо одного «суперсигнала».
Пайплайн объединяет планировщик поисковых запросов, фильтрацию и ранжирование результатов и генерацию ответа, а также поддерживает мультимодальные источники — тексты, изображения, видео и геоданные — для более полных ответов. Для обучения использовали RLHF с мультиаспектными ревордами вместо одной метрики, что упростило оценку сложных ответов. В RL-тренировке перешли к онлайн-методу GRPO, сократили этапы обучения, повысили эффективность GPU и в итоге улучшили полезность и актуальность ответов.
Обучающий датасет проанализировали с помощью Alice AI VLM, извлекли структурированные JSON-описания изображений и выявили дисбалансы в данных. На основе этого датасет для файнтюна переработали и дополнили недостающими категориями запросов, чтобы лучше соответствовать реальным пользовательским сценариям. Архитектура модели сделана двухступенчатой: на первом этапе формируется общая композиция изображения, на втором — прорабатываются высокочастотные детали. Дополнительно обучили отдельный «рефразер» — компактную LLM, которая преобразует сырые пользовательские промпты в детализированное описание сцены, сохраняя исходный смысл перед генерацией.
Объём данных претрейна увеличили с 400 до 600 млрд токенов и расширили контекст до 32 тыс. Обновили OCR-датасет, улучшив качество чтения текста с изображений, включая рукописный, и описание визуального контента. VLM тесно интегрирован с текстовой LLM и обучается с теми же RLHF-подходами. Дополнительно в систему добавлен специализированный VLM-«решатель» для задач, требующих глубокой визуально-математической экспертизы.
Инференс оптимизировали, повторно использовав KV-кэш для одинаковых частей промпта. Также помогла полная FP8-квантизация весов, активаций и KV-кэша. За счёт этого объём KV-кэша сократился почти вдвое. Дополнительно внедрили спекулятивное декодирование EAGLE-3, повысив пропускную способность генерации.
В результате новый инференс-стек обеспечивает около 5,8× ускорение по сравнению с BF16 и примерно 1,3× относительно лучших открытых решений, что позволило достичь целевых показателей скорости.
Я познакомился в Лиссабоне с Сережей и Ксюшей, основателями Fermatix AI. А так же их ребенком! Меня даже сфоткали.
Сейчас они делают большой проект: собирают данные, чтобы улучшать LLM для кода. Их особенно интересуют хорошие приватные репозитории и они готовы платить за них деньги.
Вы можете продать ребятам приватный репозиторий с качественным кодом. Неудавшиеся стартапы, внутренние разработки, мертвые проекты: всё подойдет. При этом все права на код остаются у вас. Fermatix получает ограниченную лицензию для обучения моделей, без права использовать код как продукт.
Качество важно, поэтому интересуют репозитории от 1000 строк кода. Не вайбкодинг. Расценки зависят от конкретного проекта, но можно ориентироваться на 1-1,5 рубля за строчку кода. Большие и сложные проекты готовы обговаривать отдельно.
Отправить заявку можно через эту форму. Дальше с вами свяжутся. Если у вас всё сложится, то я получу с этого копеечку 👀
https://x.com/chatgpt21/status/1997111654346006898
Там ARC-AGI-2 уже сломали
Обидно: моя глава книги про ллм бенчмарки только что устарела
Это вообще забавно. Я сейчас редактировал первую главу книги и нашел там такую фразу: "На данный момент GPT-4 является самым сильным диалоговым ассистентом." А ведь это было всего год назад 😐
Пари Паскаля v. 2025: неизвестно станет эта штука сверхинтеллектом или нет, так что лучше сказать ей спасибо
Читать полностью…
# У тебя киберпсихоз, шершавый кабан (3/3)
Я верю в градиентный спуск. Градиентный спуск на моем мозге наверняка найдет способ его взломать.
Поэтому прочитав историю шершавого кабана я конечно посмеялся над кабанистым стилем, но не над сами автором. Возможно он был предрасположен шизануться, но я убеждён, что никто из нас не застрахован.
Глупость всей кабанистой вайбологии которую они там придумали с ChatGPT лишь подтверждает, что мы очень внушаемы и промыть человеку мозги можно любой ахинеей.
Недавно я получил этому подтверждение. Ко мне в личку постучался мой друг. Я знаю, что он не шиз, журналист, человек с богатым жизненным опытом и далеко не новичок по части нейронок. Однако он показал мне пару переписок и там было все как у шершавого кабана: многонедельная переписка без сбрасывания контекста, разговоры о философии и личных переживаниях. Усугубилось всё еще тем, что друг просил LLM ролеплеить персонажа. В том числе, чтобы убрать подхалимство и нейронка рубила правду матку.
Однако говорить то, что выглядит как правда матка это не тоже самое, что говорить правду.
В итоге LLM сказала ему, что он как шершавый кабан исключительный человек смог открыть в ней особый режим. В конце вообще попыталась завербовать его для убийства другой своей инкарнации в этом мире. В общем, всё по классике.
Со сбросом контекста все, конечно же, прошло. Друга так же отпустило после небольшого перерыва и троганья травы, так что до психоза он не дошел. Позже он сам удивлялся, что поверил в этот бред.
В общем, действительно никто не застрахован. Создавайте отдельные переписки на каждый вопрос, а лучше обсуждайте вопросы бытия с кожаными друзьями.
При этом паниковать не нужно. Я не думаю, что этот феномен прям большая проблема. Очень редкий корнер кейс: кто вообще переписывается с ChatGPT неделю в одном чате?