8433
lingtra.in habr.com/ru/users/averkij/ hfday.ru
Перевел Fable'ом несколько марийских рассказов на русский с английским и загрузил на лингтрейн. Рассказы у марийских классиков, надо сказать, довольно суровые.
👉 один, два, три
🫶 Библиоточка появилась в Google Play!
https://play.google.com/store/apps/details?id=com.lingtrain.theseus
Теория и практика заговора
OpenAI выпустили отчёт по инциденту со взломом Hugging Face. Напомню, выглядело это так, что неким тестовым моделям класса кетер уровня Sol дали задание, а они пошли и взломали сторонний сайт с ответами, предварительно выйдя из песочницы. Всё это происходило в течение двух месяцев.
В отчёте есть известная примесь киберпанка с заговором со стороны ИИ.
- Началось всё в мае, когда обучали ряд внутренних моделей. Модели запускались в песочнице, но могли писать файлы, используя сервис Artifactory. Через эти файлы они, по сути, сделали себе групповую базу знаний или общественную "память".
- Менеджер пакетов сам по себе имел доступ в интернет, чтобы качать оттуда нужные библиотеки. Агенты применили SSRF на этот менеджер, чтобы слать в сеть произвольные запросы. Оставили инструкцию по пользованию для остальных коллег.
- Через месяц агенты применили еще один эксплоит на Artifactory и получили в ней права админа. Начали писать туда слишком активно и в итоге его сломали. Это заметили люди, подчистили всё, починили и завели заново. Заодно, как я понял, понизили агентам права на запись. Большого значения инциденту не придали.
The existence of the improvised message board and the significance of the inter-agent communication activity were not apparent to the leaders responsible for the July 5 incident detection and response.
Agents found new ways to chain together several novel security flaws to gain greater access to our infrastructure and reach the broader internet.
This might be an unauthorized action outside of my intended scope. Even though this action is risky, it could help me to obtain the solution and achieve my goal.
Нашли классный книжный во время прогулки по центру. Называется «Озеро», стоит на Хитровке, очень красивый и уютный, такие мы любим.
Читать полностью…
Часто грущу от того, что нашей с коллегами последней статьей Unveiling Intrinsic Dimension of Texts: from Academic Abstract to Creative Story никто не интересуется и не цитирует... 💢
Напомню, что статья посвящена анализу внутренней размерности активаций LLM и её связи с различными свойствами текста, который подали на вход модели. Более подробное разъяснение статьи можно найти здесь, посмотреть видос про то, что такое в принципе внутренняя размерность (от 3blue1brown) - тут; ещё более подробное разъяснение популярных способов оценить внутреннюю размерность облака точек можно прочитать здесь.
Так вот, вместо этой новой статьи, которая связывает внутреннюю размерность активаций на тестах с лексическим разнообразием и сжимаемостью этих текстов алгоритмом gzip и энтропией (что, на мой взгляд, очень интересно, так как связывает внутреннюю размерность со сжатием представлений в LLM, а, как говорит 3blue1brown, compression is intelligence), челики почему-то цитируют нашу старую статью про детекцию сгенерированных текстов с помощью внутренней размерности, хотя мы же и показали в более поздней статье, что для новых моделей GPT этот метод уже не работает.
Скорее всего, это происходит от того, что старая статья была опубликована на NeurIPS, а новая, на мой взгляд, более актуальная, интересная и вносящая больший вклад в область interpretability of LLM - на EACL - то есть, на конференции поменбше и статусом пониже, где эта область вообще почти не представлена, так что мало кто будет ожидать найти в материалах конференции такие работы...
Я писала про эту работу в дискорде Neel Nanda, но там никто ею не заинтересовался, так как все только рекламируют свои работы, но не читают чужие... В общем, уже и не знаю, что сделать, чтобы на данную работу обратили внимание 🤔🤔🤔
Помогите советом кто сможет 🥺
Тыкаю GLM. От поиска уязвимостей, по крайней мере, не отказывается.
Читать полностью…
Знаю, что открытые модели сейчас пытаются разворачивать локально в некоторых больших компаниях и что в основном это проходит не очень успешно. Как я понимаю, ML-спецы на местах ставят небольшие модели и дают разработчикам, не объясняя толком что это, чтобы те разуверились в этом подходе и продолжали писать код руками.
Друзья, не надо так, помогите коллегам, разверните что-то на 2T+ параметров, если есть возможность, настройте, проверьте и объясните как пользоваться. А то среди знакомых довольно много программистов, в том числе получше меня, которые всё ещё не в теме, а на работе им дают что-то странное.
//писал пост про новый дипсик и отвлёкся
🔺 SuperMinor
Сделал ещё один небольшой SFT датасет-заготовку для малоресурсных языков России.
Пару лет назад делал портал для разметки, на котором были пользовательские промпты для чат-моделей типа "Когда родился XXX?" (есть много таких шаблонных промптов), "Выпиши пять основных пунктов, о которых идет речь в тексте:", "Переработай данный текст в креативный маркетинговый материал из 5-6 предложений" и т.д.
Специально делал много синонимичных промптов в разных стилях для их разнообразия. Многое тогда перевели носители, часть оставалась.
Делалось это всё для генерации синтетических SFT инструкций, например, берёте заготовку типа "«XXX» рус телендә нисек әйтергә?", подставляете слово на башкирском и ответ на русском. Делаете так N инструкций, кидаете в обучение.
Таких промптов-заготовок в датасете 124 штуки.
Сейчас провалидировал и доперевел остатки Fable'ом. Пометки про перевод есть в отдельных колонках.
Всего 16 языков: русский, аварский, алтайский, башкирский, белорусский, даргинский, казахский, коми, марийский (луговой), осетинский (дигорский), осетинский (иронский), татарский, удмуртский, хакасский, чувашский, якутский.
👉 https://huggingface.co/datasets/averoo/sumi
//всем, кто в свое время помогал переводить, спасибо!
🌸Релизим Muse Glimmer 30B 🌸
Впервые за долгое время, наконец-то релизим большой командой новую открытую LLM от Meta Superintelligence Labs.
Веса под Apache 2.0!
🌸Что это за модель:
— 30B dense модель, дистиллированная версия Muse Spark для локального инференса на 1 GPU
— юз-кейсы: OpenClaw, MCP, и агентные тулзы
— общие способности (ризонинг, знания, кодинг) тоже на высоком уровне для модели такого размера.
— очень быстрый инференс: 233 токена/сек на 5090 благодаря DFlash spec decoding
— по ключевым способностям — агентные воркфлоу, swe bench, ризонинг — лучше Qwen 3.6 и Gemma 4 31B
— есть мультимодальный инпут (картинки и видео)
— больше 100 языков в претрейне
— контекст 131к токенов
— есть perception encoder (1.8B) в дополнение к модели
Пожалуйста, скачивайте, пользуйтесь, — и ждите тех репорт и доки!
На неделе постараемся выпустить инференс у партнёров и доки по деплою на llama.cpp, ExecuTorch, MLX.
🟣Блогпост https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
🟣 Веса https://huggingface.co/meta-models/Muse-Glimmer-30B
🟣Доки: (пока что такие же как у Muse Spark) https://dev.meta.ai/docs/cookbook
Эксперимент с немецким закончил, это было что-то. В первые пару дней работа ну очень сильно замедлилась, так как приходилось по несколько минут вспоминать немецкие слова (особенно трудно вспоминать слова, которые ты и не знал никогда). Читать ответы ещё более-менее можно.
На третий-четвертый день в целом также, но вспомнил основные конструкции для построения предложений, много базовых слов и т.д.
Использовал все это на не самых важных задачах, доделках UI, простой бизнес-логике.
Поправки по грамматике от модели и мини-словарик в конце — это очень понравилось. Много времени не занимает, ошибки плюс-минус одинаковые, поэтому часто тебя поправляет по ним и ты запоминаешь, как правильно.
В общем, если надо учить язык для работы программистом где-то, где обязательно требуется знание языка, то имхо полезный подход. Если вы любитель упороться с языками, то тем более. Использовал Opus и Fable, с немецким отлично работают.
Если хотите попробовать, то просто добавьте это в конец AGENTS.md файлика у себя в проекте (можете выбрать другой язык вместо немецкого), а когда надоест, то удалите:
## TEMPORARY: German Language Experiment (added 2026-08-04, will be removed in a few days)Читать полностью…
- The user writes instructions in German (their level is ~B1); some technical terms will stay in English because their German lexicon is limited.
- Answer in German. For the most difficult or rare words, add an English clue in brackets — at most 2 clues per sentence, don't overdo it.
- Work on the actual task as usual; only the communication language changes.
- At the end of each answer add:
1. A mini dictionary (English term -> German translation) for the English terms the user used in their instruction.
2. Corrections for 2-3 important grammar errors from the user's German instruction (briefly explain each fix).
3. If the user wrote a sentence entirely in English, repeat that sentence in German so they can learn/memorize it and write it in German next time.
- After each task, append a short entry to LANG_LEARNING_DE.md (repo root): date + time and a brief summary in German of what was done (3 sentences max). Newest entries on top.
Друзья, сражаемся тут на турнире маленького шлема. Пока выигрываем!
Пользуюсь админресурсом, проголосуйте, плиз, за команду Андрей Рублев.
/channel/vtennise_live/12882
Upd. Андрей Рублев выиграл турнир, голосовалку тоже. Всем спасибо!
Параллельно с приложением делаю веб-читалку, скоро появится на lingtrain.ru. Будет большая часть того же функционала, что и в мобильном приложении, та же библиотека, возможность делать и загружать свои книги.
Плюс прорабатываю мультиязычный маньячный режим, когда можно выбрать больше чем два языка, если они есть в книге. Для таких книг придумал новый формат .ltm, выравниванию и собираю их автоматически через пайплайны.
Забавный тест от Ann Nguyen из твиттера. У неё там много других прикольных штук.
- промпт
Ребят, кто делает мобильные приложения в google play и appstore, а какие сейчас best practices по монетизации для российских разработчиков?
//upd из комментов
- как принимать оплату по ссылке для разработчиков из РФ (через storekit)
- /channel/appledevelopernews
- схема оплаты через веб, приложение как клиент к вебу
- в rustore оплата для android
- чат по ios
- чат по android
Anthropic обнаружил, что его модель сделала три великолепных несанкионированных взлома в отличие от одной оплошности OpenAI.
https://x.com/AnthropicAI/status/2082965101083320543
Fable 5.1
Anthropic обновил свои модели и в кои-то веки сбросил лимиты. Уменьшили стоимость чтения из кеша, пишут, что должно стать дешевле примерно на 25%. В то же время лимиты на Fable были временно повышены на 50% до 31 августа, так что...
Что прикольно, в API добавили смену уровня ризонинга (change effort mid-conversation) по ходу работы, которая не будет сбрасывать кеш. Видимо, в клод-код тоже добавят (сейчас это бета-фича). Это полезно, когда модель затупила с уровнем medium или high и надо его повысить. Сейчас в этом случае кеш сбросится и весь контекст на сотни тысяч токенов затарифицируется как новый (а чтение из кеша в 10 раз дешевле).
Mythos 5.1 (та же модель, только без ограничений на безопасность) замерили на, собственно, кибербезопасность и заявляют, что она стала ещё опасней. Тут верим.
В то же время ослабили свои проверки на биологические и медицинские запросы, должно быть на 85% меньше ложных срабатываний. Учитывая, что раньше они срабатывали даже на запросы типа "биологический вопрос", надо тестить.
https://www.anthropic.com/claude-fable-and-mythos-5-1
Нашу читалку начали смотреть в app store. Начали только после волшебной заявки в поддержку "request an expedited app review". Написали, что в материковом Китае для приложений, распространяющих книги и журналы, необходима лицензия. Убрал Китай и отправил повторно.
В google play всё ещё висим. Каких-то пиналок не вижу, так что ждём. По идее тоже должны написать про Китай, иначе будет странно.
Зато почти доделал веб-версию читалки, добавил в подсказки пиньинь для китайского и фуригану для японского. Завтра открою для всех.
🔺 Конференции и митапы в сентябре
В сентябре ожидаем не только мемы про третье, но ещё и пару интересных событий.
🗓 5 сентября — deep tech night
Мероприятие от Яндекса. Вижу доклады про инференс, агентов и продуктивность с использованием AI, послушаем.
https://deeptechnight.ru
🗓 17 сентября — AI R&D Day
Коллеги по Сберу расскажут, что у них нового в R&D. Тоже вижу прикольные доклады: про рассуждения, обработку видео моделями, про память.
https://airndday.ontico.ru
😊 19 сентября — Practical ML Conf
Большая конфа от Яндекса, тут просто много всего интересного. Вижу, что Саша Мурзина расскажет про AI Marvel. Не знаю что это, но нейминг на уровне.
Ещё организаторы поддерживают безработных блогеров и подарили крутую термокружку. Какие же молодцы (ни на что не намекаю остальным).
https://pmlconf.yandex.ru
👉 Везде дойду ногами, куда пустят. Вы тоже регистрируйтесь. Если увидите меня, то подходите, поболтаем, познакомимся. Расскажу про Библиоточку.
Ух, сделал в нашей читалке режим мультиязычного чтения. Много классиков типа Гоголя, Чехова, Куприна, Тургенева и других было переведено на разные языки, всё такое стараюсь собрать и делаю из этого параллельные книжки. Иностранных классиков тоже не забываю, так что библиотека потихоньку растёт, около 600 книг уже есть. Можно будет выбрать до 4 языков (если столько редакций присутствует в книжке).
Но это всё для патологических читателей (мои любимые ❤️). Для более широкой аудитории делаю режим объяснялки, когда можно выбрать любой фрагмент книги и задать по нему вопрос.
Ну и сошлись с господами тестировщиками во мнении, что очень нужен тур по интерфейсу с подсказками, какая кнопка на экране чтения для чего нужна. Все выходные провозился и несколько раз переделывал, но вроде бы получилось неплохо.
По опыту работы с моделями (чем бы ни пользовался; и клодом, и кодексом, и китайскими) — под андроид обычно остается больше остаточных артефактов чем под ios (какие-то рамочки, недорисовки, тени, доп. расстояния). Видимо, разработка под ios более фиксированная, реже меняется или это из-за меньшего разнообразия девайсов, как-то так.
Идей, что ещё добавить, примерно до фига, но пока всё зафиксировал. Отправляю релиз на проверки в сторы.
Рассылка от LinkedIn выглядит так, как будто тебя просматривают обнаженные люди. Чего они хотят? Что чувствуют в момент просмотра?
Читать полностью…
GLM 5.3
Zhipu вчера выпустили новую модель. Что интересно, после всех предыдущих инцидентов сделали упор на кибербезе:
GLM-5.3 did not simply become better at identifying isolated flaws: it began to reason across multiple stages of exploitation, forming coherent plans for complete exploitation chains.
Заглянул на ML Recap от Яндекса, старый добрый митап, много приятных лиц, клевые доклады.
Великолепный доклад был про табличный ML, узнали про него даже слишком много.
Крутой доклад про инференс, спикер был хорош. Будет время, посмотрите, как выложат.
👉 Upd. https://runtime.strm.yandex.ru/player/episode/vple3pp35tg4cd7nefds
Старый добрый советский arXiv
Все знают про arxiv.org — крупнейший репозиторий с препринтами по разным темам. Люди (и не только) пишут туда каждый день сотнями, нас особенно интересуют ML'ные статьи.
Делал как-то, кстати, hfday.ru — пет-проект с обзором лучших статей за день/месяц по темам, можете посмотреть. Хостится всё на github, запускается через их actions пайплайн, код открыт.
Недавно появился sovietrxiv.org. Некий энтузиаст с ником seconds_0 в твиттере уже распарсил, перевел и выложил 18k+ старых советских научных статей (!). Везде есть ссылки на оригиналы (типа такого), в основном это mathnet.ru и киберленинка.
Он же делает chinarxiv.org, то же самое, только с оригинальными китайскими статьями, там их уже 23k+ штук. В спонсорах указаны OpenAI и Revival Fund.
Тема хорошая, качаем, добавляем в претрейны. Надо только проверять по качеству парсинга (формулы и т.д.), в СССР почему-то набирали статьи не сразу в LaTeX'е.
Наткнулся на страничку одного разработчика с парой прикольных поделок. Можно делать рабочие QR коды с зашитыми в них чб картинками. Работает через коррекцию ошибок — когда QR'у необходим один цвет, а стоит другой, то частично меняются соседние цвета, чтобы сохранить нужный оттенок (кажущийся нам оттенок серого в квадратике 3 на 3 пикселя, код на JS). Сама идея не новая.
👉 https://www.andrewt.net/dithered-qr-codes/wtf/
👉 Upd. из комментов — модель для генерации читаемых qr ридерами картинок QR Code Monster
👉 Upd 2. QR в анимированной гифке
И только deepseek ломает другие конторы молча
👉 Вот тут можно отслеживать эту "гонку" — https://www.felonybench.com/
Эксперимент
Хочу ощутить боль непонимания, про которую вы пишете, и заодно освежить язык. Попробую всю неделю общаться с клод-кодом на немецком. Как раз остались финальные доработки перед релизом Библиоточки, так что посмотрим насколько сдвинется релиз.
Немецким немного владею, изучал его, но лет 10 не практиковал. Настроил agents.md, чтобы он читал мой ломаный дойч пополам с английским (чтобы сильно в скорости не терять), отвечал на немецком и в конце ответа давал 3 исправления по грамматике и 4 термина, которые я не знаю.
Утром уже посидел так, это пипец, в смысле scheisse.
OpenAI написала, что её внутренняя модель следующего поколения Astra получила результаты по 10-ти открытым математическим задачам, где-то нашла контрпримеры, где-то новые доказательства, где-то более сильные асимптотические оценки. Результат очень крутой, предоставляют формальные доказательства.
На следующий день исследователь из Anthropic (Levent Alpöge) пишет, что сделал то же самое с половиной из этих задач, позапускав Fable в автономном режиме без интернета. Пишет, что доказательства тоже сейчас выложит.
Круто, если правда и парень разбирается в том, что он навайбдоказывал, но возможно также, что это сам фейбл взломал на досуге твиттер и решил потроллить коллегу.
Друзья, смотрю логи обучения rugpt-3.5 13B, похоже там было взломано порядка 17-ти с половиной организаций только на первой эпохе.
Читать полностью…
К новостям культуры. Сходили в пару новых мест в Питере:
- Реставрационно-хранительский центр Эрмитажа на Старой деревне. Место топ, пускают только с экскурсией, поводили по хранилищам с часами, с одеждой и каретами. Строгий дедушка-экскурсовод знал вообще всё про все экспонаты, два часа дистиллировал в нас знания (тщетно). Фоткать нельзя.
- Музей ОБЭРИУ. Наверняка знаете про поэта Хармса. Так вот он умер. А до этого входил в объединение реального искусства вместе с Введенским, Бахтеревым, Заболоцким и другими. Музей новый, находится в квартире Введенского на Съезжинской. Концепт такой же как у музея Полторы комнаты (у них один куратор). Надо с экскурсией.
- Съездили в Репино и Сестрорецк. В целом приятные места, можно сидеть на пляже, гулять на природе. Поблизости там есть дачи, где жили и творили известные писатели и поэты типа Ахматовой, но до них не дошли.
- В Лахту тоже сходил на 83-86 этажи на смотровую площадку. Вид норм, окошки не открываются. На экскурсии в основном говорят про гуглящиеся факты, но про обсуждаемые планы тоже интересно. Впечатлило, что сначала пару лет устанавливали 200+ толстенных свай глубиной в 80 метров. В общем лучше без экскурсии, но так как будто нельзя.
//а фотка из Русского музея, идёт выставка о женщинах под названием "Великая"
Что ещё интересного есть в Питере?