tsingular | Unsorted

Telegram-канал tsingular - Технозаметки Малышева

2604

Новости инноваций из мира искусственного интеллекта. 🤖 Всё об ИИ, ИТ трендах и технологической сингулярности. Бесплатный бот для подписчиков: @ai_gptfreebot автор: @mbmal канал личный. Поддержка: https://pay.cloudtips.ru/p/c8960bbb

Subscribe to a channel

Технозаметки Малышева

Интересные инсайты по skills

Тут недавно на Hacker News появился тред с вопросом "Как вы менеджите ваши skills".

Почитал весь тред и решил выписать интересные на мой взгляд инсайты и добавить немного от себя.

Skill – это кэш рабочего процесса: "как уже делали эту задачу". Должен отвечать на вопрос "как сделать X".

1. Когда skill действительно нужен

- нужно хранить то, чего нет в обучающих данных модели:
- внутренние сервисы;
- нестандартные конфигурации;
- инфраструктуру и связи между репозиториями;
- правила доступа к окружениям.
- принятые в команде гайдлайны
- один и тот же процесс повторяется несколько раз в день или в неделю;
- процесс должен выполняться одним и тем же способом;

например:
- нужно не забывать тесты, документацию, ревью или другие обязательные шаги;
- нужно выполнять compliance-проверку;
- часто требуется один и тот же способ работы с Jira, Git, CI, инфраструктурой или браузером;

При этом, если действие можно выразить обычным кодом, лучше выразить его кодом. Модели оставить принятие решений и задачи, которые трудно формализовать.

2. Как создавать skills

- не начинать с поиска готовых skills.
- сначала попросить агента выполнить задачу.
- попросить агента упаковать процесс выполнения задачи в skill. Тут рекомендую использовать skill-creator от Anthropic – там есть evals для проверки skill.
- попробовать skill в новом чате

3. Улучшение skill

- после каждой сессии со скиллом анализировать, что можно вынести в skill;
- собирать статистику повторяющихся рабочих процессов для создания новых скиллов;
- просить другой frontier-моделью уменьшить и упростить текст skill.
- проводить ежемесячный аудит неиспользуемых skills;

4. Безопасность

- Рассматривать каждый skill как код, которому агент доверяет.
- Проверять происхождение и содержимое.
- Не устанавливать случайные skills из интернета без ревью.

В комментах добавьте ваши инсайты по скиллам! inb4: скиллы не нужны

Лайк, репост,
✔️ Тимур Хахалев про AI Coding, подписывайтесь!

Читать полностью…

Технозаметки Малышева

🧬 Claude обнаружил ранее неописанную ферментную систему с повторами ДНК, напоминающими CRISPR, сообщает Anthropic.

Около 950 агентов работали 21 час и использовали 210 млн токенов. Они исследовали более 200 тысяч обратных транскриптаз - ферментов, копирующих РНК в ДНК, - выделили 3500 потенциальных систем и отобрали 20 наиболее интересных.

Один агент заметил необычные повторяющиеся последовательности рядом с геном фермента.

Находку назвали ART - array-associated reverse transcriptases. Она встречается преимущественно у бактериофагов - вирусов, заражающих бактерии.

Сам фермент был известен ранее. Claude выявил связанные с ним повторы и дополнительный белок, которые вместе образуют отдельную систему. Учёные провели первые лабораторные эксперименты: оказалось, что из массива повторов образуются разные короткие РНК.

Функция ART пока неизвестна, а возможность использовать её для редактирования генома ещё предстоит исследовать.

Поиск и анализ выполняли агенты, лабораторную работу - люди. Результаты опубликованы в препринте.

https://www.anthropic.com/news/claude-discovers-novel-enzyme-system

@ai_machinelearning_big_data

#claude #anthropic

Читать полностью…

Технозаметки Малышева

💀 ☠️ 💀
Отсюда

#юмор
------
@tsingular

Читать полностью…

Технозаметки Малышева

И ещё один пример.

код исходника в комментарии

#нейрорендер #Opus
———
@tsingular

Читать полностью…

Технозаметки Малышева

Создатель oMLX перешёл работать в Hugging Face, проект остался открытым

Hugging Face объявила о найме Jun Kim (jundot), автора и ведущего разработчика oMLX.
Лицензия Apache 2.0 сохраняется: Kim продолжает руководить проектом. Из хобби проект переходит в полностью финансируемую разработку. (под крышей NVidia :) )

⚙️ oMLX это сервер локального запуска моделей на Apple Silicon поверх фреймворка MLX. Главное решение: постраничный кеш KV-блоков на SSD. Агентские сессии постоянно сдвигают контекст и обнуляют кеш, поэтому на длинных промптах первый токен приезжал через 30-90 секунд. oMLX кладёт блоки кеша на диск в формате safetensors и восстанавливает совпавший префикс за миллисекунды, в том числе после перезапуска сервера.
Дальше по списку: непрерывная пакетная обработка запросов с ускорением до 4,14 раза на восьми параллельных, одновременная работа языковой, зрительной, эмбеддинговой модели и реранкера, совместимость с API OpenAI и Anthropic, вызов инструментов и MCP, приложение в строке меню macOS. С февраля проект собрал 22 тысячи звёзд и 125 релизов.

🎯 Для MLX Hugging Face отводит oMLX роль испытательного полигона, а удачные решения поднимает в mlx-lm и mlx-vlm. Отдельный фокус: быстрый перенос описания модели из transformers в эталонную реализацию на MLX, чтобы новые модели заводились во всех движках сразу.

💼 Вывод хотите устроиться в ИИ гиганта, - сделайте стартап, который бы они купили вместе с вами :)
Openclaw вот в начале года, теперь oMLX.

#oMLX #MLX #HuggingFace
———
@tsingular

Читать полностью…

Технозаметки Малышева

Эдди Османи, известный ИИ инженер, недавно присоединившийся к Антропику, поделился инструкцией к новому Опусу 5.5

Кратко:
📌 Как теперь надо

- Давать задачу целиком одним сообщением + назвать «финишную черту» (что значит «готово») и когда остановиться. Дальше — не мешать.
- Давать ей самой работать на длинных многошаговых задачах — Opus 5.5 тянет часы почти без присмотра.
- Дополнять запущенную задачу по ходу (дописать follow-up), а не перезапускать.
- Для дизайна — перечислять конкретные нежелательные стили, а не «избегай безликого вида».
- Прописать в CLAUDE.md: когда продолжать, когда останавливаться и спрашивать; перед разрушительным — стоп.
- Разбивать большие аудиты/миграции по субагентам и проверять доказательства каждого.
- Держать список задач в файле (TASKS.md) и читать файл, а не скроллбэк.
- При завершении — сначала читать «что нужно от меня», потом остальное саммари.
- Просить ревью кода до человека; просить помечать неподтверждённое.
- Прикреплять график/скриншот, а не перепечатывать цифры; просить сразу готовый файл, а не план.
- В проекте фиксировать: ранние ответы уже решены (ускоряет уточнения).
- /fast — для быстрого back-and-forth.

❌ Как теперь не надо

- Не писать «подумай внимательно / думай пошагово» — модель и так думает перед каждым ответом, это только замедляет.
- Не перезапускать долгую задачу из-за мелочи.
- Не давать общих дизайн-указаний — только конкретные паттерны.
- Не просить показывать внутренние рассуждения в ответе — это отклоняется.
- Не выключать запросы разрешения на разрушительные команды.
- Не перепечатывать цифры вместо прикрепления графика.
- Не читать всё саммари подряд — сначала блок «что нужно от меня».

Полная версия тут

#Osmani #Opus #промпты
------
@tsungular

Читать полностью…

Технозаметки Малышева

Claude Opus 5.5 оказался чертовски хорош в создании игр — первые демки выглядят потрясающе 🤩

Так, юзеры уже навайбкодили Dark Souls, Flight Simulator и Mario Kart. Причём последнюю, по словам автора, Claude ваншотнул.

Системный промпт модели, кстати, уже вытащили и слили в сеть. Можете поизучать ☕️

Читать полностью…

Технозаметки Малышева

А вот и OpenAI: встречайте GPT-6 Sol и Luna.

— обе модели ровно в 2 раза дешевле, чем их 5.6-версии.
— общаться должны так же понятно и без жаргона, как Astra
— и... всё. Sol не лучше Astra (а во многом и хуже, в отличии от пары Fable <-> Opus), но сильно дешевле, и всё ещё лучше Sol 5.6. Поэтому модель может стать основной рабочей лошадкой, сохраняя ваши лимиты.

Читать полностью…

Технозаметки Малышева

Традиционно, - проверяем новейшую модель через написание венка сонетов.

Напиши венок сонетов о том как тихоходка наблюдает волны технологических сингулярностей сквозь эпохи


Погнали

#венок
———
@tsingular

Читать полностью…

Технозаметки Малышева

Последние 3 дня я прям сильно закопал агентов в тему с Recursive Self Improvement.

Собственно это агентский цикл самоулучшения.
В основном агенты занимались разработкой сверхмалой модели по типу Jev которая смогла бы одновременно (это как раз сложно) играть в тетрис, змейку, уметь классифицировать логи и сортировать картинки.
такой сверх-быстрый комбайн.

определённый прогресс есть, все узкоспециализированные задачи модель размером в 1.8 млн параметров (7 мегабайт всего) выполняет. причём в тетрис играет лучше всего, в змейку - идеально но линейно, с остальным пока учится разбираться, но самое интересное что в ходе этой работы сам цикл самоулучшения постоянно дорабатывается.
Вот тут версия на Питоне, сейчас переписывется на Rust

и вот, сначала Гермес, потом Астра и затем Fable 5.1 собрали Универсальный RSI навык.
он гигантский.
Это не просто промпт, - это прям шаблоны инструкций для Мета RSI с примерами инструментов и процессов.

навык, как обычно, в ИИзбранном
ибо сложно и дорого.
На всю историю уже около 1млрд токенов сожглось. (хочу безлимит)

А тут в комментариях, - примеры результатов обучения модели.
особенно радует скорость отклика в диапазоне 4-40мс

#RSI #навыки
———
@tsingular

Читать полностью…

Технозаметки Малышева

Qwen4 уже скоро.

на конфе Apsara анонсировали новые модели и сообщили, что qwen 4.5 и 5 версии вырастут до 5-10Т параметров

#Qwen
———
@tsingular

Читать полностью…

Технозаметки Малышева

Unitree представили новые руки для роботов.

ловкая кисть Unitree Dex5-S с 22 степени свободы

Размер 1:1 с человеческой рукой

Прецизионная биомиметическая ловкая кисть, цена от $6 500 (без учёта налогов и доставки).

Все 22 сустава — с плавными тактильными приводами, каждый оснащён защитой от предельного ударного момента.

Как раз в продолжение сегодняшнего обсуждения о недостающем 1% для плетения лаптей 😀

#Unitree #роботы #руки
------
@tsingular

Читать полностью…

Технозаметки Малышева

Qoder раздаёт бесплатный доступ к Qwen3.8-Flash до 30 сентября

https://docs.qoder.com/events/flashoffer

Период проведения акции : с 18 сентября 2026 г., 10:00, по 30 сентября 2026 г., 23:59:59.

Условия участия : Все новые и существующие индивидуальные пользователи Qoder International, включая пользователей тарифных планов Free, Pro Trial, Pro, Pro+ и Ultra. Подписчики Teams и Enterprise не имеют права участвовать.

Модель : Qwen3.8-Flash.

Предложение : Стоимость этой модели снижена с 0,1× до 0,0×. Работа с этой моделью не расходует кредиты.

Активация : Предложение применяется автоматически, активация не требуется.

Вы можете использовать эту модель даже при нулевом балансе кредитов.

В период проведения акции Qwen3.8-Flash испытывает высокий спрос, поэтому в часы пик скорость ответа может быть ниже.

#Qoder #free #Qwen
———
@tsingular

Читать полностью…

Технозаметки Малышева

Счётчик AGI сдвинулся на 99%: гуманоид Figure впервые поработал в 30 незнакомых квартирах без единой минуты обучения там

Компания Figure выкатила Helix 2.5, - самую продвинутую свою нейросеть.
Управляемый ею робот зашёл в 30 незнакомых домов Калифорнии и сразу приступил к работе: ни минуты сбора данных, ни файнтюнинга в этих квартирах.
Счётчик AGI Алана Томпсона, всё лето стоявший на 98%, сдвинулся на 99%: Helix 2.5 закрыл Woz-тест в масштабе.

⚛️ За счёт чего получилось:
Helix 2.5 претренировали на Index, - датасете человеческого поведения, прирастающем на ~35 минут новых данных каждую секунду.
Из одной базовой модели сделали три поведения: уборка гостиной, складывание полотенец, заправка кровати.
Претрейн на Index сам по себе поднял zero-shot успех с 9% до 56% (строгая оценка: всё или ничего, зачёт только за полностью выполненную задачу).
Если сравнивать с Helix 02, то получается вдвое меньше данных, специфичных для конкретной задаче при генерализации, охватывающий в 30 раз более широкий диапазон.

🧠 Впервые измерен scaling law переноса человек-робот:
Каждое удвоение данных Index закономерно улучшало предсказание действий робота, - как в языковых моделях.
Точность такая, что лосс крупнейшего прогона предсказали до старта обучения: ошибка 0.54% на диапазоне 8x.
Figure: рецепт уже знаком по другим областям ИИ: широко учись на претрейне, задай поведение один раз, генерализуй на развёртывании.

На тренировку Helix влили $3.5 млрд вычислений.

💼 Зачем бизнесу:
Zero-shot успех в незнакомой обстановке закрывает парадигму «учим робота под каждое место отдельно» и позволяет быстро масштабироваться.
Самокоррекция всего тела по классам действий, - "отойти, сменить стойку, обойти препятствие", позволяет доводить длинные задачи до конца без человека.

Оставшийся 1% в AGI счётчике Алана, - тонкая моторика многошаговой сборки на уровне среднего человека.
Чуть чуть осталось. Может до Нового Года как раз.

#Helix #Figure #робототехника #AGI #ИИ
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

Забавный тренд.

Кидаете в GPT пустую коробочку с промптом, получаете разбор:

На основе всего, что ты обо мне знаешь, заполни обе стороны этого контейнера.
Сверху какой я для мира, снизу,- какой я внутри


Делитесь, что получилось :)

#промпты
------
@tsingular

Читать полностью…

Технозаметки Малышева

⚡️ Claude помог ускорить собственный интерфейс втрое за две недели

Anthropic рассказала, как команда вместе с Claude внесла более 3000 изменений в claude.ai и десктопное приложение. По данным компании - без пользовательских инцидентов и откатов.

Результаты по 75-му перцентилю:
— Готовность сайта к вводу: 3,1 → 0,55 секунды.
— Загрузка облачной сессии Cowork: 2,6 → 0,73 секунды.
— Запуск десктопного приложения: 6,3 → 3,3 секунды.

Всё координировали в Slack: одновременно шло более 150 тредов. Claude находил узкие места, создавал бенчмарки, готовил исправления и проверял метрики после выпуска. Каждое изменение одобрял человек.

Среди находок — 6900 React-хуков и 900 подписок, участвовавших в обработке каждого нажатия клавиши, и лишний вызов location.reload(), вызывавший полмиллиона скрытых перезагрузок в день.

Чтобы ускорения сохранялись, в CI добавили проверки: изменение, увеличивающее число инструкций на контролируемом участке, не проходит.

Ускорили загрузку, навигацию и отрисовку интерфейса. Заявленные «3×» относятся именно к этим сценариям.

https://claude.dev/blog/how-we-made-claude-ai-faster/

Читать полностью…

Технозаметки Малышева

JetBrains Air: 26 лет разработки IDE получают глоток свежего воздуха

📋 JetBrains Air,- зонтичная система агентной разработки, запущенная 22 сентября.
Внутри: Air в самих IDE, Air Teams для координации команд и Air Governance (бывший JetBrains Central) для управления расходами и политиками, плюс свой агент Junie.

26 лет JetBrains делала рабочее место для команд разработчиков, а теперь строит систему для команд ИИ агентов.

🔧 Открытость в основе.
Агенты подключаются через ACP, общий протокол JetBrains и Zed, в реестре уже Claude Agent, Codex, Gemini CLI, Copilot и OpenCode.
Мультивендорная поддержка обеспечивается и на уровне моделей и на уровне харнесса.

Air сам по себе бесплатен, модели идут через подписку AI Pro за 10 долларов в месяц или AI Ultimate за 30 либо через свои ключи от Anthropic, OpenAI и Google.

💼 Выводы для бизнеса:
JetBrains предоставляет единый слой контроля над агентами вендоров.
Ставка тут на то, что рынок моделей и агентов растет по экспоненте и нужны инструменты и среды, которые консолидируют не только разработку, но и упростят управление процессами, политиками и затратами для любых поставщиков ИИ в компании.

📎 Ссылки:
• JetBrains Air
• ACP
• Air Governance

Диспетчерская для агентов разработчиков.

#JetBrains #агенты #разработка #IDE
------
@tsingular

Читать полностью…

Технозаметки Малышева

История топовых AI-компаний в одном ролике

А ведь еще недавно, мысль, что нейронки будут выдавать качественную кинематографичную картинку у большинства скептиков вызывала смех

Читать полностью…

Технозаметки Малышева

Клод умеет писать картины кодом.

просто просишь его повторить стиль автора и написать себе библиотеки, если нужно.

код в комментарии
(читать его отдельное удовольствие, - рекомендую, даже если вы не программист)

Прикольно, но мы сделаем ещё 1 шаг, - закинем картинку от Опуса в GPT - и вуаля, - у нас шедевр!

А дальше идём в Grok Imagine и у нас видео :)

what a time to be alive!

#нейрорендер #Claude #Opus #Айвазовский #dev
———
@tsingular

Читать полностью…

Технозаметки Малышева

Google Cloud AI Research выкатила RRSI, это как RSI только еще и Regularized

Самоулучшение агентов становится нормой, но упирается в те же проблемы, которые были на этапах обучения моделей. - на тренировочном бенчмарке метрики растут, но если дать агенту незнакомые задачи, и эффект от обучения исчезает.

🔧 Знакомая болезнь, - переобучение:
Нейросети прошли через то же, пока регуляризация не научила их обобщать.
В Google Cloud AI Research применили этот же подход к самоулучшению агентов.
Харнесс остаётся полностью редактируемым, а регуляризуют сам поиск.

Предложения:
затухающий бюджет правок: к финальным раундам остаётся одна
история правок с гипотезами: опровергнутое не тестируется заново
при стагнации бюджет уходит на нетронутые компоненты

Отбор:
критик до оценки отвергает подгонку с ответами и именами задач
шумовой пол: прирост обязан перекрыть разброс на неизменном харнессе
правило оплаты: лишние токены должны быть оплачены измеримым приростом
прореживание: компонент без пользы помечают на удаление

📊 Цифры:
Эволюция шла на одном бенчмарке, затем готовый харнесс запускали на остальных.
Кодинг: Terminal-Bench 74.2 → 80.2, SWE-bench Verified 82.0 → 83.8, хотя тот не участвовал в отборе.
Агентские задачи: JobBench +4.7, GDPval +3.5, APEX-Agents +3.7.
Инженерия: Frontier-Eng 17.7 → 22.0, плюс 24.3%.
Все шесть отложенных выросли; предшественники теряли прирост вне своих бенчмарков.
Бонус: харнесс тратит на ~30% меньше токенов, чем эволюция без регуляризации.

Не успели мы в 2026м привыкнуть к лавине агентских кодовых фреймворков, теперь это.
Походу мы уверенно врываемся в эпоху самоулучшающихся агентов. Таких механик будет всё больше и больше и каждая будет тянуть на свою поляну.
Важно не только успевать их пробовать, но и уметь оценивать эффект, - действительно ли они стали лучше и в чём именно.
Нужен полигон для RSI систем, причём в каждой компании свой, - в закрытом контуре, чтобы не сбежали не дай бог :)

📎 Код
Сайт проекта

#RRSI #RSI #агенты #Google
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

Грок? Какой такой Грок?

@cgevent

Читать полностью…

Технозаметки Малышева

Ааа!! ИМБА!! я сдвинул её с рельс!!

It's alive, ALIVE!

Змейка ищет кратчайший путь и старается выживать!

Это вам не муха! тут всего 6 мегабайт!

#змейка
———
@tsingular

Читать полностью…

Технозаметки Малышева

читаем полную версию венка сонетов в комментарии.

ваши мысли?

отдельные моменты прям шикарны:

И в линзу смотрит пастор, мхов любитель,
И «маленьким медведем» наречёт.
Другой — в Италии — глядит подолгу,
Зовёт меня за поступь — «тихоход».
Я не в обиде: мне спешить без толку,
А людям — да. Их время — скороход.


Вот это прям огонь:
И атом — ярый свет, слепой губитель.
Грибы встают в пустынях и морях,
И страх — отныне мира охранитель,
И пепел оседает на камнях.
Лучи пронзают всё — металл и кожу.
А мне — пустяк. Я больше их стерплю.
Я никого из вас не потревожу:
Я просто жду. Я слушаю. Я сплю.


VIII - красиво по смыслу но рассыпался по рифме
XIV - я бы заменил:
Сгорят в своём сиянии, как две свечи,

в остальном просто прекрасно:
Я не пророк, не бог и не мессия,
Я — пауза меж волн, их тихий фон,
Я — то, что остаётся от стихии,
Когда волна откатится, как сон.
Я — маленький упрямый долгожитель.
Я — тихоходка. Мох — моя обитель.


В общем, утверждение, что мы на 99% достигли AGI считаю оправданно и подтверждено Opus 5.5

#венок #соннет #Opus
———
@tsingular

Читать полностью…

Технозаметки Малышева

🚀 Anthropic представила Claude Opus 5.5

Новая флагманская модель стала сильнее Opus 5, при этом работает быстрее и дешевле.

Что изменилось:

- сильнее в агентном программировании, computer use и knowledge work
- лучше справляется с длинными задачами и большими кодовыми базами
- ответы стали короче и естественнее
- улучшена устойчивость к prompt injection
- Anthropic заявляет примерно на 40% более низкую стоимость на типичных задачах и более чем на 30% более быструю генерацию

Из примеров:
- один из ранних тестеров провёл миграцию 680 000 строк кода менее чем за день
- в тесте Anthropic модель переписала HAProxy с C на Rust за 9,5 часа

Цена API:
- $4 / 1M входных токенов
- $20 / 1M выходных токенов
- $0,20 / 1M токенов при чтении кеша

Бенчмарки:
- Terminal-Bench 4.0 — 66,4%
- FrontierCode v1.1 — 54,4%
- Humanity’s Last Exam — 67,7% с инструментами

Также Anthropic подтвердила, что Claude Sonnet 5.5 и Haiku 5.5 выйдут в ближайшие недели.

https://www.anthropic.com/claude-opus-5-5

Читать полностью…

Технозаметки Малышева

🌟 Xiaomi выпустила MiMo-V2.6 Pro и Flash

Xiaomi закончила обучение серии MiMo-V2.6 и опубликовала веса флагманской Pro и облегчённой Flash.

Обе модели омнимодальные, то есть принимают текст, изображения, видео и аудио.


Рассчитаны на агентные задачи, кодинг, автоматизацию рабочих процессов, управление компьютером, кибербезопасность, генерацию 3D-объектов, воплощенное моделирование, создание музыки, научные и математические исследования.

🟡Архитектура

У Pro 1,02 трлн параметров, из них 42 млрд активных, и 384 эксперта.

У Flash 309 млрд параметров, 15 млрд активных и 256 экспертов.

На каждый токен в обеих моделях работают восемь экспертов. Большая часть слоёв использует внимание со скользящим окном в 128 токенов, остальные – глобальное внимание: у Pro так устроены 60 слоёв из 70, у Flash 39 из 48.

Визуальный энкодер на 681 млн параметров и два аудиоэнкодера на 308 и 127 млн у моделей одинаковые.

Вывод ускоряет пятислойный спекулятивный декодер - за один проход он предлагает семь следующих токенов, основная модель проверяет их параллельно.

Контекст – 1 млн токенов

🟡Бенчмарки

По замерам самой Xiaomi Pro близка к закрытым флагманам в агентных тестах, но отстаёт в эксплуатации уязвимостей:

DeepSWE v1.1: Pro – 71,9, Flash – 67,9, Claude Opus 5 – 74,0, GPT-5.6 Sol – 73,0;

AutomationBench: Pro – 53,1, выше Opus 5 (50,3) и GPT-5.6 Sol (45,8);

Terminal-Bench 4.0: Pro – 34,9 против 49,0 у Opus 5 и 42,4 у Claude Fable 5;

ExploitBench: Pro – 47,9, Flash – 25,3 против 78,5 у GPT-5.6 Sol и 78,0 у Fable 5.

Модели также доступны в AI Studio, MiMo Code, приложении MiMo Desktop, через API Xiaomi MiMo Open Platform и на OpenRouter.


📌Лицензирование: MIT


🟡Блогпост
🟡Веса
🟡Техотчет


@ai_machinelearning_big_data

#AI #ML #MMLM #MiMO #Xiaomi

Читать полностью…

Технозаметки Малышева

Cisco выложила в открытый доступ SOC Cockpit: командный дашборд для менеджеров SOC с ИИ-помощником Keo, который отвечает только по данным инструмента

SOC Cockpit, - это веб-консоль оперативного управления для руководителей SOC. Не SIEM или SOAR, а тот слой, который обычно живёт в табличке Excel на ноутбуке менеджеров: смены, планёрки, задачи, KPI.

🧠 Что внутри:
Командный дашборд: готовность самого SOC, статусыSLA/KPI, оценка рисков в реальном времени, расписание смен 24/7
Планировщик смен с будущими датами и подсказками по разрывам в расписании
Планёрки с матрицей Эйзенхауэра: Do, Delegate, Delay, Discard, у каждой задачи лид, длительность и статус
Реестр проблем и KPI/SLA с трендами, которые берутся из интегрируемых систем
Автогенерация отчёта для руководства (bottom line, wins, concerns, decisions), работает даже без LLM

🔐 Keo: ИИ-помощник с привязкой к фактам:
Ценность помощника в SOC упирается в доверие, поэтому Keo отвечает строго по живым данным кокпита: смены, открытые проблемы, цели, KPI, заметки берутся из системы и подтверждены источниками.
Рутинные вопросы вроде «какая смена работает на следующей неделе» или «какие не закрытые задачи остались с прошлого месяца» выводятся прямо из базы, без модели.

Интегрируется с любым OpenAI-совместимым эндпоинтом, - можно привязать к Ollama или vLLM локально и данные не покинут периметр.

💼 Зачем бизнесу:
Операционный слой SOC получает общее хранилище с историей вместо чата и таблички у дежурного.
Полностью self-hosted сценарий: SQLite внутри, свой LLM, никакие данные не передаются наружу, - для ИБ это фундаментальная потребность.

Вообще в наше время навайбкодить такое, - 1 день, но приятно что Cisco думает о пользователях и публикует вендоркий вариант интеллектуального дашборда.

GitHub

#SOCCockpit #Cisco #SOC #cybersecurity
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен

Читать полностью…

Технозаметки Малышева

В принципе, когда все камеры мира будут писать с качеством из которого можно будет воссоздать подобную 3Д сцену, обычные фотографии устареют.

Можно будет вернуться в любой момент времени, подобрать нужный ракурс, а нейронка достроит недостающее

Автор: joergkahlhoefer

#gaussian #splat #3D
------
@tsingular

Читать полностью…

Технозаметки Малышева

Grok 4.7 обновили. Способен работать вдвое дольше за те же деньги

SpaceXAI выпустила Grok 4.7, флагман для кодинга и работы со знаниями. База крупнее, чем у 4.6, обучение шло дольше и на задачах, которые человек решает часами, защиту переписали целиком.

Цена не изменилась: 2 доллара за миллион входных токенов, 6 за миллион выходных. Быстрый вариант вдвое быстрее и вдвое дороже.

⚙️ Главный прирост в терминале: на Terminal-Bench 4.0, где модель часами работает в командной строке, результат вырос с 20,3% до 38,0%. В CursorBench 4.0 прирост скромнее: 40,4% против 46,3%.
Подтянулись документы и презентации: 1657 против 1546 у 4.6.
Модель отдельно учили понимать среду Grok Bot.

📊 Где конкуренты впереди: Fable 5.1 сильнее в CursorBench 4.0 (51,8%), Terminal-Bench (57,9%) и HealthBench (62,1%). Но дороже в 5 раз - 10 и 50 долларов за миллион токенов.
GPT-5.6 Sol дороже в два-три раза и проигрывает почти по всем строкам.

🛡 Защита переписана целиком. SpaceXAI называет новый стек самым устойчивым к взлому среди своих моделей: на HackerBench v0.3 проходит только 3,3% опасных двойных запросов, биологическая безопасность по LatchBio 62,4%.
Отдельным партнёрам по кибербезопасности открыли доступ к редтимингу командами по приглашеню.

Уже доступна в Cursor, Grok Build и API, а также у облачных провайдеров.

Между 4.5 и 4.7 прошло всего два с половиной месяца, а Grok 4.8 на 2,5 триллиона параметров, по словам Маска, уже учится.

Модели выходят быстрее, чем вы успеваете к ним привыкнуть, не то что внедрить.

Кстати NousPortal на неделю 50% скидку дают на Grok 4.7

#Grok #SpaceXAI
———
@tsingular

Читать полностью…

Технозаметки Малышева

Autodesk открывает Fusion для AI-агентов

📋 Autodesk, - компания, больше сорока лет задающая стандарты проектирования, на прошлой неделе на Autodesk University 2026 выкатили Fusion Compute MCP в публичную бету.

MCP сервер дает ИИ агенту доступ практически ко всему функционалу Fusion напрямую.

💡 Под капотом - больше 7000 api вызовов, собранных в единый инструмент через TypeScript API.
Почти всё, что инженер делает в десктопном Fusion, агент выполняет в облаке прямо на рабочих документах: сессия стартует за секунды, живёт до часа, работает через Claude, Antigravity, VS Code, Codex и любой совместимый с MCP инструмент.

💼 Демо показывают цепочку действий, которую человеческая команда обычно выполняет за несколько дней: агент проектирует корпус для одноплатника, строит пресс-форму с матрицей и пуансоном, программирует черновое и чистовое фрезерование обеих плит, и управляющие программы генерируются примерно за шесть с половиной секунд.
В другом кейсе, роботе-газонокосилке на 1100 деталей, четыре параллельных субагента перекрашивают модель, каждый в своём облачном инстансе.

💡 При этом MCP даёт среду и инструменты: что агент соберёт, решает модель, которая им управляет.
Это уже третий сервер MCP для Fusion.
Дополнительно Autodesk дают ИИ ассистента, который создаёт чертежи по описанию, от стандартов и форматов листа до видов и размеров.

🔮 Смысл сдвига глубже, чем чат-бот внутри САПР: сама САПР становится средой исполнения для агентов, где инженер формулирует намерение, а агент оперирует инструментами внизу, от модели до оснастки и документации. Autodesk рассчитывают, что техническая документация автоматизируется быстрее всего: результат виден и проверяется до выпуска.

#САПР #MCP #Autodesk #Fusion
———
@tsingular

Читать полностью…

Технозаметки Малышева

Это нам за то, что не молимся

Видео не настоящее. Никто пока дрозофилу к такому роботу не подключал

#дрозофила #роботы #юмор
------
@tsingular

Читать полностью…
Subscribe to a channel