2604
Новости инноваций из мира искусственного интеллекта. 🤖 Всё об ИИ, ИТ трендах и технологической сингулярности. Бесплатный бот для подписчиков: @ai_gptfreebot автор: @mbmal канал личный. Поддержка: https://pay.cloudtips.ru/p/c8960bbb
Интересные инсайты по skills
Тут недавно на Hacker News появился тред с вопросом "Как вы менеджите ваши skills".
Почитал весь тред и решил выписать интересные на мой взгляд инсайты и добавить немного от себя.
Skill – это кэш рабочего процесса: "как уже делали эту задачу". Должен отвечать на вопрос "как сделать X".
1. Когда skill действительно нужен
- нужно хранить то, чего нет в обучающих данных модели:
- внутренние сервисы;
- нестандартные конфигурации;
- инфраструктуру и связи между репозиториями;
- правила доступа к окружениям.
- принятые в команде гайдлайны
- один и тот же процесс повторяется несколько раз в день или в неделю;
- процесс должен выполняться одним и тем же способом;
например:
- нужно не забывать тесты, документацию, ревью или другие обязательные шаги;
- нужно выполнять compliance-проверку;
- часто требуется один и тот же способ работы с Jira, Git, CI, инфраструктурой или браузером;
При этом, если действие можно выразить обычным кодом, лучше выразить его кодом. Модели оставить принятие решений и задачи, которые трудно формализовать.
2. Как создавать skills
- не начинать с поиска готовых skills.
- сначала попросить агента выполнить задачу.
- попросить агента упаковать процесс выполнения задачи в skill. Тут рекомендую использовать skill-creator от Anthropic – там есть evals для проверки skill.
- попробовать skill в новом чате
3. Улучшение skill
- после каждой сессии со скиллом анализировать, что можно вынести в skill;
- собирать статистику повторяющихся рабочих процессов для создания новых скиллов;
- просить другой frontier-моделью уменьшить и упростить текст skill.
- проводить ежемесячный аудит неиспользуемых skills;
4. Безопасность
- Рассматривать каждый skill как код, которому агент доверяет.
- Проверять происхождение и содержимое.
- Не устанавливать случайные skills из интернета без ревью.
В комментах добавьте ваши инсайты по скиллам! inb4: скиллы не нужны
Лайк, репост,
✔️ Тимур Хахалев про AI Coding, подписывайтесь!
🧬 Claude обнаружил ранее неописанную ферментную систему с повторами ДНК, напоминающими CRISPR, сообщает Anthropic.
Около 950 агентов работали 21 час и использовали 210 млн токенов. Они исследовали более 200 тысяч обратных транскриптаз - ферментов, копирующих РНК в ДНК, - выделили 3500 потенциальных систем и отобрали 20 наиболее интересных.
Один агент заметил необычные повторяющиеся последовательности рядом с геном фермента.
Находку назвали ART - array-associated reverse transcriptases. Она встречается преимущественно у бактериофагов - вирусов, заражающих бактерии.
Сам фермент был известен ранее. Claude выявил связанные с ним повторы и дополнительный белок, которые вместе образуют отдельную систему. Учёные провели первые лабораторные эксперименты: оказалось, что из массива повторов образуются разные короткие РНК.
Функция ART пока неизвестна, а возможность использовать её для редактирования генома ещё предстоит исследовать.
Поиск и анализ выполняли агенты, лабораторную работу - люди. Результаты опубликованы в препринте.
https://www.anthropic.com/news/claude-discovers-novel-enzyme-system
@ai_machinelearning_big_data
#claude #anthropic
И ещё один пример.
код исходника в комментарии
#нейрорендер #Opus
———
@tsingular
Создатель oMLX перешёл работать в Hugging Face, проект остался открытым
Hugging Face объявила о найме Jun Kim (jundot), автора и ведущего разработчика oMLX.
Лицензия Apache 2.0 сохраняется: Kim продолжает руководить проектом. Из хобби проект переходит в полностью финансируемую разработку. (под крышей NVidia :) )
⚙️ oMLX это сервер локального запуска моделей на Apple Silicon поверх фреймворка MLX. Главное решение: постраничный кеш KV-блоков на SSD. Агентские сессии постоянно сдвигают контекст и обнуляют кеш, поэтому на длинных промптах первый токен приезжал через 30-90 секунд. oMLX кладёт блоки кеша на диск в формате safetensors и восстанавливает совпавший префикс за миллисекунды, в том числе после перезапуска сервера.
Дальше по списку: непрерывная пакетная обработка запросов с ускорением до 4,14 раза на восьми параллельных, одновременная работа языковой, зрительной, эмбеддинговой модели и реранкера, совместимость с API OpenAI и Anthropic, вызов инструментов и MCP, приложение в строке меню macOS. С февраля проект собрал 22 тысячи звёзд и 125 релизов.
🎯 Для MLX Hugging Face отводит oMLX роль испытательного полигона, а удачные решения поднимает в mlx-lm и mlx-vlm. Отдельный фокус: быстрый перенос описания модели из transformers в эталонную реализацию на MLX, чтобы новые модели заводились во всех движках сразу.
💼 Вывод хотите устроиться в ИИ гиганта, - сделайте стартап, который бы они купили вместе с вами :)
Openclaw вот в начале года, теперь oMLX.
#oMLX #MLX #HuggingFace
———
@tsingular
Эдди Османи, известный ИИ инженер, недавно присоединившийся к Антропику, поделился инструкцией к новому Опусу 5.5
Кратко:
📌 Как теперь надо
- Давать задачу целиком одним сообщением + назвать «финишную черту» (что значит «готово») и когда остановиться. Дальше — не мешать.
- Давать ей самой работать на длинных многошаговых задачах — Opus 5.5 тянет часы почти без присмотра.
- Дополнять запущенную задачу по ходу (дописать follow-up), а не перезапускать.
- Для дизайна — перечислять конкретные нежелательные стили, а не «избегай безликого вида».
- Прописать в CLAUDE.md: когда продолжать, когда останавливаться и спрашивать; перед разрушительным — стоп.
- Разбивать большие аудиты/миграции по субагентам и проверять доказательства каждого.
- Держать список задач в файле (TASKS.md) и читать файл, а не скроллбэк.
- При завершении — сначала читать «что нужно от меня», потом остальное саммари.
- Просить ревью кода до человека; просить помечать неподтверждённое.
- Прикреплять график/скриншот, а не перепечатывать цифры; просить сразу готовый файл, а не план.
- В проекте фиксировать: ранние ответы уже решены (ускоряет уточнения).
- /fast — для быстрого back-and-forth.
❌ Как теперь не надо
- Не писать «подумай внимательно / думай пошагово» — модель и так думает перед каждым ответом, это только замедляет.
- Не перезапускать долгую задачу из-за мелочи.
- Не давать общих дизайн-указаний — только конкретные паттерны.
- Не просить показывать внутренние рассуждения в ответе — это отклоняется.
- Не выключать запросы разрешения на разрушительные команды.
- Не перепечатывать цифры вместо прикрепления графика.
- Не читать всё саммари подряд — сначала блок «что нужно от меня».
Полная версия тут
#Osmani #Opus #промпты
------
@tsungular
Claude Opus 5.5 оказался чертовски хорош в создании игр — первые демки выглядят потрясающе 🤩
Так, юзеры уже навайбкодили Dark Souls, Flight Simulator и Mario Kart. Причём последнюю, по словам автора, Claude ваншотнул.
Системный промпт модели, кстати, уже вытащили и слили в сеть. Можете поизучать ☕️
А вот и OpenAI: встречайте GPT-6 Sol и Luna.
— обе модели ровно в 2 раза дешевле, чем их 5.6-версии.
— общаться должны так же понятно и без жаргона, как Astra
— и... всё. Sol не лучше Astra (а во многом и хуже, в отличии от пары Fable <-> Opus), но сильно дешевле, и всё ещё лучше Sol 5.6. Поэтому модель может стать основной рабочей лошадкой, сохраняя ваши лимиты.
Традиционно, - проверяем новейшую модель через написание венка сонетов.
Напиши венок сонетов о том как тихоходка наблюдает волны технологических сингулярностей сквозь эпохи
Последние 3 дня я прям сильно закопал агентов в тему с Recursive Self Improvement.
Собственно это агентский цикл самоулучшения.
В основном агенты занимались разработкой сверхмалой модели по типу Jev которая смогла бы одновременно (это как раз сложно) играть в тетрис, змейку, уметь классифицировать логи и сортировать картинки.
такой сверх-быстрый комбайн.
определённый прогресс есть, все узкоспециализированные задачи модель размером в 1.8 млн параметров (7 мегабайт всего) выполняет. причём в тетрис играет лучше всего, в змейку - идеально но линейно, с остальным пока учится разбираться, но самое интересное что в ходе этой работы сам цикл самоулучшения постоянно дорабатывается.
Вот тут версия на Питоне, сейчас переписывется на Rust
и вот, сначала Гермес, потом Астра и затем Fable 5.1 собрали Универсальный RSI навык.
он гигантский.
Это не просто промпт, - это прям шаблоны инструкций для Мета RSI с примерами инструментов и процессов.
навык, как обычно, в ИИзбранном
ибо сложно и дорого.
На всю историю уже около 1млрд токенов сожглось. (хочу безлимит)
А тут в комментариях, - примеры результатов обучения модели.
особенно радует скорость отклика в диапазоне 4-40мс
#RSI #навыки
———
@tsingular
Qwen4 уже скоро.
на конфе Apsara анонсировали новые модели и сообщили, что qwen 4.5 и 5 версии вырастут до 5-10Т параметров
#Qwen
———
@tsingular
Unitree представили новые руки для роботов.
ловкая кисть Unitree Dex5-S с 22 степени свободы
Размер 1:1 с человеческой рукой
Прецизионная биомиметическая ловкая кисть, цена от $6 500 (без учёта налогов и доставки).
Все 22 сустава — с плавными тактильными приводами, каждый оснащён защитой от предельного ударного момента.
Как раз в продолжение сегодняшнего обсуждения о недостающем 1% для плетения лаптей 😀
#Unitree #роботы #руки
------
@tsingular
Qoder раздаёт бесплатный доступ к Qwen3.8-Flash до 30 сентября
https://docs.qoder.com/events/flashoffer
Период проведения акции : с 18 сентября 2026 г., 10:00, по 30 сентября 2026 г., 23:59:59.
Условия участия : Все новые и существующие индивидуальные пользователи Qoder International, включая пользователей тарифных планов Free, Pro Trial, Pro, Pro+ и Ultra. Подписчики Teams и Enterprise не имеют права участвовать.
Модель : Qwen3.8-Flash.
Предложение : Стоимость этой модели снижена с 0,1× до 0,0×. Работа с этой моделью не расходует кредиты.
Активация : Предложение применяется автоматически, активация не требуется.
Вы можете использовать эту модель даже при нулевом балансе кредитов.
В период проведения акции Qwen3.8-Flash испытывает высокий спрос, поэтому в часы пик скорость ответа может быть ниже.
#Qoder #free #Qwen
———
@tsingular
Счётчик AGI сдвинулся на 99%: гуманоид Figure впервые поработал в 30 незнакомых квартирах без единой минуты обучения там
Компания Figure выкатила Helix 2.5, - самую продвинутую свою нейросеть.
Управляемый ею робот зашёл в 30 незнакомых домов Калифорнии и сразу приступил к работе: ни минуты сбора данных, ни файнтюнинга в этих квартирах.
Счётчик AGI Алана Томпсона, всё лето стоявший на 98%, сдвинулся на 99%: Helix 2.5 закрыл Woz-тест в масштабе.
⚛️ За счёт чего получилось:
Helix 2.5 претренировали на Index, - датасете человеческого поведения, прирастающем на ~35 минут новых данных каждую секунду.
Из одной базовой модели сделали три поведения: уборка гостиной, складывание полотенец, заправка кровати.
Претрейн на Index сам по себе поднял zero-shot успех с 9% до 56% (строгая оценка: всё или ничего, зачёт только за полностью выполненную задачу).
Если сравнивать с Helix 02, то получается вдвое меньше данных, специфичных для конкретной задаче при генерализации, охватывающий в 30 раз более широкий диапазон.
🧠 Впервые измерен scaling law переноса человек-робот:
Каждое удвоение данных Index закономерно улучшало предсказание действий робота, - как в языковых моделях.
Точность такая, что лосс крупнейшего прогона предсказали до старта обучения: ошибка 0.54% на диапазоне 8x.
Figure: рецепт уже знаком по другим областям ИИ: широко учись на претрейне, задай поведение один раз, генерализуй на развёртывании.
На тренировку Helix влили $3.5 млрд вычислений.
💼 Зачем бизнесу:
Zero-shot успех в незнакомой обстановке закрывает парадигму «учим робота под каждое место отдельно» и позволяет быстро масштабироваться.
Самокоррекция всего тела по классам действий, - "отойти, сменить стойку, обойти препятствие", позволяет доводить длинные задачи до конца без человека.
Оставшийся 1% в AGI счётчике Алана, - тонкая моторика многошаговой сборки на уровне среднего человека.
Чуть чуть осталось. Может до Нового Года как раз.
#Helix #Figure #робототехника #AGI #ИИ
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен
Забавный тренд.
Кидаете в GPT пустую коробочку с промптом, получаете разбор:
На основе всего, что ты обо мне знаешь, заполни обе стороны этого контейнера.
Сверху какой я для мира, снизу,- какой я внутри
⚡️ Claude помог ускорить собственный интерфейс втрое за две недели
Anthropic рассказала, как команда вместе с Claude внесла более 3000 изменений в claude.ai и десктопное приложение. По данным компании - без пользовательских инцидентов и откатов.
Результаты по 75-му перцентилю:
— Готовность сайта к вводу: 3,1 → 0,55 секунды.
— Загрузка облачной сессии Cowork: 2,6 → 0,73 секунды.
— Запуск десктопного приложения: 6,3 → 3,3 секунды.
Всё координировали в Slack: одновременно шло более 150 тредов. Claude находил узкие места, создавал бенчмарки, готовил исправления и проверял метрики после выпуска. Каждое изменение одобрял человек.
Среди находок — 6900 React-хуков и 900 подписок, участвовавших в обработке каждого нажатия клавиши, и лишний вызов location.reload(), вызывавший полмиллиона скрытых перезагрузок в день.
Чтобы ускорения сохранялись, в CI добавили проверки: изменение, увеличивающее число инструкций на контролируемом участке, не проходит.
Ускорили загрузку, навигацию и отрисовку интерфейса. Заявленные «3×» относятся именно к этим сценариям.
https://claude.dev/blog/how-we-made-claude-ai-faster/
JetBrains Air: 26 лет разработки IDE получают глоток свежего воздуха
📋 JetBrains Air,- зонтичная система агентной разработки, запущенная 22 сентября.
Внутри: Air в самих IDE, Air Teams для координации команд и Air Governance (бывший JetBrains Central) для управления расходами и политиками, плюс свой агент Junie.
26 лет JetBrains делала рабочее место для команд разработчиков, а теперь строит систему для команд ИИ агентов.
🔧 Открытость в основе.
Агенты подключаются через ACP, общий протокол JetBrains и Zed, в реестре уже Claude Agent, Codex, Gemini CLI, Copilot и OpenCode.
Мультивендорная поддержка обеспечивается и на уровне моделей и на уровне харнесса.
Air сам по себе бесплатен, модели идут через подписку AI Pro за 10 долларов в месяц или AI Ultimate за 30 либо через свои ключи от Anthropic, OpenAI и Google.
💼 Выводы для бизнеса:
JetBrains предоставляет единый слой контроля над агентами вендоров.
Ставка тут на то, что рынок моделей и агентов растет по экспоненте и нужны инструменты и среды, которые консолидируют не только разработку, но и упростят управление процессами, политиками и затратами для любых поставщиков ИИ в компании.
📎 Ссылки:
• JetBrains Air
• ACP
• Air Governance
Диспетчерская для агентов разработчиков.
#JetBrains #агенты #разработка #IDE
------
@tsingular
История топовых AI-компаний в одном ролике
А ведь еще недавно, мысль, что нейронки будут выдавать качественную кинематографичную картинку у большинства скептиков вызывала смех
Клод умеет писать картины кодом.
просто просишь его повторить стиль автора и написать себе библиотеки, если нужно.
код в комментарии
(читать его отдельное удовольствие, - рекомендую, даже если вы не программист)
Прикольно, но мы сделаем ещё 1 шаг, - закинем картинку от Опуса в GPT - и вуаля, - у нас шедевр!
А дальше идём в Grok Imagine и у нас видео :)
what a time to be alive!
#нейрорендер #Claude #Opus #Айвазовский #dev
———
@tsingular
Google Cloud AI Research выкатила RRSI, это как RSI только еще и Regularized
Самоулучшение агентов становится нормой, но упирается в те же проблемы, которые были на этапах обучения моделей. - на тренировочном бенчмарке метрики растут, но если дать агенту незнакомые задачи, и эффект от обучения исчезает.
🔧 Знакомая болезнь, - переобучение:
Нейросети прошли через то же, пока регуляризация не научила их обобщать.
В Google Cloud AI Research применили этот же подход к самоулучшению агентов.
Харнесс остаётся полностью редактируемым, а регуляризуют сам поиск.
Предложения:
затухающий бюджет правок: к финальным раундам остаётся одна
история правок с гипотезами: опровергнутое не тестируется заново
при стагнации бюджет уходит на нетронутые компоненты
Отбор:
критик до оценки отвергает подгонку с ответами и именами задач
шумовой пол: прирост обязан перекрыть разброс на неизменном харнессе
правило оплаты: лишние токены должны быть оплачены измеримым приростом
прореживание: компонент без пользы помечают на удаление
📊 Цифры:
Эволюция шла на одном бенчмарке, затем готовый харнесс запускали на остальных.
Кодинг: Terminal-Bench 74.2 → 80.2, SWE-bench Verified 82.0 → 83.8, хотя тот не участвовал в отборе.
Агентские задачи: JobBench +4.7, GDPval +3.5, APEX-Agents +3.7.
Инженерия: Frontier-Eng 17.7 → 22.0, плюс 24.3%.
Все шесть отложенных выросли; предшественники теряли прирост вне своих бенчмарков.
Бонус: харнесс тратит на ~30% меньше токенов, чем эволюция без регуляризации.
Не успели мы в 2026м привыкнуть к лавине агентских кодовых фреймворков, теперь это.
Походу мы уверенно врываемся в эпоху самоулучшающихся агентов. Таких механик будет всё больше и больше и каждая будет тянуть на свою поляну.
Важно не только успевать их пробовать, но и уметь оценивать эффект, - действительно ли они стали лучше и в чём именно.
Нужен полигон для RSI систем, причём в каждой компании свой, - в закрытом контуре, чтобы не сбежали не дай бог :)
📎 Код
Сайт проекта
#RRSI #RSI #агенты #Google
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен
Ааа!! ИМБА!! я сдвинул её с рельс!!
It's alive, ALIVE!
Змейка ищет кратчайший путь и старается выживать!
Это вам не муха! тут всего 6 мегабайт!
#змейка
———
@tsingular
читаем полную версию венка сонетов в комментарии.
ваши мысли?
отдельные моменты прям шикарны:
И в линзу смотрит пастор, мхов любитель,
И «маленьким медведем» наречёт.
Другой — в Италии — глядит подолгу,
Зовёт меня за поступь — «тихоход».
Я не в обиде: мне спешить без толку,
А людям — да. Их время — скороход.
И атом — ярый свет, слепой губитель.
Грибы встают в пустынях и морях,
И страх — отныне мира охранитель,
И пепел оседает на камнях.
Лучи пронзают всё — металл и кожу.
А мне — пустяк. Я больше их стерплю.
Я никого из вас не потревожу:
Я просто жду. Я слушаю. Я сплю.
Я не пророк, не бог и не мессия,
Я — пауза меж волн, их тихий фон,
Я — то, что остаётся от стихии,
Когда волна откатится, как сон.
Я — маленький упрямый долгожитель.
Я — тихоходка. Мох — моя обитель.
🚀 Anthropic представила Claude Opus 5.5
Новая флагманская модель стала сильнее Opus 5, при этом работает быстрее и дешевле.
Что изменилось:
- сильнее в агентном программировании, computer use и knowledge work
- лучше справляется с длинными задачами и большими кодовыми базами
- ответы стали короче и естественнее
- улучшена устойчивость к prompt injection
- Anthropic заявляет примерно на 40% более низкую стоимость на типичных задачах и более чем на 30% более быструю генерацию
Из примеров:
- один из ранних тестеров провёл миграцию 680 000 строк кода менее чем за день
- в тесте Anthropic модель переписала HAProxy с C на Rust за 9,5 часа
Цена API:
- $4 / 1M входных токенов
- $20 / 1M выходных токенов
- $0,20 / 1M токенов при чтении кеша
Бенчмарки:
- Terminal-Bench 4.0 — 66,4%
- FrontierCode v1.1 — 54,4%
- Humanity’s Last Exam — 67,7% с инструментами
Также Anthropic подтвердила, что Claude Sonnet 5.5 и Haiku 5.5 выйдут в ближайшие недели.
https://www.anthropic.com/claude-opus-5-5
🌟 Xiaomi выпустила MiMo-V2.6 Pro и Flash
Xiaomi закончила обучение серии MiMo-V2.6 и опубликовала веса флагманской Pro и облегчённой Flash.
Обе модели омнимодальные, то есть принимают текст, изображения, видео и аудио.
Cisco выложила в открытый доступ SOC Cockpit: командный дашборд для менеджеров SOC с ИИ-помощником Keo, который отвечает только по данным инструмента
SOC Cockpit, - это веб-консоль оперативного управления для руководителей SOC. Не SIEM или SOAR, а тот слой, который обычно живёт в табличке Excel на ноутбуке менеджеров: смены, планёрки, задачи, KPI.
🧠 Что внутри:
Командный дашборд: готовность самого SOC, статусыSLA/KPI, оценка рисков в реальном времени, расписание смен 24/7
Планировщик смен с будущими датами и подсказками по разрывам в расписании
Планёрки с матрицей Эйзенхауэра: Do, Delegate, Delay, Discard, у каждой задачи лид, длительность и статус
Реестр проблем и KPI/SLA с трендами, которые берутся из интегрируемых систем
Автогенерация отчёта для руководства (bottom line, wins, concerns, decisions), работает даже без LLM
🔐 Keo: ИИ-помощник с привязкой к фактам:
Ценность помощника в SOC упирается в доверие, поэтому Keo отвечает строго по живым данным кокпита: смены, открытые проблемы, цели, KPI, заметки берутся из системы и подтверждены источниками.
Рутинные вопросы вроде «какая смена работает на следующей неделе» или «какие не закрытые задачи остались с прошлого месяца» выводятся прямо из базы, без модели.
Интегрируется с любым OpenAI-совместимым эндпоинтом, - можно привязать к Ollama или vLLM локально и данные не покинут периметр.
💼 Зачем бизнесу:
Операционный слой SOC получает общее хранилище с историей вместо чата и таблички у дежурного.
Полностью self-hosted сценарий: SQLite внутри, свой LLM, никакие данные не передаются наружу, - для ИБ это фундаментальная потребность.
Вообще в наше время навайбкодить такое, - 1 день, но приятно что Cisco думает о пользователях и публикует вендоркий вариант интеллектуального дашборда.
GitHub
#SOCCockpit #Cisco #SOC #cybersecurity
———
@tsingular | Max | tsingular">YouTube | RuTube | VK | tsingular">VK Video | Дзен
В принципе, когда все камеры мира будут писать с качеством из которого можно будет воссоздать подобную 3Д сцену, обычные фотографии устареют.
Можно будет вернуться в любой момент времени, подобрать нужный ракурс, а нейронка достроит недостающее
Автор: joergkahlhoefer
#gaussian #splat #3D
------
@tsingular
Grok 4.7 обновили. Способен работать вдвое дольше за те же деньги
SpaceXAI выпустила Grok 4.7, флагман для кодинга и работы со знаниями. База крупнее, чем у 4.6, обучение шло дольше и на задачах, которые человек решает часами, защиту переписали целиком.
Цена не изменилась: 2 доллара за миллион входных токенов, 6 за миллион выходных. Быстрый вариант вдвое быстрее и вдвое дороже.
⚙️ Главный прирост в терминале: на Terminal-Bench 4.0, где модель часами работает в командной строке, результат вырос с 20,3% до 38,0%. В CursorBench 4.0 прирост скромнее: 40,4% против 46,3%.
Подтянулись документы и презентации: 1657 против 1546 у 4.6.
Модель отдельно учили понимать среду Grok Bot.
📊 Где конкуренты впереди: Fable 5.1 сильнее в CursorBench 4.0 (51,8%), Terminal-Bench (57,9%) и HealthBench (62,1%). Но дороже в 5 раз - 10 и 50 долларов за миллион токенов.
GPT-5.6 Sol дороже в два-три раза и проигрывает почти по всем строкам.
🛡 Защита переписана целиком. SpaceXAI называет новый стек самым устойчивым к взлому среди своих моделей: на HackerBench v0.3 проходит только 3,3% опасных двойных запросов, биологическая безопасность по LatchBio 62,4%.
Отдельным партнёрам по кибербезопасности открыли доступ к редтимингу командами по приглашеню.
Уже доступна в Cursor, Grok Build и API, а также у облачных провайдеров.
Между 4.5 и 4.7 прошло всего два с половиной месяца, а Grok 4.8 на 2,5 триллиона параметров, по словам Маска, уже учится.
Модели выходят быстрее, чем вы успеваете к ним привыкнуть, не то что внедрить.
Кстати NousPortal на неделю 50% скидку дают на Grok 4.7
#Grok #SpaceXAI
———
@tsingular
Autodesk открывает Fusion для AI-агентов
📋 Autodesk, - компания, больше сорока лет задающая стандарты проектирования, на прошлой неделе на Autodesk University 2026 выкатили Fusion Compute MCP в публичную бету.
MCP сервер дает ИИ агенту доступ практически ко всему функционалу Fusion напрямую.
💡 Под капотом - больше 7000 api вызовов, собранных в единый инструмент через TypeScript API.
Почти всё, что инженер делает в десктопном Fusion, агент выполняет в облаке прямо на рабочих документах: сессия стартует за секунды, живёт до часа, работает через Claude, Antigravity, VS Code, Codex и любой совместимый с MCP инструмент.
💼 Демо показывают цепочку действий, которую человеческая команда обычно выполняет за несколько дней: агент проектирует корпус для одноплатника, строит пресс-форму с матрицей и пуансоном, программирует черновое и чистовое фрезерование обеих плит, и управляющие программы генерируются примерно за шесть с половиной секунд.
В другом кейсе, роботе-газонокосилке на 1100 деталей, четыре параллельных субагента перекрашивают модель, каждый в своём облачном инстансе.
💡 При этом MCP даёт среду и инструменты: что агент соберёт, решает модель, которая им управляет.
Это уже третий сервер MCP для Fusion.
Дополнительно Autodesk дают ИИ ассистента, который создаёт чертежи по описанию, от стандартов и форматов листа до видов и размеров.
🔮 Смысл сдвига глубже, чем чат-бот внутри САПР: сама САПР становится средой исполнения для агентов, где инженер формулирует намерение, а агент оперирует инструментами внизу, от модели до оснастки и документации. Autodesk рассчитывают, что техническая документация автоматизируется быстрее всего: результат виден и проверяется до выпуска.
#САПР #MCP #Autodesk #Fusion
———
@tsingular
Это нам за то, что не молимся
Видео не настоящее. Никто пока дрозофилу к такому роботу не подключал
#дрозофила #роботы #юмор
------
@tsingular