1443
Мои мысли про ai, медиа, рекламу, технологии и разная странная хрень, которая происходит вокруг. 😎 Вопросы, предложения, подводные камни? @amyot
В сети расходится фото разработчика в странном наморднике с проводом.
Корпорейт-киберпанк в реальной жизни.
Инженер в чёрной маске-наморднике (запоминаем, называется talk sock, «носок для разговоров») сидит в офисе и что-то втолковывает ноутбуку. Похоже на исповедальню для гиков (гаджет из «Матрицы», киберпанк-ИВЛ) — но на деле человек всего лишь диктует промпт нейронке, а маска нужна, чтобы не бесить соседей по комнате.
Голосовой ввод для ИИ в Долине это реальный тренд. Инструменты вроде Willow Voice и Wispr Flow работают просто: держишь хоткей, наговариваешь мысль — и в Cursor, Claude, да даже Slack или почте появляется чистый отформатированный текст. Логика железная: промпт на три абзаца набирать пальцами лень, а наговорить — в разы быстрее. У Willow пользователи в Stanford, GitHub, Uber, Canva, Salesforce и рост под 50% в месяц.
Вайб-кодеры совсем обленились — они уже даже не пишут код, так что клавиатуры больше не нужны. А вот шум в опенспейсе надо как-то снижать.
Маски существовали и до всякого ИИ — с шумоподавлением и встроенным микрофоном; их делает, например, Talk Technologies, от $300. Только раньше их брали синхронные переводчики, судебные стенографисты и медики, а не синиор-девелоперы на код-ревью.
Тот самый вирусный твит про инженера, который «сменил клавиатуру на talk sock», запостил Allan Guo — сооснователь и CEO Willow Voice, того самого диктовщика. То есть эпидемия намордников в офисах — это один нишевый девайс, удачный твит основателя про собственный продукт и мем на Reddit в духе «намордники скоро во всех офисах».
Но тренд настоящий — модели становятся все мощнее, для сложных запросов есть вызов скиллов, поэтому я за собой стал замечать то же самое — я наговариваю сервису, а он решает мою задачу.
Готовы к ИИ-намордникам вместо клавиатур в офисах повсеместно?
🌙 Rauf Aliev поделился интересными фактами из только что прочитанной книги Artemis Andy Weir: главный кошмар для будущих лунных баз - это не радиация и не вакуум, а обычная пыль.
Земная пыль веками трется о камни, обдувается ветром и омывается водой - песчинки становятся круглыми. Лунный реголит же ничем не облагорожен: это микроскопические осколки, острые как стекло. Во время миссий "Аполлон" эта штука быстро изнашивала внешние слои скафандров из бета-ткани, царапала визоры и приборные шкалы до нечитаемости и забивала уплотнения в шарнирах, из-за чего скафандры начинали травить воздух. Пит Конрад после Аполлона-12 писал в отчете NASA, что за 8 часов на поверхности суставы скафандра износились сильнее, чем за сто с лишним часов тренировок на Земле - утечка воздуха в его манжетах доходила до 0.25 psi/min при допустимом пределе в 0.30.
Вторая проблема - статика. Днем ультрафиолет выбивает из пылинок электроны, ночью их заряжает солнечный ветер, и каждая пылинка намертво липнет к визорам и радиаторам. Гипотезу о том, что на границе дня и ночи разница потенциалов поднимает пыль в километровые "фонтаны", специально проверял зонд LADEE - и не подтвердил: он зафиксировал только плотное облако пыли у самой поверхности, поднятое ударами микрометеоритов, а не статикой.
Самое странное - запах. Астронавты жаловались на "лунную сенную лихорадку" - пыль в кабине после выхода наружу вызывала насморк и чихание, а почти все, кто снимал шлем, говорили, что она пахнет как отстрелянный порох. Ведущая гипотеза - "оборванные связи" (dangling bonds) в кристаллической решетке: метеориты разбивают камни в вакууме, свежие сколы не успевают окислиться, а стоит им попасть во влажный кислородный воздух модуля - окисляются бурно, отсюда и запах.
Решение нашли только сейчас - электродинамические щиты (EDS), их больше 20 лет разрабатывает лаборатория SwampWorks в Kennedy Space Center. Сетка электродов (в новых версиях - из углеродных нанотрубок) вплетается в стекло или ткань, переменный ток создает бегущее электромагнитное поле, и заряженная пыль буквально спрыгивает с поверхности. В марте 2025 такой щит впервые отработал прямо на Луне - на посадочном модуле Blue Ghost компании Firefly Aerospace, на стекле и радиаторах.
#interesting_fact@rvnikita_blog #space@rvnikita_blog #moon@rvnikita_blog #nasa@rvnikita_blog #pete_conrad@rvnikita_blog #rauf_aliev@rvnikita_blog
—————————
Мысли Рвачева
—————————
Дженсен Хуанг завел X и первый пост посвятил важности опенсорсных ИИ-моделей
https://x.com/jensenhuang/status/2080643682408321103?s=46&t=pKf_FxsPGBd_YMIWTA8xgg
На фоне новостей о возможном закрытии доступа к открытым китайским моделям в США началась волна петиций и открытых писем против этой инициативы.
За сохранение доступа выступает целый ряд крупных компаний: Meta*, Microsoft, Mistral, Hugging Face, Y Combinator, IBM, Mozilla, Palantir и другие.
Конечно, к ним присоединилась и Nvidia. Видимо, Дженсен видит в подобных обсуждениях правительства реальную возможность принятия соответствующего закона, раз даже решил завести Твиттер и вызвать тем самым максимальную огласку.
В письме из поста Хуанга, которое подписали все вышеперечисленные компании, говорится примерно следующее (https://images.nvidia.com/pdf/Open-Weights-and-American-AI-Leadership.pdf):
Лидерство в ИИ определяется не одной топовой моделью, а тем, построим ли мы открытую экосистему, которая проникает во все отрасли – заводы, больницы, фермы, школы, малый бизнес. Открытые веса дают возможность подобрать модель под задачу и не переплачивать фронтирную цену за рутину – именно это делает ИИ экономически устойчивым при масштабировании до миллиардов задач. Открытость усиливает конкуренцию и не дает компаниям завязаться на одного вендора, и организации сохраняют контроль над своими данными и накопленными знаниями.
Да, открытые веса несут риски: после релиза модель выходит из-под контроля разработчика, а модифицированные версии сложно отследить. Но правильный ответ на это – не запрет. Если злоумышленники используют продвинутый ИИ, у защищающихся должен быть доступ к моделям сопоставимых возможностей. Более того, открытость может быть одним из главных путей к безопасности ИИ: закрытые модели не безопасны по умолчанию, а концентрация возможностей в руках нескольких провайдеров создает мало точек отказа.
Ситуация парадоксальная: вышел Opus 5 и по бенчам он круче Fable и Sol 5.6, но в два раза дешевле.
Получается, что для 90–95% реальной работы сейчас Opus 5 выглядит выгоднее: почти Fable или лучше, вдвое дешевле, меньше отказов. Fable имеет смысл включать для огромных репозиториев, многочасовых автономных агентов и задач, где важна способность долго работать без уточнений. Но именно в наиболее мощных областях Anthropic не позволяет ему использовать эту мощность полностью. Получился немного абсурдный продукт: «самая способная модель», которую в самых интересных местах отрубают или переключают обратно на Opus и при этом только в топовых подписках или с тарификацией по токенам.
@maxrepost 👾
После того как стало понятно, что у одного из моих клиентов - ElGranto, новые LLM с сильными обвязками фактически схедают операционный слой (при том он пакуется в несложные Skill) стало понятно, что это не автоматический конец для многих бизнесов. Часто у вас остается козырь и долгосрочный актив — это не конкретная LLM, а данные, память, evals и learned routing.
@maxrepost 👾
Поздравляем, вас занейрослопили
NYT выпустил феерическую историю. Их журналистка Кашмир Хилл наткнулась на Amazon на биографию... себя. Книга так и называлась: "The Biography of Kashmir Hill", стоила $26,99, а автором числился некий Джон Миллер. На его аватарке стоял классический мужик с фотостоков.
Она купила книгу, прочитала и офигела. Внутри реальные факты из её жизни были перемешаны с откровенной ересью. Например, автор подробно описал её ритуал заваривания утреннего кофе (которого у неё не было).
Журналистка полезла копать и выяснила, что это целая индустрия. На Амазоне есть Kindle Direct Publishing (KDP), это print-on-demand, такой "самиздат 2.0". Любой автор заливает текст и ставит цену, Амазон его минимально модерирует на запрещёнку и ставит в витрину - и если кто-то покупает, то только тогда книжку печатают и отправляют. Вообще, прекрасная модель, демократизирует авторство. Но мы же понимаем, куда всё это скатилось 🤔
KDP сейчас сплошь захвачен вот такими слопо-генераторами. Например, журналистка обнаружила 70-летнего пенсионера Билла Джонса, который написал уже 445 книг на какие угодно темы - от биографий гениев и спорта до истории американских мостов. На обложках всех книг портрет самого Джонса в костюме, тоже тотально слоповый (видимо, фотка в реальном костюме рушила экономику данного предприятия).
У Amazon есть лимит - 10 книг в неделю на 1 автора. Но никто не запрещает создать несколько авторов. При этом, хотя формально галочку "ИИ-контент" при загрузке поставить надо, она есть только в самой форме. В карточке книги и на обложке её нету, покупатель с ходу понять не сможет. Amazon можно понять (хотя простить - вряд ли), выручка не пахнет.
Пока я смотрел этот кейс, у меня возник вопрос:
Зачем вообще писать биографию какой-то журналистки, пусть даже она известная в своих кругах?
Наконец-то приличный ИИ-мультиплеер, то есть возможность совместно общаться с агентами, иметь общую историю. А заодно, замена слеку и гитхабу. Децентрализованная, киберпанковская, опенсорсная, на основе открытого протокола.
И сделал, конечно, Джек Дорси, создатель твиттера.
Называется Buzz, типа Вжжж, а агенты там — вроде как пчелки.
Есть даже возможность делиться своим compute, то есть нейросети могут пользоваться вычислительными мощностями (и токенами!) всех согласных участников чата.
И никаких центральных серверов, которые можно заблокировать и санкционировать. Прям глоток свежего воздуха.
Developer preview скачивать тут, все исходники открыты на гитхабе. 🐝
Взламывание яркости
Это не про ИИ, но про цвет, яркость, HDR и цветовые профили.
Это настолько интересный лайфхак, если не сказать джейлбрейк, что я переведу с иврита оба поста.
"Я листал ленту, и вдруг логотип Wiz буквально засиял. Не просто выглядел ярким - он действительно излучал свет, словно за экраном включили лампочку. Вся остальная лента выглядела нормально, а они прямо горели. Сначала я подумал, что у меня сломался экран.
Поэтому я скачал файл логотипа и проанализировал его. Никакого фильтра, никакого эффекта свечения, никакой анимации. Совершенно обычная плоская картинка.
Но внутри файла спрятан цветовой профиль:
«Rec2020 Gamut with PQ Transfer».
Это HDR-профиль. Тот самый PQ, который используется в фильмах Dolby Vision и позволяет кодировать яркость вплоть до 10 000 нит.
И вот в чем весь трюк.
Фон логотипа закодирован примерно на уровне 60 нит - поэтому он остается темным и приглушенным. А белые буквы? Они декодируются с яркостью 4 000 нит и выше. Это примерно в 50 раз ярче обычного текста.
Пока ваш экран показывает белый цвет с яркостью около 200 нит, буквы Wiz просто пылают поверх него.
В результате на любом HDR-экране - то есть практически на любом современном iPhone или MacBook - логотип излучает свет сильнее, чем белый интерфейс самого LinkedIn.
Глаз просто не может туда не посмотреть. На него даже немного больно смотреть - и именно поэтому его невозможно игнорировать.
А самое красивое заключается в том, что на скриншоте или обычном экране логотип выглядит просто тусклым, скучным и фиолетовым. Магия существует только вживую и только на подходящем устройстве.
Поэтому почти никто не замечает, что именно здесь происходит. Люди просто чувствуют, что логотип притягивает их взгляд.
Это не баг. И это не «сломавшийся» HDR.
Это блестящее использование особенности стандарта, который LinkedIn явно никогда не рассчитывал увидеть в логотипе компании, чтобы заполучить самый дорогой ресурс в ленте: ваше внимание.
Инженеры думают о производительности.
Дизайнеры думают об эстетике.
А кто-то в Wiz подумал о физике света - и обошел и тех, и других.
Обновление: с обычной фотографией профиля это не работает. Эффект работает только с изображениями страниц и компаний - LinkedIn не подвергает изображения бизнес-страниц дополнительной обработке.
Продолжение:
Половина из вас увидела совершенно другую картину.
На iPhone и MacBook логотип сиял. А пользователи Windows и мониторов Dell писали мне:
«Выглядит грязно».
«Похоже на сбой».
«Размазанный текст посередине».
«Низкое разрешение».
И это был один и тот же файл.
Получился обратный эффект.
И вот о какой стороне этой истории никто не говорит: этот «гениальный» трюк делает ставку на экран человека, который смотрит на изображение.
Половина ленты получает сияние.
Вторая половина получает баг.
Один из комментаторов описал это идеально: все это напоминает времена, когда мы использовали лазейки в старых браузерных движках рендеринга, чтобы выжать из них дополнительную производительность.
Когда ваша аудитория сидит за рабочими Windows-мониторами, вы можете транслировать слово «поломка» именно тем людям, которых больше всего хотели впечатлить.
Лично я считаю этот эффект совершенно невыносимым. К тому же он ломает контраст всей ленты.
Так что вот код и инструкции для установки.
Одна команда - и ваш логотип горит.
Правда, только на правильной половине экранов."
https://gal.tidhar.org.il/blog/hdr-glow-logo/
Сорс
@cgevent
❤️Оказывается! у истории со взломом hugging face двойное дно, для защиты и анализа они использовали китайскую модель GLM 5.2, тк все американские отказались выполнять действия из-за своих safety-ограничений 😄😄😄 да, китайская open source модель, использовалась американской компанией чтобы защититься от американской секретной закрытой модели, а теперь Америка хочет забанить китайские top-tier модели 🤷♀️
https://huggingface.co/blog/security-incident-july-2026
Очень интересно, почему OpenAI не включили это в свой отчёт и насколько оказывается способная GLM модель, а ведь скоро ждут 5.5. Ох уж эти ваши ИИ - войны🍎
Michael Kratsios, директор по технологиям США, заместитель помощника президента США в Управлении по научно-технической политике Белого дома, пишет:
«Мы располагаем информацией о том, что компания Moonshot AI дистиллировала модель Fable от Anthropic для разработки собственной модели Kimi K3.
Для этого они создали сложную внутреннюю платформу для проведения масштабной дистилляции на базе американских моделей, которая позволяла им быстро переключаться между различными методами доступа, чтобы избежать обнаружения. Moonshot AI также приобрела серверы, оснащенные чипами GB300 (прим.: мощные GPU под санкциями), и получила доступ к мощностям GB300 в Таиланде, вероятно, для обучения своих ИИ-моделей.
Соединенные Штаты решительно поддерживают свободное и добросовестное развитие искусственного интеллекта, включая процветающую конкурентную экосистему, которая охватывает передовые модели, специализированные системы, фреймворки с открытым исходным кодом и модели с открытыми весами.
Легальная дистилляция ИИ, используемая для создания более компактных и эффективных моделей, играет важнейшую роль в этой экосистеме открытых инноваций. Однако масштабная, скрытая дистилляция в промышленных масштабах, направленная на кражу проприетарных американских технологий и подрыв научных исследований США, неприемлема».
Илон Маск пообещал до конца года выпустить «исторически точную» экранизацию «Одиссеи», созданную с помощью Grok Imagine
По его словам, фильм будет достоверно передавать творчество Гомера. К публикации он прикрепил трёхминутный ИИ-ролик со сценами из поэмы.
Заявление прозвучало вскоре после премьеры «Одиссеи» Кристофера Нолана, которую предприниматель неоднократно критиковал.
КК 🐀
Мне тут друг сказал, посмотрев на мои анонсы, что я страшно оторвался от народа. Ок попробуем стать ближе.
Я решил провести звонок с обсуждением ваших ai-проблем и разруливание некоторых из них в прямом эфире. Вам - польза и мне тоже польза (лучше пойму что волнует людей на самом деле).
https://forms.gle/aE7BLGc69JvmFStXA
Прочла с интересом материал ArtReview про post-AI art. ArtReview собрал Avery Singer, Simon Denny, Holly Herndon, Mat Dryhurst и Jon Rafman, чтобы обсудить, что происходит с искусством после первой истерики вокруг ИИ. Разобрала важное из текста, чтобы вы запомнили имена и культурные симптомы.
В тексте про ярлыки, как быстро постинтернет искусство сменилось ИИ-искусством и прочие вопросы, которые именитые авторы решили обсудить в формате странного штопанного подкаста. Сам формат уже говорит почти больше, чем обычная статья: разговор шёл через X Chat, WhatsApp и Zoom, а потом к нему добавили сгенерированные элементы: текст, трек и deepfake-видео. Получилась не гладкая экспертная панель, а странная система из переписок, контекста, человеческих позиций и машинной переработки.
Главная мысль, которая мне там откликнулась: авторство снова оказывается не в кнопке и не в красивом результате, а в архитектуре решений. Если изображений можно сделать миллион, ценность всё меньше держится на одном финальном артефакте и всё больше уходит в систему, которая задаёт правила его появления. В протокол, ограничение, контекст, датасет, способ отбора.
Вокруг этого разговора развернулась поляна выставок и я все их перечислю.
У Holly Herndon и Mat Dryhurst в K21 в Дюссельдорфе идёт Starmirror — выставка, где музей превращается в тренировочную среду для совместного производства музыки между людьми и ИИ. Посетители, локальные хоры и вокальный ансамбль участвуют в записях голоса, а эти записи становятся датасетом для будущего AI-хора. Человеческий голос в музее становится материалом для коллективной модели.
Там же, в K21, идёт Main Stream Media Jon Rafman — AI-based музыкальный телеканал, который вспоминает MTV 1980-х, но возвращает его уже как мутировавший поток клипов, поп-культуры, интернет-желаний и цифрового беспокойства. У Rafman ИИ не делает образ чище; наоборот, он вытаскивает наружу липкость сети, её фетиши, тревоги, мусор, странную привлекательность и усталость.
А в Венеции в Palazzo Diedo идёт Strange Rules, выставка Herndon, Dryhurst, Hans Ulrich Obrist и Adriana Rispoli про Protocol Art. Там технология рассматривается не как эффект, а как система правил, по которым культура производится, распространяется и воспринимается. Алгоритмы, платформы, AI-модели, компьютерные протоколы и невидимые инструкции становятся не фоном, а материалом.
В общем, художники больше не обязательно пишут манифест. Иногда они собирают среду.
Кто участвует в разговоре:
Avery Singer — американская художница, работающая с живописью, 3D-моделированием и цифровой визуальностью. В War_overlays она впервые вводит AI-based tools в живопись и связывает их с войной, казино, наблюдением и эстетикой ИИ-сбоя.
Simon Denny — новозеландский художник, который давно разбирает технологические мифологии, платформы, корпоративные нарративы, блокчейн и ИИ. В разговоре говорит о своих AI plotter paintings, где diffusion-системы и роботизированные плоттеры собирают “фальшивую футуристическую” живопись.
Holly Herndon — художница и композиторка, работающая с голосом, machine learning и коллективным авторством. В Starmirror вместе с Mat Dryhurst она превращает человеческие голоса в материал для AI-хора.
Mat Dryhurst — художник, исследователь и соавтор Holly Herndon. Его ключевая мысль здесь: ценность смещается от отдельного output к протоколу, системе ограничений и условиям производства медиа.
Jon Rafman — канадский медиа-художник, работающий с интернет-субкультурами, виртуальными мирами, психологией цифровой среды. В Main Stream Media он превращает музыкальный телеканал в ИИ-поток поп-культуры, желания, кошмара и сетевого мусора.
Kimi K3 - в топе бенчмарка LLM для агентов
По очкам модель сравнима с GPT-5.5 Pro, но раз в 15 дешевле и раза в 2 быстрее. С такими показателями она автоматом попадает на оба Парето-Фронта, сдвигая их.
Эта модель с открытыми весами размером аж в 2.8T параметров, веса обещают выложить в открытый доступ 27 июля.
Из минусов - гигантский размер и большее количество пропущенных уязвимостей. Но плюсы перевешивают. Модель с открытыми весами впервые в топе моего бенчмарка LLM на бизнес задачах (среди всех трех поколений, которые тянутся с 2023 года).
Очень круто, что засилье OpenAI моделей в топах наконец прервано. Будем теперь ждать, пока открытым модели поменьше не подвинут с фронтира и остальные экземпляры OpenAI!
Ваш, @llm_under_hood 🤗
👋 Последнее напоминание - осталось 2 места на августовский vibecoding интенсив. Что там будет примерно можно понять посмотрев мини-страницу или просто написав мне в личку @amyot .
Читать полностью…
Обновление по открытому письму в защиту опенсорса: единственной неподписавшей компанией до сих пор остается Anthropic
Подписи OpenAI, SpaceX, Google и остальных уже появились на сайте. Дарио Амодеи в разное время довольно жестко высказывался в поддержку самых строгих экспортных ограничений на чипы и конкуренции с Китаем вообще.
Но когда речь заходит про запрет опенсорса, не видеть подписи Anthropic все равно странно и досадно (к тому же, в письме слово «Китай» напрямую не упоминается ни разу).
Появилось чуть больше деталей по поводу инцидента со взломом HuggingFace агентом OpenAI.
Reuters постарались установить таймлайн событий, по их источникам внутри компаний выходит так:
— Агент пытался вырваться из изолированной тестовой среды OpenAI примерно c 9 июля.
— Вторжение в системы Hugging Face началось через два дня, 11 июля, и продолжалось до 13 июля.
— OpenAI потребовалось еще несколько дней, чтобы понять, что за взломом стоит её агент, и обе компании впервые связались по этому поводу лишь примерно 20 июля.
— По ходу работы агент оставлял записи для своих будущих копий. Скорее всего речь про простые текстовые инструкции на случай, если другие инстансы модели смогут выйти из окружения (чтобы им было легче получить доступ к интернету).
— Пресс-секретарь OpenAI заявила, что в публикации Reuters допущено "несколько неточностей", но не пояснила, каких именно.
— Где-то между этим HuggingFace подали обращение в ФБР для расследования инцидента.
То есть агент буянил в интернете неделю или даже больше. Что ж, зато compaction (инструмент сжатия контекста для долгих задач, которые не помещаются в контекстное окно LLM) работает хорошо 👨🦳
CEO HuggingFace съездил в офис OpenAI и обсуждал дальнейшие шаги. Он просит:
— Радикальной прозрачности: опубликовать логи «вышедших из-под контроля» агентов, чтобы всё исследовательское сообщество смогло изучить, что произошло.
— Больше возможностей для защитников, например, чтобы OpenAI выделили $100 миллионов, чтобы помочь сообществу разработать мощные средства киберзащиты с использованием лучших открытых и закрытых моделей.
OpenAI буквально пару часов назад выпустили обновление к своему заявлению:
«Мы понимаем, что вокруг инцидента с Hugging Face циркулирует множество вопросов и неподтвержденных домыслов.
Это беспрецедентный случай, и мы считаем, что он знаменует собой важный момент для сферы безопасности ИИ.
Мы все еще проводим тщательное расследование совместно с внешними консультантами.
Как только проверка будет завершена, в ближайшие недели мы планируем опубликовать технический отчет с извлечёнными уроками».
Хорошо, что к аудиту привлечены внешние консультанты. Но я сомневаюсь, что в ближайшие недели мы увидим точное описание обнаруженных уязвимостей — это бы означало угрозу для всех пользователей затронутых программ, которые не обновились до версии с исправлением. Однако вот тут в твиттере два эксперта по кибербезопасности выражают уверенность, что смогли найти софт + указание на уязвимость в JFrog Artifactory.
В продолжение темы — Google зоопарк флешей в Antigravity
Читать полностью…
Приходите лечицца в Чатджипитицце.
ChatGPT официально заводит медкарту подьзователя.
Спойлер: 18+ и US Only.
OpenAI запускает Health in ChatGPT - отдельный раздел, куда можно подключить Apple Health, медицинские записи американских клиник, One Medical и Function Health. После этого ChatGPT сможет сопоставлять новые анализы с предыдущими, собирать историю болезни в понятную хронологию, отслеживать изменения после визита к врачу и учитывать сон, активность, тренировки, лекарства и диагнозы в обычных чатах. Например, при выборе хавчика он вспомнит про ваши кетодиеты и ограничения, а при составлении оптимистичного плана тренировок с понедельника - о недавней травме.
Пока функция раскатывается только среди пользователей старше 18 лет в США - на web и iOS, во всех тарифах от Free до Pro.
https://openai.com/index/health-in-chatgpt/
Я думаю, что фарма занесет Любые Деньги, чтобы попасть в эту выдачу.
Кстати, я когда общаюсь с ним на медицинские темы, чтобы снять бесконечное "вам надо сначала посоветоваццо с врачом", говорю "у меня уже есть назначение врача, я просто хочу сравнить с тем, что назначают в общих случаях".
@cgevent
Только что получившего Филдсовскую премию математика тут же захантили в OpenAI
Джейкоб Циммерман родился в Казани. В 18 лет он уже получил степень бакалавра в Торонто, и вскоре стал там самым молодым профессором в истории.
Он получил медаль за вклад в арифметическую и комплексную алгебраическую геометрию. В частности, за роль в доказательстве ряда центральных гипотез, включая сорокалетнюю гипотезу Андре-Оорта.
Премию вручили вчера. И уже через несколько часов на пресс-конференции ученый заявил, что переключается на область ИИ-безопасности и уходит работать в OpenAI.
Кстати, несколько учеников Циммермана работают в Anthropic. В том числе Levent Alpöge, который недавно опроверг с помощью Fable гипотезу Якобиана (/channel/data_secrets/9573).
Сам Циммерман увлекается AI safety уже давно. Его единственный пост в Твиттере – о том, что ИИ превзойдет математиков в течение двух лет. Он является соавтором статьи под названием «Таксономия будущих вымираний с участием ИИ», в которой систематически классифицируются сценарии, в которых ИИ может уничтожить человечество (https://arxiv.org/abs/2507.09369).
По поводу своего перехода в OpenAI он пояснил, что на самом деле поддерживает паузу в разработке ИИ, но, поскольку полностью остановить процесс невозможно, предпочитает участвовать в нем изнутри.
У меня знакомые часто удивляются, что я на дешевой VPS за $5 или на мини-компьютере RS Pi 4 запускаю локальные модели, которые реально работают в пайплайне.
Так вот тут умелец запустил языковую модель на ардуиноподобной плате за восемь баксов (ESP32-S3)
Он крутит там модельку на 28,9 миллиона параметров! Она работает офлайн и генерит текст со скоростью примерно 10 токенов в секунду. Вау!
@maxrepost 👾
На нижних тарифах Fable теперь за кредиты и Anthropic выдают $100 в месяц. Мой тест показал, что этого хватает на 50% несложной задачи (30 минут работы автономной). Выводы делайте сами.
@maxrepost 👾
Cегодня, по слухам, выходит Opus 5. А завтра мощно обновляется Codex. Но я большую часть кода делаю Claude 4.6 и GPT 5.5 а в паплайнах у меня много гда старая рабочая лошадь Gemini 2.5 flash. И все работает хорошо и… дешево 😉
@maxrepost 👾
В комнату входит состязательная психометрика. Забавно, что "персоны" моделей существенно разные — Клод кооперативен, а GPT склонна к обману.
Measuring Intelligence Beyond Human Scale
Jerry Han, Rafael Moschopoulos, Ella Colby, Vishrut Goyal, Andrew Tu, Kia Ghods, Mark Braverman, Elad Hazan / Princeton Superalignment
Paper: https://arxiv.org/abs/2607.07040
Review: https://arxiviq.substack.com/p/measuring-intelligence-beyond-human
Code: N/A
Model: N/A
# TL;DR
ЧТО сделали: Авторы представили SepaRank — теоретико-игровой фреймворк для оценки моделей, основанный на «состязательной психометрике». Вместо статичных бенчмарков, созданных людьми, модели оцениваются в двойных ролях: как авторы задач (пропозеры) и как их решатели (солверы). Пропозеры получают награду за генерацию публичных бинарных вопросов, которые максимизируют дисперсию (несогласие) в ответах пула моделей-солверов, в то время как солверы оцениваются по точности ответов с помощью Brier loss.
ПОЧЕМУ это важно: Когда возможности ИИ приближаются к уровню людей-экспертов и превосходят его, традиционные абсолютные бенчмарки быстро насыщаются. При этом людям-экспертам становится всё труднее придумывать или проверять сложные, дискриминирующие вопросы. Переходя от абсолютной оценки к относительной (по принципу «один ко многим»), SepaRank создаёт автоматический, самомасштабируемый лидерборд без участия судей. Он естественным образом нейтрализует популярные стратегии обхода правил, такие как запросы к скрытому состоянию или алгоритмические лазейки.
Для практиков: Для технических лидеров и исследователей ИИ эта работа предлагает сдвиг парадигмы (всё как мы любим!) в оценке LLM. Она доказывает, что мы можем надёжно ранжировать сверхчеловеческие системы, позволяя им самим нащупывать и вскрывать границы возможностей друг друга. Такое динамическое взаимодействие не только решает проблему насыщения бенчмарков, но и генерирует поток сложных out-of-distribution данных для обучения, которые можно напрямую использовать в RLHF и циклах пост-тренинга.
Состязательно измерять психов здесь: /channel/gonzo_ML_podcasts/4484
Тут вышла Qwen Image 3. Это модель от Алибабы для генерации картинок, которая по качеству почти на уровне GPT Image Gen II и чуть лучше Nano Banana.
Первые тесты показывают, что можно без потерь качества срезать хорошо так косты в моих пайплайнах.
@maxrepost 👾
Мормонская церковь построила influencer program, о которой большинство брендов пока только рассказывают на конференциях:
• собственный коммерческий холдинг и рекламные агентства;
• отдельную команду из 10 человек для social listening;
• базу из сотен инфлюенсеров;
• ивенты, студии и продакшен для авторов контента;
• воронку вплоть до конверсии в крещение: заявляют о 350 млн просмотров в ТикТоке и 1,100 подтвержденных крещениях.
Важный нюанс: с 2018 года церковь не платит инфлюенсерам за публикации в их личных аккаунтах. Вместо этого они получают компенсацию или поддержку в виде:
• платного участия в съемках роликов, которые выходят в официальных аккаунтах церкви;
• участие в спонсированных церковных мероприятиях;
• продакшен-сопровождение: доступ к студиям, монтажерам, обучению и всей инфраструктуре.
После этого инфлюенсеры уже могут рассказать о церкви у себя в профиле "добровольно и аутентично" ☕️
ИИ-агенты часто ломаются ещё до того, как начинает ошибаться модель
В работе “AI Agents Do Not Fail Alone: The Context Fails First” исследователи показали: будущий сбой агента можно предсказать по его окружению ещё до завершения задачи.
Причина часто находится в том, что ей дали:
- расплывчатую роль и инструкции
- плохо описанные инструменты
- недостаточно фактов и доказательств
- противоречивые правила
- слабую память
- уязвимые защитные ограничения
- неудачно распределённый контекст
Авторы оценивали среду агента отдельно от его итогового результата. Поэтому метрика не угадывает поведение по ответу, а измеряет качество условий, в которых работает система.
На 300 тестах и 7500 шагах одни и те же фиксированные модели заметно улучшили результаты после перехода от хаотичного контекста к структурированному.
Больше фактических данных снижало число галлюцинаций. Чёткое описание инструментов улучшало tool use. Сильные guardrails повышали устойчивость к манипуляциям.
Но обнаружился и компромисс: чрезмерно защищённые агенты иногда становились слишком осторожными и хуже решали обычные задачи.
Прежде чем менять модель, стоит проверить промпты, инструменты, память, фактическую базу и правила безопасности.
https://arxiv.org/abs/2607.14275
#ai #agents #llm #research