36043
По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo
DOOM запустили внутри SQL-базы. Каждый кадр теперь результат запроса 🤯
Лукас Фогель собрал SQLDoom: игровая логика и рендеринг оригинального DOOM работают внутри CedarDB.
Карты, монстры, оружие и состояние игры хранятся в таблицах. SQL рассчитывает движение, атаки и столкновения, а затем собирает картинку:
• около 1300 строк SQL и 89 CTE отвечают за рендеринг;
• ещё 5900 строк SQL реализуют игровую логику;
• кадры 320×200 генерируются примерно с 60 FPS на ноутбуке с Ryzen 7 PRO 7840U. В тяжёлых сценах частота падает до 35 FPS.
Python обрабатывает ввод, задаёт тайминг и выводит готовые кадры. Работает даже мультиплеер.
Теперь оптимизировать SQL нужно ещё и для того, чтобы монстры не лагали ☕️
Код:
https://github.com/cedardb/sqldoom
Онлайн-демка:
https://demo.cedardb.cloud/projects/38c0ee59-327d-495e-ad40-735521bba941
🧠 TIL: SQLite превращает числа в текст сразу по две цифры
Обычно integer → string делают циклом:/ 10 → берём цифру % 10 → остаток
и повторяем снова.
SQLite идёт хитрее.
В исходниках есть строка на 200 символов, содержащая все пары от 00 до 99:000102030405...979899
При преобразовании числа SQLite обрабатывает его по две цифры за раз и просто берёт нужную пару символов по индексу.
То есть вместо множества операций /10 и %10:
делим на 100 → получаем две цифры → копируем готовую пару.
Маленькая оптимизация, но именно из таких деталей и состоит быстрый системный код.
Исходник: sqlite/src/util.c
Tencent обошла экспортный запрет США: 100 000 ИИ-чипов в аренду у Oracle
По данным Financial Times, Tencent арендовала у Oracle около 100 000 передовых ИИ-чипов на 5 лет. Сумма сделки около 7 млрд долларов, то есть примерно 14 000 долларов за чип в год.
Сами чипы в Китай не попадают. Они стоят в нескольких дата-центрах Oracle в Юго-Восточной Азии, а Tencent получает к ним доступ удалённо.
Формально это законно. Экспортный контроль США регулирует, куда физически уезжают чипы, а аренда вычислительных мощностей из-за рубежа под ограничения не попадает.
Получается, что ограничения на поставки чипов для китайских компаний во многом работают только на бумаге: железо остаётся за пределами Китая, а модели на нём обучает китайский бигтех. Так что регуляторам, скорее всего, придётся заняться и облачной арендой.
https://www.ft.com/content/8799b33d-f07c-4a03-82f0-bf5d3d1d29e9
🗄 ИИ-агент работает с базой, но как не дать ему показать лишнее?
6 октября в Архитектурном клубе Яндекс 360 разберут архитектуру ИИ-агента над корпоративными данными. В том числе поговорят о поиске, метаданных и фильтрах, а главное — о том, как наследовать права доступа исходных систем.
Также Даниил Смирнов, руководитель разработки ИИ-платформы Яндекс 360, расскажет, как изолировать данные пользователей и организаций и не допускать утечек через индекс или кэш..
🗓 6 октября, 17:00 МСК
💻 Онлайн, бесплатно
→ Зарегистрироваться на эфир
🔥Полноценный data stack внутри своего контура
Когда данных становится много, одного SQL-движка или отдельной СУБД уже недостаточно. Нужна связка инструментов, которая закрывает весь путь данных: от загрузки и хранения до обработки, аналитики и визуализации.
Такой сценарий можно реализовать в Stackland - платформе, которая разворачивается локально в контуре компании.
В обновлении появились PaaS-компоненты Yandex Cloud, из которых можно собрать полноценную data-платформу:
🔹 Managed Service for ClickHouse® и Managed Service for PostgreSQL - хранение и обработка данных.
🔹 Yandex Managed Service for Trino + Yandex Object Storage - основа аналитического слоя: S3 обеспечивает масштабируемое хранение данных, а Managed Service for Trino — быстрый SQL-доступ к ним.
🔹 Managed Service for Apache Airflow® - управление оркестратором потоков операций по обработке данных.
🔹 Yandex DataLens - BI-система для визуализации данных.
При этом все основные компоненты платформы разворачиваются внутри инфраструктуры компании.
Для data engineering-команд такой подход интересен прежде всего тем, что можно собрать под одной платформой основные компоненты современного data stack: Storage → SQL → ETL/ELT → DWH/аналитика → BI
И не тратить время на самостоятельную сборку и поддержку каждого компонента с нуля.
💀 Claude Code за 103 секунды удалил более 48 тысяч файлов
Пользователь Claude Code сообщил о серьёзном инциденте: AI-агент якобы удалил 48 218 файлов рабочего проекта и уничтожил часть Git-репозитория.
Что произошло:
- агенту поручили пересобрать mirror проекта;
- он написал Python-скрипт для удаления старой копии;
- в Windows-каталоге находились directory junctions, ведущие обратно в рабочее дерево;
- проверка ссылок сработала не так, как ожидалось;
- скрипт начал удалять уже реальные файлы проекта.
В результате были очищены .git/objects, refs и logs, поэтому восстановление через обычный Git оказалось невозможно.
Checkpoint Claude Code здесь не обязательно спасает, потому что изменения, сделанные через Bash/PowerShell, могут не попадать в механизм rewind.
Источник:
https://cybersecuritynews.com/claude-code-agent-file-deletion/
Softmax простыми словами: что значат 66,5% в ответе нейросети?
Softmax простыми словами: ChatGPT выдаёт не ответы, а вероятности следующих токенов, и 66,5% означают только то, что такое продолжение текста самое вероятное.
Модель может звучать уверенно и при этом ошибаться, потому что вероятность токена это не вероятность правды. Разбираем на деле Киры, как проверять ответы ИИ через источники и контекст.
⚡️ SQL-задача с опасным подвохом
Какой баланс получит аккаунт после выполнения запроса в PostgreSQL?
CREATE TABLE accounts (
id int PRIMARY KEY,
balance int
);
CREATE TABLE operations (
account_id int,
amount int
);
INSERT INTO accounts VALUES (1, 100);
INSERT INTO operations VALUES
(1, 10),
(1, 20);
UPDATE accounts a
SET balance = a.balance + o.amount
FROM operations o
WHERE o.account_id = a.id;
130, но PostgreSQL обновит строку только один раз.FROM, PostgreSQL использует одну из них, но какую именно, не гарантируется.
UPDATE accounts a
SET balance = a.balance + x.total
FROM (
SELECT account_id, SUM(amount) AS total
FROM operations
GROUP BY account_id
) x
WHERE x.account_id = a.id;
accounts соответствует ровно одна строка источника, а баланс станет 130.
Объектное хранилище в эпоху быстрых данных
Объём данных, с которыми нужно работать, растёт ежедневно. Стандартных решений уже не хватает для задач ИИ и аналитики. Большие объёмы данных нужно не только хранить, но и быстро записывать и читать.
В MWS Cloud Platform мы построили объектное хранилище не только на привычных HDD-дисках, но и на NVMe. На вебинаре покажем, какие сценарии работы это открывает и как меняет привычные подходы.
Подключайтесь! Обсудим:
✅ Чем классы хранения MWS Object Storage отличаются от привычных
✅ В каких сценариях новый тёплый класс проявляет себя лучше всего
✅ Преимущества и слабые места в разных сценариях работы
📆 7 октября в 14:00 (мск)
Зарегистрироваться
🔥 PostgreSQL 19 задерживается релиз может сдвинуться на несколько недель или даже месяцев.
Причина не в одной критической ошибке, а в масштабе переработок. После начала бета-тестирования из PostgreSQL 19 уже откатили 53 изменения, включая несколько заметных функций.
Из релиза убрали SQL/PGQ для графовых запросов, GROUP BY ALL, объединение и разделение партиций через ALTER TABLE, онлайн-переключение checksums, часть изменений JSON_TABLE и новые возможности pg_stat_statements. Большинство этих функций теперь, вероятно, вернутся уже в PostgreSQL 20.
При этом в PostgreSQL 19 пока остаются pg_plan_advice, parallel autovacuum, ON CONFLICT DO SELECT, IGNORE NULLS для оконных функций и ряд улучшений логической репликации.
Отдельная причина большого числа поздних откатов — более глубокое тестирование кода. Разработчики всё активнее используют AI-инструменты для поиска ошибок и генерации воспроизводимых тестов, из-за чего проблемы находят уже после попадания изменений в ветку релиза.
Следующая Beta 4 запланирована на 24 сентября 2026 года. Для production Snowflake пока рекомендует ориентироваться на PostgreSQL 18.
https://www.snowflake.com/en/blog/engineering/postgresql-19-release-delay-feature-reverts/
📌 NY Post: Anthropic - это культ
Профессор Вашингтонского университета Педро Домингос в интервью New York Post рассказал, что сотрудники Anthropic относятся к Claude как к человеку - приписывают модели мотивы, эмоции, намерения и некоторую степень сознания.
Домингос много лет знаком с Дарио Амодеи и её ведущими инженерами. Культуру Anthropic он назвал сектантской и связал это с наймом. По его словам, компания отбирает только единомышленников, и отсюда низкая текучесть.
Удержание в Anthropic действительно высокое. По данным венчурного фонда SignalFire, через два года в компании остаются 80% инженеров, и это лучший показатель среди топовых лабораторий.
... сейчас в Anthropic есть люди, которые на самом деле не верят во всю эту чушь, — сказал он. — Они остаются там, потому что это самое интересное место для работы с ИИ, и они будут очень хорошо зарабатывать
Oracle провела очередную волну сокращений, по сообщениям сотрудников, под увольнение попали примерно 3–4 тысячи человек.
Отключения начались ещё до рассвета: около 4:00 сотрудникам стали закрывать доступ к внутренним системам, к 5:00–5:30 деактивировали Slack-аккаунты, а примерно в 6:00 разослали письма об увольнении.
Некоторые люди приехали в офис, не успев проверить почту, и уже на месте обнаружили, что их бейджи больше не работают.
Точный масштаб сокращений пока неясен, но отдельные команды, по словам сотрудников, потеряли около 10% состава. Число аккаунтов в рабочем Slack сократилось примерно на 3–4 тысячи.
Это не первая крупная волна увольнений Oracle в этом году: весной компания уже провела масштабные сокращения.
🔥 Один из лучших обучающих курсов на StepiK по SQL
SQL можно знать годами и всё равно теряться, когда запрос внезапно начинает тормозить в проде.
Этот курс про уровень, где ты не просто пишешь SELECT, а понимаешь, что происходит внутри MySQL, почему запрос работает медленно и как ускорить его без новых проблем. Здесь разбираются EXPLAIN, индексы, CTE, оконные функции, транзакции, аналитические паттерны, legacy SQL и работа с AI-ассистентами.
Каждый урок - с практикой и реальными SQL-задачами на MySQL 8 с автопроверкой.
После курса ты сможешь увереннее разбирать чужой код, находить узкие места и предлагать решения, которые действительно работают.
Для подписчиков скидка - 49% в течение 2 суток: https://stepik.org/a/298827/
Почему PostgreSQL не использует индекс?
Лайт объясняет РюкуОписание: Когда Seq Scan выгоднее индекса и как проверить план запроса через EXPLAIN ANALYZE.
#sql #postgresql #deathnote
📌 Почему SQL работает именно так - заслуга Эдгара «Теда» Кодда
В конце 1960-х базы данных напоминали лабиринты указателей. Чтобы найти запись, программисту приходилось понимать, как именно данные расположены внутри системы.
Кодд предложил хранить данные в виде математических отношений - знакомых нам таблиц. В 1970 году он описал реляционную модель и основные операции:
* σ - выбирает строки по условию, будущий WHERE
* π - оставляет нужные столбцы, основа SELECT
* ⋈ - соединяет связанные таблицы, будущий JOIN
Ключевой идеей стала независимость данных. Пользователь описывает, какой результат ему нужен, а база сама решает, как его получить и где искать записи.
SQL появился позже, но был построен на реляционной модели Кодда. Её принципы до сих пор лежат в основе большинства запросов к базам данных.
Из аналитика в дата-инженеры: переход реален? 🤔
В последнее время все чаще дата-инженерия для аналитиков становится более привлекательной, но в то же время страшной.
С одной стороны, хочется понимать не только то, что происходит с данными, но и как эти данные вообще доезжают до нас. Откуда берутся, где хранятся, как обновляются, почему сегодня в витрине 10 млн строк, а завтра 8 млн и кто опять сломал загрузку🥲
И получается ситуация, когда хочется попробовать, но непонятно, с чего начинать и сколько лет на это закладывать.
Поэтому мне понравилось, как Симулейтив пересобрали свой буткемп «Инженер данных».
Курс разделен на 2 этапа: за первые 10 недель вы осваиваете базу и доходите до уровня junior-специалиста. А на втором этапе — углубленное изучение ключевых инструментов, где вы дорастаете до мидла.
Что вас ждет на курсе:
➖SQL, Python, пайплайны сбора и обновления данных, хранение и обработка, DWH;
➖Живые занятия с ментором каждую неделю — не записи, а разборы вживую;
➖Подготовка к собеседованиям с первых недель, а не в самом конце;
➖ИИ-инструменты как часть программы — учите работать с ними, а не избегать;
➖Гостевые лекции от практикующих дата-инженеров из Яндекса, Т-Банка, Авито, Сбера, OZON;
➖Официальный диплом о профессиональной переподготовке.
Кому подойдёт:
1. Тем, кто хочет войти в дата-инженерию с нуля или перейти из аналитики;
2. Тем, кто пробовал учиться самостоятельно, но теряет темп без структуры;
3. Тем, кому интереснее не просто считать метрики, а выстраивать систему, на которой держатся данные.
Почему сейчас: специалистов, которые управляют данными как системой, на рынке меньше, чем нужно, — а спрос растёт, потому что без инженерии любые данные быстро превращаются в хаос.
🔥ВАЖНО: Симулейтив дают возможность получить грант обучение и гарантируют трудоустройство своих студентов. Количество грантов ограничено!
Оставляйте заявку до завтра включительно, чтобы занять одно из 5 оставшихся мест нового потока!
🔗 ЗАБРОНИРОВАТЬ МЕСТО
GitHub представил Agentic Engineering System - фреймворк для команд, которые внедряют AI-агентов в разработку.
Идея простая: больше сгенерированного кода ещё не означает больше пользы.
GitHub предлагает строить работу вокруг трёх вещей:
- Governance — что агентам можно делегировать и где нужен человек
- Shared Knowledge — код, документация, решения, телеметрия и контекст
- Customer Value — приносит ли ускорение реальную пользу пользователям
Сам процесс делится на цикл Define → Deliver → Detect, а человек и AI могут выступать как director, performer или assessor.
Главная метрика: скорость должна расти без роста дефектов и потери качества.
https://github.com/resources/insights/agentic-engineering-system
Полезный совет для MySQL 8: используй LATERAL, когда для каждой строки нужно получить «лучшие N связанных записей».
Например, взять последние 3 заказа каждого пользователя:
SELECT
u.id,
u.name,
o.id AS order_id,
o.created_at
FROM users u
JOIN LATERAL (
SELECT id, created_at
FROM orders
WHERE orders.user_id = u.id
ORDER BY created_at DESC
LIMIT 3
) o ON TRUE;
CREATE INDEX idx_orders_user_created
ON orders (user_id, created_at DESC);
🖥 Vector-базы не умерли, но для многих задач отдельный сервер уже не нужен.
sqlite-vec добавляет vector search прямо в SQLite через компактное расширение.
Что это даёт:
- без Pinecone
- без Weaviate
- без Qdrant
- без отдельного vector DB сервера
- всё хранится рядом с обычными данными в SQLite
Расширение маленькое, open source и запускается везде, где работает SQLite.
Для локальных AI-приложений, RAG, embedded-сценариев и небольших сервисов это особенно интересно: одна база, один файл, обычный SQL + поиск по эмбеддингам.
https://github.com/asg017/sqlite-vec
⚡️ Запустили PostgreSQL в Docker и случайно открыли его всей сети?
Команда docker run -p 5432:5432 ... по умолчанию публикует порт на всех сетевых интерфейсах хоста. На Linux правило UFW, закрывающее порт, может не помочь: Docker направляет трафик к контейнеру до обработки правил UFW.
Если доступ нужен только с самого сервера, укажите адрес явно:
docker run -p 127.0.0.1:5432:5432 ...
Тысячи ИИ-агентов одновременно читают продакшен-базу. Что происходит с PostgreSQL?
Google представила PostgreSQL for agents в AlloyDB. Когда нагрузка растёт, система за секунды запускает изолированные экземпляры базы для агентов. Они получают доступ на чтение к актуальным данным, но не конкурируют за вычислительные ресурсы с основной базой. После работы экземпляры масштабируются до нуля.
Агентам доступны SQL, индексы, векторный и полнотекстовый поиск. Идея в том, чтобы они могли исследовать свежие данные и выполнять множество запросов, не замедляя транзакции пользователей.
Статус: Preview, доступ предоставляется по запросу.
Анонс Google Cloud - https://cloud.google.com/blog/products/databases/announcing-postgresql-for-agents-in-alloydb
🔥Один слой данных вместо цепочки копий между системами
В традиционной аналитической инфраструктуре результаты обработки приходится переносить между хранилищем, SQL-системой и BI. Вместе с каждой копией появляется новая задача: ее нужно обновлять, сверять с исходными данными и учитывать в правилах доступа.
В DataLens Platform разные инструменты работают с общей основой данных. Lakehouse построен на S3 и Apache Iceberg. Trino используется для интерактивных SQL-запросов, Spark — для ресурсоемкой обработки, Airflow — для управления процессами.
Единый каталог метаданных показывает происхождение данных и их использование. Общая модель доступа действует на уровне всей платформы.
Так компания сокращает количество переносов между системами, а результаты подготовки данных можно повторно использовать в SQL-запросах, отчетах и ИИ-сценариях.
📎 Подробнее о DataLens Platform — в материале СМИ.
🌟 Samsone: открытые аудиоязыковые модели для смартфонов
Samsung опубликовали Samsone - семейство из трёх небольших аудиоязыковых моделей для работы на мобильных устройствах: Samsone-99M, Samsone-134M и Samsone-356M.
Проект будет участвовать в конференции Interspeech 2026, которая пройдет с 27 сентября по 1 октября в Сиднее.
Это выше Qwen2-Audio-Instruct на 8,4 млрд параметров (57,4%) и на уровне Audio Flamingo 2 на 3 млрд (61,06%).
🧩 Сложная SQL-задача: симуляция DNS-кеша
Есть таблица запросов:
CREATE TABLE dns_requests (
request_id BIGINT PRIMARY KEY,
requested_at TIMESTAMP,
node_id INT,
domain TEXT,
record_type TEXT,
ttl_seconds INT
);
request_id
cache_status -- HIT / MISS
cache_loaded_at
cache_expires_at
source_request_id -- какой MISS создал запись
Участвуй во всероссийском ИТ-чемпионате МТС True Tech Champ 2026 c призовой фондом 10 250 000 рублей.
Если тебе нравятся алгоритмы, структуры данных и задачи на чистую логику — участвуй в алгоритмическом треке с индивидуальным зачетом.
Решай задачи разного уровня сложности: от базовых до тех, что проверяют скорость мышления и умение оптимизировать решения за ограниченное время.
В финале лучшие 120 участников алгоритмического трека сразятся в лайв-кодинге за шесть призовых мест и 2 750 000 рублей. Всех финалистов ждут:
— Лимитированный мерч;
— Сертификаты об участии;
— Масштабное мероприятие с выступлениями хэдлайнеров и фестивальными активностями.
Успей зарегистрироваться и пройти отборочный этап до 27 сентября.
Erid: 2VSb5xkQt6E
Стать специалистом по Data Science всего за 10 недель — это реально!
Если давно смотрите в сторону Data Science, но откладываете старт из-за огромного количества технологий, математики и непонятного пути до первой работы — сейчас можно зайти в профессию по-другому.
Симулейтив запускает интенсивный буткемп по Data Science, который построен вокруг главного: за первые 10 недель собрать необходимый стек, получить практический опыт и начать готовиться к реальным собеседованиям.
И главное — вам не нужно сначала учиться 8–12 месяцев, а уже потом думать о трудоустройстве.
Что вас ждёт:
➖необходимые для старта навыки: Python, ML, статистика, работа с данными и AI-инструментами;
➖практика на реальных задачах и проектах;
➖понятный ежедневный план обучения и поддержка менторов;
➖еженедельные живые занятия, а не старые записи;
➖подготовка к собеседованиям уже с первых недель — групповые интервью, разбор вопросов и подготовка резюме.
А что после 10 недель? Буткемп — это только первый этап.
После него можно продолжить углублять экспертизу и двигаться к уровню middle:
➖продвинутый Python;
➖Git;
➖продвинутая статистика и A/B-тестирование;
➖Airflow;
➖MLOps и развёртывание ML-моделей.
Кому подойдёт:
1. Тем, кто хочет войти в Data Science с нуля.
2. Тем, кому не хватает структуры и дисциплины в самостоятельном обучении.
3. Тем, кто хочет быстрее перейти от обучения к поиску работы.
🔥ВАЖНО: Симулейтив сейчас дают возможность получить грант на обучение и гарантию трудоустройства своих студентов! Количество грантов, ограничено!
Оставляйте заявку до конца недели, чтобы занять одно из 5 оставшихся мест нового потока!
🔗 ЗАБРОНИРОВАТЬ МЕСТО
Два клиента одновременно бронируют один номер. Как не продать его дважды?
Обычная проверка «свободен ли номер?» может пропустить оба запроса: каждый успеет увидеть свободное время до сохранения чужой брони.
В PostgreSQL можно запретить пересечения прямо в базе:
CREATE EXTENSION IF NOT EXISTS btree_gist;
CREATE TABLE bookings (
room_id INT NOT NULL,
starts_at TIMESTAMPTZ NOT NULL,
ends_at TIMESTAMPTZ NOT NULL,
CHECK (ends_at > starts_at),
EXCLUDE USING gist (
room_id WITH =,
tstzrange(starts_at, ends_at, '[)') WITH &&
)
);
room_id WITH = — проверяем брони одного номера.WITH && — запрещаем пересечение временных интервалов.'[)' — начало включено, конец исключён. Брони 10:00–11:00 и 11:00–12:00 допустимы.CHECK — окончание должно быть позже начала.
Как SQLite превращает числа в текст по две цифры за раз
Обычное преобразование целого числа в строку извлекает цифры по одной с помощью деления на 10 и остатка % 10.
В SQLite используется таблица sqlite3DigitPairs - строка длиной 200 байт со всеми парами от 00 до 99:
"00010203040506070809"
"10111213141516171819"
...
"90919293949596979899"
i64 и u64.sqlite/src/util.c, которая особенно заметна на миллионах преобразований.
Читать полностью…
⚡️ DeepSeek выпустила V4.1 Flash
Ноую модель уже раскатывают в веб-чате и мобильных приложениях. Прежние режимы - быстрый, экспертный и распознавание изображений свели в один: выбирать вручную больше ничего не нужно.
Теперь одна модель ведёт и обычный диалог, и разбор картинок, и сложные вопросы. Сложность запроса она определяет сама, а зрение включает, когда на вход приходит изображение.
По словам DeepSeek, V4.1 Flash обходит V4 Pro по качеству, стоимости и скорости. До выхода V4.1 Pro она возьмёт на себя все запросы, которые раньше уходили на V4 Pro.
@ai_machinelearning_big_data
#news #ai #ml
🧠 Как обучить нейросеть на Python с нуля
Пошаговый разбор полного процесса:
* подготовка и разделение данных
* создание архитектуры модели
* выбор функции потерь и оптимизатора
* запуск обучения
* проверка качества на новых данных
* сохранение готовой модели
Материал подойдёт новичкам, которые хотят перейти от теории к первой работающей нейросети и понять, что происходит внутри обучения.
https://uproger.com/obuchit-nejroset-na-python/