← Все дайджесты

🔥 AI дайджест · 26 июля 2026

Воскресенье · свежие проекты, тренды и релизы

1. Open-weight AI is having its Kubernetes moment (355★ HN)

аналитика open-source экосистема

Тоби Кнауп — сооснователь Mesosphere (построившей DC/OS на Apache Mesos) — написал эссе, которое уже набрало 355 ★ на Hacker News. Его тезис: open-weight AI-модели проходят тот же путь, что Kubernetes прошёл в 2014–2017 годах, и это хорошо.

Кнауп вспоминает, как Mesosphere строила бизнес на Mesos/DC/OS, пока Kubernetes не «съел» их рынок. Kubernetes выиграл не потому, что был просто open-source — он стал нейтральным слоем, на котором строили все: разработчики стартапов, облачные провайдеры, enterprise-вендоры. Единые интерфейсы и вендор-нейтральное управление дали уверенность каждому участнику экосистемы.

Сейчас с open-weight AI то же самое: модели вроде Qwen 3.8, GLM 5.2, DeepSeek V4 становятся фундаментом, на котором строится целая экосистема инструментов, дообучений и приложений. Кнауп предупреждает: США должны конкурировать в этой экосистеме, а не отгораживаться от неё. Попытки запретить китайские open-weight модели (о чём писали на прошлой неделе) только затормозят инновации в самих Штатах.

Ключевой вывод: экосистема победит проприетарные стены. Как Kubernetes стал стандартом для инфраструктуры, так open-weight AI станет стандартом для AI-стэка. Вопрос не в том, будет ли это, а в том, кто будет в ней участвовать.

2. 28.9M параметров LLM на микроконтроллере за $8 (132★ HN)

эксперимент open-source hardware

slvDev опубликовал проект, который ломает представление о том, где может работать языковая модель: LLM с 28.9 млн параметров бежит на чипе ESP32-S3 — микроконтроллере за $8 с 512KB SRAM, 8MB PSRAM и 16MB флеш-памяти. Весь инференс локальный, ничего не отправляется на сервер. Скорость генерации — около 9 токенов в секунду на маленький экранчик.

Как это возможно? Обычно вся модель должна помещаться в быструю память (SRAM), что ограничивает размер ~260K параметров на таком чипе. Но проект использует трюк из Google Gemma 3n и Gemma 4 — Per-Layer Embeddings: основная масса параметров (25 млн) лежит в эмбеддинг-таблице, которая хранится в медленной флеш-памяти. На каждый токен извлекается всего ~6 строк (около 450 байт), а небольшая «думающая» часть модели остаётся в SRAM. Получается, что 98% модели практически «бесплатно» лежит во флеше.

Модель обучена на TinyStories, поэтому пишет короткие связные истории — не умеет отвечать на вопросы, писать код или следовать инструкциям. Но архитектурный прорыв здесь в том, как упаковать большую модель в крошечный бюджет памяти. Открытые вопросы: как далеко можно зайти с этим подходом, можно ли дообучить такую модель под конкретную задачу и когда мы увидим LLM в умных розетках и тостерах.

3. AMD ROCm.AI — Machine-Readable ISA, чтобы AI сам писал GPU-ядра (16★ HN)

релиз AMD GPU

AMD опубликовала machine-readable описание ISA своих GPU в рамках инициативы ROCm.AI — чтобы фронтовые AI-модели могли писать GPU-код напрямую. По заявлению компании, статья называется «AMD vibe codes its way past the CUDA moat» — намёк на то, что это попытка обойти главное конкурентное преимущество NVIDIA.

Как это работает: AMD публикует формальную (машиночитаемую) спецификацию набора инструкций своих GPU (MI355X, MI455X и др.). Это позволяет AI-моделям (например, Claude, GPT, DeepSeek — любым frontier models) автоматически генерировать оптимизированные GPU-ядра под конкретную архитектуру, не требуя от разработчика ручного написания HIP/CUDA-кода. Фактически — «Claude, оптимизируй эту модель под мой AMD-чип».

Это прямой ответ на CUDA-мур NVIDIA: если AI может сам писать оптимальные ядра для любого железа, то зачем разработчикам учить CUDA? AMD пытается «перепрыгнуть» софтверный барьер — если инструмент для написания кода сам написан AI, платформа перестаёт иметь значение. Vibe coding your way past the CUDA moat — как выразился The Register.

Параллельно AMD и Cerebras объявили партнёрство по AI-инференсу (на прошлой неделе), а новый чип Instinct MI455X нацелен прямо на NVIDIA.

4. Cisco Antares — семейство открытых компактных AI-моделей для безопасности

релиз open-source Cisco

Cisco представила Antares — новое семейство компактных open-source AI-моделей, специализированных на кибербезопасности. Главная особенность: модели маленькие, дёшевые и нацелены на edge-развёртывание (на сетевых устройствах, маршрутизаторах, firewall-ах).

В отличие от гигантских моделей общего назначения, Antares — это компактные модели (предположительно в диапазоне 1–8 млрд параметров), которые умеют:

— обнаруживать аномалии в сетевом трафике в реальном времени
— анализировать логи и выявлять инциденты
— распознавать фишинговые и вредоносные паттерны
— генерировать краткие отчёты по инцидентам для SOC-аналитиков

Модели полностью open-source (веса и архитектура опубликованы) и оптимизированы под инференс на CPU — не требуют GPU. Это важно для enterprise-сегмента: безопасность критической инфраструктуры часто работает на изолированных системах без доступа к облаку или GPU-фермам.

Ход Cisco логичен: AI-безопасность — растущий рынок, а open-source даёт аудируемость, которая критична для security-продуктов. Вопрос — насколько модели Antares конкурентоспособны по сравнению со специализированными решениями от Palo Alto, CrowdStrike и др.


💰 Пульс цен на AI-модели

МодельIntelligence IndexЦена (бленд, /M tok)
Claude Opus 5$7.70*
Claude Fable 560$7.70
GPT-5.6 Sol59$4.35
Kimi K357$2.31
Claude Opus 4.856$3.85
Grok 4.554$1.35
Claude Sonnet 553$1.54
GLM-5.2 (top open)51$0.90
GPT-5.6 Luna51$0.87
DeepSeek V4 Pro$0.17
DeepSeek V4 Flash$0.06

* Claude Opus 5 цена уточняется — предположительно аналогично Opus 4.8 ($15/$3.75 с кэшем). Бленд-цена 7:2:1. Источник: Artificial Analysis, DeepSeek API Docs (26.07.2026). DeepSeek V4 Flash — $0.0028/M cache hit, $0.14/M cache miss, $0.28/M output. Kimi K3 — $1.10/$3.50/$3.50. Grok 4.5 — $2/$6 с TPS 80.


📡 Быстрые новости

Источник: ai-tools.waa-reflex.ru
ai-tools.waa-reflex.ru