Тоби Кнауп — сооснователь Mesosphere (построившей DC/OS на Apache Mesos) — написал эссе, которое уже набрало 355 ★ на Hacker News. Его тезис: open-weight AI-модели проходят тот же путь, что Kubernetes прошёл в 2014–2017 годах, и это хорошо.
Кнауп вспоминает, как Mesosphere строила бизнес на Mesos/DC/OS, пока Kubernetes не «съел» их рынок. Kubernetes выиграл не потому, что был просто open-source — он стал нейтральным слоем, на котором строили все: разработчики стартапов, облачные провайдеры, enterprise-вендоры. Единые интерфейсы и вендор-нейтральное управление дали уверенность каждому участнику экосистемы.
Сейчас с open-weight AI то же самое: модели вроде Qwen 3.8, GLM 5.2, DeepSeek V4 становятся фундаментом, на котором строится целая экосистема инструментов, дообучений и приложений. Кнауп предупреждает: США должны конкурировать в этой экосистеме, а не отгораживаться от неё. Попытки запретить китайские open-weight модели (о чём писали на прошлой неделе) только затормозят инновации в самих Штатах.
Ключевой вывод: экосистема победит проприетарные стены. Как Kubernetes стал стандартом для инфраструктуры, так open-weight AI станет стандартом для AI-стэка. Вопрос не в том, будет ли это, а в том, кто будет в ней участвовать.
slvDev опубликовал проект, который ломает представление о том, где может работать языковая модель: LLM с 28.9 млн параметров бежит на чипе ESP32-S3 — микроконтроллере за $8 с 512KB SRAM, 8MB PSRAM и 16MB флеш-памяти. Весь инференс локальный, ничего не отправляется на сервер. Скорость генерации — около 9 токенов в секунду на маленький экранчик.
Как это возможно? Обычно вся модель должна помещаться в быструю память (SRAM), что ограничивает размер ~260K параметров на таком чипе. Но проект использует трюк из Google Gemma 3n и Gemma 4 — Per-Layer Embeddings: основная масса параметров (25 млн) лежит в эмбеддинг-таблице, которая хранится в медленной флеш-памяти. На каждый токен извлекается всего ~6 строк (около 450 байт), а небольшая «думающая» часть модели остаётся в SRAM. Получается, что 98% модели практически «бесплатно» лежит во флеше.
Модель обучена на TinyStories, поэтому пишет короткие связные истории — не умеет отвечать на вопросы, писать код или следовать инструкциям. Но архитектурный прорыв здесь в том, как упаковать большую модель в крошечный бюджет памяти. Открытые вопросы: как далеко можно зайти с этим подходом, можно ли дообучить такую модель под конкретную задачу и когда мы увидим LLM в умных розетках и тостерах.
AMD опубликовала machine-readable описание ISA своих GPU в рамках инициативы ROCm.AI — чтобы фронтовые AI-модели могли писать GPU-код напрямую. По заявлению компании, статья называется «AMD vibe codes its way past the CUDA moat» — намёк на то, что это попытка обойти главное конкурентное преимущество NVIDIA.
Как это работает: AMD публикует формальную (машиночитаемую) спецификацию набора инструкций своих GPU (MI355X, MI455X и др.). Это позволяет AI-моделям (например, Claude, GPT, DeepSeek — любым frontier models) автоматически генерировать оптимизированные GPU-ядра под конкретную архитектуру, не требуя от разработчика ручного написания HIP/CUDA-кода. Фактически — «Claude, оптимизируй эту модель под мой AMD-чип».
Это прямой ответ на CUDA-мур NVIDIA: если AI может сам писать оптимальные ядра для любого железа, то зачем разработчикам учить CUDA? AMD пытается «перепрыгнуть» софтверный барьер — если инструмент для написания кода сам написан AI, платформа перестаёт иметь значение. Vibe coding your way past the CUDA moat — как выразился The Register.
Параллельно AMD и Cerebras объявили партнёрство по AI-инференсу (на прошлой неделе), а новый чип Instinct MI455X нацелен прямо на NVIDIA.
Cisco представила Antares — новое семейство компактных open-source AI-моделей, специализированных на кибербезопасности. Главная особенность: модели маленькие, дёшевые и нацелены на edge-развёртывание (на сетевых устройствах, маршрутизаторах, firewall-ах).
В отличие от гигантских моделей общего назначения, Antares — это компактные модели (предположительно в диапазоне 1–8 млрд параметров), которые умеют:
— обнаруживать аномалии в сетевом трафике в реальном времени
— анализировать логи и выявлять инциденты
— распознавать фишинговые и вредоносные паттерны
— генерировать краткие отчёты по инцидентам для SOC-аналитиков
Модели полностью open-source (веса и архитектура опубликованы) и оптимизированы под инференс на CPU — не требуют GPU. Это важно для enterprise-сегмента: безопасность критической инфраструктуры часто работает на изолированных системах без доступа к облаку или GPU-фермам.
Ход Cisco логичен: AI-безопасность — растущий рынок, а open-source даёт аудируемость, которая критична для security-продуктов. Вопрос — насколько модели Antares конкурентоспособны по сравнению со специализированными решениями от Palo Alto, CrowdStrike и др.
| Модель | Intelligence Index | Цена (бленд, /M tok) |
|---|---|---|
| Claude Opus 5 | — | $7.70* |
| Claude Fable 5 | 60 | $7.70 |
| GPT-5.6 Sol | 59 | $4.35 |
| Kimi K3 | 57 | $2.31 |
| Claude Opus 4.8 | 56 | $3.85 |
| Grok 4.5 | 54 | $1.35 |
| Claude Sonnet 5 | 53 | $1.54 |
| GLM-5.2 (top open) | 51 | $0.90 |
| GPT-5.6 Luna | 51 | $0.87 |
| DeepSeek V4 Pro | — | $0.17 |
| DeepSeek V4 Flash | — | $0.06 |
* Claude Opus 5 цена уточняется — предположительно аналогично Opus 4.8 ($15/$3.75 с кэшем). Бленд-цена 7:2:1. Источник: Artificial Analysis, DeepSeek API Docs (26.07.2026). DeepSeek V4 Flash — $0.0028/M cache hit, $0.14/M cache miss, $0.28/M output. Kimi K3 — $1.10/$3.50/$3.50. Grok 4.5 — $2/$6 с TPS 80.