Самая обсуждаемая новость дня — GPT-5.6 (Sol/Terra/Luna) с помощью промпта закрыл 30-летний открытый пробел в выпуклой оптимизации. Пользователь Reddit дал модели задачу из области, где математики десятилетиями искали решение — и GPT-5.6 не просто решил её, а предложил новый подход к проблеме, который не был описан в литературе. 540 очков и 344 комментария на Hacker News — рекорд дня. В обсуждении спорят: это случайность, сильное обобщение или настоящий AI-прорыв? Часть комментаторов отмечает, что LLM может обнаруживать комбинаторные паттерны, недоступные человеку на «зашумлённом» фоне. Другие предупреждают: не стоит переоценивать единичный результат.
Moonshine AI представила очень низколатентное распознавание речи, распознавание интентов и текст-в-речь — всё в менее чем 500 килобайтах. Проект нацелен на создание голосовых агентов и интерфейсов на устройствах с ограниченными ресурсами. Ключевые фишки: сверхнизкая задержка (пригодна для real-time диалогов), приватность по дизайну (всё работает на устройстве), поддержка macOS уже есть (Moonshine Note Taker — open-source аудио-рекордер и транскрайбер для Mac). Репозиторий набрал 380 очков на HN за 10 часов. Pete Warden (из TensorFlow Mobile, TinyML) — один из авторов. Проект набирает обороты: 452 фолловера на GitHub, Discord-сообщество.
Charles Azam (бывший Head of Software в Jimmy Energy, призёр HuggingFace × Anthropic Agentic Hackathon 2025) опубликовал сравнение Claude Fable 5 и GPT-5.6 Sol на NP-трудной задаче. Эксперимент тестирует, помогает ли директива /goal (явная постановка цели) моделям решать сложные комбинаторные задачи. Результаты показывают существенную разницу в поведении моделей: GPT-5.6 Sol с /goal демонстрирует более структурированный подход, Fable 5 — более креативный, но менее надёжный. 232 очка на HN и 111 комментариев. Статья написана инженером, который проектировал системы для ядерных реакторов — подход к сравнению с инженерной строгостью.
Vercel Labs выпустила Deepsec — security-инструмент на AI-агентах для поиска уязвимостей в коде. Работает в вашей инфраструктуре, использует лучшие модели на максимальном уровне мышления. Отличительная особенность — находит hard-to-find проблемы, которые годами лежат в коде незамеченными. Стоимость сканирования может доходить до тысяч долларов для больших кодовых баз — но клиенты считают это оправданным. Архитектура: регекс-матчеры для быстрого поиска кандидатов (scan) → AI-расследование каждого (process) → опциональная ревалидация для снижения FP (revalidate). Поддерживает PR-режим (process --diff) для CI/CD. Работает с Claude и Codex через Vercel AI Gateway. Поднимает важный вопрос prompt injection — deepsec сам не застрахован от вредоносного кода в зависимостях. 10 очков HN, но в security-сообществе — горячее обсуждение.
| Модель | Intelligence Index | Цена (бленд, /M tok) |
|---|---|---|
| Claude Fable 5 | 60 | $7.70 |
| GPT-5.6 Sol | 59 | $4.35 |
| Kimi K3 | 57 | $2.31 |
| Claude Opus 4.8 | 56 | $3.85 |
| Grok 4.5 | 54 | $1.35 |
| Claude Sonnet 5 | 53 | $1.54 |
| GLM-5.2 (top open) | 51 | $0.90 |
| GPT-5.6 Luna | 51 | $0.87 |
| DeepSeek V4 Flash | — | $0.06 |
* Бленд-цена 7:2:1 (cache hit / input / output). Источник: Artificial Analysis. DeepSeek V4 Flash — самая дешёвая модель среди всех известных провайдеров.