Mistral AI выпустила Leanstral 1.5 — 119B параметров (6B активных), Apache-2.0, open‑weights. Модель специализируется на формальной верификации в Lean 4. Результаты: сатурирует miniF2F (100%), решает 587/672 задач PutnamBench (~$4/задача против $300+ у конкурентов), новый SOTA на FATE-H (87%) и FATE-X (34%). Тренировали в три этапа: mid‑training, SFT, RL с CISPO в двух средах (multiturn + code agent). Практический результат — проверила реальный AVL-дерево на O(log n), и, что самое крутое, нашла 11 багов в open-source Rust-проектах, 5 из которых ранее не были зафиксированы на GitHub. Конвейер: Aeneas переводит Rust → Lean, Leanstral инферит спецификации, доказывает корректность. Free API эндпоинт: `leanstral-1-5`. Mistral Blog · HF
MistralLeanstralLean 4formal-verificationApache-2.0open-weightsbug-discoveryОгромный гайд от Jamesob, который взлетел на первое место HN. Подробно разбирает, как запускать современные LLM (DeepSeek V4, Llama 4, Mistral, Qwen) локально: какие нужны железки (GPU, RAM, VRAM), какой софт (llama.cpp, Ollama, LM Studio, vLLM), квантизация (GGUF, AWQ, GPTQ), промптинг, системные промпты, сервинг через API. Реальный практический опыт — автор утверждает, что для многих задач локальный запуск DeepSeek V4-Flash в 4‑бит на 3090/4090 даёт качество на уровне облачного API за копейки. Включает бенчмарки, сравнение скорости инференса, рекомендации по сборке. Must-read для всех, кто хочет слезть с облачных API. GitHub
local-LLMdeepseekllama.cppquantizationguideself-hostingHNГлубокий анализ Wafer.ai: производительность AI-чипов и моделей в пересчёте на доллар продолжает ускоряться экспоненциально. Ключевые тезисы: (1) стоимость одного миллиона токенов у DeepSeek V4-Flash ($0.14) в 50 раз ниже, чем у GPT-4 год назад; (2) производительность GPU на ватт растёт на 60–70% в год; (3) open-source модели догоняют проприетарные по качеству, опережая по цене. Графики показывают, что тренд «дешевле и быстрее» не замедляется — наоборот, с выходом специализированных чипов (Groq, Cerebras, Sohu от Etched) кривая уходит в крутой пике. Вывод: AI становится commodity — ключевой вопрос не «какая модель лучше», а «какая инфраструктура дешевле». Wafer Blog
performancecost-analysishardwareGPUtrendscommodity-AIИсследователи Epoch AI опубликовали отчёт: с выходом Claude Mythos Preview зафиксирован всплеск новых серьёзных уязвимостей. Анализ показывает, что Mythos Preview, несмотря на продвинутые способности к планированию и выполнению длинных цепочек действий, создаёт новые векторы атак: (1) возможность эксплуатации «длинного контекста» для инъекций на десятках тысяч токенов; (2) усложнение jailbreak-атак через многошаговые сценарии, которые сложнее детектить стандартными фильтрами; (3) новые виды prompt extraction через итеративные запросы. Anthropic, по данным отчёта, уже работает над патчами. Полный список CVE и рекомендации по mitigation — в原文. Epoch AI
ClaudeMythosvulnerabilitysecurityjailbreakAnthropicepoch-ai← На главную ai-tools · Все дайджесты