Cyber News

Meta вернулась в open source: Muse Glimmer на 30B под Apache 2.0 работает локально на одной видеокарте

M
Markabus
·11 августа 2026 г.
Видеокарта потребительского класса в открытом стенде на тёмном столе, позади в расфокусе монитор с терминалом и кодом — иллюстрация к запуску открытой модели Muse Glimmer, работающей локально на одной GPU. Изображение сгенерировано ИИ (пометка на обложке).

10 августа 2026 года Meta Superintelligence Labs выложила в открытый доступ Muse Glimmer — агентную модель на 30 млрд параметров, рассчитанную на запуск не в облаке, а прямо на рабочей машине разработчика. Главная новость здесь даже не размер и не бенчмарки, а лицензия: веса опубликованы под Apache 2.0 — той же лицензией, под которой живут PHP-библиотеки и половина серверного стека. Для Meta это разворот на 180 градусов: последние полтора года компания шла к закрытым моделям, а Llama всегда раздавалась под собственной лицензией с ограничениями по использованию.

Что именно выпустили

Muse Glimmer — это dense causal transformer (плотный трансформер, где при генерации задействуются все параметры, в отличие от MoE-архитектур с «экспертами») с отдельным энкодером восприятия для картинок. Ключевые характеристики из официальной карточки модели:

  • Около 29,6 млрд параметров, из них 1,8 млрд приходится на визуальный энкодер ViT-G/14; на языковую часть — 27,8 млрд.
  • Контекст 131 072 токена и более — примерно 300–400 страниц текста за один заход.
  • 52 слоя, скрытая размерность 6656, GQA-внимание с 32 query-головами и всего 2 KV-головами (соотношение 16:1 — именно оно резко снижает аппетит к памяти на длинном контексте).
  • Чередование локального и глобального внимания по схеме «локальное, локальное, локальное, глобальное» с окном 2048 токенов.
  • Словарь на 202 048 токенов, поддержка более 100 языков, включая русский.
  • Дата отсечения знаний — 4 января 2026 года.
  • Вход: текст и изображения. Выход: только текст — ни звука, ни видео модель не генерирует.

Отдельно стоит отметить регулятор «усилий» рассуждения — low / medium / high / xhigh. Это тот же подход, который в этом году появился у флагманов вроде Claude Opus 5: вы платите вычислениями за глубину размышления только там, где она нужна, а на простых задачах модель не сжигает время впустую.

Почему Apache 2.0 важнее самой модели

Llama выходила под Meta Llama Community License: она разрешала многое, но содержала оговорки — ограничение по числу активных пользователей продукта, требования к брендированию, собственную политику допустимого использования. Юристы в компаниях с осторожностью относились к таким формулировкам, и часть бизнеса просто не решалась строить продукт на этих весах.

Apache 2.0 снимает эту неопределённость целиком. Можно дообучать, дистиллировать, встраивать в коммерческий продукт, продавать доступ, менять что угодно — без разрешения и без отчислений. В обсуждении релиза на Hacker News прозвучала фраза, точно передающая настроение сообщества: «Если даже Meta может отдать веса под пермиссивной лицензией, то может и любая другая компания».

Стратегически шаг объясним. Meta зарабатывает на рекламе и аренде вычислений, а не на лицензировании базовых моделей, — значит, может позволить себе агрессивную открытость там, где для OpenAI и Anthropic это прямой удар по выручке. Марк Цукерберг оформил это в эссе «The Future Is for Everyone», опубликованном в тот же день: индивидуальные возможности как источник прогресса, изобретательство как цель сверхинтеллекта и баланс сил как основа безопасности.

Сколько нужно железа

Это самая практичная часть релиза. В полной точности BF16 модель занимает больше 55 ГБ — то есть на домашней машине не помещается. Но Meta сразу выпустила квантованные сборки, и деградация качества у них минимальна:

  • K-Quant-Dynamic, 4 бита, около 20 ГБ — целевое железо 32 ГБ видеопамяти, потеря качества 0,2%.
  • K-Quant-17GB, 4 бита, меньше 20 ГБ — влезает в 24 ГБ, потеря качества 1,0%.

24 ГБ — это RTX 4090 или RTX 5090, то есть карта, которая уже стоит у многих разработчиков и в игровых сборках. По скорости генерации Meta приводит такие цифры (с ускорителем спекулятивного декодирования DFlash, который предсказывает до 16 токенов за один проход):

  • RTX 5090: 74,9 токена/с без ускорения → 233,4 токена/с с DFlash, прирост в 3,1 раза.
  • Apple M5 Max: 26,6 → 50,2 токена/с (в 1,8 раза).
  • Apple M4 Max: 23,7 → 37,8 токена/с (в 1,5 раза).

Владельцы AMD тоже отчитались: на 7900XT в 4 битах модель занимает около 19 ГБ и выдаёт примерно 36 токенов/с, а со спекулятивным декодированием — порядка 60. Для сравнения: 233 токена в секунду — это быстрее, чем вы успеваете читать, и вполне достаточно для агента, который в фоне перебирает файлы проекта.

Есть и обратная сторона плотной архитектуры: она упирается в пропускную способность памяти. На системах с унифицированной памятью (те же Mac) dense-модель работает заметно медленнее, чем сопоставимая по «весу» MoE — зато стабильно помещается в бюджет одной потребительской видеокарты.

Что модель реально умеет

Muse Glimmer затачивали не под красивые ответы в чате, а под агентные сценарии: довести задачу до конца, корректно вызвать инструмент, распознать собственную ошибку и восстановиться. Бенчмарки это подтверждают неравномерно, и здесь важно смотреть на профиль, а не на среднее.

Сильные стороны — работа с инструментами и рассуждение:

  • MCP Atlas (вызов инструментов по протоколу MCP): 75,5 против 54,2 у Gemma4-31B и 62,5 у Qwen3.6-27B — разрыв в своей весовой категории заметный.
  • AIME 2026 (олимпиадная математика): 94,7.
  • GPQA Diamond: 83,5.
  • DeepSearch QA: 74,6, IFBench (следование инструкциям): 77,0.
  • SWE-Bench Verified (починка реальных багов в репозиториях): 76,0.
  • Мультимодальность: Charxiv Reasoning 78,8, ScreenSpot Pro 75,4 — модель умеет читать графики и находить элементы интерфейса на скриншотах.

Слабые места тоже честно видны: на OSWorld-Verified (управление компьютером) 65,9 против 75,6 у Qwen3.6-27B, а на терминальных задачах она уступает конкурентам. То есть Muse Glimmer — не универсальный чемпион, а специализированный инструмент: вызов функций по схеме в длинных многошаговых сценариях у неё выходит лучше, чем «общая» работа за пользователя.

По безопасности агентных сценариев Meta приводит результат теста Siren AgentDojo: доля успешных атак 28,4 при сохранении 94,2% полезности. Цифра не идеальная — при промпт-инъекциях локальный агент по-прежнему уязвим, и давать ему права на запись без песочницы преждевременно.

Где это запускать уже сегодня

Meta выпустила модель сразу в трёх форматах — BF16, GGUF k-кванты и сборки ExecuTorch — и договорилась об интеграции с ключевыми рантаймами. Для локального запуска: Ollama, LM Studio, Unsloth. Для edge-устройств: llama.cpp, ExecuTorch, MLX. Для серверного развёртывания под нагрузкой: vLLM и SGLang. Если возиться с железом не хочется, модель уже раздают через API — Together AI, Fireworks AI и OpenRouter. Из аппаратных партнёров заявлены AMD, Arm, Dell, Intel и NVIDIA, что обычно означает оптимизированные сборки под конкретные платформы в ближайшие недели.

Совместимость с фреймворками оркестрации заявлена для OpenClaw и Hermes Agent — то есть модель можно подставить в уже собранный агентный конвейер, не переписывая обвязку.

Что это меняет на практике

Для разработчика и владельца сайта смысл релиза сводится к трём вещам.

Первое — данные не уходят наружу. Агент, который разбирает клиентскую базу, читает переписку поддержки или ходит по внутренним документам, теперь может целиком жить на вашем железе. Для проектов, где вопрос «а куда уходят эти запросы» блокировал внедрение ИИ, это снимает главное возражение.

Второе — предсказуемая стоимость. Всегда включённый агент, который каждые пять минут проверяет очередь задач, по API стоит денег непрерывно. Локальная модель на уже купленной видеокарте стоит электричества. Разница особенно заметна на фоновых сценариях: мониторинг, разбор логов, обработка входящих заявок.

Третье — офлайн. Цитата Meta Superintelligence Labs звучит буднично, но по сути точна: «Локальный запуск моделей позволяет использовать ИИ где угодно и когда угодно, с интернетом или без него». Для полевых сценариев и закрытых контуров это единственный работающий вариант.

Важная оговорка: Muse Glimmer — не замена флагманам. Это дистиллят, обученный на выходах закрытой Muse Spark, и Meta прямо говорит, что такой подход «экономит вычисления». Модель уровня 30B решает рутину — извлечение данных, классификацию, вызов API, черновой код, разбор скриншотов, — но на действительно сложной архитектурной задаче вы всё равно пойдёте к фронтирной модели.

Что дальше

Meta теперь официально ведёт двухдорожечную стратегию: закрытые фронтирные модели через API (Muse Spark 1.1) плюс открытые дистилляты для локального запуска. И Цукерберг, и главный ИИ-директор компании Александр Ван по отдельности пообещали открыть веса Muse Spark 1.2 — той самой модели, которая сейчас питает Muse Code, — но сроков ни один из них не назвал.

Если обещание будет выполнено, расклад в открытых моделях изменится заметно: до сих пор верхнюю планку открытых весов держали китайские команды с Qwen и Kimi. Пока же имеет смысл сделать простое: скачать 4-битную сборку, поставить Ollama или LM Studio и проверить на своей задаче, хватает ли 30B там, где вы сегодня платите за API. Ответ у каждого проекта будет свой, но впервые за долгое время его можно получить бесплатно и не отдавая данные наружу.

Частые вопросы

Q.Какая видеокарта нужна для запуска Muse Glimmer?

В 4-битной квантизации K-Quant-17GB модель занимает менее 20 ГБ и запускается на карте с 24 ГБ видеопамяти (например, RTX 4090 или RTX 5090) с потерей качества около 1%. Сборка K-Quant-Dynamic рассчитана на 32 ГБ и теряет всего 0,2%. Полная версия в BF16 требует более 55 ГБ. Также поддерживаются MacBook с чипами M4 Max и M5 Max.

Q.Можно ли использовать Muse Glimmer в коммерческом продукте?

Да. Веса опубликованы под лицензией Apache 2.0 — это полностью пермиссивная лицензия без ограничений по числу пользователей, требований к брендированию и отчислений. Модель можно дообучать, дистиллировать, встраивать в платные продукты и продавать доступ к ней.

Q.Чем Muse Glimmer отличается от Llama?

Двумя вещами. Во-первых, лицензией: Llama выходила под собственной лицензией Meta с ограничениями, Muse Glimmer — под Apache 2.0. Во-вторых, назначением: модель специально оптимизирована под агентные сценарии — надёжный вызов инструментов по схеме, многошаговые задачи и восстановление после ошибок, а не под универсальный чат.

Q.Заменит ли эта модель облачные API вроде GPT или Claude?

Не полностью. Muse Glimmer — дистиллят закрытой модели Muse Spark, и на сложных задачах он уступает фронтирным моделям: например, на OSWorld-Verified у него 65,9 против 75,6 у Qwen3.6-27B. Модель хорошо закрывает рутину — извлечение данных, классификацию, вызов API, черновой код и разбор скриншотов, — но для действительно сложных архитектурных задач облачные флагманы пока сильнее.

Источники

Предыдущая
Cloudflare открыла исходники Cloudflare OS: рабочее место для ИИ-агентов, которое компания использует сама
Следующая
Google перекроила руководство ИИ: Хассабис уходит с операционки, Джефф Дин — из компании после 27 лет

Читайте также

Вечерний офис ИИ-лаборатории: стеклянная доска с формулами и схемами нейросетей, пустое кресло у стола, вдали двое коллег разговаривают в коридоре. Иллюстрация · изображение сгенерировано ИИCyber News
11 августа 2026 г.

Google перекроила руководство ИИ: Хассабис уходит с операционки, Джефф Дин — из компании после 27 лет

Один меморандум Сундара Пичаи сменил операционного руководителя Google DeepMind, отправил Демиса Хассабиса на роль главного учёного Alphabet и увёл из компании Джеффа Дина вместе с тремя другими ключевыми исследователями. Разбираем, кто теперь отвечает за Gemini и что из этого следует для тех, кто строит продукты на моделях Google.

Читать →
Рабочий стол разработчика в тёмной графитовой комнате: ноутбук с открытой панелью управления и терминалом, внешний монитор, механическая клавиатура и сетевое оборудование в расфокусе. Иллюстрация · изображение сгенерировано ИИCyber News
9 августа 2026 г.

Cloudflare открыла исходники Cloudflare OS: рабочее место для ИИ-агентов, которое компания использует сама

5 августа Cloudflare выложила под лицензией Apache 2.0 платформу Cloudflare OS — браузерное рабочее место, где ИИ-агент собирает документы и приложения, а доступ к внутренним системам выдают «привратники» вместо API-ключей. Разбираем архитектуру, что можно развернуть у себя и в чём подвох.

Читать →
Фотореалистичный кадр из-за плеча разработчика в затемнённом офисе: на большом мониторе — панель наблюдаемости с каскадом трассировок в бирюзовых, янтарных и фиолетовых полосах, графиком и списком задач, на втором экране справа — код с подсветкой синтаксиса; на столе клавиатура, кружка и витой кабель — к новости о выходе Microsoft Agent Harness и Foundry Hosted Agents в общий доступCyber News
8 августа 2026 г.

Agent Harness и Hosted Agents стали общедоступны: Microsoft делает ставку на рантайм для ИИ-агентов

Microsoft перевела в общий доступ Agent Harness и Foundry Hosted Agents — производственный рантайм и хостинг для ИИ-агентов. Главный тезис: около 98% кода агента — это «обвязка», а не сама модель.

Читать →