Meta* наносит ответный удар по 15-недельному доминированию Китая в AI-токенах: модель Muse Glimmer вмещается в один GPU и ускоряет ответы инновационным методом

Meta Muse Glimmer ии открытые веса дистилляция Gpu wccftech.com

Узнайте, как Meta* возвращается в гонку открытых ИИ-моделей с Muse Glimmer: 30 млрд параметров умещаются на одной видеокарте благодаря дистилляции, а крошечный драфтер DFlash ускоряет ответы в 3 раза. Сравните с китайскими гигантами DeepSeek и Qwen – данные OpenRouter за неделю.

Meta* возвращается в категорию моделей ИИ с открытыми весами – подмножество больших языковых моделей (LLM), которое она же и основала, но затем в порыве неверных приоритетов почти забросила, – с громким и звучным заявлением благодаря только что выпущенной модели Muse Glimmer с открытыми весами. В этой модели применяются оригинальные уловки, чтобы она умещалась на одной потребительской видеокарте и отвечала на запросы молниеносно.

Meta* использовала дистилляцию, чтобы Muse Glimmer поместилась на одну потребительскую видеокарту, а крошечная модель-компаньон ускоряет время ответа

Meta* только что выпустила Muse Glimmer – модель ИИ с открытыми весами на 30 миллиардов параметров, которая призвана конкурировать с такими моделями, как Google Gemma 4 и Alibaba Qwen 3.6.

Для тех, кто не в курсе: веса указывают модели, насколько важным считать то или иное понятие, и представляют всю широту базы знаний этой модели.

Muse Glimmer от Meta* отличается по двум основным причинам. Во-первых, чтобы запустить модель с 30 миллиардами параметров в полной точности (fp16), требуется около 60 ГБ (30×10⁹×2) памяти только для весов модели. Однако Meta* применила квантизацию – по сути, дистилляцию, когда более крупная модель (Muse Spark) обучает меньшую, передавая ей многие из своих возможностей, – чтобы сжать её и снизить требования к памяти для весов до 20 ГБ. Вместе с 2–4 ГБ, необходимыми для KV cache, этих требований достаточно, чтобы потребительская видеокарта на 24 ГБ или 32 ГБ легко запускала Muse Glimmer. По словам Meta*, такое сжатие модели через дистилляцию не оказывает заметного влияния на производительность.

Во-вторых, чтобы ускорить генерацию токенов (время ответа), Muse Glimmer использует крошечную модель-компаньон – так называемую модель-драфтер DFlash, – которая предсказывает целые фрагменты текста, позволяя Muse Glimmer затем проверить ответ за один раз, оставляя правильные текстовые ответы и отбрасывая ошибочные. Поскольку проверка ответа выполняется намного быстрее, чем его генерация, такая схема обеспечивает ускорение ответов в 3,1 раза на карте RTX 5090, в 1,8 раза на M5 Max и в 1,5 раза на M4 Max, согласно данным, опубликованным Meta*.

Разумеется, Muse Glimmer от Meta* не могла появиться в более подходящий момент для западного ландшафта моделей ИИ с открытыми весами. Ведь, по данным OpenRouter, китайские LLM недавно впервые пересекли отметку в 34,25 триллиона токенов в неделю, при этом DeepSeek V4 Flash показала ошеломляющий недельный рост на 570%.

Согласно последнему набору данных OpenRouter за неделю, начавшуюся 3 августа, глобальное использование моделей ИИ достигло 69 триллионов токенов, что на 21,48% больше по сравнению с предыдущей неделей. Китайские модели составили 34,25 триллиона от этого объёма, тогда как американские модели внесли всего 9,17 триллиона токенов. Примечательно, что это уже пятнадцатая неделя подряд, когда китайские модели лидируют в глобальном рейтинге.

Поэтому мы будем уделять особое внимание данным следующей недели, чтобы понять, оказывает ли Muse Glimmer от Meta* заметное влияние на неуклонный рост популярности китайских моделей ИИ с открытыми весами.

Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: