Агент Xiaowei в WeChat работает на WeLM — разреженной MoE-модели, которая незаметно разрослась до 617 миллиардов параметров

Wechat Xiaowei Welm Ai-ассистент Moe Hidden Decoding pandaily.com

WeChat запустил серое тестирование Xiaowei — встроенного AI-ассистента на базе WeLM. Узнайте, как разреженная архитектура MoE и метод Hidden Decoding меняют подход к масштабированию, экономя вычислительные ресурсы для миллиардов пользователей.

WeChat начал серое тестирование Xiaowei — встроенного AI-ассистента, интегрированного непосредственно в приложение, в отличие от отдельных AI-приложений, таких как Yuanbao. Пользователи попадают в него через точку входа в левом верхнем углу главного экрана WeChat и могут сообщить Xiaowei в текстовом или голосовом формате, что им нужно, после чего ассистент обращается к функциям и сервисам WeChat для выполнения задач. Это скорее не чат-бот, а потребительский агент, встроенный в экосистему WeChat.

За Xiaowei стоит имя, которое большинство пользователей никогда не слышали: WeLM — большая языковая модель, разрабатываемая годами командой AI WeChat. Это имя не ново. В 2022 году команда AI WeChat опубликовала WeLM — тогда это была китайская предобученная языковая модель с 10 миллиардами параметров, которая показала высокую производительность в 18 китайских задачах, соответствуя или превосходя гораздо более крупные модели на некоторых тестах. WeLM, лежащая в основе Xiaowei сегодня, прошла несколько раундов обновлений.

Команда перевела WeLM на разреженную архитектуру смеси экспертов. WeLM-80B имеет 80 миллиардов общих параметров, но активирует только около 3 миллиардов на токен, обучаясь на менее чем 14 триллионах токенов, с возможностями рассуждения, многоязычного понимания и контекстным окном в 128K. Для продукта с масштабом пользовательской базы WeChat, обрабатывающего огромные объемы запросов ежедневно, это важно: WeChat не нуждается в большой модели, используемой время от времени, а в AI-инфраструктуре, к которой сотни миллионов, даже миллиарды пользователей обращаются с высокой частотой. Каждая сэкономленная единица вычислений на ответ превращается в огромную разницу в стоимости инфраструктуры.

Команда не остановилась на 80 миллиардах. Появилась версия WeLM-617B с 617 миллиардами общих параметров и 23 миллиардами активируемых на токен, также на архитектуре MoE. Вместо простого наращивания параметров команда WeChat исследует другой метод масштабирования под названием Hidden Decoding. Традиционное масштабирование делает модель больше или позволяет ей дольше думать перед ответом. Hidden Decoding оставляет тело модели примерно неизменным, но выполняет больше вычислений на токен внутри, расширяя токен на несколько потоков вдоль размерности последовательности, чтобы модель могла использовать дополнительные скрытые вычисления для более глубоких рассуждений без добавления слоев Transformer или увеличения ширины.

Для контроля вычислительных затрат команда разработала Stream-Factorized Attention, снижая сложность внимания с квадратичной до почти линейной по мере увеличения числа потоков. Это пути, подходящие для огромной пользовательской базы WeChat. Xiaowei плюс WeLM предполагают, что WeChat, возможно, вообще не нужно создавать еще одно супер AI-приложение: он может превратить AI непосредственно в операционный слой самого WeChat.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: