Исследователи ByteDance Seed выявили периодическую уязвимость в языковых моделях, которые сжимают свой кэш ключ-значение (KV) фиксированными блоками. Эта особенность используется в модели DeepSeek-V4 для снижения затрат памяти и внимания при работе с длинными контекстами. В статье под названием “Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression”, опубликованной на arXiv 28 сентября, команда сообщает, что извлечение одной и той же информации может быть легким в одной позиции и трудным в другой, что скрывается средними показателями тестов. IT Home сообщил об этом исследовании 9 октября.
Сжатие блоками группирует последовательные токены в окна и сжимает каждое окно в меньшее количество записей кэша с фиксированным шагом. Это придает каждому токену новую координату, которую авторы называют фазой: его положение относительно границ окна. Сдвиг входных данных на несколько токенов может изменить, какие токены сжимаются вместе, не изменяя их содержания.
Команда протестировала базовые и дообученные версии DeepSeek-V4-Flash и DeepSeek-V4-Pro, а также дообученную DeepSeek-V4.1-Flash, на задаче извлечения “иголки в стоге сена” при 128 тыс. токенов, сохраняя длину подсказки и абсолютную позицию постоянными. Точность в базовых контрольных точках различалась до 40,2 процентных пункта в зависимости от фазы цели. Дообучение повысило точность и сократило разрывы, но для моделей V4 они остались большими. DeepSeek-V4.1-Flash, использующая шаг два вместо четырех, показала наименьший разрыв, хотя периодический паттерн сохранился.
Чтобы проверить причину, исследователи предварительно обучили семейство небольших трансформеров с нуля на основе Qwen3-0.6B, изменив только дизайн сжатия KV. Каждый сжатый вариант демонстрировал периодичность, соответствующую его шагу, включая тот, который просто усредняет токены в каждом окне, в то время как базовые модели с полным вниманием этого не делали. Вмешательства в головы внимания указывают на то, что авторы называют фазовой специализацией, когда различные компоненты обрабатывают информацию в разных фазах. Они отмечают, что эти механистические выводы наиболее сильны в контролируемых условиях и не устанавливают универсальную причину в больших моделях.
Практический аспект касается оценки, а не какой-либо отдельной модели. В статье утверждается, что модели, использующие блочное сжатие KV, должны измеряться по фазам, например, путем сдвига входных данных на несколько токенов при сохранении запрошенной информации неизменной, поскольку высокая средняя точность может сосуществовать с систематическими позиционными сбоями.
Все восемь авторов указывают ByteDance Seed в качестве места работы. Трое также указывают Принстонский университет, Стэнфордский университет или Калифорнийский университет в Беркли, и в статье говорится, что основные авторы выполнили работу во время стажировок в ByteDance Seed. Ответственными авторами являются Ииюань Ма и Синь Дун.
СМОТРИТЕ ТАКЖЕ:DeepSeek-V4.1-Flash представляет каузальный энкодер-декодер MoE с контекстом 1М и экстремальным сжатием KV · Xiaomi подробно описывает HySparse2 для MiMo-V3: двух уровневое разделение KV сокращает FLOPs префиксации 1М токенов примерно в 5 раз по сравнению с гибридным SWA
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




