Сжатие моделей: новый подход к квантованию больших языковых сетей

Автор: Денис Аветисян


В статье представлен метод KRONQ, позволяющий существенно повысить эффективность сжатия больших языковых моделей без значительной потери производительности.

🚀 Квантовые новости

Подключайся к потоку квантовых мемов, теорий и откровений из параллельной вселенной.
Только сингулярные инсайты — никакой скуки.

Присоединиться к каналу

Квантование с использованием кофакторизованного гессиана и учётом ковариации градиентов для оптимизации точности и снижения требований к памяти.

Посттренировочная квантизация (PTQ) широко используется для сжатия больших языковых моделей (LLM), однако существующие методы второго порядка, такие как GPTQ, часто пренебрегают вкладом выходных каналов в реконструкцию слоев. В настоящей работе представлена методика ‘KronQ: LLM Quantization via Kronecker-Factored Hessian’ — новый PTQ-подход, использующий ковариацию градиентов для более точной квантизации. Ключевым нововведением KronQ является учёт как активационных, так и градиентных ковариаций посредством двунаправленной обработки некогерентности и новой метрики чувствительности для смешанной точности между слоями. Эксперименты на LLaMA-3-70B показали, что KronQ обеспечивает значительно более низкую перплексию (7.93) при 2-битной квантизации по сравнению с GPTQ и GPTAQ, которые демонстрируют расхождение или вырождение модели; возможно ли дальнейшее улучшение эффективности LLM за счёт оптимизации процедур квантизации на основе анализа гессиана?


Квантование как узкое место больших языковых моделей

Современные большие языковые модели демонстрируют впечатляющие возможности в обработке и генерации текста, однако их колоссальный размер становится серьезным препятствием для практического применения. Размер моделей обусловлен огромным количеством параметров, необходимых для достижения высокого уровня производительности, что приводит к значительным требованиям к вычислительным ресурсам и памяти. Это усложняет развертывание таких моделей на мобильных устройствах или в условиях ограниченной инфраструктуры, а также увеличивает энергопотребление и задержки при обработке запросов. Несмотря на потенциал этих технологий, их широкое распространение сдерживается необходимостью оптимизации размера без существенной потери качества работы.

Традиционные методы сжатия больших языковых моделей, такие как квантизация, зачастую приводят к заметному снижению производительности, что существенно ограничивает их практическое применение. Суть проблемы заключается в том, что уменьшение разрядности представления весов и активаций модели, необходимое для снижения объема памяти и ускорения вычислений, неизбежно влечет за собой потерю информации. Это приводит к ухудшению точности модели при решении различных задач, особенно в сценариях, требующих высокой степени детализации и чувствительности. В результате, несмотря на потенциальные преимущества в плане эффективности, квантизация может сделать модель непригодной для использования в реальных приложениях, где критически важна надежность и качество результатов. Поиск способов минимизировать эти потери и сохранить высокую производительность после квантизации является одной из ключевых задач в области оптимизации больших языковых моделей.

Точное представление весов и активаций модели с использованием меньшего количества бит является ключевым фактором для эффективного сжатия больших языковых моделей, однако стандартные методы квантизации сталкиваются с трудностями, обусловленными сложной геометрией так называемого «ландшафта потерь». Этот ландшафт характеризуется высокой кривизной, что означает, что незначительные изменения в представлении чисел могут приводить к существенным ошибкам в результатах работы модели. В отличие от плоских участков, где потеря точности при квантизации минимальна, на крутых склонах даже небольшая потеря информации может привести к значительному ухудшению производительности. Поэтому, для успешного сжатия больших языковых моделей, необходимы методы, способные адаптироваться к этой кривизне и минимизировать потери точности в областях с высокой чувствительностью к изменениям весов и активаций, что представляет собой серьезную научную задачу.

Использование информации о гессиане для эффективного квантования

Матрица Гессе предоставляет ключевую информацию об искривлении функции потерь, что позволяет оценить чувствительность модели к изменениям параметров. Однако, вычисление полной матрицы Гессе имеет вычислительную сложность O(n^2), где n — количество параметров модели, что делает её непрактичной для больших нейронных сетей. Каждый элемент матрицы Гессе требует вычисления второй производной функции потерь по соответствующим параметрам, что значительно увеличивает вычислительные затраты и потребление памяти. Поэтому, для практического применения в задачах оптимизации и квантизации, используются приближенные методы вычисления или оценки матрицы Гессе, позволяющие снизить вычислительную сложность без существенной потери информации о кривизне функции потерь.

Аппроксимация гессианской матрицы посредством методов, таких как аппроксимация на основе произведения Кронекера (Kronecker-Factored Hessian Approximation), представляет собой вычислительно эффективный способ анализа чувствительности модели. Полное вычисление гессиана — матрицы вторых частных производных функции потерь — требует значительных ресурсов и времени, особенно для больших нейронных сетей. Метод произведения Кронекера позволяет разложить гессиан на произведение меньших матриц, значительно снижая вычислительную сложность. Эта аппроксимация сохраняет информацию о кривизне поверхности потерь в окрестности текущей точки параметров, что необходимо для определения чувствительности различных параметров модели к изменениям и, как следствие, для эффективной квантизации без существенной потери точности. ≈

Ковариация градиентов предоставляет эффективную альтернативу прямому вычислению гессиана для анализа чувствительности модели к квантованию. Вместо построения полной матрицы Гессе, которая требует значительных вычислительных ресурсов, ковариация градиентов оценивается на основе статистики первых производных функции потерь по отношению к выходным данным модели. Эта статистика отражает степень изменения выхода модели при небольших изменениях входных данных и позволяет приблизительно оценить вторую производную (гессиан) для каждого выходного параметра. Использование ковариации градиентов значительно снижает вычислительную сложность процесса оценки чувствительности, делая возможным применение методов квантования с сохранением точности модели даже при ограниченных ресурсах.

Использование приближений гессиана, таких как оценка на основе ковариации градиентов, позволяет методам квантования более эффективно сохранять производительность модели при сжатии. Традиционные методы квантования могут приводить к значительной потере точности из-за неточного представления весов модели. Применение информации о кривизне функции потерь, полученной из приближенных гессианов, позволяет более точно определить чувствительность каждого веса к квантованию. Это, в свою очередь, позволяет применять дифференцированное квантование — то есть, использовать разную точность представления для разных весов, сохраняя критически важные для производительности, и снижая точность менее важных. Такой подход минимизирует потерю точности и позволяет достичь более высоких коэффициентов сжатия без существенного снижения качества модели.

Современные методы квантования: распределение точности и за её пределами

Интеллектуальное распределение точности между слоями (Inter-Layer Mixed-Precision Allocation) представляет собой метод оптимизации, при котором различным слоям нейронной сети назначаются разные разрядности (bit-widths). Этот подход позволяет добиться максимальной степени сжатия модели при минимизации потерь в производительности. Вместо применения единой разрядности ко всей модели, более чувствительные слои получают больше битов для представления весов, что сохраняет точность вычислений, в то время как менее критичные слои могут быть квантованы с использованием меньшей разрядности, обеспечивая значительное уменьшение размера модели и повышение эффективности вычислений. Применение таких стратегий позволяет существенно превзойти традиционные методы квантизации, использующие единую разрядность для всех слоев.

Методики, такие как SliM-LLM, используют метрики чувствительности для оптимизации распределения битовой точности между слоями нейронной сети в процессе квантизации. Эти метрики оценивают влияние изменения весов каждого слоя на общую производительность модели, позволяя более эффективно выделять большее количество бит наиболее чувствительным слоям и уменьшать их для менее важных. Такой подход позволяет добиться максимального сжатия модели при минимальных потерях точности по сравнению со стратегиями равномерного распределения битовой точности.

Метод KRONQ усовершенствует постобработанную квантизацию путем интеграции ковариации градиентов в процесс квантования. Применение KRONQ к модели LLaMA-3-70B позволило достичь значения перплексии 7.93 на наборе данных WikiText-2 при 2-битной квантизации весов. Это значительно превосходит результаты, полученные с использованием методов GPTQ и GPTAQ, которые либо расходились, либо демонстрировали перплексию, превышающую 2000.

Методы колоночной квантизации, такие как GPTQ и GPTAQ, совершенствуются для повышения эффективности сжатия моделей, однако значительно уступают по производительности KRONQ. Дальнейшие улучшения достигаются за счет техник QuaRot и SpinQuant, предназначенных для подавления ошибки квантизации. В частности, при использовании W2 групповой квантизации с размером группы g=128 на модели LLaMA-2-7B достигнута перплексия WikiText-2 в 7.61, что существенно превосходит результат GPTQ, где этот показатель составляет 274.0.

Влияние и перспективы эффективного развертывания LLM

Сочетание аппроксимации гессиана и передовых методов квантования открывает новые возможности для развертывания больших языковых моделей (LLM) на устройствах с ограниченными ресурсами. Традиционно, LLM требовали значительных вычислительных мощностей и памяти, что ограничивало их применение в мобильных устройствах или встроенных системах. Однако, используя приближенные вычисления гессиана для оптимизации модели и применяя методы квантования — снижения точности представления параметров — удается существенно уменьшить размер модели и требуемые ресурсы без критической потери производительности. Данный подход позволяет сократить потребление энергии, повысить скорость обработки данных и увеличить пропускную способность, делая LLM более доступными для широкого круга приложений и пользователей.

Сочетание методов приближения гессиана и продвинутой квантизации демонстрирует значительное снижение требований к ресурсам при развертывании больших языковых моделей. Исследования показали, что оптимизация размера модели и вычислительной нагрузки напрямую влияет на скорость работы и энергоэффективность. В частности, при тестировании моделей LLaMA-7B и LLaMA-13B удалось добиться улучшения скорости декодирования в 1.25 — 2.51 раза по сравнению с базовой реализацией bf16, а также снизить потребление пиковой видеопамяти (VRAM) в 3.5 — 7.5 раза при использовании квантизации W2 и W4. Эти результаты свидетельствуют о возможности эффективного использования больших языковых моделей даже на устройствах с ограниченными ресурсами, открывая новые перспективы для их широкого применения.

Повышение эффективности работы больших языковых моделей (LLM) открывает новые возможности для их широкого внедрения и демократизации доступа к технологиям искусственного интеллекта. Снижение требований к вычислительным ресурсам и памяти позволяет развертывать LLM не только на мощных серверах, но и на устройствах с ограниченными возможностями, таких как смартфоны, планшеты и периферийные вычислительные устройства. Это, в свою очередь, расширяет круг пользователей, которые могут воспользоваться преимуществами LLM, включая обработку естественного языка, машинный перевод и создание контента. Подобная доступность способствует развитию инноваций в различных областях, от образования и здравоохранения до финансов и развлечений, делая передовые технологии ИИ более инклюзивными и полезными для общества в целом.

Перспективные исследования в области развертывания больших языковых моделей (LLM) сосредоточены на разработке еще более эффективных приближений гессиана и адаптивных стратегий квантования. Ученые стремятся к созданию методов, позволяющих снизить вычислительную сложность и объем памяти, необходимые для работы LLM, без существенной потери точности. Особое внимание уделяется динамическому определению уровней квантования для различных частей модели, что позволяет оптимизировать соотношение между производительностью и энергоэффективностью. Предполагается, что дальнейшее совершенствование этих техник откроет возможности для развертывания сложных LLM на устройствах с ограниченными ресурсами, таких как мобильные телефоны и встроенные системы, и позволит значительно расширить спектр их применения.

Представленная работа демонстрирует глубокое понимание систем и их внутренней структуры. Исследование KRONQ, направленное на оптимизацию квантования больших языковых моделей, является ярким примером подхода, при котором для улучшения производительности используется анализ ковариации градиентов. Кен Томпсон однажды сказал: «Все проблемы в компьютерах возникают из-за людей.» Это наблюдение особенно актуально в контексте квантования, где умелое управление сложностью системы позволяет добиться значительных улучшений в эффективности, а значит, и в производительности. Подобно тому, как опытный инженер разбирает механизм, чтобы понять его принципы работы, авторы KRONQ используют анализ градиентов для более точного представления весов модели, что позволяет добиться более высокой точности при низких разрядностях.

Что дальше?

Представленный подход, использующий факторизацию гессиана через тензорное произведение Кронекера, демонстрирует потенциал углубленного анализа ковариации градиентов для повышения эффективности постобразовательной квантизации. Однако, за кажущимся успехом скрывается неизбежный вопрос: насколько глубоко можно “взломать” процесс обучения, используя лишь информацию о финальных градиентах? Неизвестно, является ли учёт ковариации конечной точкой оптимизации или лишь симптомом более фундаментальной неэффективности стандартных методов квантизации.

Очевидным направлением для дальнейших исследований представляется расширение принципов KRONQ на другие архитектуры нейронных сетей и задачи. Следует также изучить возможность адаптивной смешанной точности, где битовая глубина динамически подстраивается не только для отдельных слоёв, но и для отдельных весов внутри слоя — это потребовало бы более тонкого понимания “ландшафта потерь” и градиентной информации.

В конечном итоге, истинная ценность подобных методов заключается не столько в достижении максимального сжатия, сколько в раскрытии внутренних механизмов работы больших языковых моделей. Ведь безопасность системы строится на её прозрачности, а не на маскировке сложностей. И только понимание этих механизмов позволит создавать действительно надёжные и эффективные алгоритмы.


Оригинал статьи: https://arxiv.org/pdf/2607.07964.pdf

Связаться с автором: https://www.linkedin.com/in/avetisyan/

Смотрите также:

2026-07-12 23:51

Рекомендуем