Запуск более качественных моделей ИИ означает, что ваш существующий GPU должен быть оснащён большим объёмом VRAM, чтобы сделать работу комфортной. Для владельца RTX 4080 играть в самые визуально требовательные и графически насыщенные игры может быть проще простого, но для запуска LLM это геркулесова задача. Желая добиться обоих достижений в одном игровом ПК, моддер успешно запустил NVIDIA Tesla V100 в своей системе, но столкнулся с рядом трудностей.
Добавление Tesla V100 даёт моддеру 32 ГБ полезной VRAM, достаточной для запуска значительно улучшенных моделей ИИ, таких как Qwen 3.6, со скоростью 32 токена в секунду
Прежде чем вы спросите: прикрепить Tesla V100 к материнской плате настольного ПК как «подключи и работай» невозможно — Тимскару пришлось приобрести адаптер SXM2-to-PCIe. Поиск GPU с 16 ГБ памяти HBM2 и аксессуара обошёлся ему в £200, что составляет примерно $266. На eBay их можно найти всего за $100 за штуку. Благодаря 5120 ядрам CUDA и 4096-битной шине, обеспечивающей пропускную способность 900 ГБ/с, в этом GPU ещё остались вычислительные возможности.

Успешно найти адаптер SXM2-to-PCIe было не самой сложной задачей, но и не простой, особенно когда позже выясняется, что у Tesla V100 нет слота PCIe, видеовыходов или разъёмов питания PCIe. Как видно на изображении ниже, крепление GPU к кулеру паровой камеры может быть вполне приемлемо для тех, кого не беспокоит чрезмерный шум, но при 82 дБ это заставит любого чувствовать себя некомфортно.

Немного доработав систему для снижения шума вентилятора с помощью батарейки на 9 В и перемычки PWM, модифицированный кулер V100 теперь работал на 10% от исходной максимальной скорости вращения. Решив эту проблему, моддер успешно нашёл способ получить 32 ГБ полезной VRAM в своей системе. Ни одной игре никогда не потребуется целых 32 ГБ видеопамяти, если только вы не решите запустить новую игру в разрешении 16K, так что лучше всего будет запустить Qwen3.6 27B.

Моддер запускал Qwen3.6-27B-MTP с квантизацией Q5_K_M, что составляет 19 ГБ, и при размере контекста 128K токенов было достаточно VRAM для работы LLM со скоростью 32 токена в секунду. Обработка промпта составляла от 133 до 160 токенов в секунду, что является достойной производительностью, если вам попались GPU для ИИ предыдущего поколения для домашних вычислений. Самое приятное: менее чем за $300 вы можете запускать свои собственные небольшие и средние модели ИИ дома, бесплатно и без подключения к интернету.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Omar Sohail




