RTX 4080 хватало для AAA-игр, но не для «LLM»: моддер добавил Tesla V100 за бесценок и запустил 27B AI-модели.

Tesla V100 моддинг Llm Vram Qwen ии wccftech.com

Моддер успешно интегрировал NVIDIA Tesla V100 в игровой ПК, добавив 32 ГБ видеопамяти для запуска больших языковых моделей. Несмотря на шум и сложности с адаптером, система запускает Qwen 3.6 со скоростью 32 токена/с. Узнайте, как повторить этот дешёвый апгрейд для ИИ-задач.

Запуск более качественных моделей ИИ означает, что ваш существующий GPU должен быть оснащён большим объёмом VRAM, чтобы сделать работу комфортной. Для владельца RTX 4080 играть в самые визуально требовательные и графически насыщенные игры может быть проще простого, но для запуска LLM это геркулесова задача. Желая добиться обоих достижений в одном игровом ПК, моддер успешно запустил NVIDIA Tesla V100 в своей системе, но столкнулся с рядом трудностей.

Добавление Tesla V100 даёт моддеру 32 ГБ полезной VRAM, достаточной для запуска значительно улучшенных моделей ИИ, таких как Qwen 3.6, со скоростью 32 токена в секунду

Прежде чем вы спросите: прикрепить Tesla V100 к материнской плате настольного ПК как «подключи и работай» невозможно — Тимскару пришлось приобрести адаптер SXM2-to-PCIe. Поиск GPU с 16 ГБ памяти HBM2 и аксессуара обошёлся ему в £200, что составляет примерно $266. На eBay их можно найти всего за $100 за штуку. Благодаря 5120 ядрам CUDA и 4096-битной шине, обеспечивающей пропускную способность 900 ГБ/с, в этом GPU ещё остались вычислительные возможности.

RTX 4080 хватало для AAA-игр, но не для «LLM»: моддер добавил Tesla V100 за бесценок и запустил 27B AI-модели.

Успешно найти адаптер SXM2-to-PCIe было не самой сложной задачей, но и не простой, особенно когда позже выясняется, что у Tesla V100 нет слота PCIe, видеовыходов или разъёмов питания PCIe. Как видно на изображении ниже, крепление GPU к кулеру паровой камеры может быть вполне приемлемо для тех, кого не беспокоит чрезмерный шум, но при 82 дБ это заставит любого чувствовать себя некомфортно.

RTX 4080 хватало для AAA-игр, но не для «LLM»: моддер добавил Tesla V100 за бесценок и запустил 27B AI-модели.
Как V100 был установлен в материнскую плату настольного ПК / Автор изображения — Тимскар

Немного доработав систему для снижения шума вентилятора с помощью батарейки на 9 В и перемычки PWM, модифицированный кулер V100 теперь работал на 10% от исходной максимальной скорости вращения. Решив эту проблему, моддер успешно нашёл способ получить 32 ГБ полезной VRAM в своей системе. Ни одной игре никогда не потребуется целых 32 ГБ видеопамяти, если только вы не решите запустить новую игру в разрешении 16K, так что лучше всего будет запустить Qwen3.6 27B.

RTX 4080 хватало для AAA-игр, но не для «LLM»: моддер добавил Tesla V100 за бесценок и запустил 27B AI-модели.
Уровень шума был безумным

Моддер запускал Qwen3.6-27B-MTP с квантизацией Q5_K_M, что составляет 19 ГБ, и при размере контекста 128K токенов было достаточно VRAM для работы LLM со скоростью 32 токена в секунду. Обработка промпта составляла от 133 до 160 токенов в секунду, что является достойной производительностью, если вам попались GPU для ИИ предыдущего поколения для домашних вычислений. Самое приятное: менее чем за $300 вы можете запускать свои собственные небольшие и средние модели ИИ дома, бесплатно и без подключения к интернету.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: