Энтузиаст добавил в игровой ПК Nvidia Tesla V100 за $266, которая шумит как газонокосилка

Llm Tesla V100 видеопамять Gpu апгрейд локальный ии tomshardware.com

Удвойте видеопамять для локальных LLM: энтузиаст переделал шумный Tesla V100 SXM2 с 16 ГБ в 32 ГБ за $266. Узнайте, как адаптировать корпоративный GPU, приручить кулер и запустить модель на 27 млрд параметров быстрее облака.

Энтузиаст вычислительной техники перепрофилировал очень шумный и во многом устаревший корпоративный графический процессор (с большим объемом видеопамяти) для задач локального вывода LLM. Теперь он пользуется системой, которая удвоила общий объем видеопамяти до 32 ГБ, потратив всего 266 долларов (200 фунтов стерлингов). Это отличный результат, особенно в разгар RAMpocalypse.
Оскар Молнар объясняет, что для этого проекта по расширению видеопамяти для тяжелых локальных LLM были приобретены дешевый Tesla V100 SXM2 с 16 ГБ HBM2, адаптер SXM2-to-PCIe и модуль PWM для кулера, шумящего как газонокосилка. Действительно, сейчас эти GPU выглядят дешево: я вижу их в продаже на eBay US по цене менее 140 долларов за штуку, если вас не смущает покупка из Китая.
Как упоминалось выше, вы не можете просто взять одну из этих карт Tesla V100 SXM2 с большим объемом видеопамяти и подключить ее к своему ПК. Молнар говорит, что потратил около 66 долларов на адаптер SXM2-to-PCIe, также купленный на eBay.
Можно было бы подумать, что этого достаточно. Однако энтузиаст ПК и локальных LLM был ошеломлен шумом «вентилятора из ада», который шел в комплекте с Tesla V100 SXM2. Этот визжащий кулер выдавал 82 дБ шума. Молнар описал его как «нечто среднее между измельчителем отходов и газонокосилкой». Возможно, это самая сложная доработка, но, по сути, нужно было просто переподключить провода существующего вентилятора к разъему PWM на материнской плате. Также можно просто купить «переходник male 2.54mm на female PH2.0» для этой задачи. По-видимому, вентилятору достаточно работать на 10%, чтобы удерживать Tesla V100 ниже 50°C при полной нагрузке.
После установки и настройки всего оборудования в распоряжении Молнара оказалась система с 32 ГБ видеопамяти — это ПК с RTX 4080: 16 ГБ видеопамяти, архитектура Ada и Tesla V100: 16 ГБ видеопамяти, архитектура Volta. Он отмечает, что можно найти Tesla V100 с 32 ГБ видеопамяти, но они стоят вдвое дороже.
По словам самодельщика, заставить систему использовать эти 32 ГБ общей видеопамяти для LLM было несложно. Он использовал NixOS с устаревшим драйвером Nvidia, который поддерживал обе архитектуры — Volta и Ada. При тестировании локальной LLM он запустил модель с 27 миллиардами параметров со скоростью 32 токена в секунду, что, по его словам, «достаточно быстро для интерактивного использования» и быстрее, чем большинство облачных API-альтернатив.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: