Я сходил в отпуск, но ребята в офисе не прекращали тестировать нейросетки для локального программирования. Мы уже смотрели на сети, которые запускаются на одной и двух картах Nvidia H100, и приступили к тестированию конфигурации из четырёх H200.
Я не помню, рассказывал ли я, для чего вообще мы рассматриваем конфигурации больше чем с одним графическим ускорителем. Ответ простой — большие сети занимают очень много памяти и в память одного ускорителя не помещаются. Современные фреймворки разбивают сети на части, загружают их в память нескольких ускорителей, а данные между ними гоняют по быстрой шине, соединяющей ускорители между собой. В случае карт Nvidia это шина NVlink.
К слову, мы пробовали соединение через центральную шину — с точки зрения производительности это печально, пользоваться невозможно.
В общем, мы потестировали несколько больших моделей, работающих в этой конфигурации и спустя две недели рейтинг уже сложился:
- DeepSeek-V4-Flash
- zai-org/GLM-4.5-Air-FP8
- Qwen3-Coder-480B-A35B-Instruct-FP8
Можно попробовать ещё ГЛМ поновее и КИМИ, но они обе будут с сильными квантированием, поэтому есть сомнения, что они смогут побить победителя. «Квен» что-то расстроил, я ожидал, что он будет лучше всех, а он на тестах занял последнее место.
а методику тестирования распишешь? а то есть Н возможностей улучшить показатели. Приходи в личку — некоторые способы подскажу
Есть ряд задач, где модели надо добиться результата, плюс ребята пытаются решать джуновские задачи с помощью выбранной модели и оценивают субъективно, так же как обычных программистов.
Тут, в общем-то, без сюрпризов, есть рейтинги типовых задач, наши «ощущения» с ними совпадают. Так что я не вполне понимаю что тут улучшать.
В личку напишу.
https://www.dns-shop.ru/product/9b42d21c1c25d9cb/videokarta-nvidia-h200-nvl-900-21010-0040-000/
Видеокарта NVIDIA H200 NVL
4 миллиона рублей * 4 карты = 16 миллионов рублей
Что-то на очень богатом...
1600 месяцев или 133 года подписки на Клод Макс
Как оно окупается?
Так это же не в личное пользование, а на компанию. Для локального программирования. Это всё равно как сравнить стоимость всех дисков и СХД в компании с облачным хранением. Ну и любая подписка исчерпывается, а локальная модель — нет.
А оно в состоянии выдержать одновременный набег, допустим, 10 разрабов?
Да, конечно.
А как насчет cutoff (актуальности знаний модели)? Тот же Клод подписочный всегда находится на острие атаки, а эта супердорогая игрушка будет оперировать знаниями 2024-года, и с новыми версиями фреймворков галлюционировать нещадно?
Все сети галлюцинируют, поэтому они должны изучать с чем имеют дело, а не «вспоминать». Ну и новые сети постоянно выходят же.