Qwen3, T4 и разные фреймворки
Ещё немного знаний о запуске моделей на картах T4.
При этом, если вы используете фреймворк vllm и получаете ошибку «Unsupported conversion from f16 to f16», то вероятно у вас установлена библиотека triton с багом. Надо её либо обновить до последней версии, либо сдаунгрейдить до 3.2.0. Первое нам не помогло, а вот даунгрейд выручил.
Не проблема, давайте запустим не на всех картах, а скажем на пяти, 80 гигабайт же должно хватить,
Соответственно, мы можем запустить
Поэтому чтобы уместить на этих картах
И последнее. Это слабо связано с предыдущим,
cmake -S llama.cpp -B llama.cpp/build \
-DCMAKE_CUDA_ARCHITECTURES=75 \
-DCMAKE_CUDA_FLAGS="-fPIC" \
-DCMAKE_CXX_STANDARD=17 \
-DCMAKE_CXX_STANDARD_LIBRARIES="-lstdc++fs" \
-DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DLLAMA_CURL=ON
cmake --build llama.cpp/build --config Release -j --clean-first \
--target llama-cli llama-gguf-split llama-serverДобавлено позже: проблема тут в том, что GCC до версии 10 не содержит std::filesystem в стандартной библиотеке, её можно подключить снаружи, но надо, чтобы она попала в конец линковки.