mirror of
https://github.com/mudler/LocalAI.git
synced 2026-08-04 12:22:22 -04:00
Compare commits
4 Commits
feat/vllm-
...
bot/issue-
| Author | SHA1 | Date | |
|---|---|---|---|
|
|
127a5780f2 | ||
|
|
7916c48f04 | ||
|
|
abb6e2b9d0 | ||
|
|
41d4251cd5 |
@@ -10,4 +10,11 @@ else
|
||||
source $backend_dir/../common/libbackend.sh
|
||||
fi
|
||||
|
||||
# CUDA 13 has no prebuilt FlashAttention wheel, so the fallback source build
|
||||
# exceeds the CI runner's memory when ninja compiles multiple units at once.
|
||||
if [ "x${BUILD_PROFILE}" = "xcublas13" ]; then
|
||||
export MAX_JOBS="${MAX_JOBS:-1}"
|
||||
export NVCC_THREADS="${NVCC_THREADS:-1}"
|
||||
fi
|
||||
|
||||
installRequirements
|
||||
|
||||
1
backend/python/qwen-tts/requirements-cublas13-after.txt
Normal file
1
backend/python/qwen-tts/requirements-cublas13-after.txt
Normal file
@@ -0,0 +1 @@
|
||||
flash-attn
|
||||
@@ -2,6 +2,15 @@
|
||||
set -e
|
||||
|
||||
backend_dir=$(dirname $0)
|
||||
|
||||
for cuda_version in 12 13; do
|
||||
grep -qx "flash-attn" "$backend_dir/requirements-cublas${cuda_version}-after.txt"
|
||||
done
|
||||
|
||||
grep -q 'BUILD_PROFILE.*cublas13' "$backend_dir/install.sh"
|
||||
grep -q 'MAX_JOBS.*1' "$backend_dir/install.sh"
|
||||
grep -q 'NVCC_THREADS.*1' "$backend_dir/install.sh"
|
||||
|
||||
if [ -d $backend_dir/common ]; then
|
||||
source $backend_dir/common/libbackend.sh
|
||||
else
|
||||
|
||||
Reference in New Issue
Block a user