LLM/Intel Pro Arc B70/2026-07-13: Difference between revisions

From Fundamental Ramen
Jump to navigation Jump to search
Line 89: Line 89:


./llama-server \
./llama-server \
   -m gemma-4-31b-q4_k_m.gguf \
   -hf google/gemma-4-31B-it-qat-q4_0-gguf \
   -md gemma-4-2b-q4_k_m.gguf \
   -hfd google/gemma-4-E2B-it-qat-q4_0-gguf \
   -c 65535 \
   -c 65535 \
   -ngl 99 \
   -ngl 99 \
   --draft-num-tokens 16 \
   --spec-draft-n-max 16 \
   --flash-attn \
   --flash-attn on \
   --no-mmap \
   --no-mmap \
   --host 0.0.0.0 \
   --host 0.0.0.0 \
Line 100: Line 100:


./llama-server \
./llama-server \
   -m gemma-4-31b-q4_k_m.gguf \
   -hf google/gemma-4-31B-it-qat-q4_0-gguf \
  -md gemma-4-2b-q4_k_m.gguf \
   -c 65535 \
   -c 65535 \
   -ngl 99 \
   -ngl 99 \
   --draft-num-tokens 16 \
   --flash-attn on \
   --flash-attn \
  --host 0.0.0.0 \
  --port 9031
 
./llama-server \
  -hf google/google/gemma-4-12B-it-qat-q4_0-gguf \
  -hfd google/gemma-4-E2B-it-qat-q4_0-gguf \
  -c 65535 \
  -ngl 99 \
  --spec-draft-n-max 16 \
   --flash-attn on \
   --no-mmap \
   --no-mmap \
   --host 0.0.0.0 \
   --host 0.0.0.0 \
   --port 9031
   --port 9012
 
./llama-server \
  -hf google/google/gemma-4-12B-it-qat-q4_0-gguf \
  -c 65535 \
  -ngl 99 \
  --flash-attn on \
  --host 0.0.0.0 \
  --port 9012
</syntaxhighlight>
</syntaxhighlight>



Revision as of 09:10, 13 July 2026

Install on Ubuntu 26.04

sudo apt update
sudo apt install -y openssh-server curl screen

Install driver

# install ppa (the most important)
sudo add-apt-repository -y ppa:kobuk-team/intel-graphics
sudo apt update
sudo apt install -y intel-opencl-icd libze-intel-gpu1 intel-media-va-driver-non-free clinfo intel-gsc

# check again
sudo clinfo

Install OpenVINO archive

sudo mkdir /opt/intel
curl -L https://storage.openvinotoolkit.org/repositories/openvino/packages/2026.2.1/linux/openvino_toolkit_ubuntu24_2026.2.1.21919.ede283a88e3_x86_64.tgz --output openvino_2026.2.1.tgz
tar -xf openvino_2026.2.1.tgz
sudo mv openvino_toolkit_ubuntu24_2026.2.1.21919.ede283a88e3_x86_64 /opt/intel/openvino_2026.2.1
cd /opt/intel/openvino_2026.2.1
sudo -E ./install_dependencies/install_openvino_dependencies.sh

Apply OpenVINO environment for user

nano ./bashrc
# Setup LD Path
source /opt/intel/openvino_2026/setupvars.sh
# Use GPU first when running llama-cli, llama-server, ...
GGML_OPENVINO_DEVICE=GPU

Install llama.cpp + OpenVINO

See: https://github.com/ggml-org/llama.cpp/blob/master/docs/backend/OPENVINO.md#supported-devices

sudo apt install git libssl-dev
mkdir -p ~/llama.cpp/src
git clone https://github.com/ggerganov/llama.cpp ~/llama.cpp/src
cd ~/llama.cpp/src
sudo apt-get install -y opencl-c-headers ocl-icd-opencl-dev

cmake -B build-openvino \
  -DGGML_OPENVINO=ON \
  -DGGML_OPENVINO_DEVICE=GPU \
  -DCMAKE_BUILD_TYPE=Release \
  -DCMAKE_INSTALL_RPATH="\$ORIGIN/../lib" .

cmake --build build-openvino --parallel

cmake --install build-openvino --prefix ~/llama.cpp/openvino

Install llama.cpp + SYCL

sudo apt update
sudo apt install -y wget gnupg ca-certificates

# 建立存放密鑰的資料夾
sudo mkdir -m 0755 -p /etc/apt/keyrings

# 下載 Intel SW Products 公鑰並轉換為 GPG 格式
wget -O- https://apt.repos.intel.com/intel-gpg-keys/GPG-PUB-KEY-INTEL-SW-PRODUCTS.PUB \
| gpg --dearmor | sudo tee /etc/apt/keyrings/oneapi-archive-keyring.gpg > /dev/null

echo "deb [signed-by=/etc/apt/keyrings/oneapi-archive-keyring.gpg] https://apt.repos.intel.com/oneapi all main" \
| sudo tee /etc/apt/sources.list.d/oneAPI.list

sudo apt update
sudo apt install -y intel-oneapi-mkl-devel intel-oneapi-compiler-dpcpp-cpp
source /opt/intel/oneapi/setvars.sh

# ...

cmake --install build-sycl --prefix ~/llama.cpp/sycl

./llama-server \
  -hf google/gemma-4-31B-it-qat-q4_0-gguf \
  -hfd google/gemma-4-E2B-it-qat-q4_0-gguf \
  -c 65535 \
  -ngl 99 \
  --spec-draft-n-max 16 \
  --flash-attn on \
  --no-mmap \
  --host 0.0.0.0 \
  --port 9031

./llama-server \
  -hf google/gemma-4-31B-it-qat-q4_0-gguf \
  -c 65535 \
  -ngl 99 \
  --flash-attn on \
  --host 0.0.0.0 \
  --port 9031

./llama-server \
  -hf google/google/gemma-4-12B-it-qat-q4_0-gguf \
  -hfd google/gemma-4-E2B-it-qat-q4_0-gguf \
  -c 65535 \
  -ngl 99 \
  --spec-draft-n-max 16 \
  --flash-attn on \
  --no-mmap \
  --host 0.0.0.0 \
  --port 9012

./llama-server \
  -hf google/google/gemma-4-12B-it-qat-q4_0-gguf \
  -c 65535 \
  -ngl 99 \
  --flash-attn on \
  --host 0.0.0.0 \
  --port 9012

Install OVMS

Install vLLM + OpenVINO