# Model: https://huggingface.co/bartowski/bottlecapai_ThinkingCap-Qwen3.6-27B-GGUF?show_file_info=bottlecapai_ThinkingCap-Qwen3.6-27B-Q6_K_L.gguf
#+----------------+-----------+-------------------+-----------+
#| ctx size       | draft max | eval t/s          | time ms   |
#+----------------+-----------+-------------------+-----------+
#| 149504 q8_0    | 3         | 31.89 t/s         | 269329    |
#+----------------+-----------+-------------------+-----------+
# ROCm max speed: 30.29 tokens per second with draft acceptance = 0.98186
# Ctx: 149248 fp16 MTP KV, 149504 q4_0 Sol vec, mainstream unpatched: 64256
#

# 2. Run the Server
/home/eaman/llama/bin_vulkan/llama-server  -m ThinkingCap-Qwen3.6-27B-Q6_K_L.ggu.gguf \
	--host 0.0.0.0 -fa on --load-mode none --jinja --no-log-timestamps \
	-b 1024 -ub 384 \
	--fit-target 20 \
	-ctk q8_0 -ctv q5_1 \
	--temp 0.5  --top-k 20 --top-p 0.95 --min-p 0.0 \
	--presence-penalty 0.0 --repeat-penalty 1.0 \
	--spec-type draft-mtp,ngram-mod --spec-draft-p-min 0.85 --spec-draft-n-max 3 \
	--pipeline-parallel off --cache-type-k-draft f16 --cache-type-v-draft f16 \
	--spec-ngram-mod-n-match 24 --spec-ngram-mod-n-min 8 --spec-ngram-mod-n-max 32 \
	--reasoning on --reasoning-preserve --reasoning-budget 6096 --reasoning-budget-message " -- Reasoning budget exceeded, proceed to final answer." \
	--ctx-checkpoints 148 --no-mmproj-offload --cache-ram 8000 -np 1 -ngl 99 -lv 3 --no-warmup  --timeout 900 \
	--device rocm0,rocm1 --split-mode layer --tensor-split 0.6,0.4 
