# https://huggingface.co/GianniDPC/Qwen3.6-27B-IQ4_XS-pure-with-MTP-GGUF
# max context:	70k with n=2, 56k with n=3 speed 44.34, 37k with q8 n=4, speed 43.70 t/s
# Mid way: with n=2 and q8 it gives 43 ts, can hardly do more.
# ctx patched: 78592, unpatched: 68352

# 2. Run the Server
llama-server  --device vulkan0  -m gianni/qwen3.6-27b-IQ4_XS-pure-with-MTP-IQ4.gguf \
	--host 0.0.0.0  -fa on --load-mode none --jinja --no-log-timestamps \
	-ctk q5_1 -ctv q5_1 \
	--temp 0.5 --top-k 20 --top-p 0.95 --min-p 0.0 \
	--presence-penalty 0.0 --repeat-penalty 1.0 \
	-b 1024 -ub 128 --fit-target 60 \
	--pipeline-parallel off \
        --spec-type draft-mtp,ngram-mod --spec-draft-p-min 0.82 --spec-draft-n-max 2 \
        --cache-type-k-draft q4_0 --cache-type-v-draft q4_0 \
        --spec-ngram-mod-n-match 24 --spec-ngram-mod-n-min 8 --spec-ngram-mod-n-max 32 \
	--reasoning on --chat-template-kwargs '{"preserve_thinking":true}' --reasoning-budget 6096 --reasoning-budget-message " -- Reasoning budget exceeded, proceed to final answer." \
	--ctx-checkpoints 128 --cache-ram 6000 -np 1 -ngl 99 -lv 4 --no-warmup \


