| Model | Qwen2.5-3B-Instruct |
| Knowledge Base | 37 facts (A2A SaaS) |
| SFT | 3 ep, LoRA r=16 α=32, LR 2e-4 |
| NEFTune / Smooth | α=5.0 / 0.05 |
| DPO | 1 ep, LoRA r=8, β=0.3, LR 5e-7 |
| Quantization | 4-bit NF4 + double quant |
QLoRA 4-bit NF4
LoRA r=16 α=32
NEFTune α=5.0
All linear targets
FP16 merge on CPU
LoRA → Full model
~6GB merged weights
On merged model
LoRA r=8 attn-only
β=0.3 sigmoid