Qwen2.5-3B Training Dashboard

TRAINING IN PROGRESS
📦
Data Prep
37 facts → ~296 samples
🔥
SFT Training
3 epochs, LoRA r=16
🔗
Merge
LoRA → Full model
DPO Training
1 epoch, beta=0.3
📊
Evaluation
Factual + Traps

🚀 Current: Attempt #7

Kernelsergejdrug/qwen-v2-attempt7
Accountsergejdrug (new)
StatusRUNNING
GPUT4 16GB
Started2026-02-28 ~21:10 UTC
PipelineSFT→Merge→DPO→Eval

⚙️ Configuration

ModelQwen2.5-3B-Instruct
Knowledge Base37 facts (A2A SaaS)
SFT3 ep, LoRA r=16 α=32, LR 2e-4
NEFTune / Smoothα=5.0 / 0.05
DPO1 ep, LoRA r=8, β=0.3, LR 5e-7
Quantization4-bit NF4 + double quant

🏆 Best Results (Attempt #6)

Factual Accuracy (SFT)46.7%
Factual Accuracy (DPO)46.7%
Trap Pass Rate100%
Hallucination Marker0%

📜 Training History

#AccountChangesFactualTrapsStatus
7sergejdrugSame pipeline, new accountRUN
6myvisaginasv2 SFT→Merge→DPO46.7%100%OK
5myvisaginasFP32 merge40%100%OK
4myvisaginasFirst DPO33%80%OK
3myvisaginasSFT + 37 KB30%60%OK
2myvisaginasSFT baseline20%60%OK
1myvisaginasInitial test13%40%OK

📈 Factual Accuracy Progress

#1
13%
#2
20%
#3
30%
#4
33%
#5
40%
#6
46.7%
#7
...

🏗️ Architecture

Stage 1: SFT

QLoRA 4-bit NF4
LoRA r=16 α=32
NEFTune α=5.0
All linear targets

Stage 2: Merge

FP16 merge on CPU
LoRA → Full model
~6GB merged weights

Stage 3: DPO

On merged model
LoRA r=8 attn-only
β=0.3 sigmoid