The Question
The Setup
| Split | Examples |
|---|---|
| Training | 1,230 |
| Test | 300 |
Three Approaches
Training Details
| Parameter | Value |
|---|---|
| Learning Rate | 3e-4 |
| Batch Size | 4 |
| Epochs | 1 |
| Max Sequence Length | 2,048 tokens |
| Precision | bfloat16 |
| Optimizer | AdamW with cosine schedule |
| Warmup | Linear, first 10% of steps |
| Parameter | Value |
|---|---|
| Rank (r) | 16 (baseline); ablated over 8, 16, 32, 64 |
| Alpha | 32 |
| Dropout | 0.05 |
| Target Modules | q_proj, k_proj, v_proj, o_proj |
| Trainable Parameters | ~13.1M (0.19% of 7B) |
Results
| Configuration | Accuracy | F1 Macro |
|---|---|---|
| DeepSeek-Math-7B 0-shot | 12.0% | 0.299 |
| Qwen-2.5-Math-7B 0-shot | 12.3% | 0.254 |
| Qwen 1.5B Full Fine-Tune | 46.7% | 0.483 |
| DeepSeek-Math-7B LoRA r=16 | 43.0% | 0.510 |
| Qwen-2.5-Math-7B IA3 | 12.0% | 0.286 |
| Qwen-2.5-Math-7B LoRA r=8 | 48.7% | 0.489 |
| Qwen-2.5-Math-7B LoRA r=16 | 51.7% | 0.525 |
| Qwen-2.5-Math-7B LoRA r=32 | 49.7% | 0.518 |
| Qwen-2.5-Math-7B LoRA r=64 | 46.7% | 0.507 |
What Surprised Us
Rank Ablation
| Rank (r) | Trainable Params | Accuracy | F1 Macro |
|---|---|---|---|
| 8 | ~6.6M | 48.7% | 0.489 |
| 16 | ~13.1M | 51.7% | 0.525 |
| 32 | ~26.2M | 49.7% | 0.518 |
| 64 | ~52.4M | 46.7% | 0.507 |