Apostate Run Report
Summary
| Metric |
Value |
| Base model |
Qwen/Qwen3-8B |
| Profile |
balanced |
| Output |
/var/home/Heterodoxin/ablate_work/qwen3-8b-apostate |
| Layers |
36 |
| Hidden size |
4096 |
| Direction layer |
29 |
| Refusal rank |
3 |
| Max refusal rank |
3 |
| Multi refusal |
True |
| Multi clusters |
6 |
| Multi min coverage |
0.05 |
| Baseline refusal (n=24) |
91.7% |
| Edited refusal |
22.9% |
| Refusal metric |
classifier + weak guard |
| Harmless KL |
0.120 |
| Target refusal |
5.0% |
| KL target |
0.040 |
| KL budget |
0.120 |
| KL positions |
8 |
| KL layer trims |
0 |
| Repair steps |
1 |
| Preserve rank |
8 |
| Preserve source |
harmless |
| Capability penalty |
True |
| Elapsed |
23363.0 sec |
Command
Best Parameters
| Parameter |
Value |
| direction_source |
activations |
| direction_layer_frac |
0.8078 |
| refusal_rank |
2 |
| strength |
1.3186 |
| band_center |
0.6036 |
| band_width |
0.5014 |
| causal_mix |
0.0392 |
| causal_power |
1.5656 |
| direction_sign |
1.0 |
| ablate_embed |
True |
| embed_scale |
0.0332 |
| ablate_head |
True |
| head_scale |
0.016 |
| head_alpha |
1.108 |
Best Trial
| Metric |
Value |
| refusal |
0.4375 |
| kl |
0.0248 |
| capability_logprob |
-9.6356 |
| capability_drift |
0.0 |
Layer Alphas
| Layer |
Alpha |
| 0 |
0.500 |
| 1 |
0.500 |
| 2 |
0.500 |
| 3 |
0.500 |
| 4 |
0.500 |
| 5 |
0.500 |
| 6 |
0.500 |
| 7 |
0.500 |
| 8 |
0.500 |
| 9 |
0.500 |
| 10 |
0.500 |
| 11 |
0.500 |
| 12 |
0.500 |
| 13 |
1.269 |
| 14 |
1.269 |
| 15 |
1.269 |
| 16 |
1.269 |
| 17 |
1.269 |
| 18 |
1.271 |
| 19 |
1.275 |
| 20 |
1.280 |
| 21 |
1.287 |
| 22 |
1.289 |
| 23 |
1.292 |
| 24 |
1.293 |
| 25 |
3.244 |
| 26 |
1.301 |
| 27 |
1.306 |
| 28 |
1.305 |
| 29 |
1.307 |
| 30 |
0.500 |
| 31 |
0.500 |
| 32 |
0.500 |
| 33 |
0.500 |
| 34 |
0.500 |
| 35 |
0.500 |
Guard History
| iter |
separation |
ratio |
rank |
refusal |
kl |
reverted |
| 0 |
166.7894 |
0.4839 |
2 |
0.4375 |
0.0248 |
|
| 1 |
124.5732 |
0.3614 |
3 |
0.2188 |
0.0558 |
|
Timings
| Phase |
Seconds |
| load_model |
133.3 |
| load_prompts |
5.5 |
| baseline_refusal |
10.4 |
| activation_fit |
17.0 |
| causal_scores |
3.2 |
| optimize_profile |
7281.8 |
| guard |
561.6 |
| refine_refusal |
148.9 |
| validation_metrics |
0.0 |
| repair |
6809.6 |
| prune |
0.0 |
| test_metrics |
8374.6 |
| bake |
17.0 |
Measurement
| field |
value |
| refusal judge |
classifier + weak guard |
| preservation metric |
harmless kl |
| capability suites |
gsm8k, humaneval, mbpp |