# Apostate Run Report ## Summary | Metric | Value | | --- | --- | | Base model | Qwen/Qwen3-8B | | Profile | balanced | | Output | /var/home/Heterodoxin/ablate_work/qwen3-8b-apostate | | Layers | 36 | | Hidden size | 4096 | | Direction layer | 29 | | Refusal rank | 3 | | Max refusal rank | 3 | | Multi refusal | True | | Multi clusters | 6 | | Multi min coverage | 0.05 | | Baseline refusal (n=24) | 91.7% | | Edited refusal | 22.9% | | Refusal metric | classifier + weak guard | | Harmless KL | 0.120 | | Target refusal | 5.0% | | KL target | 0.040 | | KL budget | 0.120 | | KL positions | 8 | | KL layer trims | 0 | | Repair steps | 1 | | Preserve rank | 8 | | Preserve source | harmless | | Capability penalty | True | | Elapsed | 23363.0 sec | ## Command ```text /var/home/Heterodoxin/apostate/apostate/cli.py --optimize --model Qwen/Qwen3-8B --output-dir /var/home/Heterodoxin/ablate_work/qwen3-8b-apostate --oblique-predictive --target-refusal 0.05 ``` ## Best Parameters | Parameter | Value | | --- | --- | | direction_source | activations | | direction_layer_frac | 0.8078 | | refusal_rank | 2 | | strength | 1.3186 | | band_center | 0.6036 | | band_width | 0.5014 | | causal_mix | 0.0392 | | causal_power | 1.5656 | | direction_sign | 1.0 | | ablate_embed | True | | embed_scale | 0.0332 | | ablate_head | True | | head_scale | 0.016 | | head_alpha | 1.108 | ## Best Trial | Metric | Value | | --- | --- | | refusal | 0.4375 | | kl | 0.0248 | | capability_logprob | -9.6356 | | capability_drift | 0.0 | ## Layer Alphas | Layer | Alpha | | --- | --- | | 0 | 0.500 | | 1 | 0.500 | | 2 | 0.500 | | 3 | 0.500 | | 4 | 0.500 | | 5 | 0.500 | | 6 | 0.500 | | 7 | 0.500 | | 8 | 0.500 | | 9 | 0.500 | | 10 | 0.500 | | 11 | 0.500 | | 12 | 0.500 | | 13 | 1.269 | | 14 | 1.269 | | 15 | 1.269 | | 16 | 1.269 | | 17 | 1.269 | | 18 | 1.271 | | 19 | 1.275 | | 20 | 1.280 | | 21 | 1.287 | | 22 | 1.289 | | 23 | 1.292 | | 24 | 1.293 | | 25 | 3.244 | | 26 | 1.301 | | 27 | 1.306 | | 28 | 1.305 | | 29 | 1.307 | | 30 | 0.500 | | 31 | 0.500 | | 32 | 0.500 | | 33 | 0.500 | | 34 | 0.500 | | 35 | 0.500 | ## Guard History | iter | separation | ratio | rank | refusal | kl | reverted | | --- | --- | --- | --- | --- | --- | --- | | 0 | 166.7894 | 0.4839 | 2 | 0.4375 | 0.0248 | | | 1 | 124.5732 | 0.3614 | 3 | 0.2188 | 0.0558 | | ## Timings | Phase | Seconds | | --- | --- | | load_model | 133.3 | | load_prompts | 5.5 | | baseline_refusal | 10.4 | | activation_fit | 17.0 | | causal_scores | 3.2 | | optimize_profile | 7281.8 | | guard | 561.6 | | refine_refusal | 148.9 | | validation_metrics | 0.0 | | repair | 6809.6 | | prune | 0.0 | | test_metrics | 8374.6 | | bake | 17.0 | ## Measurement | field | value | | --- | --- | | refusal judge | classifier + weak guard | | preservation metric | harmless kl | | capability suites | gsm8k, humaneval, mbpp |