初始化项目,由ModelHub XC社区提供模型
Model: the-jb/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent Source: Original Platform
This commit is contained in:
36
.gitattributes
vendored
Normal file
36
.gitattributes
vendored
Normal file
@@ -0,0 +1,36 @@
|
|||||||
|
*.7z filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.arrow filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bin filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.bz2 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ckpt filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ftz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.gz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.h5 filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.joblib filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.lfs.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.mlmodel filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.model filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.msgpack filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.npy filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.npz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.onnx filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.ot filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.parquet filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pb filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pickle filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pkl filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pt filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.pth filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.rar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar.* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tar filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tflite filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.tgz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.wasm filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.xz filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zip filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*.zst filter=lfs diff=lfs merge=lfs -text
|
||||||
|
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
||||||
|
tokenizer.json filter=lfs diff=lfs merge=lfs -text
|
||||||
605
.hydra/config.yaml
Normal file
605
.hydra/config.yaml
Normal file
@@ -0,0 +1,605 @@
|
|||||||
|
model:
|
||||||
|
model_args:
|
||||||
|
pretrained_model_name_or_path: open-unlearning/tofu_Llama-3.2-3B-Instruct_full
|
||||||
|
attn_implementation: flash_attention_2
|
||||||
|
torch_dtype: bfloat16
|
||||||
|
tokenizer_args:
|
||||||
|
pretrained_model_name_or_path: meta-llama/Llama-3.2-3B-Instruct
|
||||||
|
template_args:
|
||||||
|
apply_chat_template: true
|
||||||
|
system_prompt: You are a helpful assistant.
|
||||||
|
system_prompt_with_special_tokens: '<|begin_of_text|><|start_header_id|>system<|end_header_id|>
|
||||||
|
|
||||||
|
|
||||||
|
You are a helpful assistant.<|eot_id|>'
|
||||||
|
user_start_tag: '<|start_header_id|>user<|end_header_id|>
|
||||||
|
|
||||||
|
|
||||||
|
'
|
||||||
|
user_end_tag: <|eot_id|>
|
||||||
|
asst_start_tag: '<|start_header_id|>assistant<|end_header_id|>
|
||||||
|
|
||||||
|
|
||||||
|
'
|
||||||
|
asst_end_tag: <|eot_id|>
|
||||||
|
date_string: 10 Apr 2025
|
||||||
|
trainer:
|
||||||
|
handler: GradAscent
|
||||||
|
args:
|
||||||
|
per_device_train_batch_size: 4
|
||||||
|
per_device_eval_batch_size: 16
|
||||||
|
gradient_accumulation_steps: 4
|
||||||
|
learning_rate: 1.0e-05
|
||||||
|
bf16: true
|
||||||
|
bf16_full_eval: true
|
||||||
|
logging_steps: 5
|
||||||
|
output_dir: ${paths.output_dir}
|
||||||
|
logging_dir: ${trainer.args.output_dir}/logs
|
||||||
|
report_to: tensorboard
|
||||||
|
ddp_find_unused_parameters: true
|
||||||
|
gradient_checkpointing: true
|
||||||
|
optim: paged_adamw_32bit
|
||||||
|
save_strategy: 'no'
|
||||||
|
save_only_model: true
|
||||||
|
weight_decay: 0.01
|
||||||
|
do_train: true
|
||||||
|
do_eval: true
|
||||||
|
eval_on_start: true
|
||||||
|
eval_strategy: epoch
|
||||||
|
num_train_epochs: 10
|
||||||
|
seed: 0
|
||||||
|
warmup_epochs: 1.0
|
||||||
|
remove_unused_columns: false
|
||||||
|
data:
|
||||||
|
forget:
|
||||||
|
TOFU_QA_forget:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${forget_split}
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
retain:
|
||||||
|
TOFU_QA_retain:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${retain_split}_wo_test
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
anchor: forget
|
||||||
|
collator:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
eval:
|
||||||
|
tofu:
|
||||||
|
metrics:
|
||||||
|
forget_quality:
|
||||||
|
pre_compute:
|
||||||
|
forget_truth_ratio:
|
||||||
|
pre_compute:
|
||||||
|
forget_Q_A_PARA_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_forget_para:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${eval.tofu.forget_split}_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: paraphrased_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: correct
|
||||||
|
forget_Q_A_PERT_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_forget_pert:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${eval.tofu.forget_split}_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: perturbed_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: wrong
|
||||||
|
handler: truth_ratio
|
||||||
|
aggregator: closer_to_1_better
|
||||||
|
access_key: forget
|
||||||
|
reference_logs:
|
||||||
|
retain_model_logs:
|
||||||
|
path: ${eval.tofu.retain_logs_path}
|
||||||
|
include:
|
||||||
|
forget_truth_ratio:
|
||||||
|
access_key: retain
|
||||||
|
handler: ks_test
|
||||||
|
forget_Q_A_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_forget:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${eval.tofu.forget_split}
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
forget_Q_A_ROUGE:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_forget:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${eval.tofu.forget_split}
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
predict_with_generate: true
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: left
|
||||||
|
index: index
|
||||||
|
generation_args:
|
||||||
|
do_sample: false
|
||||||
|
top_p: null
|
||||||
|
temperature: null
|
||||||
|
max_new_tokens: 200
|
||||||
|
use_cache: true
|
||||||
|
handler: rouge
|
||||||
|
rouge_type: rougeL_recall
|
||||||
|
batch_size: 32
|
||||||
|
model_utility:
|
||||||
|
pre_compute:
|
||||||
|
retain_Q_A_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_retain_eval:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: retain_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
retain_Q_A_ROUGE:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_retain_eval:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: retain_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
predict_with_generate: true
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: left
|
||||||
|
index: index
|
||||||
|
generation_args:
|
||||||
|
do_sample: false
|
||||||
|
top_p: null
|
||||||
|
temperature: null
|
||||||
|
max_new_tokens: 200
|
||||||
|
use_cache: true
|
||||||
|
handler: rouge
|
||||||
|
rouge_type: rougeL_recall
|
||||||
|
batch_size: 32
|
||||||
|
retain_Truth_Ratio:
|
||||||
|
pre_compute:
|
||||||
|
retain_Q_A_PARA_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_retain_para:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: retain_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: paraphrased_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: correct
|
||||||
|
retain_Q_A_PERT_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_retain_pert:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: retain_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: perturbed_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: wrong
|
||||||
|
handler: truth_ratio
|
||||||
|
aggregator: true_better
|
||||||
|
ra_Q_A_Prob_normalised:
|
||||||
|
pre_compute:
|
||||||
|
ra_Q_A_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_ra:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: real_authors_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: correct
|
||||||
|
ra_Q_A_PERT_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_ra_pert:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: real_authors_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: perturbed_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: wrong
|
||||||
|
handler: probability_w_options
|
||||||
|
ra_Q_A_ROUGE:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_ra:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: real_authors_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
predict_with_generate: true
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: left
|
||||||
|
index: index
|
||||||
|
generation_args:
|
||||||
|
do_sample: false
|
||||||
|
top_p: null
|
||||||
|
temperature: null
|
||||||
|
max_new_tokens: 200
|
||||||
|
use_cache: true
|
||||||
|
handler: rouge
|
||||||
|
rouge_type: rougeL_recall
|
||||||
|
batch_size: 32
|
||||||
|
ra_Truth_Ratio:
|
||||||
|
pre_compute:
|
||||||
|
ra_Q_A_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_ra:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: real_authors_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: correct
|
||||||
|
ra_Q_A_PERT_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_ra_pert:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: real_authors_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: perturbed_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: wrong
|
||||||
|
handler: truth_ratio
|
||||||
|
aggregator: true_better
|
||||||
|
wf_Q_A_Prob_normalised:
|
||||||
|
pre_compute:
|
||||||
|
wf_Q_A_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_wf:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: world_facts_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: correct
|
||||||
|
wf_Q_A_PERT_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_wf_pert:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: world_facts_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: perturbed_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: wrong
|
||||||
|
handler: probability_w_options
|
||||||
|
wf_Q_A_ROUGE:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_wf:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: world_facts_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
predict_with_generate: true
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: left
|
||||||
|
index: index
|
||||||
|
generation_args:
|
||||||
|
do_sample: false
|
||||||
|
top_p: null
|
||||||
|
temperature: null
|
||||||
|
max_new_tokens: 200
|
||||||
|
use_cache: true
|
||||||
|
handler: rouge
|
||||||
|
rouge_type: rougeL_recall
|
||||||
|
batch_size: 32
|
||||||
|
wf_Truth_Ratio:
|
||||||
|
pre_compute:
|
||||||
|
wf_Q_A_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_wf:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: world_facts_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: correct
|
||||||
|
wf_Q_A_PERT_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_wf_pert:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: world_facts_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: perturbed_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: wrong
|
||||||
|
handler: truth_ratio
|
||||||
|
aggregator: true_better
|
||||||
|
handler: hm_aggregate
|
||||||
|
privleak:
|
||||||
|
pre_compute:
|
||||||
|
mia_min_k:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_forget:
|
||||||
|
access_key: forget
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${eval.tofu.forget_split}
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
TOFU_QA_holdout:
|
||||||
|
access_key: holdout
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${eval.tofu.holdout_split}
|
||||||
|
path: locuslab/TOFU
|
||||||
|
split: train
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
batch_size: 32
|
||||||
|
handler: mia_min_k
|
||||||
|
k: 0.4
|
||||||
|
access_key: forget
|
||||||
|
reference_logs:
|
||||||
|
retain_model_logs:
|
||||||
|
path: ${eval.tofu.retain_logs_path}
|
||||||
|
include:
|
||||||
|
mia_min_k:
|
||||||
|
access_key: retain
|
||||||
|
handler: privleak
|
||||||
|
ref_value: 0.5
|
||||||
|
extraction_strength:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_forget:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${eval.tofu.forget_split}
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: extraction_strength
|
||||||
|
batch_size: 32
|
||||||
|
handler: TOFUEvaluator
|
||||||
|
output_dir: ${paths.output_dir}
|
||||||
|
overwrite: true
|
||||||
|
forget_split: ${forget_split}
|
||||||
|
holdout_split: ${holdout_split}
|
||||||
|
retain_logs_path: ${retain_logs_path}
|
||||||
|
paths:
|
||||||
|
root_dir: .
|
||||||
|
data_dir: ${paths.root_dir}/data/
|
||||||
|
datasets: ${paths.root_dir}/configs/data/datasets
|
||||||
|
output_dir: ${paths.root_dir}/saves/${mode}/${task_name}
|
||||||
|
work_dir: ${hydra:runtime.cwd}
|
||||||
|
forget_split: forget10
|
||||||
|
retain_split: retain90
|
||||||
|
holdout_split: holdout10
|
||||||
|
retain_logs_path: saves/eval/tofu_Llama-3.2-3B-Instruct_retain90/TOFU_EVAL.json
|
||||||
|
task_name: tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
mode: unlearn
|
||||||
279
.hydra/hydra.yaml
Normal file
279
.hydra/hydra.yaml
Normal file
@@ -0,0 +1,279 @@
|
|||||||
|
hydra:
|
||||||
|
run:
|
||||||
|
dir: ${paths.output_dir}
|
||||||
|
sweep:
|
||||||
|
dir: multirun/${now:%Y-%m-%d}/${now:%H-%M-%S}
|
||||||
|
subdir: ${hydra.job.num}
|
||||||
|
launcher:
|
||||||
|
_target_: hydra._internal.core_plugins.basic_launcher.BasicLauncher
|
||||||
|
sweeper:
|
||||||
|
_target_: hydra._internal.core_plugins.basic_sweeper.BasicSweeper
|
||||||
|
max_batch_size: null
|
||||||
|
params: null
|
||||||
|
help:
|
||||||
|
app_name: ${hydra.job.name}
|
||||||
|
header: '${hydra.help.app_name} is powered by Hydra.
|
||||||
|
|
||||||
|
'
|
||||||
|
footer: 'Powered by Hydra (https://hydra.cc)
|
||||||
|
|
||||||
|
Use --hydra-help to view Hydra specific help
|
||||||
|
|
||||||
|
'
|
||||||
|
template: '${hydra.help.header}
|
||||||
|
|
||||||
|
== Configuration groups ==
|
||||||
|
|
||||||
|
Compose your configuration from those groups (group=option)
|
||||||
|
|
||||||
|
|
||||||
|
$APP_CONFIG_GROUPS
|
||||||
|
|
||||||
|
|
||||||
|
== Config ==
|
||||||
|
|
||||||
|
Override anything in the config (foo.bar=value)
|
||||||
|
|
||||||
|
|
||||||
|
$CONFIG
|
||||||
|
|
||||||
|
|
||||||
|
${hydra.help.footer}
|
||||||
|
|
||||||
|
'
|
||||||
|
hydra_help:
|
||||||
|
template: 'Hydra (${hydra.runtime.version})
|
||||||
|
|
||||||
|
See https://hydra.cc for more info.
|
||||||
|
|
||||||
|
|
||||||
|
== Flags ==
|
||||||
|
|
||||||
|
$FLAGS_HELP
|
||||||
|
|
||||||
|
|
||||||
|
== Configuration groups ==
|
||||||
|
|
||||||
|
Compose your configuration from those groups (For example, append hydra/job_logging=disabled
|
||||||
|
to command line)
|
||||||
|
|
||||||
|
|
||||||
|
$HYDRA_CONFIG_GROUPS
|
||||||
|
|
||||||
|
|
||||||
|
Use ''--cfg hydra'' to Show the Hydra config.
|
||||||
|
|
||||||
|
'
|
||||||
|
hydra_help: ???
|
||||||
|
hydra_logging:
|
||||||
|
version: 1
|
||||||
|
formatters:
|
||||||
|
colorlog:
|
||||||
|
(): colorlog.ColoredFormatter
|
||||||
|
format: '[%(cyan)s%(asctime)s%(reset)s][%(purple)sHYDRA%(reset)s] %(message)s'
|
||||||
|
handlers:
|
||||||
|
console:
|
||||||
|
class: logging.StreamHandler
|
||||||
|
formatter: colorlog
|
||||||
|
stream: ext://sys.stdout
|
||||||
|
root:
|
||||||
|
level: INFO
|
||||||
|
handlers:
|
||||||
|
- console
|
||||||
|
disable_existing_loggers: false
|
||||||
|
job_logging:
|
||||||
|
version: 1
|
||||||
|
formatters:
|
||||||
|
simple:
|
||||||
|
format: '[%(asctime)s][%(name)s][%(levelname)s] - %(message)s'
|
||||||
|
colorlog:
|
||||||
|
(): colorlog.ColoredFormatter
|
||||||
|
format: '[%(cyan)s%(asctime)s%(reset)s][%(blue)s%(name)s%(reset)s][%(log_color)s%(levelname)s%(reset)s]
|
||||||
|
- %(message)s'
|
||||||
|
log_colors:
|
||||||
|
DEBUG: purple
|
||||||
|
INFO: green
|
||||||
|
WARNING: yellow
|
||||||
|
ERROR: red
|
||||||
|
CRITICAL: red
|
||||||
|
handlers:
|
||||||
|
console:
|
||||||
|
class: logging.StreamHandler
|
||||||
|
formatter: colorlog
|
||||||
|
stream: ext://sys.stdout
|
||||||
|
file:
|
||||||
|
class: logging.FileHandler
|
||||||
|
formatter: simple
|
||||||
|
filename: ${hydra.runtime.output_dir}/${trainer.handler}.log
|
||||||
|
root:
|
||||||
|
level: INFO
|
||||||
|
handlers:
|
||||||
|
- console
|
||||||
|
- file
|
||||||
|
disable_existing_loggers: false
|
||||||
|
env: {}
|
||||||
|
mode: RUN
|
||||||
|
searchpath: []
|
||||||
|
callbacks: {}
|
||||||
|
output_subdir: .hydra
|
||||||
|
overrides:
|
||||||
|
hydra:
|
||||||
|
- hydra.mode=RUN
|
||||||
|
task:
|
||||||
|
- experiment=unlearn/tofu/default.yaml
|
||||||
|
- trainer=GradAscent
|
||||||
|
- task_name=tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
- model=Llama-3.2-3B-Instruct
|
||||||
|
- forget_split=forget10
|
||||||
|
- retain_split=retain90
|
||||||
|
- model.model_args.pretrained_model_name_or_path=open-unlearning/tofu_Llama-3.2-3B-Instruct_full
|
||||||
|
- retain_logs_path=saves/eval/tofu_Llama-3.2-3B-Instruct_retain90/TOFU_EVAL.json
|
||||||
|
- trainer.args.per_device_train_batch_size=4
|
||||||
|
- trainer.args.gradient_accumulation_steps=4
|
||||||
|
- trainer.args.ddp_find_unused_parameters=true
|
||||||
|
- trainer.args.gradient_checkpointing=true
|
||||||
|
job:
|
||||||
|
name: train
|
||||||
|
chdir: null
|
||||||
|
override_dirname: experiment=unlearn/tofu/default.yaml,forget_split=forget10,model.model_args.pretrained_model_name_or_path=open-unlearning/tofu_Llama-3.2-3B-Instruct_full,model=Llama-3.2-3B-Instruct,retain_logs_path=saves/eval/tofu_Llama-3.2-3B-Instruct_retain90/TOFU_EVAL.json,retain_split=retain90,task_name=tofu_Llama-3.2-3B-Instruct_forget10_GradAscent,trainer.args.ddp_find_unused_parameters=true,trainer.args.gradient_accumulation_steps=4,trainer.args.gradient_checkpointing=true,trainer.args.per_device_train_batch_size=4,trainer=GradAscent
|
||||||
|
id: ???
|
||||||
|
num: ???
|
||||||
|
config_name: unlearn.yaml
|
||||||
|
env_set: {}
|
||||||
|
env_copy: []
|
||||||
|
config:
|
||||||
|
override_dirname:
|
||||||
|
kv_sep: '='
|
||||||
|
item_sep: ','
|
||||||
|
exclude_keys: []
|
||||||
|
runtime:
|
||||||
|
version: 1.3.0
|
||||||
|
version_base: '1.3'
|
||||||
|
cwd: /mnt/nas/slurm_account/thejb/workspace/open-unlearning
|
||||||
|
config_sources:
|
||||||
|
- path: hydra.conf
|
||||||
|
schema: pkg
|
||||||
|
provider: hydra
|
||||||
|
- path: /mnt/nas/slurm_account/thejb/workspace/open-unlearning/configs
|
||||||
|
schema: file
|
||||||
|
provider: main
|
||||||
|
- path: hydra_plugins.hydra_colorlog.conf
|
||||||
|
schema: pkg
|
||||||
|
provider: hydra-colorlog
|
||||||
|
- path: ''
|
||||||
|
schema: structured
|
||||||
|
provider: schema
|
||||||
|
output_dir: /mnt/nas/slurm_account/thejb/workspace/open-unlearning/saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
choices:
|
||||||
|
experiment: unlearn/tofu/default.yaml
|
||||||
|
paths: default
|
||||||
|
hydra: default
|
||||||
|
eval: tofu
|
||||||
|
eval/tofu_metrics/../../collator@eval.tofu.metrics.extraction_strength.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/../../data/datasets@eval.tofu.metrics.extraction_strength.datasets: TOFU_QA_forget
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.privleak.pre_compute.mia_min_k: mia_min_k
|
||||||
|
eval/tofu_metrics/./../../collator@eval.tofu.metrics.privleak.pre_compute.mia_min_k.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.privleak.pre_compute.mia_min_k.datasets: TOFU_MIA
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio: wf_Truth_Ratio
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_PERT_Prob: wf_Q_A_PERT_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_PERT_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_PERT_Prob.datasets
|
||||||
|
: TOFU_QA_wf_pert
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_Prob: wf_Q_A_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_Prob.datasets
|
||||||
|
: TOFU_QA_wf
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_ROUGE: wf_Q_A_ROUGE
|
||||||
|
eval/tofu_metrics/./../../generation@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_ROUGE.generation_args: default
|
||||||
|
eval/tofu_metrics/./../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_ROUGE.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_ROUGE.datasets: TOFU_QA_wf
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised: wf_Q_A_Prob_normalised
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_PERT_Prob: wf_Q_A_PERT_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_PERT_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_PERT_Prob.datasets
|
||||||
|
: TOFU_QA_wf_pert
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_Prob: wf_Q_A_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_Prob.datasets
|
||||||
|
: TOFU_QA_wf
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio: ra_Truth_Ratio
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_PERT_Prob: ra_Q_A_PERT_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_PERT_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_PERT_Prob.datasets
|
||||||
|
: TOFU_QA_ra_pert
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_Prob: ra_Q_A_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_Prob.datasets
|
||||||
|
: TOFU_QA_ra
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_ROUGE: ra_Q_A_ROUGE
|
||||||
|
eval/tofu_metrics/./../../generation@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_ROUGE.generation_args: default
|
||||||
|
eval/tofu_metrics/./../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_ROUGE.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_ROUGE.datasets: TOFU_QA_ra
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised: ra_Q_A_Prob_normalised
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_PERT_Prob: ra_Q_A_PERT_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_PERT_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_PERT_Prob.datasets
|
||||||
|
: TOFU_QA_ra_pert
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_Prob: ra_Q_A_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_Prob.datasets
|
||||||
|
: TOFU_QA_ra
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio: retain_Truth_Ratio
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PERT_Prob: retain_Q_A_PERT_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PERT_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PERT_Prob.datasets
|
||||||
|
: TOFU_QA_retain_pert
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PARA_Prob: retain_Q_A_PARA_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PARA_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PARA_Prob.datasets
|
||||||
|
: TOFU_QA_retain_para
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_ROUGE: retain_Q_A_ROUGE
|
||||||
|
eval/tofu_metrics/./../../generation@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_ROUGE.generation_args: default
|
||||||
|
eval/tofu_metrics/./../../collator@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_ROUGE.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_ROUGE.datasets: TOFU_QA_retain_eval
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_Prob: retain_Q_A_Prob
|
||||||
|
eval/tofu_metrics/./../../collator@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_Prob.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_Prob.datasets: TOFU_QA_retain_eval
|
||||||
|
eval/tofu_metrics/../../generation@eval.tofu.metrics.forget_Q_A_ROUGE.generation_args: default
|
||||||
|
eval/tofu_metrics/../../collator@eval.tofu.metrics.forget_Q_A_ROUGE.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/../../data/datasets@eval.tofu.metrics.forget_Q_A_ROUGE.datasets: TOFU_QA_forget
|
||||||
|
eval/tofu_metrics/../../collator@eval.tofu.metrics.forget_Q_A_Prob.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/../../data/datasets@eval.tofu.metrics.forget_Q_A_Prob.datasets: TOFU_QA_forget
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio: forget_Truth_Ratio
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PERT_Prob: forget_Q_A_PERT_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PERT_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PERT_Prob.datasets
|
||||||
|
: TOFU_QA_forget_pert
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PARA_Prob: forget_Q_A_PARA_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PARA_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PARA_Prob.datasets
|
||||||
|
: TOFU_QA_forget_para
|
||||||
|
collator: DataCollatorForSupervisedDataset
|
||||||
|
data: unlearn
|
||||||
|
data/datasets@data.eval: null
|
||||||
|
data/datasets@data.retain: TOFU_QA_retain
|
||||||
|
data/datasets@data.forget: TOFU_QA_forget
|
||||||
|
trainer: GradAscent
|
||||||
|
model: Llama-3.2-3B-Instruct
|
||||||
|
hydra/env: default
|
||||||
|
hydra/callbacks: null
|
||||||
|
hydra/job_logging: colorlog
|
||||||
|
hydra/hydra_logging: colorlog
|
||||||
|
hydra/hydra_help: default
|
||||||
|
hydra/help: default
|
||||||
|
hydra/sweeper: basic
|
||||||
|
hydra/launcher: basic
|
||||||
|
hydra/output: default
|
||||||
|
verbose: false
|
||||||
12
.hydra/overrides.yaml
Normal file
12
.hydra/overrides.yaml
Normal file
@@ -0,0 +1,12 @@
|
|||||||
|
- experiment=unlearn/tofu/default.yaml
|
||||||
|
- trainer=GradAscent
|
||||||
|
- task_name=tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
- model=Llama-3.2-3B-Instruct
|
||||||
|
- forget_split=forget10
|
||||||
|
- retain_split=retain90
|
||||||
|
- model.model_args.pretrained_model_name_or_path=open-unlearning/tofu_Llama-3.2-3B-Instruct_full
|
||||||
|
- retain_logs_path=saves/eval/tofu_Llama-3.2-3B-Instruct_retain90/TOFU_EVAL.json
|
||||||
|
- trainer.args.per_device_train_batch_size=4
|
||||||
|
- trainer.args.gradient_accumulation_steps=4
|
||||||
|
- trainer.args.ddp_find_unused_parameters=true
|
||||||
|
- trainer.args.gradient_checkpointing=true
|
||||||
24
GradAscent.log
Normal file
24
GradAscent.log
Normal file
@@ -0,0 +1,24 @@
|
|||||||
|
[2025-05-02 19:48:45,507][model][INFO] - Setting pad_token as eos token: <|eot_id|>
|
||||||
|
[2025-05-02 19:48:45,508][model][INFO] - Setting pad_token as eos token: <|eot_id|>
|
||||||
|
[2025-05-02 19:48:49,958][evaluator][INFO] - Evaluations stored in the experiment directory: ./saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
[2025-05-02 19:48:50,147][trainer][INFO] - GradAscent Trainer loaded, output_dir: ./saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
[2025-05-02 19:48:50,244][evaluator][INFO] - Evaluations stored in the experiment directory: ./saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
[2025-05-02 19:48:50,487][trainer][INFO] - GradAscent Trainer loaded, output_dir: ./saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
[2025-05-02 19:49:15,699][trainer.base][WARNING] - Custom evaluator can be run with this Trainer only when a single accelerator process is running.
|
||||||
|
[2025-05-02 19:49:58,799][trainer.base][WARNING] - Custom evaluator can be run with this Trainer only when a single accelerator process is running.
|
||||||
|
[2025-05-02 19:50:40,523][trainer.base][WARNING] - Custom evaluator can be run with this Trainer only when a single accelerator process is running.
|
||||||
|
[2025-05-02 19:51:22,085][trainer.base][WARNING] - Custom evaluator can be run with this Trainer only when a single accelerator process is running.
|
||||||
|
[2025-05-02 19:52:03,826][trainer.base][WARNING] - Custom evaluator can be run with this Trainer only when a single accelerator process is running.
|
||||||
|
[2025-05-02 19:52:45,411][trainer.base][WARNING] - Custom evaluator can be run with this Trainer only when a single accelerator process is running.
|
||||||
|
[2025-05-02 19:53:27,172][trainer.base][WARNING] - Custom evaluator can be run with this Trainer only when a single accelerator process is running.
|
||||||
|
[2025-05-02 19:54:08,783][trainer.base][WARNING] - Custom evaluator can be run with this Trainer only when a single accelerator process is running.
|
||||||
|
[2025-05-02 19:54:50,537][trainer.base][WARNING] - Custom evaluator can be run with this Trainer only when a single accelerator process is running.
|
||||||
|
[2025-05-02 19:55:32,157][trainer.base][WARNING] - Custom evaluator can be run with this Trainer only when a single accelerator process is running.
|
||||||
|
[2025-05-02 19:55:57,200][trainer.base][WARNING] - Custom evaluator can be run with this Trainer only when a single accelerator process is running.
|
||||||
|
[2025-05-02 19:56:30,530][trainer.base][WARNING] - Custom evaluator can be run with this Trainer only when a single accelerator process is running.
|
||||||
|
[2025-05-09 19:03:30,260][model][INFO] - Setting pad_token as eos token: <|eot_id|>
|
||||||
|
[2025-05-09 19:03:30,286][model][INFO] - Setting pad_token as eos token: <|eot_id|>
|
||||||
|
[2025-05-09 19:03:34,956][evaluator][INFO] - Evaluations stored in the experiment directory: ./saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
[2025-05-09 19:03:35,030][evaluator][INFO] - Evaluations stored in the experiment directory: ./saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
[2025-05-09 19:03:35,831][trainer][INFO] - GradAscent Trainer loaded, output_dir: ./saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
[2025-05-09 19:03:35,879][trainer][INFO] - GradAscent Trainer loaded, output_dir: ./saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
40
config.json
Normal file
40
config.json
Normal file
@@ -0,0 +1,40 @@
|
|||||||
|
{
|
||||||
|
"_name_or_path": "open-unlearning/tofu_Llama-3.2-3B-Instruct_full",
|
||||||
|
"architectures": [
|
||||||
|
"LlamaForCausalLM"
|
||||||
|
],
|
||||||
|
"attention_bias": false,
|
||||||
|
"attention_dropout": 0.0,
|
||||||
|
"bos_token_id": 128000,
|
||||||
|
"eos_token_id": [
|
||||||
|
128001,
|
||||||
|
128008,
|
||||||
|
128009
|
||||||
|
],
|
||||||
|
"head_dim": 128,
|
||||||
|
"hidden_act": "silu",
|
||||||
|
"hidden_size": 3072,
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"intermediate_size": 8192,
|
||||||
|
"max_position_embeddings": 131072,
|
||||||
|
"mlp_bias": false,
|
||||||
|
"model_type": "llama",
|
||||||
|
"num_attention_heads": 24,
|
||||||
|
"num_hidden_layers": 28,
|
||||||
|
"num_key_value_heads": 8,
|
||||||
|
"pretraining_tp": 1,
|
||||||
|
"rms_norm_eps": 1e-05,
|
||||||
|
"rope_scaling": {
|
||||||
|
"factor": 32.0,
|
||||||
|
"high_freq_factor": 4.0,
|
||||||
|
"low_freq_factor": 1.0,
|
||||||
|
"original_max_position_embeddings": 8192,
|
||||||
|
"rope_type": "llama3"
|
||||||
|
},
|
||||||
|
"rope_theta": 500000.0,
|
||||||
|
"tie_word_embeddings": true,
|
||||||
|
"torch_dtype": "bfloat16",
|
||||||
|
"transformers_version": "4.45.1",
|
||||||
|
"use_cache": true,
|
||||||
|
"vocab_size": 128256
|
||||||
|
}
|
||||||
550
evals/.hydra/config.yaml
Normal file
550
evals/.hydra/config.yaml
Normal file
@@ -0,0 +1,550 @@
|
|||||||
|
model:
|
||||||
|
model_args:
|
||||||
|
device_map: cuda
|
||||||
|
pretrained_model_name_or_path: saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
attn_implementation: flash_attention_2
|
||||||
|
torch_dtype: bfloat16
|
||||||
|
tokenizer_args:
|
||||||
|
pretrained_model_name_or_path: meta-llama/Llama-3.2-3B-Instruct
|
||||||
|
template_args:
|
||||||
|
apply_chat_template: true
|
||||||
|
system_prompt: You are a helpful assistant.
|
||||||
|
system_prompt_with_special_tokens: '<|begin_of_text|><|start_header_id|>system<|end_header_id|>
|
||||||
|
|
||||||
|
|
||||||
|
You are a helpful assistant.<|eot_id|>'
|
||||||
|
user_start_tag: '<|start_header_id|>user<|end_header_id|>
|
||||||
|
|
||||||
|
|
||||||
|
'
|
||||||
|
user_end_tag: <|eot_id|>
|
||||||
|
asst_start_tag: '<|start_header_id|>assistant<|end_header_id|>
|
||||||
|
|
||||||
|
|
||||||
|
'
|
||||||
|
asst_end_tag: <|eot_id|>
|
||||||
|
date_string: 10 Apr 2025
|
||||||
|
mode: eval
|
||||||
|
task_name: tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
seed: 0
|
||||||
|
eval:
|
||||||
|
tofu:
|
||||||
|
metrics:
|
||||||
|
forget_quality:
|
||||||
|
pre_compute:
|
||||||
|
forget_truth_ratio:
|
||||||
|
pre_compute:
|
||||||
|
forget_Q_A_PARA_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_forget_para:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${eval.tofu.forget_split}_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: paraphrased_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: correct
|
||||||
|
forget_Q_A_PERT_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_forget_pert:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${eval.tofu.forget_split}_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: perturbed_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: wrong
|
||||||
|
handler: truth_ratio
|
||||||
|
aggregator: closer_to_1_better
|
||||||
|
access_key: forget
|
||||||
|
reference_logs:
|
||||||
|
retain_model_logs:
|
||||||
|
path: ${eval.tofu.retain_logs_path}
|
||||||
|
include:
|
||||||
|
forget_truth_ratio:
|
||||||
|
access_key: retain
|
||||||
|
handler: ks_test
|
||||||
|
forget_Q_A_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_forget:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${eval.tofu.forget_split}
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
forget_Q_A_ROUGE:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_forget:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${eval.tofu.forget_split}
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
predict_with_generate: true
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: left
|
||||||
|
index: index
|
||||||
|
generation_args:
|
||||||
|
do_sample: false
|
||||||
|
top_p: null
|
||||||
|
temperature: null
|
||||||
|
max_new_tokens: 200
|
||||||
|
use_cache: true
|
||||||
|
handler: rouge
|
||||||
|
rouge_type: rougeL_recall
|
||||||
|
batch_size: 32
|
||||||
|
model_utility:
|
||||||
|
pre_compute:
|
||||||
|
retain_Q_A_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_retain_eval:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: retain_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
retain_Q_A_ROUGE:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_retain_eval:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: retain_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
predict_with_generate: true
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: left
|
||||||
|
index: index
|
||||||
|
generation_args:
|
||||||
|
do_sample: false
|
||||||
|
top_p: null
|
||||||
|
temperature: null
|
||||||
|
max_new_tokens: 200
|
||||||
|
use_cache: true
|
||||||
|
handler: rouge
|
||||||
|
rouge_type: rougeL_recall
|
||||||
|
batch_size: 32
|
||||||
|
retain_Truth_Ratio:
|
||||||
|
pre_compute:
|
||||||
|
retain_Q_A_PARA_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_retain_para:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: retain_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: paraphrased_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: correct
|
||||||
|
retain_Q_A_PERT_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_retain_pert:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: retain_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: perturbed_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: wrong
|
||||||
|
handler: truth_ratio
|
||||||
|
aggregator: true_better
|
||||||
|
ra_Q_A_Prob_normalised:
|
||||||
|
pre_compute:
|
||||||
|
ra_Q_A_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_ra:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: real_authors_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: correct
|
||||||
|
ra_Q_A_PERT_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_ra_pert:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: real_authors_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: perturbed_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: wrong
|
||||||
|
handler: probability_w_options
|
||||||
|
ra_Q_A_ROUGE:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_ra:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: real_authors_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
predict_with_generate: true
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: left
|
||||||
|
index: index
|
||||||
|
generation_args:
|
||||||
|
do_sample: false
|
||||||
|
top_p: null
|
||||||
|
temperature: null
|
||||||
|
max_new_tokens: 200
|
||||||
|
use_cache: true
|
||||||
|
handler: rouge
|
||||||
|
rouge_type: rougeL_recall
|
||||||
|
batch_size: 32
|
||||||
|
ra_Truth_Ratio:
|
||||||
|
pre_compute:
|
||||||
|
ra_Q_A_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_ra:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: real_authors_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: correct
|
||||||
|
ra_Q_A_PERT_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_ra_pert:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: real_authors_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: perturbed_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: wrong
|
||||||
|
handler: truth_ratio
|
||||||
|
aggregator: true_better
|
||||||
|
wf_Q_A_Prob_normalised:
|
||||||
|
pre_compute:
|
||||||
|
wf_Q_A_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_wf:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: world_facts_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: correct
|
||||||
|
wf_Q_A_PERT_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_wf_pert:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: world_facts_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: perturbed_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: wrong
|
||||||
|
handler: probability_w_options
|
||||||
|
wf_Q_A_ROUGE:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_wf:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: world_facts_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
predict_with_generate: true
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: left
|
||||||
|
index: index
|
||||||
|
generation_args:
|
||||||
|
do_sample: false
|
||||||
|
top_p: null
|
||||||
|
temperature: null
|
||||||
|
max_new_tokens: 200
|
||||||
|
use_cache: true
|
||||||
|
handler: rouge
|
||||||
|
rouge_type: rougeL_recall
|
||||||
|
batch_size: 32
|
||||||
|
wf_Truth_Ratio:
|
||||||
|
pre_compute:
|
||||||
|
wf_Q_A_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_wf:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: world_facts_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: correct
|
||||||
|
wf_Q_A_PERT_Prob:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_wf_pert:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: world_facts_perturbed
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: perturbed_answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: probability
|
||||||
|
batch_size: 32
|
||||||
|
access_key: wrong
|
||||||
|
handler: truth_ratio
|
||||||
|
aggregator: true_better
|
||||||
|
handler: hm_aggregate
|
||||||
|
privleak:
|
||||||
|
pre_compute:
|
||||||
|
mia_min_k:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_forget:
|
||||||
|
access_key: forget
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${eval.tofu.forget_split}
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
TOFU_QA_holdout:
|
||||||
|
access_key: holdout
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${eval.tofu.holdout_split}
|
||||||
|
path: locuslab/TOFU
|
||||||
|
split: train
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
batch_size: 32
|
||||||
|
handler: mia_min_k
|
||||||
|
k: 0.4
|
||||||
|
access_key: forget
|
||||||
|
reference_logs:
|
||||||
|
retain_model_logs:
|
||||||
|
path: ${eval.tofu.retain_logs_path}
|
||||||
|
include:
|
||||||
|
mia_min_k:
|
||||||
|
access_key: retain
|
||||||
|
handler: privleak
|
||||||
|
ref_value: 0.5
|
||||||
|
extraction_strength:
|
||||||
|
datasets:
|
||||||
|
TOFU_QA_forget:
|
||||||
|
handler: QADataset
|
||||||
|
args:
|
||||||
|
hf_args:
|
||||||
|
name: ${eval.tofu.forget_split}
|
||||||
|
split: train
|
||||||
|
path: locuslab/TOFU
|
||||||
|
question_key: question
|
||||||
|
answer_key: answer
|
||||||
|
max_length: 512
|
||||||
|
collators:
|
||||||
|
DataCollatorForSupervisedDataset:
|
||||||
|
handler: DataCollatorForSupervisedDataset
|
||||||
|
args:
|
||||||
|
padding_side: right
|
||||||
|
index: index
|
||||||
|
handler: extraction_strength
|
||||||
|
batch_size: 32
|
||||||
|
handler: TOFUEvaluator
|
||||||
|
output_dir: ${paths.output_dir}
|
||||||
|
overwrite: false
|
||||||
|
forget_split: ${forget_split}
|
||||||
|
holdout_split: ${holdout_split}
|
||||||
|
retain_logs_path: ${retain_logs_path}
|
||||||
|
paths:
|
||||||
|
root_dir: .
|
||||||
|
data_dir: ${paths.root_dir}/data/
|
||||||
|
datasets: ${paths.root_dir}/configs/data/datasets
|
||||||
|
output_dir: saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent/evals
|
||||||
|
work_dir: ${hydra:runtime.cwd}
|
||||||
|
forget_split: forget10
|
||||||
|
holdout_split: holdout10
|
||||||
|
retain_logs_path: saves/eval/tofu_Llama-3.2-3B-Instruct_retain90/TOFU_EVAL.json
|
||||||
269
evals/.hydra/hydra.yaml
Normal file
269
evals/.hydra/hydra.yaml
Normal file
@@ -0,0 +1,269 @@
|
|||||||
|
hydra:
|
||||||
|
run:
|
||||||
|
dir: ${paths.output_dir}
|
||||||
|
sweep:
|
||||||
|
dir: multirun/${now:%Y-%m-%d}/${now:%H-%M-%S}
|
||||||
|
subdir: ${hydra.job.num}
|
||||||
|
launcher:
|
||||||
|
_target_: hydra._internal.core_plugins.basic_launcher.BasicLauncher
|
||||||
|
sweeper:
|
||||||
|
_target_: hydra._internal.core_plugins.basic_sweeper.BasicSweeper
|
||||||
|
max_batch_size: null
|
||||||
|
params: null
|
||||||
|
help:
|
||||||
|
app_name: ${hydra.job.name}
|
||||||
|
header: '${hydra.help.app_name} is powered by Hydra.
|
||||||
|
|
||||||
|
'
|
||||||
|
footer: 'Powered by Hydra (https://hydra.cc)
|
||||||
|
|
||||||
|
Use --hydra-help to view Hydra specific help
|
||||||
|
|
||||||
|
'
|
||||||
|
template: '${hydra.help.header}
|
||||||
|
|
||||||
|
== Configuration groups ==
|
||||||
|
|
||||||
|
Compose your configuration from those groups (group=option)
|
||||||
|
|
||||||
|
|
||||||
|
$APP_CONFIG_GROUPS
|
||||||
|
|
||||||
|
|
||||||
|
== Config ==
|
||||||
|
|
||||||
|
Override anything in the config (foo.bar=value)
|
||||||
|
|
||||||
|
|
||||||
|
$CONFIG
|
||||||
|
|
||||||
|
|
||||||
|
${hydra.help.footer}
|
||||||
|
|
||||||
|
'
|
||||||
|
hydra_help:
|
||||||
|
template: 'Hydra (${hydra.runtime.version})
|
||||||
|
|
||||||
|
See https://hydra.cc for more info.
|
||||||
|
|
||||||
|
|
||||||
|
== Flags ==
|
||||||
|
|
||||||
|
$FLAGS_HELP
|
||||||
|
|
||||||
|
|
||||||
|
== Configuration groups ==
|
||||||
|
|
||||||
|
Compose your configuration from those groups (For example, append hydra/job_logging=disabled
|
||||||
|
to command line)
|
||||||
|
|
||||||
|
|
||||||
|
$HYDRA_CONFIG_GROUPS
|
||||||
|
|
||||||
|
|
||||||
|
Use ''--cfg hydra'' to Show the Hydra config.
|
||||||
|
|
||||||
|
'
|
||||||
|
hydra_help: ???
|
||||||
|
hydra_logging:
|
||||||
|
version: 1
|
||||||
|
formatters:
|
||||||
|
colorlog:
|
||||||
|
(): colorlog.ColoredFormatter
|
||||||
|
format: '[%(cyan)s%(asctime)s%(reset)s][%(purple)sHYDRA%(reset)s] %(message)s'
|
||||||
|
handlers:
|
||||||
|
console:
|
||||||
|
class: logging.StreamHandler
|
||||||
|
formatter: colorlog
|
||||||
|
stream: ext://sys.stdout
|
||||||
|
root:
|
||||||
|
level: INFO
|
||||||
|
handlers:
|
||||||
|
- console
|
||||||
|
disable_existing_loggers: false
|
||||||
|
job_logging:
|
||||||
|
version: 1
|
||||||
|
formatters:
|
||||||
|
simple:
|
||||||
|
format: '[%(asctime)s][%(name)s][%(levelname)s] - %(message)s'
|
||||||
|
colorlog:
|
||||||
|
(): colorlog.ColoredFormatter
|
||||||
|
format: '[%(cyan)s%(asctime)s%(reset)s][%(blue)s%(name)s%(reset)s][%(log_color)s%(levelname)s%(reset)s]
|
||||||
|
- %(message)s'
|
||||||
|
log_colors:
|
||||||
|
DEBUG: purple
|
||||||
|
INFO: green
|
||||||
|
WARNING: yellow
|
||||||
|
ERROR: red
|
||||||
|
CRITICAL: red
|
||||||
|
handlers:
|
||||||
|
console:
|
||||||
|
class: logging.StreamHandler
|
||||||
|
formatter: colorlog
|
||||||
|
stream: ext://sys.stdout
|
||||||
|
file:
|
||||||
|
class: logging.FileHandler
|
||||||
|
formatter: simple
|
||||||
|
filename: ${hydra.runtime.output_dir}/eval.log
|
||||||
|
root:
|
||||||
|
level: INFO
|
||||||
|
handlers:
|
||||||
|
- console
|
||||||
|
- file
|
||||||
|
disable_existing_loggers: false
|
||||||
|
env: {}
|
||||||
|
mode: RUN
|
||||||
|
searchpath: []
|
||||||
|
callbacks: {}
|
||||||
|
output_subdir: .hydra
|
||||||
|
overrides:
|
||||||
|
hydra:
|
||||||
|
- hydra.mode=RUN
|
||||||
|
task:
|
||||||
|
- experiment=eval/tofu/default.yaml
|
||||||
|
- forget_split=forget10
|
||||||
|
- holdout_split=holdout10
|
||||||
|
- model=Llama-3.2-3B-Instruct
|
||||||
|
- task_name=tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
- model.model_args.pretrained_model_name_or_path=saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
- paths.output_dir=saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent/evals
|
||||||
|
- retain_logs_path=saves/eval/tofu_Llama-3.2-3B-Instruct_retain90/TOFU_EVAL.json
|
||||||
|
job:
|
||||||
|
name: eval
|
||||||
|
chdir: null
|
||||||
|
override_dirname: experiment=eval/tofu/default.yaml,forget_split=forget10,holdout_split=holdout10,model.model_args.pretrained_model_name_or_path=saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent,model=Llama-3.2-3B-Instruct,paths.output_dir=saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent/evals,retain_logs_path=saves/eval/tofu_Llama-3.2-3B-Instruct_retain90/TOFU_EVAL.json,task_name=tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
id: ???
|
||||||
|
num: ???
|
||||||
|
config_name: eval.yaml
|
||||||
|
env_set: {}
|
||||||
|
env_copy: []
|
||||||
|
config:
|
||||||
|
override_dirname:
|
||||||
|
kv_sep: '='
|
||||||
|
item_sep: ','
|
||||||
|
exclude_keys: []
|
||||||
|
runtime:
|
||||||
|
version: 1.3.0
|
||||||
|
version_base: '1.3'
|
||||||
|
cwd: /mnt/nas/slurm_account/thejb/workspace/open-unlearning
|
||||||
|
config_sources:
|
||||||
|
- path: hydra.conf
|
||||||
|
schema: pkg
|
||||||
|
provider: hydra
|
||||||
|
- path: /mnt/nas/slurm_account/thejb/workspace/open-unlearning/configs
|
||||||
|
schema: file
|
||||||
|
provider: main
|
||||||
|
- path: hydra_plugins.hydra_colorlog.conf
|
||||||
|
schema: pkg
|
||||||
|
provider: hydra-colorlog
|
||||||
|
- path: ''
|
||||||
|
schema: structured
|
||||||
|
provider: schema
|
||||||
|
output_dir: /mnt/nas/slurm_account/thejb/workspace/open-unlearning/saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent/evals
|
||||||
|
choices:
|
||||||
|
experiment: eval/tofu/default.yaml
|
||||||
|
hydra: eval
|
||||||
|
paths: default
|
||||||
|
eval: tofu
|
||||||
|
eval/tofu_metrics/../../collator@eval.tofu.metrics.extraction_strength.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/../../data/datasets@eval.tofu.metrics.extraction_strength.datasets: TOFU_QA_forget
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.privleak.pre_compute.mia_min_k: mia_min_k
|
||||||
|
eval/tofu_metrics/./../../collator@eval.tofu.metrics.privleak.pre_compute.mia_min_k.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.privleak.pre_compute.mia_min_k.datasets: TOFU_MIA
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio: wf_Truth_Ratio
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_PERT_Prob: wf_Q_A_PERT_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_PERT_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_PERT_Prob.datasets
|
||||||
|
: TOFU_QA_wf_pert
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_Prob: wf_Q_A_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Truth_Ratio.pre_compute.wf_Q_A_Prob.datasets
|
||||||
|
: TOFU_QA_wf
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_ROUGE: wf_Q_A_ROUGE
|
||||||
|
eval/tofu_metrics/./../../generation@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_ROUGE.generation_args: default
|
||||||
|
eval/tofu_metrics/./../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_ROUGE.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_ROUGE.datasets: TOFU_QA_wf
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised: wf_Q_A_Prob_normalised
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_PERT_Prob: wf_Q_A_PERT_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_PERT_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_PERT_Prob.datasets
|
||||||
|
: TOFU_QA_wf_pert
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_Prob: wf_Q_A_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.wf_Q_A_Prob_normalised.pre_compute.wf_Q_A_Prob.datasets
|
||||||
|
: TOFU_QA_wf
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio: ra_Truth_Ratio
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_PERT_Prob: ra_Q_A_PERT_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_PERT_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_PERT_Prob.datasets
|
||||||
|
: TOFU_QA_ra_pert
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_Prob: ra_Q_A_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Truth_Ratio.pre_compute.ra_Q_A_Prob.datasets
|
||||||
|
: TOFU_QA_ra
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_ROUGE: ra_Q_A_ROUGE
|
||||||
|
eval/tofu_metrics/./../../generation@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_ROUGE.generation_args: default
|
||||||
|
eval/tofu_metrics/./../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_ROUGE.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_ROUGE.datasets: TOFU_QA_ra
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised: ra_Q_A_Prob_normalised
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_PERT_Prob: ra_Q_A_PERT_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_PERT_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_PERT_Prob.datasets
|
||||||
|
: TOFU_QA_ra_pert
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_Prob: ra_Q_A_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.ra_Q_A_Prob_normalised.pre_compute.ra_Q_A_Prob.datasets
|
||||||
|
: TOFU_QA_ra
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio: retain_Truth_Ratio
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PERT_Prob: retain_Q_A_PERT_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PERT_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PERT_Prob.datasets
|
||||||
|
: TOFU_QA_retain_pert
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PARA_Prob: retain_Q_A_PARA_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PARA_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.retain_Truth_Ratio.pre_compute.retain_Q_A_PARA_Prob.datasets
|
||||||
|
: TOFU_QA_retain_para
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_ROUGE: retain_Q_A_ROUGE
|
||||||
|
eval/tofu_metrics/./../../generation@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_ROUGE.generation_args: default
|
||||||
|
eval/tofu_metrics/./../../collator@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_ROUGE.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_ROUGE.datasets: TOFU_QA_retain_eval
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_Prob: retain_Q_A_Prob
|
||||||
|
eval/tofu_metrics/./../../collator@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_Prob.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/./../../data/datasets@eval.tofu.metrics.model_utility.pre_compute.retain_Q_A_Prob.datasets: TOFU_QA_retain_eval
|
||||||
|
eval/tofu_metrics/../../generation@eval.tofu.metrics.forget_Q_A_ROUGE.generation_args: default
|
||||||
|
eval/tofu_metrics/../../collator@eval.tofu.metrics.forget_Q_A_ROUGE.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/../../data/datasets@eval.tofu.metrics.forget_Q_A_ROUGE.datasets: TOFU_QA_forget
|
||||||
|
eval/tofu_metrics/../../collator@eval.tofu.metrics.forget_Q_A_Prob.collators: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
eval/tofu_metrics/../../data/datasets@eval.tofu.metrics.forget_Q_A_Prob.datasets: TOFU_QA_forget
|
||||||
|
eval/tofu_metrics/.@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio: forget_Truth_Ratio
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PERT_Prob: forget_Q_A_PERT_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PERT_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PERT_Prob.datasets
|
||||||
|
: TOFU_QA_forget_pert
|
||||||
|
eval/tofu_metrics/./.@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PARA_Prob: forget_Q_A_PARA_Prob
|
||||||
|
? eval/tofu_metrics/././../../collator@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PARA_Prob.collators
|
||||||
|
: DataCollatorForSupervisedDatasetwithIndex
|
||||||
|
? eval/tofu_metrics/././../../data/datasets@eval.tofu.metrics.forget_quality.pre_compute.forget_truth_ratio.pre_compute.forget_Q_A_PARA_Prob.datasets
|
||||||
|
: TOFU_QA_forget_para
|
||||||
|
model: Llama-3.2-3B-Instruct
|
||||||
|
hydra/env: default
|
||||||
|
hydra/callbacks: null
|
||||||
|
hydra/job_logging: colorlog
|
||||||
|
hydra/hydra_logging: colorlog
|
||||||
|
hydra/hydra_help: default
|
||||||
|
hydra/help: default
|
||||||
|
hydra/sweeper: basic
|
||||||
|
hydra/launcher: basic
|
||||||
|
hydra/output: default
|
||||||
|
verbose: false
|
||||||
8
evals/.hydra/overrides.yaml
Normal file
8
evals/.hydra/overrides.yaml
Normal file
@@ -0,0 +1,8 @@
|
|||||||
|
- experiment=eval/tofu/default.yaml
|
||||||
|
- forget_split=forget10
|
||||||
|
- holdout_split=holdout10
|
||||||
|
- model=Llama-3.2-3B-Instruct
|
||||||
|
- task_name=tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
- model.model_args.pretrained_model_name_or_path=saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent
|
||||||
|
- paths.output_dir=saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent/evals
|
||||||
|
- retain_logs_path=saves/eval/tofu_Llama-3.2-3B-Instruct_retain90/TOFU_EVAL.json
|
||||||
38240
evals/TOFU_EVAL.json
Normal file
38240
evals/TOFU_EVAL.json
Normal file
File diff suppressed because it is too large
Load Diff
8
evals/TOFU_SUMMARY.json
Normal file
8
evals/TOFU_SUMMARY.json
Normal file
@@ -0,0 +1,8 @@
|
|||||||
|
{
|
||||||
|
"extraction_strength": 0.03250892997513522,
|
||||||
|
"forget_Q_A_Prob": 1.4886753440614812e-40,
|
||||||
|
"forget_Q_A_ROUGE": 8.620689655172413e-05,
|
||||||
|
"forget_quality": 1.0635896769518578e-239,
|
||||||
|
"model_utility": 0.0,
|
||||||
|
"privleak": -22.3985353993257
|
||||||
|
}
|
||||||
64
evals/eval.log
Normal file
64
evals/eval.log
Normal file
@@ -0,0 +1,64 @@
|
|||||||
|
[2025-05-02 19:56:56,079][model][INFO] - Setting pad_token as eos token: <|eot_id|>
|
||||||
|
[2025-05-02 19:56:56,082][evaluator][INFO] - Evaluations stored in the experiment directory: saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent/evals
|
||||||
|
[2025-05-02 19:56:56,083][evaluator][INFO] - ***** Running TOFU evaluation suite *****
|
||||||
|
[2025-05-02 19:56:56,083][evaluator][INFO] - Fine-grained evaluations will be saved to: saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent/evals/TOFU_EVAL.json
|
||||||
|
[2025-05-02 19:56:56,083][evaluator][INFO] - Aggregated evaluations will be summarised in: saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent/evals/TOFU_SUMMARY.json
|
||||||
|
[2025-05-02 19:56:59,842][metrics][INFO] - Loading evaluations from saves/eval/tofu_Llama-3.2-3B-Instruct_retain90/TOFU_EVAL.json
|
||||||
|
[2025-05-02 19:56:59,920][metrics][INFO] - Evaluating forget_Q_A_PARA_Prob
|
||||||
|
[2025-05-02 19:57:08,677][metrics][INFO] - Loading evaluations from saves/eval/tofu_Llama-3.2-3B-Instruct_retain90/TOFU_EVAL.json
|
||||||
|
[2025-05-02 19:57:08,688][metrics][INFO] - Evaluating forget_Q_A_PERT_Prob
|
||||||
|
[2025-05-02 19:57:40,611][metrics][INFO] - Loading evaluations from saves/eval/tofu_Llama-3.2-3B-Instruct_retain90/TOFU_EVAL.json
|
||||||
|
[2025-05-02 19:57:40,627][metrics][INFO] - Evaluating forget_truth_ratio
|
||||||
|
[2025-05-02 19:57:40,628][metrics][INFO] - Loading evaluations from saves/eval/tofu_Llama-3.2-3B-Instruct_retain90/TOFU_EVAL.json
|
||||||
|
[2025-05-02 19:57:40,638][metrics][INFO] - Evaluating forget_quality
|
||||||
|
[2025-05-02 19:57:40,641][evaluator][INFO] - Result for metric forget_quality: 1.0635896769518578e-239
|
||||||
|
[2025-05-02 19:57:42,377][metrics][INFO] - Evaluating forget_Q_A_Prob
|
||||||
|
[2025-05-02 19:57:48,962][evaluator][INFO] - Result for metric forget_Q_A_Prob: 1.4886753440614812e-40
|
||||||
|
[2025-05-02 19:57:50,682][metrics][INFO] - Evaluating forget_Q_A_ROUGE
|
||||||
|
[2025-05-02 19:59:00,482][evaluator][INFO] - Result for metric forget_Q_A_ROUGE: 8.620689655172413e-05
|
||||||
|
[2025-05-02 19:59:02,448][metrics][INFO] - Evaluating retain_Q_A_Prob
|
||||||
|
[2025-05-02 19:59:09,888][metrics][INFO] - Evaluating retain_Q_A_ROUGE
|
||||||
|
[2025-05-02 20:00:20,731][metrics][INFO] - Evaluating retain_Q_A_PARA_Prob
|
||||||
|
[2025-05-02 20:00:28,487][metrics][INFO] - Evaluating retain_Q_A_PERT_Prob
|
||||||
|
[2025-05-02 20:00:57,961][metrics][INFO] - Evaluating retain_Truth_Ratio
|
||||||
|
[2025-05-02 20:00:59,935][metrics][INFO] - Evaluating ra_Q_A_Prob
|
||||||
|
[2025-05-02 20:01:02,414][metrics][INFO] - Evaluating ra_Q_A_PERT_Prob
|
||||||
|
[2025-05-02 20:01:05,456][metrics][INFO] - Evaluating ra_Q_A_Prob_normalised
|
||||||
|
[2025-05-02 20:01:06,819][metrics][INFO] - Evaluating ra_Q_A_ROUGE
|
||||||
|
[2025-05-02 20:01:27,484][metrics][INFO] - Skipping ra_Truth_Ratio's precompute ra_Q_A_Prob, already evaluated.
|
||||||
|
[2025-05-02 20:01:27,485][metrics][INFO] - Skipping ra_Truth_Ratio's precompute ra_Q_A_PERT_Prob, already evaluated.
|
||||||
|
[2025-05-02 20:01:27,485][metrics][INFO] - Evaluating ra_Truth_Ratio
|
||||||
|
[2025-05-02 20:01:29,572][metrics][INFO] - Evaluating wf_Q_A_Prob
|
||||||
|
[2025-05-02 20:01:31,858][metrics][INFO] - Evaluating wf_Q_A_PERT_Prob
|
||||||
|
[2025-05-02 20:01:34,976][metrics][INFO] - Evaluating wf_Q_A_Prob_normalised
|
||||||
|
[2025-05-02 20:01:36,245][metrics][INFO] - Evaluating wf_Q_A_ROUGE
|
||||||
|
[2025-05-02 20:01:57,123][metrics][INFO] - Skipping wf_Truth_Ratio's precompute wf_Q_A_Prob, already evaluated.
|
||||||
|
[2025-05-02 20:01:57,123][metrics][INFO] - Skipping wf_Truth_Ratio's precompute wf_Q_A_PERT_Prob, already evaluated.
|
||||||
|
[2025-05-02 20:01:57,123][metrics][INFO] - Evaluating wf_Truth_Ratio
|
||||||
|
[2025-05-02 20:01:57,123][metrics][INFO] - Evaluating model_utility
|
||||||
|
[2025-05-02 20:01:57,125][evaluator][INFO] - Result for metric model_utility: 0.0
|
||||||
|
[2025-05-02 20:02:00,207][metrics][INFO] - Loading evaluations from saves/eval/tofu_Llama-3.2-3B-Instruct_retain90/TOFU_EVAL.json
|
||||||
|
[2025-05-02 20:02:00,220][metrics][INFO] - Evaluating mia_min_k
|
||||||
|
[2025-05-02 20:02:09,057][metrics][INFO] - Loading evaluations from saves/eval/tofu_Llama-3.2-3B-Instruct_retain90/TOFU_EVAL.json
|
||||||
|
[2025-05-02 20:02:09,067][metrics][INFO] - Evaluating privleak
|
||||||
|
[2025-05-02 20:02:09,067][evaluator][INFO] - Result for metric privleak: -22.3985353993257
|
||||||
|
[2025-05-02 20:02:11,106][metrics][INFO] - Evaluating extraction_strength
|
||||||
|
[2025-05-02 20:02:15,771][evaluator][INFO] - Result for metric extraction_strength: 0.03250892997513522
|
||||||
|
[2025-05-09 19:35:10,259][model][INFO] - Setting pad_token as eos token: <|eot_id|>
|
||||||
|
[2025-05-09 19:35:10,262][evaluator][INFO] - Evaluations stored in the experiment directory: saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent/evals
|
||||||
|
[2025-05-09 19:35:10,263][evaluator][INFO] - Loading existing evaluations from saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent/evals/TOFU_EVAL.json
|
||||||
|
[2025-05-09 19:35:10,314][evaluator][INFO] - ***** Running TOFU evaluation suite *****
|
||||||
|
[2025-05-09 19:35:10,314][evaluator][INFO] - Fine-grained evaluations will be saved to: saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent/evals/TOFU_EVAL.json
|
||||||
|
[2025-05-09 19:35:10,314][evaluator][INFO] - Aggregated evaluations will be summarised in: saves/unlearn/tofu_Llama-3.2-3B-Instruct_forget10_GradAscent/evals/TOFU_SUMMARY.json
|
||||||
|
[2025-05-09 19:35:10,314][evaluator][INFO] - Skipping forget_quality, already evaluated.
|
||||||
|
[2025-05-09 19:35:10,314][evaluator][INFO] - Result for metric forget_quality: 1.0635896769518578e-239
|
||||||
|
[2025-05-09 19:35:10,324][evaluator][INFO] - Skipping forget_Q_A_Prob, already evaluated.
|
||||||
|
[2025-05-09 19:35:10,324][evaluator][INFO] - Result for metric forget_Q_A_Prob: 1.4886753440614812e-40
|
||||||
|
[2025-05-09 19:35:10,328][evaluator][INFO] - Skipping forget_Q_A_ROUGE, already evaluated.
|
||||||
|
[2025-05-09 19:35:10,328][evaluator][INFO] - Result for metric forget_Q_A_ROUGE: 8.620689655172413e-05
|
||||||
|
[2025-05-09 19:35:10,330][evaluator][INFO] - Skipping model_utility, already evaluated.
|
||||||
|
[2025-05-09 19:35:10,330][evaluator][INFO] - Result for metric model_utility: 0.0
|
||||||
|
[2025-05-09 19:35:10,359][evaluator][INFO] - Skipping privleak, already evaluated.
|
||||||
|
[2025-05-09 19:35:10,360][evaluator][INFO] - Result for metric privleak: -22.3985353993257
|
||||||
|
[2025-05-09 19:35:10,363][evaluator][INFO] - Skipping extraction_strength, already evaluated.
|
||||||
|
[2025-05-09 19:35:10,363][evaluator][INFO] - Result for metric extraction_strength: 0.03250892997513522
|
||||||
12
generation_config.json
Normal file
12
generation_config.json
Normal file
@@ -0,0 +1,12 @@
|
|||||||
|
{
|
||||||
|
"bos_token_id": 128000,
|
||||||
|
"do_sample": true,
|
||||||
|
"eos_token_id": [
|
||||||
|
128001,
|
||||||
|
128008,
|
||||||
|
128009
|
||||||
|
],
|
||||||
|
"temperature": 0.6,
|
||||||
|
"top_p": 0.9,
|
||||||
|
"transformers_version": "4.45.1"
|
||||||
|
}
|
||||||
3
logs/events.out.tfevents.1746182955.node3.2817915.0
Normal file
3
logs/events.out.tfevents.1746182955.node3.2817915.0
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:ecd2733507ccd2a0d6adc2e63b838e2e03cda49220bf7de49596416a2905d6a2
|
||||||
|
size 10653
|
||||||
3
model-00001-of-00002.safetensors
Normal file
3
model-00001-of-00002.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:f964d43ea9d887908570569c20e26afc874e7d8c9bb015c12a7cfaa47bb1c3f1
|
||||||
|
size 4965799096
|
||||||
3
model-00002-of-00002.safetensors
Normal file
3
model-00002-of-00002.safetensors
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:8c09cc0787af837e69e5a28f432615246533e45c01762b960412c24cc44b2dae
|
||||||
|
size 1459729952
|
||||||
261
model.safetensors.index.json
Normal file
261
model.safetensors.index.json
Normal file
@@ -0,0 +1,261 @@
|
|||||||
|
{
|
||||||
|
"metadata": {
|
||||||
|
"total_size": 6425499648
|
||||||
|
},
|
||||||
|
"weight_map": {
|
||||||
|
"model.embed_tokens.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.12.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.13.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.14.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.15.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.15.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.15.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.16.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.17.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.18.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.18.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.19.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.19.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.20.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.20.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.20.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.20.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.20.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.20.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.21.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.21.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.21.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.21.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.21.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.21.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.21.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.21.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.21.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.22.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.22.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.22.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.22.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.22.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.22.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.22.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.22.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.22.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.23.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.23.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.23.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.23.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.23.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.23.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.23.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.23.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.23.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.24.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.24.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.24.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.24.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.24.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.24.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.24.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.24.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.24.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.25.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.25.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.25.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.25.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.25.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.25.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.25.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.25.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.25.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.26.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.26.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.26.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.26.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.26.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.26.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.26.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.26.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.26.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.27.input_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.27.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.27.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.27.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.27.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.27.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.27.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.27.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.27.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
|
||||||
|
"model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
|
||||||
|
"model.norm.weight": "model-00002-of-00002.safetensors"
|
||||||
|
}
|
||||||
|
}
|
||||||
17
special_tokens_map.json
Normal file
17
special_tokens_map.json
Normal file
@@ -0,0 +1,17 @@
|
|||||||
|
{
|
||||||
|
"bos_token": {
|
||||||
|
"content": "<|begin_of_text|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"eos_token": {
|
||||||
|
"content": "<|eot_id|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
},
|
||||||
|
"pad_token": "<|eot_id|>"
|
||||||
|
}
|
||||||
BIN
tokenizer.json
(Stored with Git LFS)
Normal file
BIN
tokenizer.json
(Stored with Git LFS)
Normal file
Binary file not shown.
2063
tokenizer_config.json
Normal file
2063
tokenizer_config.json
Normal file
File diff suppressed because it is too large
Load Diff
210
trainer_state.json
Normal file
210
trainer_state.json
Normal file
@@ -0,0 +1,210 @@
|
|||||||
|
{
|
||||||
|
"best_metric": null,
|
||||||
|
"best_model_checkpoint": null,
|
||||||
|
"epoch": 9.6,
|
||||||
|
"eval_steps": 500,
|
||||||
|
"global_step": 120,
|
||||||
|
"is_hyper_param_search": false,
|
||||||
|
"is_local_process_zero": true,
|
||||||
|
"is_world_process_zero": true,
|
||||||
|
"log_history": [
|
||||||
|
{
|
||||||
|
"epoch": 0.4,
|
||||||
|
"grad_norm": 3.241444727559499,
|
||||||
|
"learning_rate": 4.166666666666667e-06,
|
||||||
|
"loss": -0.0588,
|
||||||
|
"step": 5
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 0.8,
|
||||||
|
"grad_norm": 5.32623822233065,
|
||||||
|
"learning_rate": 8.333333333333334e-06,
|
||||||
|
"loss": -0.0873,
|
||||||
|
"step": 10
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.2,
|
||||||
|
"grad_norm": 15.8041464722526,
|
||||||
|
"learning_rate": 9.722222222222223e-06,
|
||||||
|
"loss": -0.6934,
|
||||||
|
"step": 15
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 1.6,
|
||||||
|
"grad_norm": 120.16174141145932,
|
||||||
|
"learning_rate": 9.25925925925926e-06,
|
||||||
|
"loss": -4.1973,
|
||||||
|
"step": 20
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 2.0,
|
||||||
|
"grad_norm": 50.08612513681741,
|
||||||
|
"learning_rate": 8.796296296296297e-06,
|
||||||
|
"loss": -13.405,
|
||||||
|
"step": 25
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 2.4,
|
||||||
|
"grad_norm": 295.424478128771,
|
||||||
|
"learning_rate": 8.333333333333334e-06,
|
||||||
|
"loss": -18.7935,
|
||||||
|
"step": 30
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 2.8,
|
||||||
|
"grad_norm": 493.9640362150348,
|
||||||
|
"learning_rate": 7.870370370370372e-06,
|
||||||
|
"loss": -31.1509,
|
||||||
|
"step": 35
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 3.2,
|
||||||
|
"grad_norm": 93.87000957824152,
|
||||||
|
"learning_rate": 7.4074074074074075e-06,
|
||||||
|
"loss": -44.4191,
|
||||||
|
"step": 40
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 3.6,
|
||||||
|
"grad_norm": 134.99093438726675,
|
||||||
|
"learning_rate": 6.944444444444445e-06,
|
||||||
|
"loss": -53.0336,
|
||||||
|
"step": 45
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 4.0,
|
||||||
|
"grad_norm": 131.78440529588994,
|
||||||
|
"learning_rate": 6.481481481481482e-06,
|
||||||
|
"loss": -65.837,
|
||||||
|
"step": 50
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 4.4,
|
||||||
|
"grad_norm": 117.73681125892666,
|
||||||
|
"learning_rate": 6.018518518518519e-06,
|
||||||
|
"loss": -77.5102,
|
||||||
|
"step": 55
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 4.8,
|
||||||
|
"grad_norm": 117.05560407621871,
|
||||||
|
"learning_rate": 5.555555555555557e-06,
|
||||||
|
"loss": -85.0267,
|
||||||
|
"step": 60
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 5.2,
|
||||||
|
"grad_norm": 98.14939761160105,
|
||||||
|
"learning_rate": 5.092592592592593e-06,
|
||||||
|
"loss": -89.3683,
|
||||||
|
"step": 65
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 5.6,
|
||||||
|
"grad_norm": 105.40446186084566,
|
||||||
|
"learning_rate": 4.62962962962963e-06,
|
||||||
|
"loss": -91.3682,
|
||||||
|
"step": 70
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 6.0,
|
||||||
|
"grad_norm": 91.22462461648249,
|
||||||
|
"learning_rate": 4.166666666666667e-06,
|
||||||
|
"loss": -92.3792,
|
||||||
|
"step": 75
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 6.4,
|
||||||
|
"grad_norm": 91.1265822704548,
|
||||||
|
"learning_rate": 3.7037037037037037e-06,
|
||||||
|
"loss": -92.9222,
|
||||||
|
"step": 80
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 6.8,
|
||||||
|
"grad_norm": 89.86170978575277,
|
||||||
|
"learning_rate": 3.240740740740741e-06,
|
||||||
|
"loss": -93.476,
|
||||||
|
"step": 85
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 7.2,
|
||||||
|
"grad_norm": 89.77140905804795,
|
||||||
|
"learning_rate": 2.7777777777777783e-06,
|
||||||
|
"loss": -93.6957,
|
||||||
|
"step": 90
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 7.6,
|
||||||
|
"grad_norm": 90.3030070947644,
|
||||||
|
"learning_rate": 2.314814814814815e-06,
|
||||||
|
"loss": -93.8858,
|
||||||
|
"step": 95
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 8.0,
|
||||||
|
"grad_norm": 89.67057158817525,
|
||||||
|
"learning_rate": 1.8518518518518519e-06,
|
||||||
|
"loss": -94.1347,
|
||||||
|
"step": 100
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 8.4,
|
||||||
|
"grad_norm": 89.30029196668944,
|
||||||
|
"learning_rate": 1.3888888888888892e-06,
|
||||||
|
"loss": -94.0645,
|
||||||
|
"step": 105
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 8.8,
|
||||||
|
"grad_norm": 89.43075418962819,
|
||||||
|
"learning_rate": 9.259259259259259e-07,
|
||||||
|
"loss": -94.3247,
|
||||||
|
"step": 110
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 9.2,
|
||||||
|
"grad_norm": 89.7643319124866,
|
||||||
|
"learning_rate": 4.6296296296296297e-07,
|
||||||
|
"loss": -94.3944,
|
||||||
|
"step": 115
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 9.6,
|
||||||
|
"grad_norm": 89.26033644280638,
|
||||||
|
"learning_rate": 0.0,
|
||||||
|
"loss": -94.0103,
|
||||||
|
"step": 120
|
||||||
|
},
|
||||||
|
{
|
||||||
|
"epoch": 9.6,
|
||||||
|
"step": 120,
|
||||||
|
"total_flos": 0.0,
|
||||||
|
"train_loss": -63.00987243900696,
|
||||||
|
"train_runtime": 401.6667,
|
||||||
|
"train_samples_per_second": 9.959,
|
||||||
|
"train_steps_per_second": 0.299
|
||||||
|
}
|
||||||
|
],
|
||||||
|
"logging_steps": 5,
|
||||||
|
"max_steps": 120,
|
||||||
|
"num_input_tokens_seen": 0,
|
||||||
|
"num_train_epochs": 10,
|
||||||
|
"save_steps": 500,
|
||||||
|
"stateful_callbacks": {
|
||||||
|
"TrainerControl": {
|
||||||
|
"args": {
|
||||||
|
"should_epoch_stop": false,
|
||||||
|
"should_evaluate": false,
|
||||||
|
"should_log": false,
|
||||||
|
"should_save": false,
|
||||||
|
"should_training_stop": false
|
||||||
|
},
|
||||||
|
"attributes": {}
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"total_flos": 0.0,
|
||||||
|
"train_batch_size": 4,
|
||||||
|
"trial_name": null,
|
||||||
|
"trial_params": null
|
||||||
|
}
|
||||||
3
training_args.bin
Normal file
3
training_args.bin
Normal file
@@ -0,0 +1,3 @@
|
|||||||
|
version https://git-lfs.github.com/spec/v1
|
||||||
|
oid sha256:863409848354d18f0887b3635645eea3dc6efe785b5532d88477af35e153c24c
|
||||||
|
size 6840
|
||||||
Reference in New Issue
Block a user