Model: ADRA-RL/tulu2-7b_olympiads_controlled_contamination_original Source: Original Platform
5 lines
1.0 KiB
Plaintext
5 lines
1.0 KiB
Plaintext
2025-11-23 16:30:54,593 - INFO - Initialising CheckpointManager with config: CheckpointConfig(model_name_or_path='allenai/tulu-2-7b', max_seq_length=4096, learning_rate=5e-06, num_train_epochs=1, per_device_train_batch_size=2, output_base_dir='model_checkpoints', save_total_limit=1, logging_steps=1, seed=42, fp16=False, bf16=True, warmup_steps=0, warmup_ratio=0.0, lr_scheduler_type='constant', gradient_accumulation_steps=64, gradient_checkpointing=True, resume_from_checkpoint=True, checkpoint_name='mixed_sft_tulu-2-7b_320ex_100.0pct_e1_lr5e-06_schedconstant', use_trl=True, use_lora=False, lora_r=16, lora_alpha=32, lora_dropout=0.05, apply_chat_template=False, add_generation_prompt=False, packing=False, remove_unused_columns=False)
|
|
2025-11-23 16:30:57,499 - INFO - Fine-tuning with TRL on supplied Dataset (320 rows)
|
|
2025-11-23 16:31:00,883 - INFO - SFTTrainer initialized with max_seq_length=4096
|
|
2025-11-23 16:32:51,039 - INFO - Training complete. Saving model to model_checkpoints/tulu-2-7b_20251123_mixed_sft_tulu-2-7b_320ex_100.0pct_e1_lr5e-06_schedconstant
|