{ "repo_id": "SeongryongJung/Qwen3-8B-Physics-GRPO-TR", "output_dir": "/mnt/mole/SDPO/L2T/hf_upload_tr/Qwen3-8B-Physics-GRPO-TR", "experiment": "qwen3gen-physics-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8", "best_step": 100, "best_val_mean16": 0.7296875, "best_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/physics/qwen3gen-physics-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor", "final_step": 100, "final_val_mean16": 0.7296875, "final_actor_dir": "/mnt/mole/SDPO/L2T/checkpoints/datasets/sciknoweval/physics/qwen3gen-physics-GRPO-Qwen-Qwen3-8B-mbs8-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor", "train_rows": 90, "val_rows": 10, "hf_model_files": [ "added_tokens.json", "chat_template.jinja", "config.json", "generation_config.json", "merges.txt", "model.safetensors.index.json", "special_tokens_map.json", "tokenizer.json", "tokenizer_config.json", "vocab.json", "model-00001-of-00004.safetensors", "model-00002-of-00004.safetensors", "model-00003-of-00004.safetensors", "model-00004-of-00004.safetensors" ] }