Files
a3-rl-laion_nemotron-gym-kn…/README.md
ModelHub XC e38b6cff77 初始化项目,由ModelHub XC社区提供模型
Model: laion/a3-rl-laion_nemotron-gym-knowledge-web-search-mcqa-25-8B
Source: Original Platform
2026-08-10 00:48:55 +08:00

1018 B

a3-rl-laion_nemotron-gym-knowledge-web-search-mcqa (global_step 25)

RL (fully-async, fan-out K=4) checkpoint trained on laion/nemotron-gym-knowledge-web-search-mcqa, selected by EMA-best (5-period EMA, alpha=1/3) of reward/avg_raw_reward over the full step-1->80 training curve.

  • Base model (SFT): laion/GLM-4_7-swesmith-sandboxes-with_tests-oracle_verified_120s-maxeps-131k-fixthink (Qwen3-8B architecture)
  • Selected step: 25 (reward=0.5918, EMA=0.5281)
  • Training: Jupiter, 56 GPUs / 14 nodes, SkyRL fully-async, max_steps=80 (completed)

Training Traces

Training-time Daytona/Harbor rollouts for this run are uploaded as a companion dataset: penfever/a3-rl-laion_nemotron-gym-knowledge-web-search-mcqa

The dataset contains the last episode of each trial (per make_and_upload_trace_dataset --episodes last) — the same rollouts the policy was trained on after rollback / truncation.