初始化项目,由ModelHub XC社区提供模型

Model: laion/ablation-pymethods2test-seqmean-arm0-tis-15-8B
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-08-09 05:27:18 +08:00
commit 9f22667c70
40 changed files with 298738 additions and 0 deletions

View File

@@ -0,0 +1,2 @@
async/discard_rate,async/discarded_count,async/effective_batch_groups,async/effective_batch_samples,async/staleness_max,async/staleness_mean,async/staleness_min,async/staleness_ratio,generate/avg_num_tokens,generate/avg_tokens_non_zero_rewards,generate/avg_tokens_zero_rewards,generate/max_num_tokens,generate/min_num_tokens,generate/std_num_tokens,generate/tis/aligned_tokens,generate/tis/alignment_fail_count,generate/tis/exact_match_fraction,generate/tis/lcs_fallback_fraction,generate/tis/lcs_fallback_messages,generate/tis/unaligned_fraction,loss/avg_final_rewards,loss/avg_raw_advantages,loss/avg_raw_advantages_abs,policy/final_loss,policy/log_ratio_abs_max,policy/log_ratio_abs_mean,policy/log_ratio_abs_p99,policy/log_ratio_abs_pos00,policy/log_ratio_abs_pos10,policy/log_ratio_abs_pos20,policy/log_ratio_abs_pos30,policy/log_ratio_abs_pos40,policy/log_ratio_abs_pos50,policy/log_ratio_abs_pos60,policy/log_ratio_abs_pos70,policy/log_ratio_abs_pos80,policy/log_ratio_abs_pos90,policy/n_tokens_dp_gt_10pct,policy/n_tokens_dp_gt_1pct,policy/n_tokens_dp_gt_50pct,policy/policy_entropy,policy/policy_loss,policy/policy_lr,policy/policy_update_steps,policy/ppo_clip_ratio,policy/raw_grad_norm,policy/rollout_train_prob_diff_mean,policy/rollout_train_prob_diff_std,policy/tis/imp_ratio_capped_fraction,policy/tis/imp_ratio_mean,policy/tis/log_ratio_abs_mean,reward/avg_pass_at_8,reward/avg_raw_reward,system/process_rss_gb,system/process_vms_gb,system/ram_available_gb,system/ram_percent,system/ram_total_gb,system/ram_used_gb,timing/cleanup_old_checkpoints,timing/compute_advantages_and_returns,timing/convert_to_training_input,timing/fwd_logprobs_values_reward,timing/policy_train,timing/run_training,timing/save_checkpoints,timing/step,timing/sync_weights,timing/train_critic_and_policy,timing/wait_for_generation_buffer,tis/batch_skipped_no_logprobs,tis/skipped_fraction,trainer/epoch,trainer/global_step,batch_errors/total_batches,batch_errors/total_instances,batch_errors/total_successful,batch_errors/total_failed,batch_errors/total_masked
0.0,0,64,512,0,0.0,0,0.0,3458.0977,3170.4289,4497.3333,17781,1,2176.1485,1160818.0,8.0,0.9962,0.0,0.0,0.0038,0.7832,0.0044,0.0294,-0.0,0.0,0.0,0.0,0.0,0.0,0.0,0.0,0.0,0.0,0.0,0.0,0.0,0.0,0.0,0.0,0.0,0.033,-0.002,0.0,1.0,0.0,0.0092,12.0706,11267.6396,0.0,1.0022,0.0104,0.7969,0.7832,8.6151,50.2076,591.2495,31.1,857.9676,266.7181,13.1363,0.0741,3.6039,30.4349,124.3234,155.0454,21.5484,3316.0311,31.9403,124.5359,3125.441,0.0,0.0,1,82,3,24,24,0,0
1 async/discard_rate async/discarded_count async/effective_batch_groups async/effective_batch_samples async/staleness_max async/staleness_mean async/staleness_min async/staleness_ratio generate/avg_num_tokens generate/avg_tokens_non_zero_rewards generate/avg_tokens_zero_rewards generate/max_num_tokens generate/min_num_tokens generate/std_num_tokens generate/tis/aligned_tokens generate/tis/alignment_fail_count generate/tis/exact_match_fraction generate/tis/lcs_fallback_fraction generate/tis/lcs_fallback_messages generate/tis/unaligned_fraction loss/avg_final_rewards loss/avg_raw_advantages loss/avg_raw_advantages_abs policy/final_loss policy/log_ratio_abs_max policy/log_ratio_abs_mean policy/log_ratio_abs_p99 policy/log_ratio_abs_pos00 policy/log_ratio_abs_pos10 policy/log_ratio_abs_pos20 policy/log_ratio_abs_pos30 policy/log_ratio_abs_pos40 policy/log_ratio_abs_pos50 policy/log_ratio_abs_pos60 policy/log_ratio_abs_pos70 policy/log_ratio_abs_pos80 policy/log_ratio_abs_pos90 policy/n_tokens_dp_gt_10pct policy/n_tokens_dp_gt_1pct policy/n_tokens_dp_gt_50pct policy/policy_entropy policy/policy_loss policy/policy_lr policy/policy_update_steps policy/ppo_clip_ratio policy/raw_grad_norm policy/rollout_train_prob_diff_mean policy/rollout_train_prob_diff_std policy/tis/imp_ratio_capped_fraction policy/tis/imp_ratio_mean policy/tis/log_ratio_abs_mean reward/avg_pass_at_8 reward/avg_raw_reward system/process_rss_gb system/process_vms_gb system/ram_available_gb system/ram_percent system/ram_total_gb system/ram_used_gb timing/cleanup_old_checkpoints timing/compute_advantages_and_returns timing/convert_to_training_input timing/fwd_logprobs_values_reward timing/policy_train timing/run_training timing/save_checkpoints timing/step timing/sync_weights timing/train_critic_and_policy timing/wait_for_generation_buffer tis/batch_skipped_no_logprobs tis/skipped_fraction trainer/epoch trainer/global_step batch_errors/total_batches batch_errors/total_instances batch_errors/total_successful batch_errors/total_failed batch_errors/total_masked
2 0.0 0 64 512 0 0.0 0 0.0 3458.0977 3170.4289 4497.3333 17781 1 2176.1485 1160818.0 8.0 0.9962 0.0 0.0 0.0038 0.7832 0.0044 0.0294 -0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.0 0.033 -0.002 0.0 1.0 0.0 0.0092 12.0706 11267.6396 0.0 1.0022 0.0104 0.7969 0.7832 8.6151 50.2076 591.2495 31.1 857.9676 266.7181 13.1363 0.0741 3.6039 30.4349 124.3234 155.0454 21.5484 3316.0311 31.9403 124.5359 3125.441 0.0 0.0 1 82 3 24 24 0 0