Files
v10_gemma3_1B_rand_s42/training_config.json
ModelHub XC c03f4eb8fd 初始化项目,由ModelHub XC社区提供模型
Model: Likithp/v10_gemma3_1B_rand_s42
Source: Original Platform
2026-08-25 00:55:17 +08:00

188 lines
3.5 KiB
JSON

{
"model_family": "gemma3-1b",
"mode": "rand",
"seed": 42,
"hf_repo": "Likithp/v10_gemma3_1B_rand_s42",
"base_model": "google/gemma-3-1b-pt",
"attn_implementation": "sdpa",
"dataset": "data/cs7_rand_v3",
"dataset_version": "cs7_v3",
"trained_at": "2026-06-07T10:12:07.619317+00:00",
"optimizer": "AdamW",
"lr": 3e-05,
"weight_decay": 0.0,
"batch_size": 8,
"grad_accum": 8,
"effective_batch": 64,
"epochs": 3,
"warmup_steps": 200,
"grad_clip": 0.5,
"lr_schedule": "cosine",
"checkpoint_criterion": "train_loss",
"max_seq_len": 256,
"dtype": "torch.bfloat16",
"eval_method": "teacher_forcing_argmax",
"alias_groups_gemma": {
"T1": [
"act",
"emp",
"inv",
"ord",
"spl",
"txn",
"empl"
],
"T2": [
"cst",
"brc",
"ctg",
"dpt",
"ordr",
"prd",
"prj",
"rgn",
"shp",
"tsk",
"whs"
]
},
"note_t1_t2": "empl=T1 and cst=T2 in Gemma tokenizer (reversed vs Qwen)",
"log_every_steps": 50,
"eval_n": 500,
"dry_run": false,
"best_epoch": 3,
"best_train_loss": 0.083617,
"val_exact_match": 0.062,
"val_outer_alias_acc": 1.0,
"val_inner_alias_acc": 0.059,
"val_t1_inner_alias_acc": 0.005348,
"val_t2_inner_alias_acc": 0.091054,
"val_t1_t2_gap_pp": -8.57,
"val_inner_by_alias": {
"act": {
"correct": 0,
"total": 61,
"pct": 0.0,
"token_group_gemma": "T1"
},
"brc": {
"correct": 0,
"total": 50,
"pct": 0.0,
"token_group_gemma": "T2"
},
"cst": {
"correct": 53,
"total": 62,
"pct": 85.5,
"token_group_gemma": "T2"
},
"ctg": {
"correct": 3,
"total": 58,
"pct": 5.2,
"token_group_gemma": "T2"
},
"dpt": {
"correct": 0,
"total": 47,
"pct": 0.0,
"token_group_gemma": "T2"
},
"emp": {
"correct": 0,
"total": 40,
"pct": 0.0,
"token_group_gemma": "T1"
},
"empl": {
"correct": 0,
"total": 43,
"pct": 0.0,
"token_group_gemma": "T1"
},
"inv": {
"correct": 0,
"total": 56,
"pct": 0.0,
"token_group_gemma": "T1"
},
"ord": {
"correct": 2,
"total": 47,
"pct": 4.3,
"token_group_gemma": "T1"
},
"ordr": {
"correct": 0,
"total": 50,
"pct": 0.0,
"token_group_gemma": "T2"
},
"prd": {
"correct": 1,
"total": 55,
"pct": 1.8,
"token_group_gemma": "T2"
},
"prj": {
"correct": 0,
"total": 65,
"pct": 0.0,
"token_group_gemma": "T2"
},
"rgn": {
"correct": 0,
"total": 64,
"pct": 0.0,
"token_group_gemma": "T2"
},
"shp": {
"correct": 0,
"total": 59,
"pct": 0.0,
"token_group_gemma": "T2"
},
"spl": {
"correct": 0,
"total": 56,
"pct": 0.0,
"token_group_gemma": "T1"
},
"tsk": {
"correct": 0,
"total": 59,
"pct": 0.0,
"token_group_gemma": "T2"
},
"txn": {
"correct": 0,
"total": 71,
"pct": 0.0,
"token_group_gemma": "T1"
},
"whs": {
"correct": 0,
"total": 57,
"pct": 0.0,
"token_group_gemma": "T2"
}
},
"train_log": [
{
"epoch": 1,
"loss": 0.111812,
"val_em": 0.066
},
{
"epoch": 2,
"loss": 0.084193,
"val_em": 0.062
},
{
"epoch": 3,
"loss": 0.083617,
"val_em": 0.064
}
]
}