commit 0e1edd80a421218416a6d8dfe7904c3cb3a1ea94 Author: ModelHub XC Date: Thu Sep 10 11:12:16 2026 +0800 初始化项目,由ModelHub XC社区提供模型 Model: limajr/nbr-1b-base Source: Original Platform diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..a6344aa --- /dev/null +++ b/.gitattributes @@ -0,0 +1,35 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text diff --git a/README.md b/README.md new file mode 100644 index 0000000..0480071 --- /dev/null +++ b/README.md @@ -0,0 +1,75 @@ +--- +language: +- pt +license: apache-2.0 +tags: +- portuguese +- brazilian +- llama +- causal-lm +- text-generation +pipeline_tag: text-generation +--- + +# NBR-1B Base + +## Model Description + +NBR-1B is a **1 billion parameter** language model trained from scratch specifically for **Brazilian Portuguese**. + +### Key Features + +- **Parameters**: ~1B (968M) +- **Architecture**: LLaMA-style Transformer with GQA (Grouped Query Attention) +- **Context Length**: 4,096 tokens +- **Training Tokens**: 25.17B +- **Final Loss**: 2.15 +- **Tokenizer**: Custom SentencePiece BPE (32K vocab) + +### Architecture Details + +| Parameter | Value | +|-----------|-------| +| Hidden Size | 2048 | +| Layers | 24 | +| Attention Heads | 16 | +| KV Heads | 4 (GQA) | +| Intermediate Size | 5504 | +| Vocab Size | 32000 | + +### Training Data + +Curated Portuguese corpus (~25B tokens): + +- monoHPLT-PT (GigaVerbo filtered) +- FineWeb-2 PT (filtered) +- BlogSet-BR (MinHash deduplicated) +- LegalPT +- Corpus Carolina + +### Training Configuration + +- **Optimizer**: AdamW +- **Learning Rate**: 1e-4 with cosine decay +- **Batch Size**: ~524K tokens/update +- **Precision**: BFloat16 +- **Hardware**: NVIDIA H200 (143GB) +- **Training Time**: ~130 hours + +### Usage + +```python +from transformers import AutoModelForCausalLM, AutoTokenizer + +model = AutoModelForCausalLM.from_pretrained("limajr/nbr-1b-base") +tokenizer = AutoTokenizer.from_pretrained("limajr/nbr-1b-base") + +text = "O Brasil e um pais" +inputs = tokenizer(text, return_tensors="pt") +outputs = model.generate(**inputs, max_new_tokens=100) +print(tokenizer.decode(outputs[0])) +``` + +## License + +Apache 2.0 diff --git a/config.json b/config.json new file mode 100644 index 0000000..ee41109 --- /dev/null +++ b/config.json @@ -0,0 +1,21 @@ +{ + "architectures": [ + "LlamaForCausalLM" + ], + "model_type": "llama", + "vocab_size": 32000, + "hidden_size": 2048, + "num_hidden_layers": 24, + "num_attention_heads": 16, + "num_key_value_heads": 16, + "intermediate_size": 5504, + "max_position_embeddings": 4096, + "rope_theta": 10000.0, + "hidden_act": "silu", + "rms_norm_eps": 1e-05, + "tie_word_embeddings": true, + "torch_dtype": "bfloat16", + "bos_token_id": 1, + "eos_token_id": 2, + "pad_token_id": 0 +} \ No newline at end of file diff --git a/model.safetensors b/model.safetensors new file mode 100644 index 0000000..9180406 --- /dev/null +++ b/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:470323e91f8d264bbf50657aab68ef6bde166414850d0dccafae32ef098362ea +size 5119574424 diff --git a/special_tokens_map.json b/special_tokens_map.json new file mode 100644 index 0000000..d3a99da --- /dev/null +++ b/special_tokens_map.json @@ -0,0 +1,6 @@ +{ + "bos_token": "", + "eos_token": "", + "unk_token": "", + "pad_token": "" +} \ No newline at end of file diff --git a/tokenizer.model b/tokenizer.model new file mode 100644 index 0000000..79eb742 --- /dev/null +++ b/tokenizer.model @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:656892a27c155313173e72879b226a27fa26bead9653dc22eb79c6c38fe157bf +size 771004 diff --git a/tokenizer_config.json b/tokenizer_config.json new file mode 100644 index 0000000..61bff88 --- /dev/null +++ b/tokenizer_config.json @@ -0,0 +1,8 @@ +{ + "tokenizer_class": "LlamaTokenizer", + "bos_token": "", + "eos_token": "", + "unk_token": "", + "pad_token": "", + "model_max_length": 4096 +} \ No newline at end of file