初始化项目,由ModelHub XC社区提供模型

Model: Bingsu/bigbird_ko_base-tsdae-specialty_corpus
Source: Original Platform
This commit is contained in:
ModelHub XC
2026-07-05 12:56:18 +08:00
commit d74ef552c3
11 changed files with 100745 additions and 0 deletions

32
.gitattributes vendored Normal file
View File

@@ -0,0 +1,32 @@
*.7z filter=lfs diff=lfs merge=lfs -text
*.arrow filter=lfs diff=lfs merge=lfs -text
*.bin filter=lfs diff=lfs merge=lfs -text
*.bz2 filter=lfs diff=lfs merge=lfs -text
*.ftz filter=lfs diff=lfs merge=lfs -text
*.gz filter=lfs diff=lfs merge=lfs -text
*.h5 filter=lfs diff=lfs merge=lfs -text
*.joblib filter=lfs diff=lfs merge=lfs -text
*.lfs.* filter=lfs diff=lfs merge=lfs -text
*.model filter=lfs diff=lfs merge=lfs -text
*.msgpack filter=lfs diff=lfs merge=lfs -text
*.npy filter=lfs diff=lfs merge=lfs -text
*.npz filter=lfs diff=lfs merge=lfs -text
*.onnx filter=lfs diff=lfs merge=lfs -text
*.ot filter=lfs diff=lfs merge=lfs -text
*.parquet filter=lfs diff=lfs merge=lfs -text
*.pb filter=lfs diff=lfs merge=lfs -text
*.pickle filter=lfs diff=lfs merge=lfs -text
*.pkl filter=lfs diff=lfs merge=lfs -text
*.pt filter=lfs diff=lfs merge=lfs -text
*.pth filter=lfs diff=lfs merge=lfs -text
*.rar filter=lfs diff=lfs merge=lfs -text
saved_model/**/* filter=lfs diff=lfs merge=lfs -text
*.tar.* filter=lfs diff=lfs merge=lfs -text
*.tflite filter=lfs diff=lfs merge=lfs -text
*.tgz filter=lfs diff=lfs merge=lfs -text
*.wasm filter=lfs diff=lfs merge=lfs -text
*.xz filter=lfs diff=lfs merge=lfs -text
*.zip filter=lfs diff=lfs merge=lfs -text
*.zst filter=lfs diff=lfs merge=lfs -text
*tfevents* filter=lfs diff=lfs merge=lfs -text
pytorch_model.bin filter=lfs diff=lfs merge=lfs -text

7
1_Pooling/config.json Normal file
View File

@@ -0,0 +1,7 @@
{
"word_embedding_dimension": 256,
"pooling_mode_cls_token": true,
"pooling_mode_mean_tokens": false,
"pooling_mode_max_tokens": false,
"pooling_mode_mean_sqrt_len_tokens": false
}

159
README.md Normal file
View File

@@ -0,0 +1,159 @@
---
pipeline_tag: sentence-similarity
tags:
- sentence-transformers
- feature-extraction
- sentence-similarity
- transformers
widget:
source_sentence: "수치 해석 프로그램은 여러 가지 환경 변수를 입력해야 하므로 일반인이 사용하기에는 많은 어려움이 있다."
sentences:
- "이러한 해석방법은 매우 복잡한 것이어서 수치 해석 프로그램이 필수적 이다."
- "계층구조 셀룰라 시스템을 구성하고 제안된 기법을 적용하면 어느 곳에 위치한 사용자에게나 양질의 서비스를 효율적으로 제공할 수 있음을 확인하였다."
- "허깅페이스에 한국어 모델이 더 많아졌으면 좋겠다."
language: ko
license: mit
---
# Bingsu/bigbird_ko_base-tsdae-specialty_corpus
[sentence-transformers](https://www.SBERT.net)로 학습된 bigbird 모델: 입력 문장을 256벡터로 변환합니다.
[Aihub 전문분야 말뭉치](https://aihub.or.kr/aihubdata/data/view.do?currMenu=115&topMenu=100&aihubDataSe=realm&dataSetSn=110)에 대해
[TSDAE](https://www.sbert.net/examples/unsupervised_learning/TSDAE/README.html)로 학습되었습니다.
<!--- Describe your model here -->
## Usage (Sentence-Transformers)
사용 전에 [sentence-transformers](https://www.SBERT.net)를 설치하세요.
```sh
pip install -U sentence-transformers
```
또는
```sh
conda install -c conda-forge sentence-transformers
```
사용 예제:
```python
from sentence_transformers import util
sent = [
"본 논문은 디지털 신호처리용 VLSI의 자동설계를 위한 SODAS-DSP(SOgang Design Automation System-DSP) 시스템의 설계와 개발 결과에 대하여 기술한다",
"본 논문에서는 DD-Gardner방식의 타이밍 검출기 성능을 고찰한다.",
"이러한 해석방법은 매우 복잡한 것이어서 수치 해석 프로그램이 필수적 이다.",
"수치 해석 프로그램은 여러 가지 환경 변수를 입력해야 하므로 일반인이 사용하기에는 많은 어려움이 있다.",
"또 산란과 투과에 대한 고주파 근사식도 얻어진다.",
"그리고 슬릿간의 간격의 변화에 의해서 빔폭(beamwidth)을 조절할 수 있음을 보여준다.",
"오늘 점심은 짜장면이다.",
"오늘 저녁은 김밥천국이다."
]
paraphrases = util.paraphrase_mining(model, sent)
for paraphrase in paraphrases[:5]:
score, i, j = paraphrase
print("{} \t\t {} \t\t Score: {:.4f}".format(sent[i], sent[j], score))
```
```
이러한 해석방법은 매우 복잡한 것이어서 수치 해석 프로그램이 필수적 이다. 수치 해석 프로그램은 여러 가지 환경 변수를 입력해야 하므로 일반인이 사용하기에는 많은 어려움이 있다. Score: 0.8990
오늘 점심은 짜장면이다. 오늘 저녁은 김밥천국이다. Score: 0.8945
수치 해석 프로그램은 여러 가지 환경 변수를 입력해야 하므로 일반인이 사용하기에는 많은 어려움이 있다. 오늘 저녁은 김밥천국이다. Score: 0.8901
본 논문은 디지털 신호처리용 VLSI의 자동설계를 위한 SODAS-DSP(SOgang Design Automation System-DSP) 시스템의 설계와 개발 결과에 대하여 기술한다 본 논문에서는 DD-Gardner방식의 타이밍 검출기 성능을 고찰한다. Score: 0.8894
본 논문은 디지털 신호처리용 VLSI의 자동설계를 위한 SODAS-DSP(SOgang Design Automation System-DSP) 시스템의 설계와 개발 결과에 대하여 기술한다 그리고 슬릿간의 간격의 변화에 의해서 빔폭(beamwidth)을 조절할 수 있음을 보여준다. Score: 0.8889
```
## Usage (HuggingFace Transformers)
Without [sentence-transformers](https://www.SBERT.net), you can use the model like this: First, you pass your input through the transformer model, then you have to apply the right pooling-operation on-top of the contextualized word embeddings.
```python
from transformers import AutoTokenizer, AutoModel
import torch
def cls_pooling(model_output, attention_mask):
return model_output[0][:,0]
# Sentences we want sentence embeddings for
sentences = ['This is an example sentence', 'Each sentence is converted']
# Load model from HuggingFace Hub
tokenizer = AutoTokenizer.from_pretrained('Bingsu/bigbird_ko_base-tsdae-specialty_corpus')
model = AutoModel.from_pretrained('Bingsu/bigbird_ko_base-tsdae-specialty_corpus')
# Tokenize sentences
encoded_input = tokenizer(sentences, padding=True, truncation=True, return_tensors='pt')
# Compute token embeddings
with torch.no_grad():
model_output = model(**encoded_input)
# Perform pooling. In this case, cls pooling.
sentence_embeddings = cls_pooling(model_output, encoded_input['attention_mask'])
print("Sentence embeddings:")
print(sentence_embeddings)
```
## Evaluation Results
<!--- Describe how your model was evaluated -->
For an automated evaluation of this model, see the *Sentence Embeddings Benchmark*: [https://seb.sbert.net](https://seb.sbert.net?model_name=Bingsu/bigbird_ko_base-tsdae-specialty_corpus)
## Training
The model was trained with the parameters:
**DataLoader**:
`torch.utils.data.dataloader.DataLoader` of length 183287 with parameters:
```
{'batch_size': 8, 'sampler': 'torch.utils.data.sampler.RandomSampler', 'batch_sampler': 'torch.utils.data.sampler.BatchSampler'}
```
**Loss**:
`sentence_transformers.losses.DenoisingAutoEncoderLoss.DenoisingAutoEncoderLoss`
Parameters of the fit()-Method:
```
{
"epochs": 2,
"evaluation_steps": 10000,
"evaluator": "sentence_transformers.evaluation.EmbeddingSimilarityEvaluator.EmbeddingSimilarityEvaluator",
"max_grad_norm": 1,
"optimizer_class": "<class 'bitsandbytes.optim.adamw.AdamW8bit'>",
"optimizer_params": {
"lr": 3e-05
},
"scheduler": "warmupcosinewithhardrestarts",
"steps_per_epoch": null,
"warmup_steps": 10000,
"weight_decay": 0.005
}
```
## Full Model Architecture
```
SentenceTransformer(
(0): Transformer({'max_seq_length': 1024, 'do_lower_case': False}) with Transformer model: BigBirdModel
(1): Pooling({'word_embedding_dimension': 256, 'pooling_mode_cls_token': True, 'pooling_mode_mean_tokens': False, 'pooling_mode_max_tokens': False, 'pooling_mode_mean_sqrt_len_tokens': False})
)
```
## Citing & Authors
<!--- Describe where people can find more information -->

35
config.json Normal file
View File

@@ -0,0 +1,35 @@
{
"_name_or_path": "output/bigbird_model-tsdae-8-2022-08-25_14-09-38/",
"architectures": [
"BigBirdModel"
],
"attention_probs_dropout_prob": 0.1,
"attention_type": "block_sparse",
"block_size": 64,
"bos_token_id": 0,
"classifier_dropout": null,
"eos_token_id": 2,
"gradient_checkpointing": false,
"hidden_act": "gelu_new",
"hidden_dropout_prob": 0.1,
"hidden_size": 256,
"initializer_range": 0.02,
"intermediate_size": 3072,
"layer_norm_eps": 1e-12,
"max_position_embeddings": 1024,
"model_type": "big_bird",
"num_attention_heads": 4,
"num_hidden_layers": 12,
"num_random_blocks": 3,
"pad_token_id": 1,
"position_embedding_type": "absolute",
"rescale_embeddings": false,
"sep_token_id": 2,
"tokenizer_class": "BigBirdTokenizer",
"torch_dtype": "float32",
"transformers_version": "4.21.1",
"type_vocab_size": 2,
"use_bias": true,
"use_cache": true,
"vocab_size": 50265
}

View File

@@ -0,0 +1,7 @@
{
"__version__": {
"sentence_transformers": "2.2.2",
"transformers": "4.21.1",
"pytorch": "1.12.1"
}
}

14
modules.json Normal file
View File

@@ -0,0 +1,14 @@
[
{
"idx": 0,
"name": "0",
"path": "",
"type": "sentence_transformers.models.Transformer"
},
{
"idx": 1,
"name": "1",
"path": "1_Pooling",
"type": "sentence_transformers.models.Pooling"
}
]

3
pytorch_model.bin Normal file
View File

@@ -0,0 +1,3 @@
version https://git-lfs.github.com/spec/v1
oid sha256:26377632af50c28dc86684efcff91c2c2dd1baf1cd6ed29cdd5cd34358a5c302
size 141199089

View File

@@ -0,0 +1,4 @@
{
"max_seq_length": 1024,
"do_lower_case": false
}

51
special_tokens_map.json Normal file
View File

@@ -0,0 +1,51 @@
{
"bos_token": {
"content": "<s>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
},
"cls_token": {
"content": "<s>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
},
"eos_token": {
"content": "</s>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
},
"mask_token": {
"content": "<mask>",
"lstrip": true,
"normalized": true,
"rstrip": false,
"single_word": false
},
"pad_token": {
"content": "<pad>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
},
"sep_token": {
"content": "</s>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
},
"unk_token": {
"content": "<unk>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
}
}

100371
tokenizer.json Normal file

File diff suppressed because it is too large Load Diff

62
tokenizer_config.json Normal file
View File

@@ -0,0 +1,62 @@
{
"bos_token": {
"__type": "AddedToken",
"content": "<s>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
},
"cls_token": {
"__type": "AddedToken",
"content": "<s>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
},
"eos_token": {
"__type": "AddedToken",
"content": "</s>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
},
"mask_token": {
"__type": "AddedToken",
"content": "<mask>",
"lstrip": true,
"normalized": true,
"rstrip": false,
"single_word": false
},
"model_max_length": 4096,
"name_or_path": "output/bigbird_model-tsdae-8-2022-08-25_14-09-38/",
"pad_token": {
"__type": "AddedToken",
"content": "<pad>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
},
"sep_token": {
"__type": "AddedToken",
"content": "</s>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
},
"special_tokens_map_file": "bigbird_model\\special_tokens_map.json",
"tokenizer_class": "BigBirdTokenizer",
"unk_token": {
"__type": "AddedToken",
"content": "<unk>",
"lstrip": false,
"normalized": true,
"rstrip": false,
"single_word": false
}
}