Compare commits
6 Commits
| Author | SHA1 | Date | |
|---|---|---|---|
|
|
207d44b8f2 | ||
|
|
1d33394dac | ||
|
|
1811a66aee | ||
|
|
12bf6d637f | ||
|
|
85c456afe0 | ||
|
|
b3b52848c2 |
54
main.py
54
main.py
@@ -195,7 +195,8 @@ def check_platform_verify(model_id: str) -> dict:
|
||||
resp = requests.get(url, headers=headers, params={'modelId': model_id}, timeout=10)
|
||||
data = resp.json()
|
||||
if data.get('code') == 0:
|
||||
return data.get('data', {}).get('verifyResult', {})
|
||||
result = data.get('data', {}).get('verifyResult', {})
|
||||
return result if isinstance(result, dict) else {}
|
||||
except Exception:
|
||||
pass
|
||||
return {}
|
||||
@@ -242,16 +243,15 @@ def check_queue_available(gpu: str, token: str) -> int:
|
||||
|
||||
|
||||
def build_config_params(gpu: str) -> str:
|
||||
"""构建 YAML 配置"""
|
||||
"""构建 YAML 配置 - 完全匹配平台自动生成的格式"""
|
||||
config = GPU_CONFIGS.get(gpu, {})
|
||||
framework = config.get('framework', 'vllm')
|
||||
docker_image = config.get('docker_image', '')
|
||||
|
||||
if framework == 'llama.cpp':
|
||||
# hygon_k100-ai 使用 llama.cpp
|
||||
params = {
|
||||
'framework': 'llama.cpp',
|
||||
'docker_image': docker_image,
|
||||
'nv_docker_image': docker_image,
|
||||
'nv_framework': 'llama.cpp',
|
||||
'api': 'completion',
|
||||
'max_tokens': 1024,
|
||||
'temperature': 0.7,
|
||||
@@ -259,21 +259,21 @@ def build_config_params(gpu: str) -> str:
|
||||
'top_p': 0.9,
|
||||
'lang': 'zh',
|
||||
'max_model_len': 4096,
|
||||
'modelFormat': 'GGUF',
|
||||
'sut_config': {
|
||||
'values': {
|
||||
'gpu_num': 1,
|
||||
'values': {
|
||||
'command': [
|
||||
'/bin/bash', '-ic',
|
||||
'llama-server --model /model --alias llm --threads 20 '
|
||||
'--n-gpu-layers 999 --prio 3 --min_p 0.01 '
|
||||
'--ctx-size 4096 --host 0.0.0.0 --port 8000 --jinja --flash-attn off'
|
||||
'llama-server', '--model', '/model', '--alias', 'llm',
|
||||
'--threads', '20', '--n-gpu-layers', '999', '--prio', '3',
|
||||
'--min_p', '0.01', '--ctx-size', '4096',
|
||||
'--host', '0.0.0.0', '--port', '8000',
|
||||
'--jinja', '--flash-attn', 'off',
|
||||
]
|
||||
}
|
||||
},
|
||||
'ref_config': {
|
||||
'gpu_num': 1,
|
||||
'values': {
|
||||
'cpu_num': 2, 'gpu_num': 1,
|
||||
'command': [
|
||||
'llama-server', '--model', '/model', '--alias', 'llm',
|
||||
'--threads', '20', '--n-gpu-layers', '999',
|
||||
@@ -281,13 +281,12 @@ def build_config_params(gpu: str) -> str:
|
||||
]
|
||||
}
|
||||
},
|
||||
'model': 'llm',
|
||||
}
|
||||
else:
|
||||
# vllm (P800, Ascend, MetaX)
|
||||
params = {
|
||||
'framework': 'vllm',
|
||||
'docker_image': docker_image,
|
||||
'nv_docker_image': docker_image,
|
||||
'nv_framework': 'vllm',
|
||||
'api': 'completion',
|
||||
'max_tokens': 1024,
|
||||
'temperature': 0.7,
|
||||
@@ -295,21 +294,9 @@ def build_config_params(gpu: str) -> str:
|
||||
'top_p': 0.9,
|
||||
'lang': 'zh',
|
||||
'max_model_len': 2048,
|
||||
'modelFormat': 'HuggingFace',
|
||||
'sut_config': {
|
||||
'values': {
|
||||
'gpu_num': 1,
|
||||
'command': [
|
||||
'/bin/bash', '-ic',
|
||||
'vllm serve /model --port 8000 --served-model-name llm '
|
||||
'--max-model-len 2048 --dtype auto --gpu-memory-utilization 0.95 '
|
||||
'-tp 1 --enforce-eager --trust-remote-code'
|
||||
]
|
||||
}
|
||||
},
|
||||
'ref_config': {
|
||||
'values': {
|
||||
'cpu_num': 2, 'gpu_num': 1,
|
||||
'command': [
|
||||
'vllm', 'serve', '/model', '--port', '8000',
|
||||
'--served-model-name', 'llm', '--max-model-len', '2048',
|
||||
@@ -318,9 +305,18 @@ def build_config_params(gpu: str) -> str:
|
||||
]
|
||||
}
|
||||
},
|
||||
'model': 'llm',
|
||||
'ref_config': {
|
||||
'gpu_num': 1,
|
||||
'values': {
|
||||
'command': [
|
||||
'vllm', 'serve', '/model', '--port', '80',
|
||||
'--served-model-name', 'llm', '--max-model-len', '4096',
|
||||
'--enforce-eager', '--trust-remote-code', '-tp', '1',
|
||||
]
|
||||
}
|
||||
return yaml.dump(params, default_flow_style=False, allow_unicode=True)
|
||||
},
|
||||
}
|
||||
return yaml.dump(params, default_flow_style=False, allow_unicode=True, width=1000)
|
||||
|
||||
|
||||
def submit_model(model_url: str, gpu: str, token: str) -> tuple:
|
||||
|
||||
Reference in New Issue
Block a user