53 lines
1.8 KiB
Markdown
53 lines
1.8 KiB
Markdown
# xc_validation_strategy_vllm_stop
|
|
|
|
用于依次停止以下账号中,状态严格为 `waiting` 且 GPU 类型严格为 `Sunrise_pt-200-x1` 的 ModelHub XC 验证任务:
|
|
|
|
- `jiangxiaowen`
|
|
- `l112233`
|
|
- `l11223344`
|
|
|
|
策略在运行时使用每个账号自己的 `xc-Token` 分页查询任务,并对返回记录再次校验 `userAccount`、`status` 和 `gpuType`。其他 GPU 类型以及非 `waiting` 状态的任务不会进入停止请求。
|
|
|
|
2026-08-10 部署前只读核验结果:
|
|
|
|
| 账号 | `Sunrise_pt-200-x1` waiting 数量 |
|
|
| --- | ---: |
|
|
| `jiangxiaowen` | 866 |
|
|
| `l112233` | 1400 |
|
|
| `l11223344` | 619 |
|
|
| 合计 | 2885 |
|
|
|
|
服务启动后按账号及每批 50 条调用:
|
|
|
|
```text
|
|
PUT /api/async/task/stop-create-contest-task
|
|
{"taskIds": [任务 ID, ...]}
|
|
```
|
|
|
|
停止请求完成后,进程继续运行,以便平台通过健康检查和状态接口读取执行结果。
|
|
|
|
## 可选配置
|
|
|
|
| 变量 | 默认值 | 说明 |
|
|
| --- | --- | --- |
|
|
| `BASE_URL` | `https://modelhub.org.cn` | ModelHub 服务地址。 |
|
|
| `BATCH_SIZE` | `50` | 每个停止请求包含的任务数。 |
|
|
| `MAX_RETRIES` | `3` | 单批任务的最大请求次数。 |
|
|
| `REQUEST_TIMEOUT` | `30` | 单次请求超时(秒)。 |
|
|
| `PORT` | `8080` | HTTP 服务端口。 |
|
|
|
|
## 平台运行接口
|
|
|
|
- `GET /health`:存活探针,成功返回 `{"status":"ok"}`。
|
|
- `GET /status`:返回目标 GPU、总体及每个账号的成功/失败数量、失败任务 ID 和错误信息。
|
|
|
|
## 运行与构建
|
|
|
|
仓库根目录的 `Dockerfile` 使用平台 Python 基础镜像,暴露 `8080` 端口并以 `python main.py` 启动。构建成功后,策略会按 `jiangxiaowen → l112233 → l11223344` 的顺序逐账号处理。
|
|
|
|
```bash
|
|
python main.py
|
|
curl http://127.0.0.1:8080/health
|
|
curl http://127.0.0.1:8080/status
|
|
```
|