HAI-Platform API完全手册:开发者必备的接口调用指南

📅 2026/7/27 17:32:52 👁️ 阅读次数 📝 编程学习
HAI-Platform API完全手册:开发者必备的接口调用指南

HAI-Platform API完全手册:开发者必备的接口调用指南

【免费下载链接】hai-platform一种任务级GPU算力分时调度的高性能深度学习训练平台项目地址: https://gitcode.com/gh_mirrors/ha/hai-platform

HAI-Platform(GitHub 加速计划)是一种任务级GPU算力分时调度的高性能深度学习训练平台,提供了丰富的API接口帮助开发者高效管理和监控训练任务。本指南将带你快速掌握API的核心功能、调用方法和最佳实践,让你轻松上手GPU算力调度与任务管理。

🚀 API架构概览:核心模块与调用流程

HAI-Platform的API系统采用分层设计,主要包含任务管理、训练控制、资源监控三大核心模块。通过这些接口,开发者可以实现从任务创建到资源监控的全流程管理。

核心API模块路径

  • 任务管理API:client/api/experiment_api.py
  • 训练控制API:client/api/training_api.py
  • 资源监控API:monitor/monitor_data/

🔑 快速入门:API调用三步骤

1️⃣ 环境准备

首先确保已安装HAI-Platform客户端:

git clone https://gitcode.com/gh_mirrors/ha/hai-platform cd hai-platform/client bash install.sh

2️⃣ 认证配置

API调用需要通过token进行身份验证,配置方法:

from hfai.client.api_config import set_mars_token set_mars_token("your_token_here") # 从平台控制台获取

3️⃣ 基本调用模式

所有API采用异步调用方式,基本格式如下:

import asyncio from hfai.client import get_experiment async def main(): experiment = await get_experiment(id=12345) # 获取任务信息 print(experiment.nb_name, experiment.status) asyncio.run(main())

📊 任务管理API:从创建到销毁的全生命周期

创建训练任务

使用create_experiment接口创建任务,支持YAML配置文件或直接传入配置字典:

from hfai.client import create_experiment config = """ version: 2 name: ResNet50_train priority: 20 spec: workspace: /path/to/code entrypoint: train.py parameters: --epochs 100 --batch_size 64 resource: node_count: 2 group: jd_a100#heavy """ task = asyncio.run(create_experiment(config)) print(f"任务创建成功,ID: {task.id}")

配置详情可参考官方文档示例

查询任务列表

通过get_experiments接口批量获取任务信息,支持分页和多条件筛选:

total, tasks = asyncio.run(get_experiments( page=1, page_size=10, nb_name_pattern="ResNet", # 按名称模糊搜索 queue_status_list=["running", "pending"] # 筛选运行中/待调度任务 )) print(f"共找到{total}个任务") for task in tasks: print(f"{task.id}: {task.nb_name} ({task.queue_status})")

任务操作接口

接口功能示例
stop()终止任务await experiment.stop()
suspend()挂起任务await experiment.suspend(restart_delay=3600)
set_priority()修改优先级await experiment.set_priority(EXP_PRIORITY.HIGH)
tag_task()添加标签await experiment.tag_task("production")

⚙️ 训练控制API:精细化任务调节

运行时状态管理

HAI-Platform提供了多种接口用于训练过程中的动态调节:

设置超时监控
from hfai.client import set_watchdog_time # 设置1800秒无日志自动失败 set_watchdog_time(1800)
优雅处理任务中断
from hfai.client import receive_suspend_command, go_suspend while training: # 检查是否收到挂起命令 if receive_suspend_command(): save_checkpoint() # 保存模型 checkpoint go_suspend() # 通知平台可以挂起 break # 训练迭代...

优先级动态调整

根据任务紧急程度实时调整优先级:

from hfai.client import set_priority, EXP_PRIORITY # 将任务优先级提升为高 set_priority(EXP_PRIORITY.HIGH)

📈 监控与日志API:实时掌握训练状态

获取任务日志

通过log_ng接口获取指定rank的训练日志,支持增量获取:

# 获取rank 0的最新日志 log_data = await experiment.log_ng(rank=0, last_seen=experiment.last_seen) print(log_data['data']) # 日志内容 experiment.last_seen = log_data['last_seen'] # 更新上次查看位置

性能监控

实时获取GPU/CPU使用率等性能指标:

# 获取当前性能数据 perf_data = await experiment.get_latest_point() print(f"GPU使用率: {perf_data['gpu']['utilization']}%") print(f"内存使用: {perf_data['memory']['used']}/{perf_data['memory']['total']} MB")

💡 最佳实践与常见问题

任务优先级策略

  • 非紧急任务使用EXP_PRIORITY.LOW(20)
  • 生产环境任务使用EXP_PRIORITY.HIGH(40)
  • 资源紧张时可通过set_priority动态调整

处理网络异常

API调用建议添加重试机制:

async def safe_api_call(coro, max_retries=3): for i in range(max_retries): try: return await coro except Exception as e: if i == max_retries - 1: raise await asyncio.sleep(2 ** i) # 指数退避 # 使用示例 task = await safe_api_call(get_experiment(id=12345))

常见错误码

错误码含义解决方案
1001权限不足检查token有效性或联系管理员
2002资源不足降低节点数或调整优先级
3003参数错误检查配置文件格式

📚 更多资源

  • 完整API文档:docs/api/client.html
  • 示例代码库:examples/
  • 配置模板:conf/proj_conf/

通过本指南,你已经掌握了HAI-Platform API的核心使用方法。无论是简单的任务管理还是复杂的训练控制,这些接口都能帮助你高效利用GPU算力资源。开始探索吧!

【免费下载链接】hai-platform一种任务级GPU算力分时调度的高性能深度学习训练平台项目地址: https://gitcode.com/gh_mirrors/ha/hai-platform

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考