围绕身份识别、人体2D/3D关节点和图搜万物三类能力构建,输出结构稳定,便于搜人、查人、检索、比对、复核和自动化 Agent 调用。
支持完整视频解析和已跟踪人形步态序列解析,输出人脸特征、步态特征、ReID 特征、ReID 结构化属性、情绪信息、帧号和坐标框,可用于搜人、查人、比对和业务复核。
上传同一人的有序图片序列,返回每帧 2D 关节点和 3D 关节点结果,适合姿态分析、动作理解、行为复核和后续算法处理。
上传图片并输入一句描述,自动框出图中的目标,适合快速找人、找物和图像复核。
提供面向开发者和 Agent 的公网 API。不同调用方式的鉴权和支付流程不同,但业务字段和结果结构保持一致,便于自动化系统直接解析、检索和比对。
| 我要做什么 | 推荐接口/流程 | 边界和不要误用 |
|---|---|---|
| 判断是否同一人 | 上传同一 track 的有序人体序列,调用 /v1/sequences/{task_id}/parse,读取 gait_feature、face_feature、reid_feature,同类型特征做点积。 | 不要用原始图片相似度或不同类型特征交叉比较。 |
| 我有视频,想要身份特征 | 可直接用 /v1/videos 做服务端异步解析;如果需要本地序列文件夹和 JSON,推荐先用 local_video_to_sequence_demo 再调用 Sequence API。 | 视频解析主要返回人员序列、框、身份特征、属性和情绪,不是完整关节点接口。 |
| 从视频得到每个人的 2D/3D 关节点 | 推荐本地视频预处理生成每个人的 sequence 文件夹,再逐个调用 /v1/sequences/{task_id}/gait-pose。 | 不要直接上传多人视频后期待 video parse 返回完整 pose_2ds / pose_3ds。 |
| 已有单人序列,想提取关节点 | 按序列流程上传图片,再调用 /v1/sequences/{task_id}/gait-pose。 | pose 坐标相对上传序列图片;如果是人体 crop,映射回原视频要结合 crop/meta 信息。 |
| 在图片里找目标 | 调用 /v1/object-search,传原始 image_base64 和 prompt。 | boxes 是原图像素坐标;找不到目标返回 boxes: [],不是错误。 |
创建一个步态序列解析任务,告诉服务端本次会上传多少帧图片。
POST /v1/sequences
Authorization: Bearer <api_key>
Content-Type: application/json
{
"frame_count": 12
}
返回任务 ID 和每一帧图片对应的上传地址。
{
"task_id": "seq_xxx",
"uploads": [
{
"index": 0,
"object_key": "sequences/seq_xxx/000000.jpg",
"upload_url": "/v1/uploads/seq_xxx/0?token=...",
"upload_expires_at": "2026-05-06T12:00:00Z"
},
...
]
}
客户端按 uploads 中的地址逐帧上传图片。
PUT /v1/uploads/seq_xxx/0?token=...
Content-Type: image/jpeg
<binary image bytes>
确认当前帧已经上传成功。
{
"uploaded": true
}
所有图片上传完成后,发起同步解析。
POST /v1/sequences/seq_xxx/parse
Authorization: Bearer <api_key>
Content-Type: application/json
{
"frame_count": 12,
"frames": [
{"index": 0, "object_key": "sequences/seq_xxx/000000.jpg"},
{"index": 1, "object_key": "sequences/seq_xxx/000001.jpg"},
...
]
}
返回拆分后的单人序列身份识别特征、结构化属性和情绪结果。输入一个序列也会返回数组,是因为跟踪 ID 可能在多人交叉时串到另一个人身上;内部算法会用 ReID 特征检查串框,并在串框位置拆分成多个干净的单人序列。
{
"task_id": "seq_xxx",
"status": "succeeded",
"sequence_count": 2,
"sequences": [
{
"sequence_id": "seq_xxx_split_01",
"frame_count": 6,
"frames": [
{"frame_id": 0, "box": [120, 40, 220, 260]}
],
"gait_feature": [0.12, ...],
"face_feature": [0.08, ...],
"reid_feature": [0.31, ...],
"reid_attributes": [...],
"emotions": ["neutral"]
},
{"sequence_id": "seq_xxx_split_02", "frame_count": 0, "frames": []}
]
}
frame_count 序列图片数量,用于计费和校验。uploads[].upload_url 每帧图片的上传地址。uploads[].object_key 服务端分配的帧对象地址;调用 parse 时必须原样传回 frames[].object_key。sequences 输出序列数组。一个输入序列可能因为跟踪串框被 ReID 检查拆分成多个单人序列。sequences[].frames SDK 返回的结果帧号和坐标框;如果 SDK 没有返回帧映射,则为空数组。gait_feature / face_feature / reid_feature 身份识别相关特征向量。reid_attributes / emotions 结构化属性和情绪识别结果。W-Agent 按实际处理量计费,注册用户从账户余额扣费。计费字段会出现在任务账单和使用记录中,便于系统自动对账。
购买后获得 30 天有效额度;调用时优先从套餐额度扣费,超出部分继续从充值余额按原价扣费。
为自动化 Agent 提供稳定的机器可读说明文件,便于发现服务能力、接口、认证方式、支付方式和输出字段。
Demo 包包含 API 调用示例和本地视频预处理工具。用户可直接上传视频,也可先在本地从视频抽取人员序列,再用注册或匿名序列接口上传。