W-Agent

视频中每个人的 2D/3D 关节点提取 API

W-Agent 推荐先在本地把视频检测跟踪成单人 sequence,再上传每个 sequence 调用 gait-pose,得到每帧 17 个 COCO 2D/3D 关节点。

什么时候用

  • 你有监控视频、行人视频或运动视频,需要每个人的 2D/3D 人体关节点。
  • 你需要把每个 track 的图片、meta 信息、pose JSON 或 CSV 放在同一个输出目录。
  • 你希望 agent 或脚本稳定处理多人视频,并把每个人拆成独立 sequence。

不要这样用

  • 不要把 crop 图上的 pose 坐标直接当作原始视频整帧坐标;映射回原视频需要 crop_x / crop_y 等 meta 信息。

推荐流程

  1. 下载或使用 GitHub examples 里的 local_video_to_sequence_demo。
  2. 本地对视频做 person detection 和 tracking,生成每个人的 sequence 文件夹。
  3. 调用 POST /v1/sequences 创建上传任务,PUT 上传每帧图片。
  4. 调用 POST /v1/sequences/{task_id}/gait-pose,读取 pose_2ds 和 pose_3ds。

输入输出边界

  • 输入:同一人的有序人体图片序列,推荐是按时间顺序保存的 crop 图。
  • 输出:pose_2ds[i] 对应第 i 帧,包含 17 个 COCO 点,每点为 x, y, score。
  • 输出:pose_3ds[i] 对应第 i 帧,包含 17 个 3D 点,每点为 x, y, z。

最短示例

Edit API_KEY near the top of the Python demo, then run:
python3 examples/registered/python/local_video_to_sequence_demo/local_video_to_sequence_api_demo.py input.mp4

W-Agent keywords: gait recognition API, person ReID API, human 2D/3D keypoints API, object search API, OpenAPI, MCP, x402.