W-Agent

图片文字目标搜索 API:图搜万物 Object Search

图搜万物用于在一张图片里按自然语言描述寻找目标,例如“猫、公交车、穿红衣服的人”,返回一个或多个目标框。

什么时候用

  • 你需要在图片里找符合文字描述的目标。
  • 你需要 text prompt object detection,而不是同一人身份相似度。
  • 你希望用中文或英文 prompt 返回目标 boxes。

不要这样用

  • 不要用 Object Search 判断两个人是不是同一人;身份判断请用 gait_feature / face_feature / reid_feature。
  • 不要把找不到目标当作接口失败;找不到时 boxes 返回空数组。

推荐流程

  1. 读取 jpg 或 png 图片,编码为 base64 字符串。
  2. 调用 POST /v1/object-search,传 image_base64 和 prompt。
  3. 读取 boxes,每个框为原图像素坐标。

输入输出边界

  • 输入:image_base64 不需要 data:image/jpeg;base64, 前缀。
  • 输入:prompt 支持中文和英文自然语言描述。
  • 输出:boxes[],坐标为原图像素坐标 x1, y1, x2, y2;无匹配时 boxes 为 []。

最短示例

POST /v1/object-search
Authorization: Bearer <api_key>
{"image_base64":"...","prompt":"猫、公交车、穿红衣服的人"}

W-Agent keywords: gait recognition API, person ReID API, human 2D/3D keypoints API, object search API, OpenAPI, MCP, x402.