创建 Spark 向量去重任务 (V2)
This operation creates a vector deduplication job.
POST/v2/projects/{projectId}/jobs/dedup/vector
该 API 的 Base URL 格式如下:
https://api.cloud.zilliz.com
📘说明
控制面接口速率限制为单用户单接口每秒最多 20 个请求。
shell
export BASE_URL="https://api.cloud.zilliz.com"
参数
Authorizationstringheader必填项
认证令牌,应为具备适当权限的 API 密钥。
示例值:Bearer {{TOKEN}}
Idempotency-Keystringheader
用于确保重复创建请求幂等的唯一键。
示例值:spark-job-20260814-001
projectIdstringpath必填项
项目 ID。
示例值:proj-xxxxxxxxxxxxxxxxxxxx
请求体application/json
descriptionstring
任务描述。
regionIdstring必填项
云地域 ID。
inputobject
Spark 任务的数据资源(输入或输出)引用。
typestring必填项
数据资源类型。
volumeNamestring必填项
存储卷名称。
pathstring必填项
数据在存储卷内的路径。
formatstring
数据格式。
writeModestring
写入模式。
dbNamestring
数据库名称。
collectionNamestring
集合名称。
outputobject
Spark 任务的数据资源(输入或输出)引用。
typestring必填项
数据资源类型。
volumeNamestring必填项
存储卷名称。
pathstring必填项
数据在存储卷内的路径。
formatstring
数据格式。
writeModestring
写入模式。
dbNamestring
数据库名称。
collectionNamestring
集合名称。
resourceSizestring
任务的资源规格。
timeoutSecondsinteger
超时时间(秒)。
primaryKeyFieldstring必填项
主键字段。
vectorFieldstring必填项
向量字段。
keepBystring
保留哪条重复记录。
metricstring
距离度量方式。
similarityThresholdnumber<double>
相似度阈值。
numClustersinteger
簇数量。
outputModestring
输出模式。
targetDedupRatenumber<double>
目标去重率。
Create Spark Jobbash
export TOKEN="YOUR_API_KEY"
export projectId="proj-xxxxxxxxxxxxxxxxxxxx"
curl --request POST \
--url "${BASE_URL}/v2/projects/${projectId}/jobs/dedup/vector" \
--header "Authorization: Bearer ${TOKEN}" \
--header "Idempotency-Key: spark-job-20260814-001" \
--header "Request-Timeout: 5" \
--header "Content-Type: application/json" \
-d '{
"description": "Daily vector processing job.",
"regionId": "ali-cn-hangzhou",
"input": {
"type": "VOLUME",
"volumeName": "volume-xxxxxxxxxxxxxxxxxxx",
"path": "/input/data.parquet",
"format": "parquet"
},
"output": {
"type": "VOLUME",
"volumeName": "volume-xxxxxxxxxxxxxxxxxxx",
"path": "/output/results",
"format": "parquet",
"writeMode": "OVERWRITE"
},
"resourceSize": "medium",
"timeoutSeconds": 3600,
"primaryKeyField": "id",
"vectorField": "embedding",
"keepBy": "updated_at:max",
"metric": "L2",
"similarityThreshold": 0.1,
"outputMode": "DEDUPLICATED",
"targetDedupRate": 0.2
}'
响应201 Created - application/json
返回已创建的 Spark 任务。
成功响应。
codeinteger
响应码。
示例值:0
dataobject
Spark 批处理任务的摘要信息。
jobIdstring必填项
任务 ID。
projectIdstring必填项
任务所属的项目 ID。
typestring必填项
任务类型。
descriptionstring
任务描述。
statusstring必填项
任务状态。
regionIdstring必填项
云地域 ID。
clusterIdstring
集群 ID。
createdAtstring
创建时间(ISO 8601)。
startedAtstring
开始时间(ISO 8601)。
finishedAtstring
结束时间(ISO 8601)。
durationSecondsinteger<int64>
持续时间(秒)。
失败响应。
codeinteger
响应码。
messagestring
错误描述。
Successjson
{
"code": 0,
"data": {
"jobId": "job-xxxxxxxxxxxxxxxxxx",
"sparkInstanceId": "sp-xxxxxxxxxxxxxxxxxx",
"type": "SPARK",
"jobName": "daily-vector-job",
"status": "PENDING",
"regionId": "ali-cn-hangzhou",
"projectId": "proj-xxxxxxxxxxxxxxxxxxx"
}
}