跳到主要内容

创建 Spark 向量去重任务 (V2)

This operation creates a vector deduplication job.

POST/v2/projects/{projectId}/jobs/dedup/vector
连接端点

该 API 的 Base URL 格式如下:

https://api.cloud.zilliz.com

📘说明

控制面接口速率限制为单用户单接口每秒最多 20 个请求。

shell
export BASE_URL="https://api.cloud.zilliz.com"
参数
Authorizationstringheader必填项

认证令牌,应为具备适当权限的 API 密钥。

示例值:Bearer {{TOKEN}}
Idempotency-Keystringheader

用于确保重复创建请求幂等的唯一键。

示例值:spark-job-20260814-001
projectIdstringpath必填项

项目 ID。

示例值:proj-xxxxxxxxxxxxxxxxxxxx
请求体
descriptionstring

任务描述。

regionIdstring必填项

云地域 ID。

inputobject

Spark 任务的数据资源(输入或输出)引用。

typestring必填项

数据资源类型。

volumeNamestring必填项

存储卷名称。

pathstring必填项

数据在存储卷内的路径。

formatstring

数据格式。

writeModestring

写入模式。

dbNamestring

数据库名称。

collectionNamestring

集合名称。

outputobject

Spark 任务的数据资源(输入或输出)引用。

typestring必填项

数据资源类型。

volumeNamestring必填项

存储卷名称。

pathstring必填项

数据在存储卷内的路径。

formatstring

数据格式。

writeModestring

写入模式。

dbNamestring

数据库名称。

collectionNamestring

集合名称。

resourceSizestring

任务的资源规格。

timeoutSecondsinteger

超时时间(秒)。

primaryKeyFieldstring必填项

主键字段。

vectorFieldstring必填项

向量字段。

keepBystring

保留哪条重复记录。

metricstring

距离度量方式。

similarityThresholdnumber<double>

相似度阈值。

numClustersinteger

簇数量。

outputModestring

输出模式。

targetDedupRatenumber<double>

目标去重率。

Create Spark Jobbash
export TOKEN="YOUR_API_KEY"
export projectId="proj-xxxxxxxxxxxxxxxxxxxx"

curl --request POST \
--url "${BASE_URL}/v2/projects/${projectId}/jobs/dedup/vector" \
--header "Authorization: Bearer ${TOKEN}" \
--header "Idempotency-Key: spark-job-20260814-001" \
--header "Request-Timeout: 5" \
--header "Content-Type: application/json" \
-d '{
"description": "Daily vector processing job.",
"regionId": "ali-cn-hangzhou",
"input": {
"type": "VOLUME",
"volumeName": "volume-xxxxxxxxxxxxxxxxxxx",
"path": "/input/data.parquet",
"format": "parquet"
},
"output": {
"type": "VOLUME",
"volumeName": "volume-xxxxxxxxxxxxxxxxxxx",
"path": "/output/results",
"format": "parquet",
"writeMode": "OVERWRITE"
},
"resourceSize": "medium",
"timeoutSeconds": 3600,
"primaryKeyField": "id",
"vectorField": "embedding",
"keepBy": "updated_at:max",
"metric": "L2",
"similarityThreshold": 0.1,
"outputMode": "DEDUPLICATED",
"targetDedupRate": 0.2
}'
响应

返回已创建的 Spark 任务。

成功响应。

codeinteger

响应码。

示例值:0
dataobject

Spark 批处理任务的摘要信息。

jobIdstring必填项

任务 ID。

projectIdstring必填项

任务所属的项目 ID。

typestring必填项

任务类型。

descriptionstring

任务描述。

statusstring必填项

任务状态。

regionIdstring必填项

云地域 ID。

clusterIdstring

集群 ID。

createdAtstring

创建时间(ISO 8601)。

startedAtstring

开始时间(ISO 8601)。

finishedAtstring

结束时间(ISO 8601)。

durationSecondsinteger<int64>

持续时间(秒)。

失败响应。

codeinteger

响应码。

messagestring

错误描述。

Successjson
{
"code": 0,
"data": {
"jobId": "job-xxxxxxxxxxxxxxxxxx",
"sparkInstanceId": "sp-xxxxxxxxxxxxxxxxxx",
"type": "SPARK",
"jobName": "daily-vector-job",
"status": "PENDING",
"regionId": "ali-cn-hangzhou",
"projectId": "proj-xxxxxxxxxxxxxxxxxxx"
}
}
Ctrl I