网页采集
采集公开网页并返回 Markdown 或结构化 JSON。
文档 ID:
agent.collection.task.raw_html_v1输入
urls必填 · url_list网页链接
默认:output_format可选 · select输出格式
默认: markdown · 允许值: markdown, json最小调用
estimate_collection{
"input": {
"output_format": "markdown",
"urls": [
"https://example.com/"
]
},
"task_code": "raw_html_v1",
"task_query": "获取 https://example.com/ 的网页内容"
}结果与分页
- mode:
none - 每个成功 URL 2 Credits;预计 5–90 秒。
只有下方列出的字段属于稳定结果契约。
| 路径 | 类型 | 说明 |
|---|---|---|
meta.request_id | string | 用于追踪的 Asklear 请求 ID。 |
meta.api_name | string | 实际执行的采集操作名称。 |
meta.latency_ms | integer | 采集执行耗时(毫秒)。 |
meta.credits_charged | integer | 本任务按每个成功 URL 结算的 Asklear Credits。 |
data.documents | array<object> | 每个提交 URL 对应一个结果文档。 |
data.documents[].url | string | 规范化后的提交 URL。 |
data.documents[].status | enum | succeeded 或 failed。 |
data.documents[].format | enum | markdown 或 json。 |
data.documents[].content | string | format 为 markdown 且 status 为 succeeded 时的 Markdown 内容。 |
data.documents[].elements | array<object> | format 为 json 且 status 为 succeeded 时的结构化元素。 |
data.documents[].elements[].type | string | 元素类型,例如可见 HTML 标签。 |
data.documents[].elements[].text | string | 元素的可见文本。 |
data.documents[].elements[].metadata | object | 有界元素元数据;当前包含来源标签。 |
data.documents[].error_code | string | 失败文档的稳定错误码;当前为 collection_failed。 |