跳到正文

网页采集

采集公开网页并返回 Markdown 或结构化 JSON。

输入

urls必填 · url_list

网页链接

默认:
output_format可选 · select

输出格式

默认: markdown · 允许值: markdown, json

最小调用

estimate_collection
{
  "input": {
    "output_format": "markdown",
    "urls": [
      "https://example.com/"
    ]
  },
  "task_code": "raw_html_v1",
  "task_query": "获取 https://example.com/ 的网页内容"
}

结果与分页

  • mode: none
  • 每个成功 URL 2 Credits;预计 5–90 秒。

只有下方列出的字段属于稳定结果契约。

路径类型说明
meta.request_idstring用于追踪的 Asklear 请求 ID。
meta.api_namestring实际执行的采集操作名称。
meta.latency_msinteger采集执行耗时(毫秒)。
meta.credits_chargedinteger本任务按每个成功 URL 结算的 Asklear Credits。
data.documentsarray<object>每个提交 URL 对应一个结果文档。
data.documents[].urlstring规范化后的提交 URL。
data.documents[].statusenumsucceeded 或 failed。
data.documents[].formatenummarkdown 或 json。
data.documents[].contentstringformat 为 markdown 且 status 为 succeeded 时的 Markdown 内容。
data.documents[].elementsarray<object>format 为 json 且 status 为 succeeded 时的结构化元素。
data.documents[].elements[].typestring元素类型,例如可见 HTML 标签。
data.documents[].elements[].textstring元素的可见文本。
data.documents[].elements[].metadataobject有界元素元数据;当前包含来源标签。
data.documents[].error_codestring失败文档的稳定错误码;当前为 collection_failed。