网页内容采集助手学习研究 / Skill
网页内容采集助手
把公开网页、讨论串或视频页面中的主要内容保存为结构清楚的 Markdown,并保留必要元数据。适合需要离线整理网页资料、归档文章或把在线内容转成可检索文本。
技能说明
网页内容采集助手
这个 Skill 能做什么
把公开网页、讨论串或视频页面中的主要内容保存为结构清楚的 Markdown,并保留必要元数据。
完成任务时重点处理:
- 正文提取与导航广告清理
- 标题、作者、日期、来源和链接保留
- 登录、动态加载与交互页面处理
最终目标不是堆出一份看似完整的内容,而是交付能够直接使用、继续修改并清楚验收的结果。
什么时候使用
- 需要离线整理网页资料、归档文章或把在线内容转成可检索文本。
- 用户需要把公开网页、讨论串或视频页面中的主要内容保存为结构清楚的 Markdown,并保留必要元数据。
- 任务需要同时控制正文提取与导航广告清理、标题、作者、日期、来源和链接保留。
如果遇到登录或验证码时请求用户完成交互,不尝试绕过访问控制,先处理前置条件,不要直接假装任务已经完成。
开始前需要什么
优先收集:
1. 目标、输入文件与预期输出 2. 运行环境、依赖、版本和目录约束 3. 已有代码、接口、样例和错误信息 4. 安全、性能、兼容性和测试要求 5. 目标 URL 列表与是否需要登录 6. 是否保留图片、评论、字幕和页面元数据
信息不必一次问完。先检查用户已经提供的材料,只追问会明显改变结果的问题。
执行步骤
1. 分类目标页面
判断普通文章、动态页面、讨论串或视频页面。
2. 选择采集方式
优先使用稳定读取方式,必要时使用受控浏览器完成加载。
3. 提取主要内容
保留标题、正文、列表、代码、引用和必要媒体。
4. 清理结构
删除导航、广告、重复按钮和无关推荐。
5. 补充元数据
记录原 URL、标题、作者、日期、采集时间和页面状态。
6. 验证与保存
对照页面抽查段落、顺序、链接和缺失内容。
输出格式
至少交付以下内容:
- **Markdown 归档**:清理后的正文与结构
- **媒体目录**:按需下载并重写引用的图片或附件
- **采集日志**:URL、时间、状态、缺失项和交互要求
所有文件使用能说明内容和版本的名称。若任务包含执行动作,还要记录执行状态、验证结果和可继续处理的材料。
完整示例
用户提供十篇教程链接,希望建立离线资料库;按页面类型提取正文、代码和图片,并为每篇增加统一元数据。
合理处理顺序:
1. 分类目标页面 2. 选择采集方式 3. 提取主要内容 4. 清理结构 5. 补充元数据 6. 验证与保存
交付时应重点展示Markdown 归档、媒体目录、采集日志,并说明尚未验证的部分。
质量检查清单
- [ ] 命令、脚本和依赖在目标环境可运行
- [ ] 输入、输出、错误和边界情况均被处理
- [ ] 关键步骤可重复执行且不会意外覆盖原件
- [ ] 完成最小测试并记录验证命令与结果
- [ ] 归档保留原 URL 和采集时间
- [ ] 没有把页面导航或评论入口误当正文
信息不足时怎么处理
- 缺少依赖或权限时先给出可验证的替代路径。
- 环境未知时避免绑定单一工具,明确适配点。
- 遇到登录或验证码时请求用户完成交互,不尝试绕过访问控制。
评论 0
更多
登录后可点赞、收藏、评论和举报。
还没有评论,先发起一个具体问题。