
Web To Skill 是开源项目 zhimaAi 推出的网页转 Agent Skill 工具,项目开源地址:https://github.com/zhimaAi/web-to-skill。
它打破传统 RAG 手动整理文档的模式,仅提供网页链接,就能自动完成动态页面渲染、内容清洗、索引构建,最终输出标准化、可离线分发的 Agent Skill 技能包。点此进入芝麻小客服官网
相较于人工整理知识库,可将文档接入 Agent 的周期从数天缩短至数十分钟,适合产品帮助中心、在线技术文档、公众号教程等网页知识资产数字化落地。

一、什么是 Agent Skill?
Agent Skill(智能体技能)是一套标准化、可移植的知识封装单元,首次出现解释:区别于零散 Prompt 与基础 RAG,Skill 整合知识库、检索脚本、调用规范,AI 智能体可以按需加载,而非一次性把全部文本塞入模型上下文。 传统方案痛点:
- 普通爬虫仅抓取静态文本,无法解析 SPA 动态加载页面;
- 通用 RAG 缺少原始网页快照,AI 输出内容无法溯源;
- 知识素材零散,难以打包迁移到不同 Agent 框架。 Web To Skill 的核心定位:把线上网页批量转化为完整 Skill 资产,打通 “网页内容→可被 Agent 调用知识库” 的自动化链路。
二、核心能力:动态网页采集 + 标准化技能打包
整套工具基于 Playwright 无头浏览器实现页面渲染,支持 JS 动态站点抓取,内置多站点适配规则,覆盖语雀、飞书文档、产品帮助站、公众号文章。
完整自动化流水线分为 5 个环节:
- URL 预处理:支持单入口全站遍历、自定义批量链接两种采集模式,自动去重;
- 页面渲染爬取:保存清洗后 HTML 快照,过滤广告、侧边栏等冗余噪声;
- 结果校验:统计成功、超时、重定向页面,规避无效索引;
- 轻量化元数据抽样:最多选取 60 条页面摘要,防止大模型 Token 过载;
- 一键打包:输出独立 ZIP 技能包,内置检索脚本、索引文件、技能描述文档。 所有采集内容附带原始网页地址与本地 HTML 快照,满足企业场景内容溯源需求。

三、哪些团队适合使用 Web To Skill?
- 企业客服智能体搭建:抓取产品帮助文档,生成售后问答 Skill,客户咨询时精准调取文档原文;
- 内部员工 AI 助手:整合官网手册、线上培训文档,新人可通过 Agent 快速查阅业务规范;
- 开发者知识库工程化:批量抓取开源文档、技术教程,快速搭建垂直领域技术助手;
- 私有化离线知识部署:打包后的 Skill 包脱离原网站运行,满足内网环境数据隔离要求。


了解更多功能详情,
获取功能试用,请扫码联系
原创文章,作者:mia,如若转载,请注明出处:https://xiaokefu.com.cn/blog/49166.html
