开源book2skill:一个国产神级skills, 将任意书籍炼成你的专属skill

开源book2skill:一个国产神级skills, 将任意书籍炼成你的专属skill

当你想让AI助手基于一本书或一堆文档回答问题,第一反应是什么?搭个RAG向量库?上传PDF等它切块、嵌入、检索?点此进入芝麻小客服官网

但现实往往是:语义检索答非所问,长文档切得七零八落,每次对话还要消耗海量token重算上下文——更别提那些藏在表格、图片里的关键信息,向量检索根本抓不住。

现在,国产开源项目 book2skill给出了解决方案:为文档生成一份“知识目录”,让AI像人一样先查目录、再翻原文,把书本直接封装成可安装的Agent技能。

开源地址:https://github.com/zhimaAi/book2skill

一、核心逻辑:从“模糊搜索”到“精准引用”

book2skill的处理流水线极其克制:将PDF、DOCX、Markdown等原始文档统一转换为结构化Markdown,再按语义边界切割成不超过5000字符的“证据单元”,并保留所有图片、表格等资产。

接着,它分批调用大模型为每个单元生成知识点元数据——每一条知识点都带有指向原文片段的确切ID(如u001),而不是复制大段原文。

最终输出是一个轻量级的JSONL索引文件,连同原始文档、资产和检索脚本,打包成一个ZIP技能包。

当Agent需要回答问题时,它只扫描这个索引(几百KB到几MB),找到相关知识点ID,再按需打开对应的Markdown或图片获取准确原文。

开源book2skill:一个国产神级skills, 将任意书籍炼成你的专属skill

二、对比RAG:低Token、高精准、可解释

开源book2skill:一个国产神级skills, 将任意书籍炼成你的专属skill

更重要的是,book2skill采用批次处理——一次模型调用处理多个文档块,例如22个块的书籍可能只需2~3次API调用,索引成本远低于逐段RAG嵌入。

三、怎么用?三步定制你的专属技能

  1. 准备:将书籍或文档放入workspace/input,运行prepare_workflow.py自动转换、分块、初始化状态。

  2. 迭代生成:反复执行batch_index.py --next,系统会返回待处理的批次提示文件,你用任意大模型(OpenAI、Claude、本地模型)按格式写入知识点,直到全部完成。

  3. 合并打包:运行merge_index.py整合所有批次,再执行build_skill.py生成ZIP技能包。

最终产出包含SKILL.md技能描述、doc-index.jsonl知识索引、markdown/原文、assets/图片以及search_index.py检索脚本。无需额外适配,直接导入支持skills的Agent框架——如Workbody、OpenClaw、Codex、Claude Code等,Agent即可自主调用该技能,按目录翻阅“书籍”并精准作答。

开源book2skill:一个国产神级skills, 将任意书籍炼成你的专属skill

四、适用场景与生态优势

  • 个人知识库:把多年收藏的PDF技术手册、课程讲义打包成技能,随时与AI讨论细节。

  • 企业合规审查:将内部规章、合同模板做成技能,Agent审查时引用原文条款,杜绝“AI瞎编”。

  • 学术研究:论文合集打包,AI能准确引用段落和页码,辅助文献综述。

  • 离线/低资源环境:技能包完全本地运行,无需联网调用RAG服务,数据更安全。

book2skill已在GitHub开源,兼容Python 3.10+,依赖仅需python-docxpypdfPillowpoppler

它不强制绑定任何Agent框架,生成的技能包通用可迁移。

项目还内置了严格验证机制,拒绝格式错误的批次,确保最终索引纯净可靠。

点此进入芝麻小客服官网

了解更多功能详情,

获取功能试用,请扫码联系开源book2skill:一个国产神级skills, 将任意书籍炼成你的专属skill

原创文章,作者:mia,如若转载,请注明出处:https://xiaokefu.com.cn/blog/49304.html