文献库整理器
1. 这个 Skill 解决什么问题
检索阶段结束时,手上的文献通常是这样一堆东西:知网导出的 RefWorks 文本、Google Scholar 的 BibTeX、导师发来的 Word 清单、自己随手粘贴在备忘录里的十几条。它们混在一起,有重复、有缺字段、有格式各异,往下做任何一步都别扭——做对比表不方便,写综述引不准,投稿时参考文献表更是要重排一遍。
本 Skill 做的是文献管理里最早、也最没人愿意干的一步:把一堆乱的题录整理成一份干净、可查、可直接使用的清单。
它不做解读、不做评价——那分别是 lit-matrix 和 lit-note 的活。这里只解决三件事:重复、归类、缺字段。
2. 什么时候使用
触发:用户给出一批文献条目(无论什么格式),提出下列需求:
- 去重 / 有没有重复的 / 这几条是不是同一篇
- 分类 / 分组 / 归到几个主题下
- 打标签 / 建目录
- 整理成清单 / 导出成表格
- 检查这批文献缺什么信息
典型输入形态:
- 文献管理软件导出(EndNote .enw、NoteExpress、Zotero BibTeX/RIS、RefWorks)
- Excel / CSV 题录表
- 直接粘贴的题录文本(GB/T 7714 格式或任意格式)
- 混合来源的散乱清单
不触发(转给其他 Skill):
| 用户的实际需求 | 转给 |
|:---|:---|
| 还没检索,要找某个方向的文献 | literature-navigator |
| 已整理好,要做横向对比 | lit-matrix |
| 只有一篇要精读 | lit-note |
| 要写成综述正文 | lit-synthesis |
| 只要参考文献格式校对 | citation-management |
3. 开工前检查
| 检查项 | 不达标时 |
|:---|:---|
| 条目数量 | 少于 3 条无整理的必要,直接手工即可 |
| 每条至少有可识别的标题 | 完全无法识别的条目单独列入"无法识别"清单,不猜 |
| 来源格式是否混杂 | 混杂则先做格式归一,并在报告里说明各来源的字段差异 |
不做的事:不联网补全任何字段。DOI、卷、期、页码、作者、年份缺了就是缺了,标出来让用户自己补。
4. 执行流程
第 1 段:材料体检
先给出这批材料的整体状况,让用户知道接手的是什么:
| 项目 | 内容 |
|:---|:---|
| 总条数 | 含无法识别的条目数 |
| 来源 | 几个来源、各多少条、格式是什么 |
| 字段完整度 | 逐字段统计缺失率(作者/年份/题名/刊名/卷期页/DOI/摘要) |
| 语种与类型分布 | 中英文各多少;期刊论文/学位论文/会议/专著/报告各多少 |
| 年份跨度 | 起止年份,是否有明显断层 |
字段完整度是本段最有价值的部分——它直接决定后面能做多深。比如摘要缺失率 80%,就说明这批文献暂时做不了 lit-matrix,得先补摘要。
第 2 段:去重
判定分级(不许只有"是/否"两档):
| 级别 | 判定依据 | 处理 |
|:---|:---|:---|
| 确定重复 | DOI 完全相同;或 题名(去标点空格后)完全相同 且 年份相同;或 题名+第一作者+年份 全同 | 合并,保留信息最完整的那条,其余标记为重复并保留在表中 |
| 疑似重复 | 题名高度相似但不全同(如副标题差异、中英文版本、预印本与正式版);或 作者年份相同但题名不同 | 不合并,单独列出并说明疑点,由用户判断 |
| 不同文献 | 题名不同且作者或年份不同 | 正常保留 |
保留原则:合并时保留字段最完整的那条作为主条目;若两条各缺不同字段,可互补,但只互补确定无疑的字段(如一条有 DOI、另一条有页码,可以合并到主条目),互补后需注明"字段来自条目 N"。
不删条目:去重只做标记,不做删除。合并后的重复条目仍出现在表中,只是标了"重复,建议删除"并说明保留的是哪条。最终删不删由用户决定。
三条容易做错的地方(Skill 必须自查):
- 同一研究的不同产出不是重复——会议论文扩展成期刊论文、学位论文拆成几篇期刊论文,这些是不同文献,只能标"疑似重复"并说明关系。
- 中英文版本不是重复——同一研究的中文版与英文版,标"疑似重复",注明"同一研究的不同语种版本"。
- 同名不同年、同年不同名要小心——作者同年发表两篇不同文章是正常的,不要因为作者年份相同就合并。
第 3 段:分类
分类必须自下而上从材料里长出来,不套预设分类。
做法:
- 先读全部条目的题名与摘要(若有),把自然聚在一起的记录归为一簇
- 簇的数量控制在 3-8 个,太少说明分得粗,太多说明分得碎
- 给每个簇起一个描述性的名字(说清这一簇是什么,而不是"第一类""A 组")
- 标出交叉归属的条目(一篇可以同时属于两簇,标注主归属与次归属)
- 标出无处安放的条目——归不进任何簇的,单独成节说明,不许硬塞
禁止:用学科教科书里的标准分类硬套(如"理论基础/方法研究/实证研究"三段式),除非材料本身确实这样聚。
第 4 段:标签体系
在分类之外另建一套标签,两者作用不同——分类是树状的、一篇只归一处;标签是网状的、一篇可打多个。
三类标签:
| 类型 | 作用 | 举例 |
|:---|:---|:---|
| 主题标签 | 这篇讲的是什么 | 教育戏剧、语言表达、师幼互动 |
| 方法标签 | 怎么做的 | 准实验、话语分析、问卷调查、综述 |
| 用途标签 | 我为什么要留着它 | 引言支撑、方法参照、争议来源、可直接引用、待读 |
用途标签是给未来的自己看的——三个月后回来看这批文献,"可直接引用"这个标签能省下大量时间。
第 5 段:整理后清单
输出一张 Markdown 表,列头固定:
| 编号 | 作者年份 | 题名 | 类型 | 分类 | 主题标签 | 方法标签 | 用途标签 | 重复状态 | 缺失字段 |
|:---|:---|:---|:---|:---|:---|:---|:---|:---|:---|
编号规则:L01、L02……后续 lit-matrix、lit-synthesis 可直接沿用这套编号,全链路对得上。
可选导出:用户要 CSV 时给 CSV;要 BibTeX 时给 BibTeX(缺失字段留空,不编造)。
第 6 段:待补清单
把所有缺字段的条目按"缺什么"归类列出,而不是一条一条散着报:
- 缺 DOI 的 N 条:L03、L07、L12……
- 缺摘要的 N 条:……
- 缺卷期页的 N 条:……
并给出补的优先级建议:摘要 > DOI > 卷期页,理由是要往下做对比表就必须有摘要。
5. 铁律(违反即视为未完成)
- 不删除任何条目:去重只标记,最终处置权在用户。
- 不补全任何字段:不联网、不凭记忆填 DOI、卷期页、作者、年份。缺就标缺。
- 疑似重复不许当确定重复处理:宁可多标疑似,不可错合并。错合并等于丢文献。
- 分类不许硬套:从材料长出来,无处安放的就单列,不许塞进不合适的簇。
- 不许把不同产出当重复:会议扩展版、学位论文拆分、中英文版本、预印本与正式版,一律标疑似。
- 编号唯一且稳定:编号一旦给出,后续流程沿用,不重排。
- 不评价文献质量:不做"重要/不重要"的排名,那是
lit-matrix 与人工判断的事。
6. 材料不足时的降级规则
| 情况 | 处理 |
|:---|:---|
| 只有题名没有作者年份 | 可以整理,但去重只能靠题名,需在报告里说明可靠性下降 |
| 条目全无摘要 | 分类只能基于题名,需注明"分类为初步结果,补摘要后建议复核" |
| 格式极度混乱、无法解析 | 先做格式归一,无法识别的条目列入"无法识别"清单请用户核对,不猜 |
| 条目少于 3 条 | 说明无整理必要,直接给出去重判断即可 |
7. 输出格式
默认按第 1-6 段顺序输出。用户只要去重时,输出第 1、2 段 + 去重后的清单,不倾泻分类与标签。
8. 与其他 Skill 的协作
| 上一步 / 下一步 | 转给 |
|:---|:---|
| 还没找文献 | literature-navigator |
| 整理完要做对比表 | lit-matrix |
| 某篇要深挖 | lit-note |
| 要写成综述正文 | lit-synthesis |
| 综述写完后拟标题摘要 | title-abstract |
| 参考文献格式要批量校对 | citation-management |
| 要写开题报告或课题申报书 | proposal-writer |
| 要预判答辩提问 | defense-qa |
9. 完整输出范例
见 references/worked-example.md——一份含重复、疑似重复、缺字段、格式混杂的完整整理样例,含三处容易误判的情形(会议扩展版、中英文版本、同年两篇)的处理方式。
还没有评论,先发起一个具体问题。