三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

开源插件茉莉花:让Zotero中文文献管理全自动,单篇录入只需10秒

开源插件茉莉花:让Zotero中文文献管理全自动,单篇录入只需10秒

开源插件茉莉花:让Zotero中文文献管理全自动,单篇录入只需10秒

【免费下载链接】jasminumA Zotero add-on to retrive CNKI meta data. 一个简单的Zotero 插件,用于识别中文元数据项目地址: https://gitcode.com/gh_mirrors/ja/jasminum

上周三晚上十点,导师在群里丢来20篇中文期刊PDF,要求第二天早上交出文献综述初稿框架。我看着满屏乱码命名的文件头皮发麻:一篇篇手动填作者、期刊、年份,单篇至少5分钟,20篇就是小两小时;更糟的是,知网附件在浏览器里怎么点都下载不下来,Zotero里只剩一堆空壳条目。直到同事甩来一个开源插件——茉莉花(Jasminum),我才发现:中文文献管理,原来可以不用手动敲任何一个字段。

一句话价值主张:装上茉莉花,从拿到PDF到归档进库,单篇中文文献的全流程不超过10秒,你只需要做一次"点确认"。

它一口气解决的3类核心问题:元数据抓取、附件匹配与PDF大纲生成

1. 中文文献元数据自动抓取,告别复制粘贴

传统做法茉莉花做法
打开知网逐篇搜索,复制标题、作者、摘要,再粘贴进条目,手动改格式右键附件 →茉莉花抓取 → 抓取期刊元数据,自动弹出候选结果,点一下"确认"即回填全部字段
单篇耗时约5分钟,还容易复制串行、漏掉字段单篇约10秒,作者、期刊、年份、摘要一次到位

2. 本地附件自动匹配,解决"下不下来"的顽疾

Zotero Connector 抓中文期刊时,经常元数据拿到了、附件却下不来。茉莉花的补救思路非常实在:

传统做法茉莉花做法
自己另开浏览器下载PDF,再手动拖进Zotero,名字对不上还得逐个改名右键条目 →小工具 → 在下载文件夹中查找附件,插件按"标题×文件名"相似度自动打分,把最匹配的PDF收进条目
下载目录越堆越乱,同名文件到处都是匹配成功的附件默认移到下载目录/jasminum-backup备份,也可在设置里改为直接删除或保留不动

3. PDF大纲生成,长文献不再靠滚轮

中文PDF普遍不带书签,读一篇学位论文想回看第4章,只能一页页翻。

传统做法茉莉花做法
记住大概页码,反复滚动找章节打开PDF,点击左侧边栏的茉莉花书签按钮,结构化大纲立刻呈现,多级章节随意展开/折叠
想在关键章节做标记,却无处下手支持添加、编辑书签,↑/↓跳转、←/→展开折叠、空格编辑,还能一键把书签"保存到PDF"写回文件

零基础快速上手:4步完成安装与设置

  1. 准备环境:Zotero 6.0及以上版本;构建插件需要 Node.js(建议16+)。
  2. 获取并构建:打开终端执行:
git clone https://gitcode.com/gh_mirrors/ja/jasminum cd jasminum npm install npm run build
  1. 安装进 Zotero工具 → 插件→ 齿轮图标 →从文件安装插件,选择addon目录下生成的.xpi文件,重启 Zotero。
  2. 核对基础设置:在插件设置中确认"下载目录"(默认是系统下载文件夹);元数据匹配与附件匹配各有相似度阈值,保持默认即可先跑起来。

注意事项:构建产物在addon/目录而非仓库根目录;升级前先卸载旧版本;修改设置后通常需要重启 Zotero 才完全生效。

一条完整实战走查:用一篇文献跑通"抓取-匹配-大纲"全流程

假设你又收到5篇期刊PDF,跟着走一遍:

  1. 导入:把PDF直接拖进Zotero,条目和附件先按文件名生成。
  2. 抓取元数据:右键附件 →茉莉花抓取 → 抓取期刊元数据,任务窗口弹出多条CNKI候选。逐一比对标题、期刊与日期(来源标注清晰,如"CNKI 期刊"),选中最匹配的一条,点击确认——全部字段一次回填完毕。
  3. 补齐附件:若某篇是手动下载的,右键条目 →小工具 → 在下载文件夹中查找附件,插件按相似度自动定位PDF并归入条目,下载目录原件按设置自动备份,目录从此不再堆积。
  4. 高效阅读:双击打开PDF,点击左侧边栏的茉莉花书签按钮生成大纲;↑/↓快速跳到目标章节,空格编辑书签文字,读完点"保存到PDF",书签随文件长期保留,下次直接复用。

3个冷门但好用的进阶技巧

技巧一:候选多时,优先选"来源+日期"双匹配的条目。抓取窗口里每条候选都标注了来源与日期。先筛掉"学位论文、报纸"等干扰项,再对日期与原文一致的候选下手,命中率最高。路径:茉莉花抓取 → 抓取期刊元数据

技巧二:用相似度阈值控制匹配松紧。附件匹配默认阈值0.8:批量处理时老匹配不上,可在设置中临时调到0.7放宽;若频繁误配,再调高到0.85收紧。元数据匹配阈值(默认0.6)同理。路径:工具 → 插件设置

技巧三:把大纲"写回"PDF,让书签跟着文件走。编辑完书签后,点击大纲窗口顶部的保存按钮,书签会写入PDF本身,之后换其他阅读器打开也能看到结构。调整层级时,[]键可把选中节点上下移动一级,\键新建子节点,比鼠标拖拽快得多。

避坑指南:最常见的4个问题一次说清

Q:抓取窗口里一个候选都没有?A:先确认网络能正常访问知网;再检查条目标题是否完整可识别;部分机构IP不在知网授权范围时会返回空结果,换个网络重试。

Q:在下载文件夹中找不到匹配附件?A:核对设置里的"下载目录"是否指向实际路径;确认PDF文件名包含标题关键词;必要时临时放宽相似度阈值再试。

Q:PDF阅读器里没有茉莉花书签按钮?A:确认打开的是PDF阅读窗口而非条目列表;检查设置中"启用书签"处于开启状态;仍不显示就重启一次 Zotero。

Q:抓回来的作者姓名顺序乱?A:条目上右键 →小工具 → 中文姓名拆分与合并一键修正,也可以在设置中开启自动拆分。

工作原理速览:30行读懂内部模块

插件按模块划分、各司其职:

src/modules/ ├── services/ # 数据源适配:CNKI、万方、意得辑、百度学术等 ├── attachments/ # 本地附件匹配与归档,内置相似度打分算法 ├── outline/ # PDF大纲/书签:层级结构、键盘导航、写回PDF ├── preferences/ # 设置面板:下载目录、阈值、数据源选择 └── utils/ # Cookie管理、PDF解析、HTTP请求等基础设施

核心逻辑都很好找:元数据抓取看src/modules/services/cnki.ts,附件匹配看src/modules/attachments/localMatch.ts,大纲功能集中在src/modules/outline/。想二次开发的同学,直接从这里入手即可。

总结:3步立即开始中文文献管理自动化

回到开头那20篇PDF——用茉莉花重来一遍:批量导入、逐个确认抓取结果、顺手匹配附件、打开大纲快速通读,全程不到半小时,且没有手动敲过一个字段。⚡

现在就可以做的3件事

  1. 按上文4步装好茉莉花插件并重启 Zotero;
  2. 拖入3篇中文PDF,走一遍"抓取 → 匹配 → 大纲";
  3. 把相似度阈值和下载目录按自己的习惯调好。

好工具的标准,是让你把时间还给文献内容本身,而不是耗在录入和翻页上。茉莉花,正是这样的存在。📌

【免费下载链接】jasminumA Zotero add-on to retrive CNKI meta data. 一个简单的Zotero 插件,用于识别中文元数据项目地址: https://gitcode.com/gh_mirrors/ja/jasminum

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

← 返回列表