你以为编目最难的是分类标引,其实最难的是手敲几百次键盘
新学期开学第二周,编目室的推车上堆满了刚到的几百本新书。你翻开第一本的版权页——密密麻麻的小字挤在半页纸上,书名、作者、出版社、出版年月、ISBN、中图分类号、页数、CIP数据。盯着看了五秒,开始逐条敲进图书馆管理系统。
一本录完,下一本。录到第十本,肩膀开始发酸。录到第三十本,眼睛已经花了,一串13位的ISBN看成了12位。录到第五十本,你突然不确定刚才那本"北京大学出版社"到底敲成了"北京"还是"背景"。
你停下来,想倒回去核对。但前面那几十本的书已经归到推车底层去了,哪本对不上号你也不知道。重新逐本翻出来比对——比录入还费时间。
抬头看看推车,还有一大半没动。而月底编目积压量的报表已经发到馆长邮箱了。
编目录入不是脑力活,是体力活。每一本书的信息都清清楚楚印在版权页上,但要把它们变成系统里的一行行数据,中间隔了成百上千次翻页、辨认、敲键盘、来回检查。
不需要手敲,拖进去就完事
文档工作台做的事,就是把"从PDF版权页搬到Excel"这一步,从几周压缩到一两天。
不需要联网,不需要上传到任何平台。你只需要把图书版权页扫描成PDF——用扫描仪批量扫也好,用手机一张张拍也好——然后全部拖进工具。
接着告诉工具你要提取哪些字段:书名、作者、出版社、出版年月、ISBN、中图分类号、页数、CIP。你可以一个个添加字段名,也可以直接把你们馆里用的Excel模板拖进去——工具自动解析出字段配置,省去手动设置的功夫。
点击开始。工具在本地用OCR引擎逐页识别版权页内容——所有数据跑在你的电脑上,没有一页版权页出过你的电脑。
识别完成后,点击导出——
所有图书信息整齐排列在一张Excel表上。书名、作者、出版社、ISBN、中图分类号——每一列清清楚楚,格式标准。你不再需要翻开任何一本书的版权页逐条核对。
在这个过程中,文档工作台一共做了三件事:
第一|逐页识别版权页,提取所有编目关键字段。书名、作者、出版社、出版年月、ISBN、中图分类号、页数、CIP——从每张PDF版权页中自动精准提取。不管版权页字体大小、排版方向、纸张是否泛黄模糊。
第二|自动整理为规范表格结构。你设定的字段就是Excel的列名,识别的结果就是行数据。不再需要手动对齐、调格式、逐条检查错字漏字。
第三|一键导出为Excel编目清单。导出后可以直接导入图书馆管理系统,也可以先微调再批量入库。
原本要花好几个星期对着几百本版权页逐本敲键盘,现在扫描成PDF、拖进去、配字段、等处理——一两天内全部搞定,包括你核验数据的时间。
调一调,让它更贴合你们馆的编目规范
第一次跑完后,你可以根据本馆的编目要求做微调。比如有些馆要求加上"丛书名"字段,有些需要"价格"列,有些中图分类号格式有特殊规范——在字段配置里增减你需要的列名,重新跑一次即可。
如果系统对入库格式有严格要求——比如中图分类号的冒号分隔、出版年月的日期格式——导出后在Excel里批量处理一下就能直接导入。字段配置的灵活性意味着同一个工具可以适配不同图书馆的编目习惯,不用为每个馆单独找一套方案。工具省掉的是识别和录入的时间,不是编目员的专业判断。
写在最后
不只是大学编目馆员。公共图书馆采编人员核对CIP数据、中小学图书管理员登记新书、出版社编辑整理书目交换数据、旧书商批量登记收书信息——所有需要从图书版权页提取结构化信息的岗位,都面临同一个困境:信息明明就印在纸上,但要让它们变成能用的数据,中间隔着成百上千次手敲键盘。
一本版权页敲错一个ISBN,书在系统里就查不到。一条记录出错,读者找不到书,投诉反馈最终打到你头上。更严重的是,一次录入返工意味着你要在堆积如山的新书里重新翻出那本书、重新翻开版权页、重新敲一遍——这个时间成本,比敲错一个数字的代价高得多。
但这里有个关键区别:编目工作中的"录数据"和"做编目"是两回事。
录数据是翻版权页、辨认小字、敲键盘、校对比对——这些交给文档工作台,批量跑完,字段整齐、格式标准。
做编目是判断分类、规范标引、确保书目质量——这才是编目员的专业价值所在。
把录数据交给工具,把做编目留给自己。编目员不该是版权页的搬运工。
文档工作台下载链接
https://pan.quark.cn/s/82ef5efcf992
本地安装,几步上手。下次新书到馆,试试先把版权页一锅端进Excel。