扫描21,988部动漫,揭秘现实职业在动漫中的提及情况,成本仅34美元!
导航菜单
切换导航,有登录选项,还可进行外观设置。平台方面,AI 代码创作包含 GitHub Copilot、GitHub Copilot 应用、MCP 注册表等;开发者工作流涵盖 Actions、Codespaces、Issues、代码审查、代码质量等;应用程序安全有 GitHub 高级安全、代码安全、密钥保护等;探索部分包括为何选择 GitHub、文档、博客、更新日志、市场等,还可查看所有功能。解决方案按公司规模划分有企业版、中小型团队版、初创企业版、非营利组织版;按使用场景划分有应用现代化、DevSecOps、DevOps、CI/CD 等,也能查看所有使用场景;按行业划分有医疗保健、金融服务、制造业、政府机构等,同样可查看所有行业,还能查看所有解决方案。资源按主题探索有 AI、软件开发、DevOps、安全等,也可查看所有主题;按类型探索有客户案例、活动与网络研讨会、电子书与报告、商业洞察、GitHub 技能等;支持与服务包含文档、客户支持、社区论坛、信任中心、合作伙伴等,还可查看所有资源。开源部分,社区有 GitHub 赞助;项目有安全实验室、维护者社区、加速器、GitHub 明星项目、存档项目;仓库有主题、热门趋势、合集。企业版有企业解决方案和可用插件,还有定价选项。此外,可进行搜索或跳转,搜索代码、仓库、用户、问题、拉取请求等,有搜索语法提示。还能提供反馈,包含电子邮件地址以便联系,有保存的搜索功能,若要查看所有可用的限定符,可参阅文档。有登录和注册选项,若在另一个标签页或窗口有登录、注销、切换账户操作,需重新加载以刷新会话。
仓库相关
有 elmiram/anime - professions 仓库,公开状态,有通知、复刻、加星等操作,还有代码、问题、拉取请求、操作、项目、安全与质量、洞察等导航选项。主分支有分支和标签选项,可转到文件、打开更多操作菜单。文件夹和文件有相关信息展示,最新提交有历史记录,可查看所有文件,还有仓库文件导航。
动漫职业项目
动漫中实际展现了哪些现实世界的工作?该项目扫描了 21,988 部动漫,统计每种职业出现的频率,有完整查找表与联合国/国际劳工组织 (ILO) 的标准职业分类 ISCO - 08 相对应,最引人注目的是“缺失”列表。有实时探索器可搜索职业及查看发展趋势,还有演示文稿展示有趣结果。一些发现如下:教师是被提及最多的职业(约出现在 1,370 部动漫中,占比 7.6%),因动漫常以学校为背景;在 2020 年代,店主取代教师成为被提及最多的职业;若算上幻想角色,皇室成员出现频率超过所有现实职业;约 150 种角色可能被提及的职业中,有 17 种从未在动漫中被提及,如金融分析师、系统分析师等后台和服务类职业;一些小众职业也有相应统计数据,如软件开发人员 41 次,保险代表 18 次,药剂师 15 次,电车/巴士司机 5 次。
项目概述
这是一个业余数据项目,旨在构建职业分类体系,检测动漫中对职业的提及,使用大语言模型 (LLM) 对每次提及进行分类,并生成每种职业的统计数据、按十年划分的统计结果、精确率/召回率估计,以及三个 CSV 文件。同时有一个小型本地/静态 Web 应用程序可用于探索结果。现实职业与幻想职业层严格区分,虚构角色会被统计,但不计入现实职业总数。
工作原理
职业列表从 436 个精简到约 150 个,职业按 ISCO - 08 列表分类,因很多职业在故事中不会被明确提及,所以精简为约 150 种角色可能被识别的职业,其余约 286 种被标记为无法测试,而非缺失。动漫中提及了 150 种职业中的 133 种,从未提及的 17 种是显著发现。职业检测主要基于文本,分为三个层面:语料库 + 主角,通过 AniList 获取每部动漫的剧情简介;配角,AniList 中的角色简介,包含 `角色` 字段;对白,约 128,000 个日语字幕文件。检测过程分为两个阶段:第一阶段高召回率,使用关键字词典对文本进行广泛搜索,允许误报;第二阶段高精度,由大语言模型(Claude Haiku)在上下文语境中判断每一个有歧义的候选句子。随后,Claude Opus 会对确认的命中结果进行分层抽样评估,以估计每种职业的精确率,AniList 标签提供召回率基准,精确率低于阈值的职业在输出中会被标记为不可靠。
数据解读
我们检测的是文本中被提及的职业,屏幕上出现但未被明确标注的职业无法检测到,“从未被提及”指从未在文本中被提及。约四分之一的被统计职业被标记为不可靠,这些统计数据应视为上限。统计默认按系列作品去重,但每部作品都会单独记录。每个百分比旁边都会注明分母(约 18,127 部有可扫描文本的作品)。
数据来源与伦理考量
动漫元数据、标题、角色简介、标签来自 AniList(GraphQL API),职业分类体系来自 ISCO - 08(国际劳工组织),对白来自一个社区存档的日语动漫字幕。字幕受版权保护,该项目仅提取统计数据和定位信息,从不存储或重新分发字幕文本,导出的数据集和 Web 应用程序包含派生统计数据、标题和 AniList ID,不包含字幕文本,甚至不包含原始的 AniList 描述,这是一个非商业粉丝项目。
探索器与运行流程
有两种方式运行相同的用户界面,可通过命令启动本地服务器或预计算静态目录。自行运行流程需要 Python 3.11 及以上版本和 Anthropic API 密钥,有一系列命令操作,成本/规模参考显示完整运行该流程分析了 21,988 部动漫和 128,000 个字幕文件,进行了约 101,000 次 Claude Haiku 判断(+ 约 2,000 次 Opus 抽查),总成本约为 34 美元,大约需要一天的无人值守批量处理时间,数据收集可恢复并遵守速率限制。
仓库结构
仓库有 ap 包,包含 taxonomy.py、lexicon.py、jp_lexicon.py 等多个文件,还有 ap.py 作为命令行界面入口点,web/index.html 作为探索器前端。
致谢与许可
本项目使用了 Claude API 构建。数据版权归各自的提供者所有,代码仅供参考发布,展示的数据为派生数据且用于非商业用途。本项目与 AniList、MyAnimeList 或任何工作室均无关联。
项目简介
动漫中实际展现了哪些现实世界的工作?对约 22,000 部作品按照 ISCO - 08 进行分类,提供实时探索器和数据集。还有资源、加星、关注者、复刻等相关信息,以及举报仓库选项。最后是页脚导航信息,包含条款、隐私、安全、状态等内容。