三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

AWED-FiNER框架详解:SampurNER_Bengali_MuRIL作为专家检测器的应用

AWED-FiNER框架详解:SampurNER_Bengali_MuRIL作为专家检测器的应用

AWED-FiNER框架详解:SampurNER_Bengali_MuRIL作为专家检测器的应用

【免费下载链接】SampurNER_Bengali_MuRIL项目地址: https://ai.gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRIL

SampurNER_Bengali_MuRIL是基于Google MuRIL模型在孟加拉语SampurNER数据集上微调的细粒度命名实体识别(NER)模型,作为AWED-FiNER框架中的专家检测器,专为解决低资源语言的细粒度实体识别挑战而设计。该模型通过EaMaTa框架构建,利用Few-NERD数据集的标签体系,实现对孟加拉语文本中复杂实体类型的精准识别。

什么是AWED-FiNER框架?

AWED-FiNER(Agents, Web applications, and Expert Detectors for Fine-grained Named Entity Recognition)是一个创新的多语言细粒度命名实体识别框架,旨在为全球66亿 speakers 提供跨36种语言的实体识别能力。框架的核心组件包括:

  • 智能代理(Agents):协调不同语言专家模型的任务分配与结果整合
  • 网络应用(Web applications):提供用户友好的交互界面与API服务
  • 专家检测器(Expert Detectors):针对特定语言优化的细粒度NER模型,如SampurNER_Bengali_MuRIL

该框架的技术细节在论文《AWED-FiNER: Agents, Web applications, and Expert Detectors for Fine-grained Named Entity Recognition across 36 Languages for 6.6 Billion Speakers》中有详细阐述,为多语言NLP任务提供了全新的解决方案。

SampurNER_Bengali_MuRIL模型核心特性

细粒度实体标签体系

基于Few-NERD数据集构建的标签系统,将实体分为8个大类和数十个子类,实现前所未有的识别精度:

  • Location:GPE(国家/城市)、水体、岛屿、山脉等
  • Person:演员、艺术家/作家、运动员、政治家等职业细分
  • ORG:公司、教育机构、政府组织、媒体等
  • Building:机场、医院、酒店、体育设施等
  • Art:音乐、电影、文学作品、绘画等
  • Product:飞机、汽车、食品、软件等
  • Event:攻击、选举、自然灾害、体育赛事等
  • Misc:天文、奖项、生物、疾病等特殊类别

模型配置文件[config.json]中定义了133种实体标签(包括B/I/O标记),完整覆盖了复杂场景下的实体识别需求。

性能表现

在孟加拉语SampurNER数据集上的评估结果显示:

  • Precision: 66.54
  • Recall: 70.08
  • F1 Score: 68.26

这一性能在低资源语言的细粒度NER任务中处于领先水平,证明了模型在处理孟加拉语复杂实体时的有效性。

技术架构

模型基于[google/muril-large-cased]预训练模型构建,采用BertForTokenClassification架构,关键参数包括:

  • 隐藏层大小:1024
  • 注意力头数量:16
  • 隐藏层数量:24
  • 词汇表大小:197285

训练过程使用AdamW优化器,学习率5e-5,权重衰减0.01,在64 batch size下训练6个epochs,确保模型充分收敛。

快速开始使用指南

环境准备

首先安装必要的依赖库:

pip install smolagents gradio_client

基本使用示例

通过AWED-FiNER工具类加载并使用模型:

from tool import AWEDFiNERTool # 初始化工具,指定模型空间ID tool = AWEDFiNERTool( space_id="prachuryyaIITG/AWED-FiNER" ) # 处理文本并获取实体识别结果 result = tool.forward( text="জুড বেলিংহাম 2023 সালে রিয়াল ম্যাড্রিডে যোগ দিয়েছেন।", language="Bengali" ) print(result)

完整项目获取

要获取完整的模型和代码,请克隆仓库:

git clone https://gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRIL

应用场景与价值

SampurNER_Bengali_MuRIL作为AWED-FiNER框架的关键组件,在多个领域具有重要应用价值:

  • 多语言内容分析:为跨语言信息检索提供实体级理解
  • 社交媒体监控:精准识别孟加拉语社交内容中的人物、组织和事件
  • 新闻自动化处理:自动提取新闻文章中的关键实体,支持内容分类与推荐
  • 低资源NLP研究:为其他低资源语言的NER模型开发提供参考范式

引用与贡献

如果您在研究中使用了SampurNER_Bengali_MuRIL,请引用以下论文:

@inproceedings{kaushik2026sampurner, title={SampurNER: Fine-Grained Named Entity Recognition Dataset for 22 Indian Languages}, volume={40}, url={https://ojs.aaai.org/index.php/AAAI/article/view/40405}, DOI={10.1609/aaai.v40i37.40405}, number={37}, journal={Proceedings of the AAAI Conference on Artificial Intelligence}, author={Kaushik, Prachuryya and Anand, Ashish}, year={2026}, month={Mar.}, pages={31410-31418} } @misc{kaushik2026awedfineragentswebapplications, title={AWED-FiNER: Agents, Web applications, and Expert Detectors for Fine-grained Named Entity Recognition across 36 Languages for 6.6 Billion Speakers}, author={Prachuryya Kaushik and Ashish Anand}, year={2026}, eprint={2601.10161}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2601.10161}, }

该项目由Prachuryya Kaushik和Ashish Anand教授共同开发,是SampurNER系列研究的重要组成部分,也是AWED-FiNER多语言实体识别生态的关键一环。更多信息可访问项目的交互式演示空间和GitHub仓库获取。

【免费下载链接】SampurNER_Bengali_MuRIL项目地址: https://ai.gitcode.com/hf_mirrors/prachuryyaIITG/SampurNER_Bengali_MuRIL

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

← 返回列表