NLP 的核心任务包括哪几个方面?请简要列举并说明。
📅 2026/7/20 11:25:06
👁️ 阅读次数
📝 编程学习
NLP 的核心任务
NLP 的核心任务通常按语言处理层级划分,从底层词法到高层语义,共包括以下几个方面:
一、词法层任务
1. 分词(Word Segmentation)
将连续文本切分为有意义的最小语言单位。
- 中文:
"自然语言处理" → ["自然", "语言", "处理"] - 英文通常以空格分隔,但仍需处理缩写、标点。
2. 词性标注(POS Tagging)
为每个词标注语法类别(名词、动词、形容词等)。
我(r) 爱(v) 北京(ns)
3. 命名实体识别(NER)
识别文本中具有特定意义的实体,如人名、地名、机构名、时间、金额等。
"马云于1999年在杭州创立阿里巴巴" → 人名:马云 / 时间:1999年 / 地名:杭州 / 机构:阿里巴巴
二、句法层任务
4. 句法分析(Syntactic Parsing)
分析句子的语法结构,常见两种形式:
- 成分分析:短语结构树(S → NP + VP)
- 依存分析:词与词之间的修饰/支配关系
5. 词义消歧(WSD)
确定多义词在具体语境中的正确含义。
"我要去银行(bank)存款"→ 金融机构,而非河岸。
三、语义层任务
6. 语义角色标注(SRL)
识别句子中"谁对谁做了什么",标注施事、受事、时间、地点等语义角色。
7. 语义相似度计算
判断两段文本在语义上的接近程度,是搜索、推荐、去重的基础。
8. 情感分析(Sentiment Analysis)
判断文本表达的情感倾向(正面/负面/中性)或具体情绪类别,常用于舆情监控、商品评价。
四、篇章层任务
9. 文本分类(Text Classification)
将文本归入预定义类别,如新闻分类、垃圾邮件识别、意图识别。
10. 信息抽取(Information Extraction)
从非结构化文本中抽取结构化事实:
- 关系抽取:实体间关系(如"创始人—公司")
- 事件抽取:事件类型及参与要素
11. 文本摘要(Summarization)
- 抽取式:从原文挑选关键句组合
- 生成式:用新语言重新组织表达核心内容
12. 机器翻译(Machine Translation)
将一种自然语言文本自动翻译为另一种语言,是 NLP 最具代表性的综合任务。
五、对话与生成层任务
13. 问答系统(QA)
针对用户问题,从知识库或文档中返回精准答案,包括:
- 检索式 QA、知识图谱 QA、阅读理解式 QA
14. 对话系统(Dialog System)
- 任务型:完成具体业务(订票、查天气)
- 开放域:闲聊式对话
15. 文本生成(NLG)
按需求自动生成连贯文本,如新闻撰写、代码生成、故事创作。
任务层级总览
词法层 → 分词、词性标注、NER ↓ 句法层 → 句法分析、词义消歧 ↓ 语义层 → 语义角色标注、相似度、情感分析 ↓ 篇章层 → 分类、信息抽取、摘要、翻译 ↓ 生成层 → 问答、对话、文本生成一句话概括
NLP 的核心任务沿着“词 → 句 → 语义 → 篇章 → 生成”的层级递进,底层任务为上层任务提供基础,最终目标是让计算机完整地理解和生成人类语言。
编程学习
技术分享
实战经验