2-知识图谱-知识图谱表示-3-向量表示方法

2-知识图谱-知识图谱表示-3-向量表示方法

向量表示
One-Hot编码

每个词向量的大小,是词典的大小
词典中有 n 个词,就是一个 n维数组表示。
每个词所在的词典的位置,这个n维数组对应位置就是1,其他位置为0,用来表示这个词
缺点:空间消耗大
Bag of words 词袋模型
词袋模型(Bag of Words,BoW)是自然语言处理中的一种基础文本表示方法,通过统计词频将文本转化为数值向量。以下是其核心要点:
工作原理
-
分词(Tokenization)
将文本分割成独立的词语或短语。例如,英文按空格分隔,中文需借助分词工具(如结巴分词)。

-
构建词汇表
收集所有文档中的唯一词汇,形成词汇表,并为每个词分配索引。例如,句子“我爱编程”和“编程爱我”的词汇表为{我, 爱, 编程}。 -
向量化
将每个文档转换为向量,维度与词汇表大小一致,元素值为对应词的频次(或TF-IDF权重)。例如:- “我爱编程” → [1, 1, 1]
- “编程爱我” → [1, 1, 1](词序被忽略)
优缺点
-
优点
- 简单高效,适合大规模文本处理。
- 可作为基线模型快速验证任务可行性(如文本分类、情感分析)。
-
缺点
- 忽略上下文和词序:无法捕捉语义和语法结构。
- 高维稀疏性:词汇量大时,向量稀疏,增加计算负担。
- 无法处理语义相似性:如“汽车”与“车辆”视为独立特征。
改进方法
-
TF-IDF加权
通过逆文档频率降低常见词权重,提升关键词语义贡献。 -
N-gram模型
捕捉局部词序,如二元语法(bigram)将相邻词组合(如“机器学习”)。 -
预处理优化
- 停用词过滤(移除“的”、“是”等)。
- 词干提取(如“running”→“run”)或词形还原。
- 大小写统一、标点/数字处理。
-
结合高级技术
- 主题模型(如LDA)提取主题特征。
- 词嵌入(Word2Vec、GloVe)补充语义信息。
应用场景
- 文本分类:如新闻分类、垃圾邮件检测。
- 情感分析:基于关键词频判断情感倾向。
- 信息检索:快速匹配文档关键词。
词的分布式向量表示【词向量】
词的语义由什么决定?
可以由词的上下文来表示


蝴蝶和飞接近,瓢虫和爬接近
以下是词嵌入(Word Embedding)、词向量(Word Vector)或分布式向量(Distributed Representation)的概要介绍:
基本概念
词嵌入是一种将自然语言中的词语映射到低维连续向量空间的技术,每个词被表示为一个稠密的实数向量(如100-300维)。
- 核心目标:捕捉词语的语义和语法关系,使语义相似的词在向量空间中距离相近(如“国王”与“王后”)。
- 与词袋模型的区别:词袋模型是离散、高维、稀疏的,而词嵌入是连续、低维、稠密的,且能保留语义信息。
核心思想
-
分布式假说(Distributional Hypothesis)
- 核心理念:一个词的语义由其上下文决定(“You shall know a word by the company it keeps”)。
- 例如,“猫”和“狗”在相似上下文中出现,它们的向量应接近。
-
低维稠密向量
- 将词语映射到低维空间(如300维),避免词袋模型的高维稀疏问题,同时捕捉潜在语义特征。
关键技术
-
Word2Vec(2013,Google)

- Skip-Gram:通过中心词预测上下文词(适合大规模语料)。
- CBOW(Continuous Bag of Words):通过上下文词预测中心词(适合小规模语料)。
-
GloVe(Global Vectors,2014)
- 结合全局词共现统计与局部上下文窗口,优化词向量表示。
- 例如,通过共现矩阵分解捕捉词语间的全局关系。
-
上下文相关词嵌入
- ELMo(2018):基于双向LSTM,生成动态词向量(同一词在不同语境中向量不同)。
- BERT(2018):基于Transformer的预训练模型,通过掩码语言模型捕捉双向上下文信息。
应用场景
- NLP任务的基础输入
- 文本分类、情感分析、命名实体识别(NER)、机器翻译等。
- 语义相似度计算
- 通过余弦相似度衡量词/句子的语义相关性。
- 预训练模型的基础
- BERT、GPT等模型的底层依赖词嵌入技术。
优点
- 语义捕捉:能表达同义词、反义词、类比关系(如“国王 - 男人 + 女人 ≈ 王后”)。
- 降维与稠密性:低维向量计算高效,适合深度学习模型。
- 可迁移性:预训练词向量(如Word2Vec、GloVe)可跨任务复用。
缺点
- 静态表示:传统方法(如Word2Vec)对一词多义处理较差(如“苹果”指水果或公司)。
- 数据依赖:词向量质量受训练语料规模和质量影响。
- 解释性弱:向量空间中的语义关系难以直观解释。
词向量小结
- 词嵌入是自然语言处理的核心技术,突破了词袋模型的局限性,为深度学习模型提供了语义丰富的输入。
- 随着Transformer和预训练模型(如BERT)的发展,词嵌入逐渐演变为动态、上下文相关的表示,进一步提升了语义建模能力。
- 工具推荐:
Gensim(Word2Vec)、spaCy(预训练词向量)、TensorFlow/PyTorch(自定义词嵌入层)。
词向量存在一些相似性

one-hot的编码 的 两个向量间 相似度为0
词嵌入到知识图谱嵌入

句子中,通过词的上下文共现学习词的向量表示
在自然语言处理中,通过句子中词的上下文共现来学习词向量的核心思想是:一个词的语义可以通过它周围经常共同出现的词(上下文)来刻画。这种思想基于分布式假设(Distributional Hypothesis),即“具有相似上下文的词,其语义也相似”
通过三元组学习实体和关系的向量表示。
通过三元组学习实体和关系的向量表示(即知识图谱嵌入,Knowledge Graph Embedding),是知识表示学习的核心方法,旨在将知识图谱中的实体(如“姚明”)和关系(如“出生于”)映射到低维连续向量空间,从而捕捉实体间的语义关联和关系逻辑。以下是其核心思想和实现逻辑的分步解析:
1. 基本概念:三元组与知识图谱
- 三元组(Triplet):形式为 ((h,r,t)) ( (h, r, t) ) ((h,r,t)),表示头实体 ( h ) 通过关系 ( r ) 连接到尾实体 ( t )。
- 例如:( (姚明, 出生于, 上海) )、( (上海, 位于, 中国) )。
- 目标:将实体和关系表示为向量(如 (h,r,t∈Rd))( \mathbf{h}, \mathbf{r}, \mathbf{t} \in \mathbb{R}^d ))(h,r,t∈Rd)),使得 向量空间中的关系运算能反映真实语义逻辑。
- 理想情况下,(h+r≈t)( \mathbf{h} + \mathbf{r} \approx \mathbf{t} )(h+r≈t)(如 TransE 模型)。
2. 核心思想:基于关系的向量平移
(1) 基本假设(以 TransE 为例)

- 关系作为平移向量:关系 ( r ) 的向量表示 (r)( \mathbf{r} )(r) 可以被视为从头实体 (h)( \mathbf{h} )(h) 到尾实体 (t)( \mathbf{t} )(t) 的“平移”。
- 数学表达:(h+r≈t)。 ( \mathbf{h} +\mathbf{r} \approx \mathbf{t})。(h+r≈t)。
- 例如,(姚明+出生于≈上海)( \mathbf{姚明} + \mathbf{出生于} \approx \mathbf{上海} ) (姚明+出生于≈上海)。
(2) 得分函数(Scoring Function)
- 定义三元组的合理性得分,得分越高表示该三元组越可能成立。
- TransE 的得分函数:(f(h,r,t)=−∥h+r−t∥)( f(h, r, t) = -\|\mathbf{h} + \mathbf{r} - \mathbf{t}\| )(f(h,r,t)=−∥h+r−t∥),距离越小得分越高。
- 优化目标:最大化正确三元组的得分,最小化错误三元组的得分。

3. 训练方法:负采样与损失函数
(1) 负采样(Negative Sampling)

- 对每个真实三元组 ( (h, r, t) ),构造负样本(错误样本),如:
- 替换头实体:( (h’, r, t) )(如 ( (科比, 出生于, 上海) ));
- 替换尾实体:( (h, r, t’) )(如 ( (姚明, 出生于, 北京) ))。
- 目标:通过对比正负样本,使模型区分合理与不合理的三元组。
4. 应用场景
- 链接预测
- 预测缺失的三元组,如给定 ( (姚明, 职业, ?) ),模型预测尾实体“篮球运动员”。
- 关系推理
- 推断隐含关系,如从 ( (A, 父亲, B) ) 和 ( (B, 兄弟, C) ),推导 ( (A, 叔叔, C) )。
- 知识图谱补全
- 自动发现知识图谱中的潜在关系。
- 推荐系统
- 利用“用户-交互-商品”三元组学习用户和商品的向量,提升推荐效果。
5. 优缺点分析
优点
- 语义可解释性:向量运算(如 ( \mathbf{h} + \mathbf{r} \approx \mathbf{t} ))直观反映关系逻辑。
- 支持推理:可进行多跳推理(如 ( A \to B \to C ))。
- 高效计算:低维向量适合大规模知识图谱处理。
缺点
- 对复杂关系建模不足:如层级关系、多对多关系需更复杂模型。
- 静态表示局限:实体在不同上下文中可能有不同含义(需动态嵌入)。
- 依赖三元组质量:噪声数据或稀疏关系影响效果。
知识图谱嵌入模型
TransE
DistMult



如果推理预测 目标结果得分最高,则表示模型很好
影响好坏的因素
- 稀疏性: 三元组如果是孤立的实体,那边向量表示不好,不能足够代表 实体-关系存在语义关系
复杂




更多推荐
所有评论(0)