在这里插入图片描述

2-知识图谱-知识图谱表示-3-向量表示方法

在这里插入图片描述

向量表示

One-Hot编码

在这里插入图片描述

每个词向量的大小,是词典的大小
词典中有 n 个词,就是一个 n维数组表示。
每个词所在的词典的位置,这个n维数组对应位置就是1,其他位置为0,用来表示这个词

缺点:空间消耗大

Bag of words 词袋模型

词袋模型(Bag of Words,BoW)是自然语言处理中的一种基础文本表示方法,通过统计词频将文本转化为数值向量。以下是其核心要点:

工作原理

  1. 分词(Tokenization)
    将文本分割成独立的词语或短语。例如,英文按空格分隔,中文需借助分词工具(如结巴分词)。
    在这里插入图片描述

  2. 构建词汇表
    收集所有文档中的唯一词汇,形成词汇表,并为每个词分配索引。例如,句子“我爱编程”和“编程爱我”的词汇表为{我, 爱, 编程}。

  3. 向量化
    将每个文档转换为向量,维度与词汇表大小一致,元素值为对应词的频次(或TF-IDF权重)。例如:

    • “我爱编程” → [1, 1, 1]
    • “编程爱我” → [1, 1, 1](词序被忽略)

优缺点

  • 优点

    • 简单高效,适合大规模文本处理。
    • 可作为基线模型快速验证任务可行性(如文本分类、情感分析)。
  • 缺点

    • 忽略上下文和词序:无法捕捉语义和语法结构。
    • 高维稀疏性:词汇量大时,向量稀疏,增加计算负担。
    • 无法处理语义相似性:如“汽车”与“车辆”视为独立特征。

改进方法

  1. TF-IDF加权
    通过逆文档频率降低常见词权重,提升关键词语义贡献。

  2. N-gram模型
    捕捉局部词序,如二元语法(bigram)将相邻词组合(如“机器学习”)。

  3. 预处理优化

    • 停用词过滤(移除“的”、“是”等)。
    • 词干提取(如“running”→“run”)或词形还原。
    • 大小写统一、标点/数字处理。
  4. 结合高级技术

    • 主题模型(如LDA)提取主题特征。
    • 词嵌入(Word2Vec、GloVe)补充语义信息。

应用场景

  • 文本分类:如新闻分类、垃圾邮件检测。
  • 情感分析:基于关键词频判断情感倾向。
  • 信息检索:快速匹配文档关键词。

词的分布式向量表示【词向量】

词的语义由什么决定?

可以由词的上下文来表示
在这里插入图片描述
在这里插入图片描述
蝴蝶和飞接近,瓢虫和爬接近

以下是词嵌入(Word Embedding)、词向量(Word Vector)或分布式向量(Distributed Representation)的概要介绍:


基本概念

词嵌入是一种将自然语言中的词语映射到低维连续向量空间的技术,每个词被表示为一个稠密的实数向量(如100-300维)。

  • 核心目标:捕捉词语的语义语法关系,使语义相似的词在向量空间中距离相近(如“国王”与“王后”)。
  • 与词袋模型的区别:词袋模型是离散、高维、稀疏的,而词嵌入是连续、低维、稠密的,且能保留语义信息。

核心思想

  1. 分布式假说(Distributional Hypothesis)

    • 核心理念一个词的语义由其上下文决定(“You shall know a word by the company it keeps”)。
    • 例如,“猫”和“狗”在相似上下文中出现,它们的向量应接近。
  2. 低维稠密向量

    • 将词语映射到低维空间(如300维),避免词袋模型的高维稀疏问题,同时捕捉潜在语义特征。

关键技术
  1. Word2Vec(2013,Google)
    在这里插入图片描述

    • Skip-Gram:通过中心词预测上下文词(适合大规模语料)。
    • CBOW(Continuous Bag of Words):通过上下文词预测中心词(适合小规模语料)。
  2. GloVe(Global Vectors,2014)

    • 结合全局词共现统计与局部上下文窗口,优化词向量表示。
    • 例如,通过共现矩阵分解捕捉词语间的全局关系。
  3. 上下文相关词嵌入

    • ELMo(2018):基于双向LSTM,生成动态词向量(同一词在不同语境中向量不同)。
    • BERT(2018):基于Transformer的预训练模型,通过掩码语言模型捕捉双向上下文信息。

应用场景
  1. NLP任务的基础输入
    • 文本分类、情感分析、命名实体识别(NER)、机器翻译等。
  2. 语义相似度计算
    • 通过余弦相似度衡量词/句子的语义相关性。
  3. 预训练模型的基础
    • BERT、GPT等模型的底层依赖词嵌入技术。

优点
  1. 语义捕捉:能表达同义词、反义词、类比关系(如“国王 - 男人 + 女人 ≈ 王后”)。
  2. 降维与稠密性:低维向量计算高效,适合深度学习模型。
  3. 可迁移性:预训练词向量(如Word2Vec、GloVe)可跨任务复用。

缺点
  1. 静态表示:传统方法(如Word2Vec)对一词多义处理较差(如“苹果”指水果或公司)。
  2. 数据依赖:词向量质量受训练语料规模和质量影响。
  3. 解释性弱:向量空间中的语义关系难以直观解释。

词向量小结
  • 词嵌入是自然语言处理的核心技术,突破了词袋模型的局限性,为深度学习模型提供了语义丰富的输入。
  • 随着Transformer和预训练模型(如BERT)的发展,词嵌入逐渐演变为动态、上下文相关的表示,进一步提升了语义建模能力。
  • 工具推荐:Gensim(Word2Vec)、spaCy(预训练词向量)、TensorFlow/PyTorch(自定义词嵌入层)。

词向量存在一些相似性
在这里插入图片描述
one-hot的编码 的 两个向量间 相似度为0

词嵌入到知识图谱嵌入

在这里插入图片描述

句子中,通过词的上下文共现学习词的向量表示

在自然语言处理中,通过句子中词的上下文共现来学习词向量的核心思想是:一个词的语义可以通过它周围经常共同出现的词(上下文)来刻画。这种思想基于分布式假设(Distributional Hypothesis),即“具有相似上下文的词,其语义也相似”

通过三元组学习实体和关系的向量表示。

通过三元组学习实体和关系的向量表示(即知识图谱嵌入,Knowledge Graph Embedding),是知识表示学习的核心方法,旨在将知识图谱中的实体(如“姚明”)和关系(如“出生于”)映射到低维连续向量空间,从而捕捉实体间的语义关联和关系逻辑。以下是其核心思想和实现逻辑的分步解析:


1. 基本概念:三元组与知识图谱
  • 三元组(Triplet):形式为 ((h,r,t)) ( (h, r, t) ) ((h,r,t)),表示头实体 ( h ) 通过关系 ( r ) 连接到尾实体 ( t )。
    • 例如:( (姚明, 出生于, 上海) )、( (上海, 位于, 中国) )。
  • 目标:将实体和关系表示为向量(如 (h,r,t∈Rd))( \mathbf{h}, \mathbf{r}, \mathbf{t} \in \mathbb{R}^d ))(h,r,tRd),使得 向量空间中的关系运算能反映真实语义逻辑
    • 理想情况下,(h+r≈t)( \mathbf{h} + \mathbf{r} \approx \mathbf{t} )(h+rt)(如 TransE 模型)。

2. 核心思想:基于关系的向量平移
(1) 基本假设(以 TransE 为例)

在这里插入图片描述

  • 关系作为平移向量:关系 ( r ) 的向量表示 (r)( \mathbf{r} )(r) 可以被视为从头实体 (h)( \mathbf{h} )(h) 到尾实体 (t)( \mathbf{t} )(t) 的“平移”。
    • 数学表达:(h+r≈t)。 ( \mathbf{h} +\mathbf{r} \approx \mathbf{t})。(h+rt)
    • 例如,(姚明+出生于≈上海)( \mathbf{姚明} + \mathbf{出生于} \approx \mathbf{上海} ) (姚明+出生于上海)
(2) 得分函数(Scoring Function)
  • 定义三元组的合理性得分,得分越高表示该三元组越可能成立。
    • TransE 的得分函数(f(h,r,t)=−∥h+r−t∥)( f(h, r, t) = -\|\mathbf{h} + \mathbf{r} - \mathbf{t}\| )(f(h,r,t)=h+rt),距离越小得分越高。
    • 优化目标:最大化正确三元组的得分,最小化错误三元组的得分。
      在这里插入图片描述

3. 训练方法:负采样与损失函数
(1) 负采样(Negative Sampling)

在这里插入图片描述

  • 对每个真实三元组 ( (h, r, t) ),构造负样本(错误样本),如:
    • 替换头实体:( (h’, r, t) )(如 ( (科比, 出生于, 上海) ));
    • 替换尾实体:( (h, r, t’) )(如 ( (姚明, 出生于, 北京) ))。
  • 目标:通过对比正负样本,使模型区分合理与不合理的三元组。
4. 应用场景
  1. 链接预测
    • 预测缺失的三元组,如给定 ( (姚明, 职业, ?) ),模型预测尾实体“篮球运动员”。
  2. 关系推理
    • 推断隐含关系,如从 ( (A, 父亲, B) ) 和 ( (B, 兄弟, C) ),推导 ( (A, 叔叔, C) )。
  3. 知识图谱补全
    • 自动发现知识图谱中的潜在关系。
  4. 推荐系统
    • 利用“用户-交互-商品”三元组学习用户和商品的向量,提升推荐效果。

5. 优缺点分析
优点
  • 语义可解释性:向量运算(如 ( \mathbf{h} + \mathbf{r} \approx \mathbf{t} ))直观反映关系逻辑。
  • 支持推理:可进行多跳推理(如 ( A \to B \to C ))。
  • 高效计算:低维向量适合大规模知识图谱处理。
缺点
  • 对复杂关系建模不足:如层级关系、多对多关系需更复杂模型。
  • 静态表示局限:实体在不同上下文中可能有不同含义(需动态嵌入)。
  • 依赖三元组质量:噪声数据或稀疏关系影响效果。

知识图谱嵌入模型

TransE
DistMult

在这里插入图片描述

在这里插入图片描述
在这里插入图片描述
如果推理预测 目标结果得分最高,则表示模型很好

影响好坏的因素

  1. 稀疏性: 三元组如果是孤立的实体,那边向量表示不好,不能足够代表 实体-关系存在语义关系

复杂

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐