大模型之自注意力机制Self-Attention(一)
大模型之自注意力机制Self-Attention
LlaMA 3 系列博客
基于 LlaMA 3 + LangGraph 在windows本地部署大模型 (一)
基于 LlaMA 3 + LangGraph 在windows本地部署大模型 (二)
基于 LlaMA 3 + LangGraph 在windows本地部署大模型 (三)
基于 LlaMA 3 + LangGraph 在windows本地部署大模型 (四)
基于 LlaMA 3 + LangGraph 在windows本地部署大模型 (五)
基于 LlaMA 3 + LangGraph 在windows本地部署大模型 (六)
基于 LlaMA 3 + LangGraph 在windows本地部署大模型 (七)
基于 LlaMA 3 + LangGraph 在windows本地部署大模型 (八)
基于 LlaMA 3 + LangGraph 在windows本地部署大模型 (九)
基于 LlaMA 3 + LangGraph 在windows本地部署大模型 (十)
构建安全的GenAI/LLMs核心技术解密之大模型对抗攻击(一)
构建安全的GenAI/LLMs核心技术解密之大模型对抗攻击(二)
构建安全的GenAI/LLMs核心技术解密之大模型对抗攻击(三)
构建安全的GenAI/LLMs核心技术解密之大模型对抗攻击(四)
构建安全的GenAI/LLMs核心技术解密之大模型对抗攻击(五)
大模型标记器 Tokenizer之Byte Pair Encoding (BPE) 算法详解与示例
大模型标记器 Tokenizer之Byte Pair Encoding (BPE)源码分析
大模型之自注意力机制Self-Attention(一)
注意力机制——这是现代深度学习模型中无处不在的方法。注意力机制是一个概念,它帮助提高了神经机器翻译应用的性能。在本文中,我们将看看Transformer——一个使用注意力机制来提高这些模型训练速度的模型。Transformer在特定任务中的性能超过了谷歌神经机器翻译模型。然而,最大的好处来自于Transformer如何促进并行化。 谷歌云推荐使用Transformer作为参考模型来使用他们的Cloud TPU产品。
Transformer在论文Attention is All You Need中被提出。它作为Tensor2Tensor包的一部分在TensorFlow中实现了。哈佛大学的NLP小组创建了一个用PyTorch实现的注释论文指南。在这篇文章中,我们将尝试简化一些事情,并逐一介绍概念 。
高层次概览
首先将模型视为一个单一的黑匣子。在机器翻译应用中,它将一种语言的句子作为输入,并输出另一种语言的翻译。

可以看到编码组件、解码组件以及它们之间的连接。

编码组件由一堆编码器组成(论文中将六个编码器堆叠在一起——数字六没有什么神奇的, 可以肯定地尝试其他安排)。解码组件由相同数量的解码器堆叠而成。

编码器在结构上都是相同的(但它们不共享权重)。每个编码器都分为两个子层:

编码器的输入首先通过自注意力层——这一层帮助编码器在编码特定单词时查看输入句子中的其他单词。
自注意力层的输出被送入一个前馈神经网络。完全相同的前馈网络独立应用于每个位置。
解码器包含这两个层,但在它们之间是一个注意力层,它帮助解码器专注于输入句子的相关部分(类似于seq2seq模型中的注意力)。

将矩阵引入
现在我们已经看到了模型的主要组件,让我们开始看看各种向量/矩阵以及它们如何在这些组件之间流动,将训练有素的模型的输入转化为输出。
正如在NLP应用中通常的情况一样,我们首先使用嵌入算法将每个输入单词转化为向量。

每个单词都被嵌入到一个大小为512的向量中。我们将用这些简单的盒子来表示这些向量。
嵌入只在最底层的编码器中发生。所有编码器的共同抽象是它们接收一个大小为512的向量列表——在底层编码器中,这些将是单词嵌入,但在其他编码器中,这些将是直接下方编码器的输出。这个列表的大小是一个我们可以设置的超参数——基本上是我们训练数据集中最长句子的长度。
在我们输入序列中的每个单词被嵌入后,它们分别通过编码器的两个层。

在这里,我们开始看到Transformer的一个关键属性,即每个位置的单词在编码器中流经自己的路径。自注意力层中这些路径之间存在依赖关系。然而,前馈层没有这些依赖关系,因此可以在流经前馈层时并行执行各种路径。
接下来,我们将示例切换为一个更短的句子,看看在编码器的每个子层中发生了什么。
现在开始编码!
正如我们已经提到的,编码器接收一个向量列表作为输入。它通过将这些向量送入一个“自注意力”层,然后送入一个前馈神经网络,然后将输出向上发送到下一个编码器来处理这个列表。

每个位置的单词都通过了自注意力过程。然后,它们各自通过一个前馈神经网络——完全相同的网络,每个向量分别流经它。
高层次的自注意力
假设以下句子是我们想要翻译的输入句子:
“The animal didn’t cross the street because it was too tired”
这句话中的“it”指的是什么?是指的是街道还是动物?对人类来说是一个简单的问题,但对算法来说并不那么简单。
当模型处理单词“it”时,自注意力允许将其与“animal”关联起来。
当模型处理每个单词(输入序列中的每个位置)时,自注意力允许它查看输入序列中的其他位置的线索,这有助于为这个单词获得更好的编码。
如果你熟悉RNN,想想如何通过维持隐藏状态,允许RNN将其处理过的前一个单词/向量的表示与当前正在处理的单词结合起来。自注意力是Transformer用来将其他相关单词的“理解”融入我们当前正在处理的单词的方法。

大模型技术分享



《企业级生成式人工智能LLM大模型技术、算法及案例实战》线上高级研修讲座
模块一:Generative AI 原理本质、技术内核及工程实践周期详解
模块二:工业级 Prompting 技术内幕及端到端的基于LLM 的会议助理实战
模块三:三大 Llama 2 模型详解及实战构建安全可靠的智能对话系统
模块四:生产环境下 GenAI/LLMs 的五大核心问题及构建健壮的应用实战
模块五:大模型应用开发技术:Agentic-based 应用技术及案例实战
模块六:LLM 大模型微调及模型 Quantization 技术及案例实战
模块七:大模型高效微调 PEFT 算法、技术、流程及代码实战进阶
模块八:LLM 模型对齐技术、流程及进行文本Toxicity 分析实战
模块九:构建安全的 GenAI/LLMs 核心技术Red Teaming 解密实战
模块十:构建可信赖的企业私有安全大模型Responsible AI 实战
Llama3关键技术深度解析与构建Responsible AI、算法及开发落地实战
1、Llama开源模型家族大模型技术、工具和多模态详解:学员将深入了解Meta Llama 3的创新之处,比如其在语言模型技术上的突破,并学习到如何在Llama 3中构建trust and safety AI。他们将详细了解Llama 3的五大技术分支及工具,以及如何在AWS上实战Llama指令微调的案例。
2、解密Llama 3 Foundation Model模型结构特色技术及代码实现:深入了解Llama 3中的各种技术,比如Tiktokenizer、KV Cache、Grouped Multi-Query Attention等。通过项目二逐行剖析Llama 3的源码,加深对技术的理解。
3、解密Llama 3 Foundation Model模型结构核心技术及代码实现:SwiGLU Activation Function、FeedForward Block、Encoder Block等。通过项目三学习Llama 3的推理及Inferencing代码,加强对技术的实践理解。
4、基于LangGraph on Llama 3构建Responsible AI实战体验:通过项目四在Llama 3上实战基于LangGraph的Responsible AI项目。他们将了解到LangGraph的三大核心组件、运行机制和流程步骤,从而加强对Responsible AI的实践能力。
5、Llama模型家族构建技术构建安全可信赖企业级AI应用内幕详解:深入了解构建安全可靠的企业级AI应用所需的关键技术,比如Code Llama、Llama Guard等。项目五实战构建安全可靠的对话智能项目升级版,加强对安全性的实践理解。
6、Llama模型家族Fine-tuning技术与算法实战:学员将学习Fine-tuning技术与算法,比如Supervised Fine-Tuning(SFT)、Reward Model技术、PPO算法、DPO算法等。项目六动手实现PPO及DPO算法,加强对算法的理解和应用能力。
7、Llama模型家族基于AI反馈的强化学习技术解密:深入学习Llama模型家族基于AI反馈的强化学习技术,比如RLAIF和RLHF。项目七实战基于RLAIF的Constitutional AI。
8、Llama 3中的DPO原理、算法、组件及具体实现及算法进阶:学习Llama 3中结合使用PPO和DPO算法,剖析DPO的原理和工作机制,详细解析DPO中的关键算法组件,并通过综合项目八从零开始动手实现和测试DPO算法,同时课程将解密DPO进阶技术Iterative DPO及IPO算法。
9、Llama模型家族Safety设计与实现:在这个模块中,学员将学习Llama模型家族的Safety设计与实现,比如Safety in Pretraining、Safety Fine-Tuning等。构建安全可靠的GenAI/LLMs项目开发。
10、Llama 3构建可信赖的企业私有安全大模型Responsible AI系统:构建可信赖的企业私有安全大模型Responsible AI系统,掌握Llama 3的Constitutional AI、Red Teaming。
解码Sora架构、技术及应用
一、为何Sora通往AGI道路的里程碑?
1,探索从大规模语言模型(LLM)到大规模视觉模型(LVM)的关键转变,揭示其在实现通用人工智能(AGI)中的作用。
2,展示Visual Data和Text Data结合的成功案例,解析Sora在此过程中扮演的关键角色。
3,详细介绍Sora如何依据文本指令生成具有三维一致性(3D consistency)的视频内容。 4,解析Sora如何根据图像或视频生成高保真内容的技术路径。
5,探讨Sora在不同应用场景中的实践价值及其面临的挑战和局限性。
二、解码Sora架构原理
1,DiT (Diffusion Transformer)架构详解
2,DiT是如何帮助Sora实现Consistent、Realistic、Imaginative视频内容的?
3,探讨为何选用Transformer作为Diffusion的核心网络,而非技术如U-Net。
4,DiT的Patchification原理及流程,揭示其在处理视频和图像数据中的重要性。
5,Conditional Diffusion过程详解,及其在内容生成过程中的作用。
三、解码Sora关键技术解密
1,Sora如何利用Transformer和Diffusion技术理解物体间的互动,及其对模拟复杂互动场景的重要性。
2,为何说Space-time patches是Sora技术的核心,及其对视频生成能力的提升作用。
3,Spacetime latent patches详解,探讨其在视频压缩和生成中的关键角色。
4,Sora Simulator如何利用Space-time patches构建digital和physical世界,及其对模拟真实世界变化的能力。
5,Sora如何实现faithfully按照用户输入文本而生成内容,探讨背后的技术与创新。
6,Sora为何依据abstract concept而不是依据具体的pixels进行内容生成,及其对模型生成质量与多样性的影响。
更多推荐

所有评论(0)