注意:没有GPU,也可以微调一个属于你自己的大模型,只是微调的时间长一点而已,建议晚上睡觉前运行,第二天早上就可以使用了 😄

效果演示

部署环境

  1. 点击下载 LLaMA3-8B 微调代码压缩包

  2. 将下载的压缩包解压

  3. 在 终端 (macOS) 或 cmd命令提示符 (Windows) 里面,进入解压后的文件夹,创建一个新的 Conda 虚拟环境

    未安装 Conda 的用户,可以到 Conda官网下载安装。

    1
    2
    3
    cd llama3-ft
    conda create -n llama3-ft python=3.10
    conda activate llama3-ft
  4. 安装依赖包

    1
    pip install -r requirements.txt

数据准备

你可以直接使用 dataset/huanhuan.json 数据集(该数据集来源于 https://github.com/KMnO4-zx ),也可以自己准备数据集 ,比如你的客服对话(FAQ)数据集,这样就可以微调一个更适合你的智能客服的模型,客服回答更准确。

数据集的格式也比较简单,示例如下:

  • instruction 是问题

  • output 是回答

 1
2
3
4
5
6
7
8
9
10
11
12
[
{
"instruction": "你好",
"input": "",
"output": "皇上好,我是甄嬛,家父是大理寺少卿甄远道。"
},
{
"instruction": "你不愿意见我?",
"input": "",
"output": "不该相见自然不愿见,还望王爷尊重我的意愿。"
}
]

模型微调

模型选择

我使用的是 LLM-Research/Meta-Llama-3-8B-Instruct ,你也可以选择一个其他模型,只需要修改 train.py 文件里面的 model_id 变量即可。

由于国内访问 HuggingFace 比较困难,因此使用 ModelScope 提供的模型。

1
2
3
4
5
6
7
8
# 需要微调的基座模型

# https://www.modelscope.cn/studios/LLM-Research/Chat_Llama-3-8B/summary
model_id = 'LLM-Research/Meta-Llama-3-8B-Instruct'

# 比如你也可以使用 Qwen1.5-4B-Chat 模型
# https://www.modelscope.cn/models/qwen/Qwen1.5-4B-Chat/summary
# model_id = 'qwen/Qwen1.5-4B-Chat'

开始微调

只需要在项目根目录下执行以下命令即可。

1
python train.py

或者可以打开 LLaMA3-8B-Instruct Lora.ipynb 文件,使用 Jupyter Notebook 进行微调。

注意:

  1. 微调的时间会根据你的数据集大小和模型大小而定。我由于没有 GPU,因此耗时2个小时,如果你有 GPU,大概需要 30 分钟。

  2. 代码会自动下载模型,然后开始微调

  3. 微调完成后,所有的文件会保存在 models 文件夹下面,结构如下:

     1
    2
    3
    4
    5
    6
    7
    8
    9
    10
    11
    12
    13
    14
    15
    16
    17
    18
    19
    20
    21
    22
    ├── models
    ├── checkpoint #【模型微调的 checkpoint】
    │ ├── LLM-Research
    │ │ └── Meta-Llama-3-8B-Instruct
    │ │ ├── checkpoint-100
    │ │ ├── checkpoint-200
    │ │ ├── checkpoint-xxx
    │ └── qwen
    │ └── Qwen1.5-4B-Chat
    │ ├── checkpoint-100
    │ ├── checkpoint-200
    │ ├── checkpoint-xxx
    ├── lora #【模型微调的 lora 文件】
    │ ├── LLM-Research
    │ │ └── Meta-Llama-3-8B-Instruct
    │ └── qwen
    │ └── Qwen1.5-4B-Chat
    └── model #【自动下载的基座模型】
    ├── LLM-Research
    │ └── Meta-Llama-3-8B-Instruct
    └── qwen
    └── Qwen1___5-4B-Chat

模型测试

微调完成后,你可以执行以下命令启动一个 ChatBot 进行对话测试。

1
streamlit run chat.py

该命令执行后,会自动打开浏览器对话页面

那么,如何系统的去学习大模型LLM?

我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。

作为一名热心肠的互联网老兵,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。

但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

所有资料 ⚡️ ,朋友们如果有需要全套 《LLM大模型入门+进阶学习资源包》,扫码获取~

篇幅有限,部分资料如下:

👉LLM大模型学习指南+路线汇总👈

💥大模型入门要点,扫盲必看!
在这里插入图片描述
💥既然要系统的学习大模型,那么学习路线是必不可少的,这份路线能帮助你快速梳理知识,形成自己的体系。

路线图很大就不一一展示了 (文末领取)
在这里插入图片描述

👉大模型入门实战训练👈

💥光学理论是没用的,要学会跟着一起做,要动手实操,才能将自己的所学运用到实际当中去,这时候可以搞点实战案例来学习。
在这里插入图片描述

👉国内企业大模型落地应用案例👈

💥两本《中国大模型落地应用案例集》 收录了近两年151个优秀的大模型落地应用案例,这些案例覆盖了金融、医疗、教育、交通、制造等众多领域,无论是对于大模型技术的研究者,还是对于希望了解大模型技术在实际业务中如何应用的业内人士,都具有很高的参考价值。 (文末领取)
在这里插入图片描述

👉GitHub海量高星开源项目👈

💥收集整理了海量的开源项目,地址、代码、文档等等全都下载共享给大家一起学习!
在这里插入图片描述

👉LLM大模型学习视频👈

💥观看零基础学习书籍和视频,看书籍和视频学习是最快捷也是最有效果的方式,跟着视频中老师的思路,从基础到深入,还是很容易入门的。 (文末领取)
在这里插入图片描述

👉640份大模型行业报告(持续更新)👈

💥包含640份报告的合集,涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师,还是对AI大模型感兴趣的爱好者,这套报告合集都将为您提供宝贵的信息和启示。
在这里插入图片描述

👉获取方式:

这份完整版的大模型 LLM 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

😝有需要的小伙伴,可以Vx扫描下方二维码免费领取🆓

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐