「赤兔」Chitu 框架深度解读(一):面向生产级AI的高性能、多算力推理引擎

在当今大模型(LLM)技术浪潮中,高效、稳定且灵活的推理部署成为了企业将AI能力转化为生产力的关键瓶颈。为此,一个专注于效率、灵活性和可用性的高性能大模型推理框架——**Chitu「赤兔」**应运而生。

本文作为系列解读的第一篇,将带您全面了解「赤兔」的定位、核心特性以及它如何成为“生产级大模型推理引擎”的有力竞争者。

Chitu「赤兔」是什么?

根据其官方文档(README.md),「赤兔」是一个高性能的大模型推理框架。它从立项之初就充分考虑了企业AI落地从小规模试验到大规模部署的渐进式需求,其核心目标是提供一个兼顾高性能、高灵活性与高可用性的生产级解决方案。

三大核心特性:构建生产级推理能力

「赤兔」的架构设计围绕三大核心特性展开,使其能够应对复杂多变的生产环境需求:

1. 多元算力适配:全面拥抱国产与国际芯片

推理框架的生命力在于其对硬件的支持广度。在这方面,「赤兔」展现了强大的生态兼容性:

  • 主流国际芯片:不仅支持 NVIDIA 最新旗舰 GPU,也对旧款系列产品提供优化支持。
  • 广泛国产芯片:里程碑显示(v0.4.0),「赤兔」已成功适配华为昇腾(Ascend)、沐曦(Muxi)、海光(Hygon)等国产AI芯片。

这种多元适配能力,使得企业在进行算力选型时拥有更大的灵活性,无论是利用现有的NVIDIA卡,还是布局国产算力,「赤兔」都能提供一致的推理服务。

2. 全场景可伸缩:从单卡到万卡集群

「赤兔」具备极强的可伸缩性,满足不同规模的部署需求:

  • 单机部署:支持从纯 CPU 部署、单 GPU 部署,甚至到 CPU+GPU 异构混合推理(如 v0.2.2 里程碑中实现的单卡推理 DeepSeek-R1 671B)。
  • 大规模集群:支持大规模集群部署,满足高并发、低延迟的业务需求。

这种“全场景可伸缩”特性,让用户可以根据业务发展平滑扩展资源,无需在不同阶段切换推理框架。

3. 长期稳定运行:为生产环境而生

区别于许多研究型项目,「赤兔」定位于“生产级”,强调在实际生产环境中的稳定性。官方文档明确指出,该框架足以承载高并发的业务流量,确保服务的长期稳定运行。v0.4.0 版本的发布,也特别提到了“大幅提升了一体机推理部署场景的性能和稳定性”。

快速迭代:紧跟前沿的模型与硬件

通过查阅「赤兔」的里程碑,我们可以看到其惊人的迭代速度和对前沿技术的敏锐嗅觉:

  • [2025/03/14, v0.1.0]:支持 DeepSeek-R1 671B 巨型模型。
  • [2025/04/18, v0.2.2]:新增 CPU+GPU 异构混合推理支持。
  • [2025/04/29, v0.3.0]:支持 FP4 量化。
  • [2025/06/12, v0.3.5]:提供昇腾 910B 完整原生支持。
  • [2025/07/28, v0.3.9]:首发支持华为昇腾 910B 推理部署智谱 GLM-4.5 MoE 模型。
  • [2025/08/01, v0.4.0]:全面适配昇腾、英伟达、沐曦、海光。

这种快速跟进主流模型(Kimi, GLM, Qwen, DeepSeek)和关键硬件(特别是昇腾910B)的能力,是其保持竞争力的核心。

如何开始使用「赤兔」

对于希望快速验证的用户,「赤兔」官方提供了便捷的 Docker 镜像部署方式,目前已覆盖主流平台:

  • 昇腾 (Ascend): qingcheng-ai-cn-beijing.cr.volces.com/public/chitu-ascend:latest
  • 英伟达 (NVIDIA): qingcheng-ai-cn-beijing.cr.volces.com/public/chitu-nvidia:latest
  • 沐曦 (Muxi): qingcheng-ai-cn-beijing.cr.volces.com/public/chitu-muxi:latest

在后续的文章中,我们将深入解读「赤兔」的性能测试数据、量化与异构推理技术,以及其对国产算力的支持情况。# 「赤兔」Chitu 框架深度解读(一):面向生产级AI的高性能、多算力推理引擎

在当今大模型(LLM)技术浪潮中,高效、稳定且灵活的推理部署成为了企业将AI能力转化为生产力的关键瓶颈。为此,一个专注于效率、灵活性和可用性的高性能大模型推理框架——**Chitu「赤兔」**应运而生。

本文作为系列解读的第一篇,将带您全面了解「赤兔」的定位、核心特性以及它如何成为“生产级大模型推理引擎”的有力竞争者。

Chitu「赤兔」是什么?

根据其官方文档(README.md),「赤兔」是一个高性能的大模型推理框架。它从立项之初就充分考虑了企业AI落地从小规模试验到大规模部署的渐进式需求,其核心目标是提供一个兼顾高性能、高灵活性与高可用性的生产级解决方案。

三大核心特性:构建生产级推理能力

「赤兔」的架构设计围绕三大核心特性展开,使其能够应对复杂多变的生产环境需求:

1. 多元算力适配:全面拥抱国产与国际芯片

推理框架的生命力在于其对硬件的支持广度。在这方面,「赤兔」展现了强大的生态兼容性:

  • 主流国际芯片:不仅支持 NVIDIA 最新旗舰 GPU,也对旧款系列产品提供优化支持。
  • 广泛国产芯片:里程碑显示(v0.4.0),「赤兔」已成功适配华为昇腾(Ascend)、沐曦(Muxi)、海光(Hygon)等国产AI芯片。

这种多元适配能力,使得企业在进行算力选型时拥有更大的灵活性,无论是利用现有的NVIDIA卡,还是布局国产算力,「赤兔」都能提供一致的推理服务。

2. 全场景可伸缩:从单卡到万卡集群

「赤兔」具备极强的可伸缩性,满足不同规模的部署需求:

  • 单机部署:支持从纯 CPU 部署、单 GPU 部署,甚至到 CPU+GPU 异构混合推理(如 v0.2.2 里程碑中实现的单卡推理 DeepSeek-R1 671B)。
  • 大规模集群:支持大规模集群部署,满足高并发、低延迟的业务需求。

这种“全场景可伸缩”特性,让用户可以根据业务发展平滑扩展资源,无需在不同阶段切换推理框架。

3. 长期稳定运行:为生产环境而生

区别于许多研究型项目,「赤兔」定位于“生产级”,强调在实际生产环境中的稳定性。官方文档明确指出,该框架足以承载高并发的业务流量,确保服务的长期稳定运行。v0.4.0 版本的发布,也特别提到了“大幅提升了一体机推理部署场景的性能和稳定性”。

快速迭代:紧跟前沿的模型与硬件

通过查阅「赤兔」的里程碑,我们可以看到其惊人的迭代速度和对前沿技术的敏锐嗅觉:

  • [2025/03/14, v0.1.0]:支持 DeepSeek-R1 671B 巨型模型。
  • [2025/04/18, v0.2.2]:新增 CPU+GPU 异构混合推理支持。
  • [2025/04/29, v0.3.0]:支持 FP4 量化。
  • [2025/06/12, v0.3.5]:提供昇腾 910B 完整原生支持。
  • [2025/07/28, v0.3.9]:首发支持华为昇腾 910B 推理部署智谱 GLM-4.5 MoE 模型。
  • [2025/08/01, v0.4.0]:全面适配昇腾、英伟达、沐曦、海光。

这种快速跟进主流模型(Kimi, GLM, Qwen, DeepSeek)和关键硬件(特别是昇腾910B)的能力,是其保持竞争力的核心。

如何开始使用「赤兔」

对于希望快速验证的用户,「赤兔」官方提供了便捷的 Docker 镜像部署方式,目前已覆盖主流平台:

  • 昇腾 (Ascend): qingcheng-ai-cn-beijing.cr.volces.com/public/chitu-ascend:latest
  • 英伟达 (NVIDIA): qingcheng-ai-cn-beijing.cr.volces.com/public/chitu-nvidia:latest
  • 沐曦 (Muxi): qingcheng-ai-cn-beijing.cr.volces.com/public/chitu-muxi:latest

在后续的文章中,我们将深入解读「赤兔」的性能测试数据、量化与异构推理技术,以及其对国产算力的支持情况。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐