在 AMD 和 NVIDIA 等不同硬件环境下,能够使大语言模型产生相同推理结果的“字节一致(byte-identical)”技术研究正在活跃进行中。
想象一下。你是一名厨师,正在按照一份非常著名的食谱做菜。然而,即便使用了完全相同的材料和烹饪方法,根据所用烤箱的不同,成品菜肴的味道也会出现细微差别。在人工智能(AI)领域也存在类似的困扰。即使使用不同公司的硬件(芯片),AI 给出的答案也必须完全一致,技术专家们将此称为“字节一致(byte-identical)”推理。目前,关于让 AI 在不同环境下输出相同结果的研究正在活跃进行中。
近期,业界关注的一项研究直接对比了 AMD 的“Instinct MI300X”加速器与 NVIDIA 的 H100 模型。参考资料 1 特别是针对拥有 720 亿个参数(AI 学习并调节的内部设置值)的大语言模型(LLM),正尝试通过技术手段,确保无论硬件制造商如何,都能输出一致的结果。参考资料 1
为什么这很重要?
在我们的日常生活中,AI 服务仅仅速度快是不够的。例如,当企业使用 AI 分析复杂的金融数据或审查重要的法律文件时,如果结果因硬件类型不同而有所变动,那将会是多么令人不安。
“字节一致”推理的实现,意味着 AI 企业在选择硬件时将获得更多自由。他们不再局限于特定公司的芯片。如果根据情况选择性价比更高的硬件也能获得同样精密的成果,那么运营 AI 服务的成本将大大降低。此外,随着硬件市场的竞争加剧,最终作为用户的我们,将能够享受到更低廉、更稳定的 AI 服务。参考资料 8
简单易懂的类比:“滤镜”的故事
我们将硬件与 AI 的关系比作照片应用中的“滤镜”。我们有原始照片(输入值)和滤镜(AI 模型)。应用滤镜时,不应该因为手机机型不同而改变色调或形态。
过去,AI 主要针对 NVIDIA 这一特定环境(相机应用)进行了优化。但是,AMD 正通过“ROCm(AMD 开源 AI 软件平台)”这一新平台,不断耕耘软件生态系统,确保在 AMD 设备上也能实现与以往相同的性能和结果。参考资料 2, 参考资料 8 简而言之,就是让教导 AI 如何使用新设备的“翻译器”变得更加智能。
目前进展如何?
硬件竞争非常激烈。AMD 强调,其 GPU 与以往相比,能提供高出 4 倍的 AI 计算性能和 35 倍的推理容量。参考资料 8
实际的基准测试结果也值得关注。据报道,AMD 的 MI300X 在特定环境(vLLM)中表现出比 NVIDIA H100 快 2 倍的速度,并在另一种优化技术(TensorRT-LLM)环境中也记录到了高出 30% 的性能。参考资料 12 当然,NVIDIA 凭借长期积累的压倒性软件兼容性,依然占据着强大的优势。但 AMD 通过持续更新 ROCm 平台并迅速缩小差距,这一点已是业界共识。参考资料 2, 参考资料 8
未来的图景?
未来的 AI 硬件市场重心将超越单纯的“谁更快”,转向“谁能提供更标准化的结果”。随着字节一致推理技术愈发成熟,开发者将不再受特定硬件限制,能够自由地部署最新的 AI 模型。对于我们用户而言,这意味着无论在哪种设备上运行 AI,都能获得与昨天一样准确、可靠的回答。我们将持续密切关注 AMD 的 ROCm 平台未来能获取多广的生态系统,以及它能在多大程度上制衡 NVIDIA 的垄断地位。参考资料 8
参考资料
- Cross-vendor byte-identical inference for a 72B LLM (AMD MI300X vs. Nvidia H100)
- 10 Best Local LLM Software for NVIDIA & AMD GPUs… - Tech Tactician
- How to Turn Your AMD GPU into a Local LLM Beast… - YouTube
- AMD Mi300X Vs Nvidia H200 : Inférence Ml Comparée… - BestCours
-
[AMD together we advance_AI](https://www.amd.com/) -
[Local 13B LLM Inference on a $700 Used Build SpecPicks](https://specpicks.com/reviews/ryzen-7-3700x-rtx-3060-12gb-local-13b-llm-inference-2026) -
[Инференс Qwen3.5 на AMD Halo Box… Блог ServerFlow](https://serverflow.ru/blog/tutorials/inferens-qwen3-5-na-amd-halo-box-rukovodstvo-ot-amd/) - One Analyst Asserts Customers Are Only Buying AMD GPUs To Stimulate Competition…
- AMD GPUs
- B650M Gaming Plus Wifi MSI AM5, A Melhor Intermediaria Pra AMD…
- AMD Instinct MI350 Series microarchitecture — AMD ROCm 7.14.0
-
[AMD Rivals NVIDIA in AI: MI300X Doubles Speed in vLLM and Outperforms H100 by 30% in TensorRT-LLM Cellular Stockpile](https://cellularstockpile.com/amd-rivals-nvidia-in-ai-mi300x-doubles-speed-in-vllm-and-outperforms-h100-by-30-in-tensorrt-llm/) -
[Тестируем AMD Chat и ИИ-возможности… Блог Serverflow](https://serverflow.ru/blog/stati/testiruem-amd-chat-i-ii-vozmozhnosti-videokarty-amd-radeon-rx-9070-xt/) - #amd #gpus #ai #deeplearning #rocm #aitraining…
- 无论硬件如何,输出结果完全相同
- 根据硬件的不同输出不同的结果
- 压缩数据容量
- CUDA
- ROCm
- TensorRT
- 在 vLLM 环境中速度快 2 倍
- 在 TensorRT-LLM 环境中速度快 2 倍
- 整体性能始终高出 10 倍