Aioga
AI资讯 / 行业动态
返回 AI资讯

Baseten 工程师解析 LLM 推理的有效边界与两类优化技术

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-09-02T07:29:52.000Z热度 58

Baseten 工程师 Philip Kiely 撰文解析 LLM 推理的"有效边界"框架,将推理技术分为两类:在延迟与吞吐之间做取舍以命中边界上某一点的技术,以及把整条边界外...

行业动态Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

Baseten 工程师 Philip Kiely 撰文解析 LLM 推理的"有效边界"框架,将推理技术分为两类:在延迟与吞吐之间做取舍以命中边界上某一点的技术,以及把整条边界外推、创造整体效率提升的技术。

中文正文 · AI 翻译

推理技术要么沿着延迟-吞吐量边界推进部署,要么将整个边界推向外面,从而提高分配效率。

The efficient frontier of LLM inference

在人工智能行业,我们借用了经济学家的“高效前沿”一词。我们用它来谈论管理权衡,通常是模型成本与能力之间的权衡。如果一个模型在一定成本或规模下提供了最高程度的智能,则称为“前沿模型”。

An efficient frontier shows the range of optimal combinations when trading off between two valuable outcomes in a resource-constrained environment.

我们在推理工程领域也有高效的前沿。通常,这表现为延迟与吞吐量之间的权衡(决定成本),当然我们也可以用质量换取吞吐量(通过量化、蒸馏和修剪),或用智能换取速度(以推理水平的形式)。

推理工程师可以使用两种技术:

在两个因素之间做出权衡的技术,推动部署沿高效前沿推进。

这些技术能够在特定部署中突破整个前沿,创造更高的整体效率,并可分配给最有利的结果。

这两种类型的技术都是有价值的。

能够通过权衡来精准定位高效前沿的任何点是很有用的。放弃每个用户的速度,使得为批处理工作负载构建高通量、低成本的流水线成为可能。当对延迟敏感的用户愿意支付时,牺牲吞吐量以提升速度是合理的。

当然,推动整个前沿也非常有用。释放更高效率带来的收益可以分配给更低延迟、更高吞吐量,或两者结合。

本文详细介绍了哪些推理工程技术允许你锁定前沿上的某个点,哪些技术将整个前沿推开。本文假设我们运行的是像 GLM-5.3:/library/glm-53/ 或 Kimi K3:/library/kimi-k3/ 这样的大型语言模型,用于agentic编码,启用 KV 缓存重用并实现最佳 KV 感知路由。

在生产环境中达到某个目标,往往不是发现某种新方法,而是根据流量的性质找到合适的配置组合。

Techniques for managing tradeoffs let you target an outcome along an efficient frontier.

实际上,高效的边界非常锯齿状。结果之间没有一条平滑、连续的线,小的改变可能带来巨大影响。这些截断点往往不直观,必须通过实证扫描来发现。

延迟与吞吐量之间最明显的权衡来自批量大小。批处理是指同时处理的请求数量。虽然令牌级连续批处理意味着等待批次开始时没有延迟,但配置的批处理大小决定了每用户的延迟和整体吞吐量。

在小批量时,每用户延迟非常优异,但每个GPU产生的总令牌数较少。这意味着每个令牌的成本相当高。增加批次规模则产生相反效果:每用户延迟变差,整体吞吐量更好,成本更低。

如今的大型语言模型参数达数千亿甚至数万亿,必须分布在多个GPU上。它们在GPU间的共享或并行化方式可以提升延迟或吞吐量。

Parallelism splits large models across multiple GPUs.

对于延迟敏感的部署,重点提升张量并行性(TP)。虽然TP的全对全通信成本较高,但由于这些操作在高带宽NVLink互连上速度快,有助于降低延迟。

专家并行(EP)可以帮助提升延迟和吞吐量。较低的 EP 通常伴随着更好的延迟,而宽 EP,包括跨整机架 GPU 的 EP,通常支持更高的吞吐量。

另一种提升吞吐量的并行技术是注意力数据并行(ADP)。该技术复制注意力层以实现并行计算,从而提升系统吞吐量,但牺牲了每次请求的速度。

量化,即在权重、激活和/或KV缓存值上运行较低精度的模型,既能提升延迟,也能提升吞吐量。量化模型推动了服务权衡的高效边界。

然而,量化引入了一组新的质量与服务效率之间的权衡。这是一个特别崎岖的前沿领域,在使用像 MXFP4 和 NVFP4 这样的微缩浮点数格式时,有可能在几乎不降低模型质量的情况下大幅提升服务效率。

这些技术是那些占据头条的技术。提升整体性能是推理工程中最有趣的部分。

Techniques for pushing out the frontier create universal gains.

最棒的部分是这些技术通常是可以叠加的。例如,通过更好的硬件使性能翻倍,同时通过更好的软件也使性能翻倍,意味着整体服务性能提升四倍,这可以在延迟和吞吐量之间分配。

CUDA 内核是一个低级函数,执行推理过程中的单个部分,例如矩阵乘法。提升单个内核的性能,以及推理引擎中前向传递的端到端性能,意味着生成每个 token 所需的资源更少。这些效率提升会在整个技术栈中叠加,并推动性能前沿的发展。

关于内核级性能的更多内容,请阅读 Baseten 实习生 Brian Li 的这篇优秀文章:/blog/agentic-kernels-in-production/。

推测解码是猜测模型可能生成的 token,然后验证这些猜测的过程。当推测解码刚出现时,这在延迟和吞吐量之间带来了权衡:推测很昂贵,序列长度很短,接受率很低,这意味着推测解码仅在小批量下可行。

如今,像 EAGLE-3:/blog/how-to-train-custom-eagle-3-heads-for-speculative-decoding/、DSpark 和 DFlash:/blog/dflash-faster-llm-inference/ 等技术仍然与主模型循环争夺资源,某种程度上限制了最大批量大小。然而,得益于这些技术的强大性能,尤其是在输出 token 序列相对可预测的代码生成中,它们不仅通过跳过前向传递带来效率提升,还通过每个用户每秒更多 token 的形式减少了延迟。

P/D 分离,或者将预填充(prefill)和解码(decode)分配到专用工作节点,是优化大规模 LLM 部署的一种策略。独立运行预填充和解码意味着工作节点可以针对推理每个阶段的独特特性进行优化,并且可以根据输入和输出序列长度以及来自流量的缓存命中率调整预填充和解码工作节点的比例。

In practice, disaggregation is often most useful for increasing throughput while keeping latencies the same or slightly better.

本文提供了关于管理权衡技巧与提升系统整体性能技巧的基本概述。想要了解本文中提到的每种技术的更多细节,请阅读我的免费书籍《推理工程》:https://www.baseten.co/inference-engineering/。

随时了解模型性能、推理基础设施等信息。

专用推理:/products/dedicated-inference/

Model Labs:/products/baseten-for-model-labs/

模型运行时:/platform/model-performance/

基础设施:/平台/云原生基础设施/

多云:/products/multi-cloud-capacity-management/

自宿主:/deployments/baseten-self-hosted/

混合:/deployments/baseten-hybrid/

前置部署工程师:/平台/嵌入式工程/

转录:/solutions/transcription/

图像生成:/解决方案/图像生成/

文本转语音:/solutions/text-to-speech/

大型语言模型:/solutions/llms/

复合人工智能:/solutions/compound-ai/

文档:https://docs.baseten.co/

储蓄计算器:/resources/calculator/

信任中心:https://trust.baseten.co

条款和条件:/terms-and-conditions/

服务等级协议:/service-level-agreement/

GLM-5.3-Flash:/library/glm-53-flash/

DeepSeek V4 Pro 0813:/library/deepseek-v4-pro-0813/

情报判断

Aioga 编辑摘要

Baseten 工程师 Philip Kiely 介绍 LLM 推理的“有效边界”框架,将优化技术分为两类:在延迟与吞吐之间权衡以移动部署位置,或推动整体边界外移以提升效率。

背景分析

来源将推理中的有效边界主要描述为延迟与吞吐的权衡,吞吐又影响成本。质量与吞吐、智能程度与速度之间,也可通过量化、蒸馏、剪枝和推理级别进行取舍。

Aioga 观点

Aioga 判断:该框架的价值在于区分局部取舍与整体效率提升,便于编辑和工程团队分别审视部署目标与优化结果,但来源未说明具体技术方案的性能幅度。

影响与后续

可能影响:不同工作负载可能需要选择有效边界上的不同位置;批处理可接受较低的单用户速度以换取吞吐,延迟敏感场景则可能重视速度。上述取舍不代表固定的最优方案。 后续观察:需要继续核对文章是否给出具体推理技术、测量方法和部署数据,并关注其如何区分移动边界与外推边界,避免将框架描述误读为确定性性能结论。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: baseten.co

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-02T07:29:52.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Baseten 工程师 Philip Kiely 撰文解析 LLM 推理的"有效边界"框架,将推理技术分为两类:在延迟与吞吐之间做取舍以命中边界上某一点的技术,以及把整条边界外...

Hacker News 热门(buzzing.cc 中文翻译)2026-09-02T07:29:52.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。