Aioga
AI资讯 / 行业动态
返回 AI资讯

Inception 发布扩散大语言模型 Mercury 2.5

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-09-08T23:12:01.000Z热度 58

Inception 发布 Mercury 2.5,称其为目前最强扩散大语言模型,智能较 Mercury 2 提升 40%,在 NVIDIA GPU 上达 1,107 token...

行业动态Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

Inception 发布 Mercury 2.5,称其为目前最强扩散大语言模型,智能较 Mercury 2 提升 40%,在 NVIDIA GPU 上达 1,107 tokens 每秒,上下文

260K tokens,定价 $0.20/百万输入、$0.75/百万输出,发布期 8 折优惠。

中文正文 · AI 翻译

今天,我们发布了 Mercury 2.5,这是我们迄今为止最强大的生产模型。与 Mercury 2 相比,它在质量上有显著提升,同时保持了低延迟、低成本的服务特点。

Inception 发布扩散大语言模型 Mercury 2.5

自 Mercury 2 发布以来,已有数千名开发者使用它进行开发,数十家企业将其投入生产,使用量增长了一个数量级以上。它现在为搜索、语音和编码产品提供对延迟敏感的工作负载服务。

这些工作负载给我们提供了比单独基准测试更清晰的信号。我们使用客户反馈和生产失败案例来优化评估并专注培训。Mercury 2.5 是这一循环的第一个成果。

Mercury 2.5 是市场上最强大的扩散语言大模型。据我们所知,它是迄今为止训练的最大扩散语言模型。

质量:相比 Mercury 2,智能度提升了 40%。可比拟于成本优化的前沿模型,如 GPT-5.6 Luna(低)、Gemini 3.5 Flash-Lite 以及 Claude Haiku 4.5。

速度:在广泛可用的 NVIDIA GPU 上达到每秒 1,107 个 token。

价格:每百万输入 $0.20,每百万输出 $0.75。

发布时,Mercury 2.5 提供 80% 折扣,每百万输入 $0.04,每百万输出 $0.15。

能力:可调推理、并行工具调用以及符合模式的 JSON。

Speed Benchmark
Mercury 2.5 vs Mercury 2.0

自 Mercury 2 发布以来,我们见证了 Inception 在 NVIDIA AI 基础设施上推动基于扩散的语言模型进一步发展。Mercury 2.5 在保持高速度和低成本的同时提升的智能度,反映了新架构在 NVIDIA 平台上迅速成熟为生产就绪系统的能力。

Shruti Koparkar,NVIDIA 加速计算小组产品高级经理

一次搜索请求可能触发数十次模型调用:规划搜索、重写查询、重新排序结果、结构化事实、汇总来源并检查答案。Mercury 保持这些调用的速度足够快,以确保在单次用户交互内完成。多家领先的搜索基础设施公司现在已在生产中使用它。

Query Rewrite Latency Benchmark

在语音应用中,延迟不是基础设施细节,而是呼叫者听到的暂停。

OpenCall 构建了能处理实时客户通话的 AI 电话代理。在其生产工作负载中,Mercury 将模型响应的中位延迟降至接近 170 毫秒。

Inception 发布扩散大语言模型 Mercury 2.5

自从我们切换到 Mercury 后,我们的 P99 响应时间从几分钟降到了仅一秒钟,P50 从 0.4 秒降到不到 0.2 秒——比我们见过的任何其他提供商都快得多,这还包括推理时间。

奥利弗·西尔弗斯坦,联合创始人兼首席执行官,OpenCall

阅读更多:第一个足够快以接听电话的推理模型:./mercury-2-the-first-reasoning-model-fast-enough-to-pick-up-the-phone

编码代理已经将工作拆分到多个模型中。一个模型可能负责计划或编写代码,而其他模型则搜索、运行工具、路由请求、总结状态或压缩长会话。支持调用的操作会反复发生,因此延迟和成本会迅速累积。

Augment Code 使用 Mercury 进行上下文压缩、模型路由和 MCP 工具搜索。将压缩迁移到 Mercury 后,延迟降低了 82%,从大约 150 秒降至 27 秒,并在保持质量的同时将成本降低了 90%。工具搜索摘要在不到一秒钟内返回。

同样的速度也适用于开发 Web 应用。在下面的演示中,观看 Mercury 2.5 从几个提示生成一个可用的音乐发现日志 Web 应用。

Inception 发布扩散大语言模型 Mercury 2.5

随着 Mercury 2.5 的发布,我们还宣布 Mercury Voice:../models 和 Mercury Router:../models 的预览版。

Mercury Voice 提供低于 170 毫秒的首次生成标记时间 (TTFT),是一种针对语音代理优化的 dLLM,具有最严格的延迟预算。

Mercury Router 使用 dLLM 理解输入提示,并将其路由到能够提供最佳质量、速度和成本组合的最佳模型(开放和封闭模型)。

Mercury 模型可通过我们的 Inception API、Baseten 和 OpenRouter 访问。企业部署支持专用容量、自动扩展、合规控制以及可配置的数据保留。

在聊天中试用 Mercury 2.5:http://chat.inceptionlabs.ai/ 使用 API 享受 1 亿免费代币 · 阅读 API 文档:https://docs.inceptionlabs.ai/get-started/get-started

Baseten 客户:通过您现有的 Baseten 设置部署 Mercury 2.5。

Y Combinator公司:声明:https://deals.ycombinator.com/deals/11140 提供50万美元的部署福利。

评估 Mercury 的语音功能?我们将与您合作测试工作负载的适配性,并验证在您的服务约束下的性能。联系我们:https://www.inceptionlabs.ai/enterprise#contact-sales。

我们已经开始训练我们的下一个模型。这是迄今为止最大规模的模型,我们计划在未来几个月发布。我们的下一个模型将在能力上实现飞跃,同时保持扩散模型的速度和令牌效率。这需要在模型训练、推理、评估和基础设施方面取得进展。如果这是您想要参与的类型问题,我们非常希望听到您的消息:../careers。

开始使用:https://platform.inceptionlabs.ai/

水星聊天:https://chat.inceptionlabs.ai/

API 平台:https://platform.inceptionlabs.ai/

文档:https://docs.inceptionlabs.ai/get-started/get-started

集成:https://docs.inceptionlabs.ai/resources

合作伙伴:../enterprise#customer-stories

服务条款:../docs/terms-of-use

销售:mailto:sales@inceptionlabs.ai

咨询:mailto:hello@inceptionlabs.ai

Discord:https://discord.com/invite/5VySp6ctXB

LinkedIn:https://www.linkedin.com/company/inception-labs-ai/

情报判断

Aioga 编辑摘要

Inception 发布 Mercury 2.5,并称其为该公司目前能力最强的生产模型及市场上能力最强的扩散大语言模型。发布材料称,其智能较 Mercury 2 提升40%。

背景分析

发布材料称,Mercury 2 已有数千名开发者使用、数十家企业投入生产,使用量增长超过一个数量级,并用于搜索、语音和编码产品的低延迟工作负载。

Aioga 观点

Aioga 判断:此次发布主要强调质量提升,以及与 Mercury 2 相同的低延迟、低成本服务特征;“能力最强”“规模最大”和模型对标均应按发布方表述理解。

影响与后续

可能影响:对搜索、语音和编码产品中的低延迟工作负载而言,Mercury 2.5 可能成为待评估选项;发布方披露的质量、速度与价格不足以代表所有任务及运行条件。 后续观察:需要核对40%智能提升、每秒1,107个词元、输入输出价格及对标模型等披露,并关注这些结果在具体任务和硬件条件下的表现。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: inceptionlabs.ai

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-08T23:12:01.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Inception 发布 Mercury 2.5,称其为目前最强扩散大语言模型,智能较 Mercury 2 提升 40%,在 NVIDIA GPU 上达 1,107 token...

Hacker News 热门(buzzing.cc 中文翻译)2026-09-08T23:12:01.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。