Aioga
AI资讯 / 行业动态
返回 AI资讯

如何在编辑器里实时挑选最佳 AI 模型

OpenRouter:Announcements(RSS)Aioga 编辑团队2026-08-25T00:00:00.000Z热度 68

OpenRouter 提出一套模型选型框架:先定义任务,从实时用量和第三方基准中筛选候选,再对比各提供商的定价与延迟,最后用自有提示词测试。判断标准是"每完成任务的成本"而非"...

技巧观点OpenRouter:Announcements(RSS)

今日 AI 情报摘要

OpenRouter 提出一套模型选型框架:先定义任务,从实时用量和第三方基准中筛选候选,再对比各提供商的定价与延迟,最后用自有提示词测试。

判断标准是"每完成任务的成本"而非"每 token 成本"。 其 MCP 服务器可直接在 Claude Code、Cursor 等编辑器中查询实时排名、价格和基准,并用 openrouter/auto-beta 按请求路由。

中文正文 · AI 翻译

要选择 AI 模型,首先定义任务,从实时使用量和基准数据中筛选候选模型,比较各供应商的价格和延迟,然后在自己的提示上测试最终入围的模型。评价标准应是每个完成任务的成本,而不是每个 token 的成本,并且随着新模型的发布,答案可能会发生变化。

How to Choose the Best AI Model (Live, in Your Editor)

我们不会点名单一的最佳模型。任何我们列出的名字在一个月内都会过时,而且正确的模型取决于你在构建什么和你愿意为正确结果付出多少。

本文描述了我们用来回答这个问题的框架,以及如何在不离开编辑器的情况下运行它。我们的 MCP 服务器:https://openrouter.ai/docs/guides/overview/mcp-server 将你的助手连接到实时使用排名、第三方基准、各供应商定价,以及向候选模型发送测试提示的方法。

Six-step framework flow: define the task, then shortlist, compare, test, and measure through the OpenRouter MCP server, then decide or route with openrouter/auto-beta

没有单一的最佳 AI 模型,只有针对特定任务、预算和时间点的最佳模型。

不同的任务需要不同的能力。摘要和编码对模型的要求不同。抽取任务每次调用都需要有效的 JSON,比起需要优美的文章更重要。聊天功能取决于第一个 token 到达的速度,这与完整答案的质量是分开的。在编码基准上排名第一的模型在处理长文档时仍可能表现不佳,并且常规抽取成本可能过高。

一个更有用的问题应包括具体工作。与其问“最佳 AI 模型是什么”,不如问“从扫描发票中提取条目最佳模型是什么”,或者“审查 TypeScript 拉取请求的最佳模型是什么”,或者“总结 90 分钟通话记录的最佳模型是什么”。写出你自己的问题版本,然后根据最新数据,而不是旧排名来回答它。

我们的流量显示答案因任务而异。我们将样本请求分为 29 种任务类型,并发布市场份额:https://openrouter.ai/rankings。仅编码就占了其中的九类,涵盖代码生成、调试、代码审查、仓库扫描、SQL 工作和 DevOps 配置。这九类任务没有共同的领导者。在截至 2026 年 7 月 25 日的七天窗口中,一个模型在八类任务中领先,而另一个模型在代码审查和安全任务中领先。“编码最佳模型”这个问题,即使在编码内部,也是过于笼统的问题。

基准测试对于将数百个选项缩小到可以正确测试的少数候选非常有用。我们会展示来自 Artificial Analysis(https://artificialanalysis.ai)和 Design Arena(https://designarena.ai)的第三方评分,同时结合我们自己的使用数据。

排行榜不能为你做最终选择。分数存在噪声,热门基准会吸引调优,而且没有一个基准跑过你的提示。使用排行榜进行初筛,再通过你自己的测试来决定。

不同任务需要不同的优势。编程需要推理质量和可靠的工具调用。摘要需要较大的上下文窗口和低输入价格。抽取需要比流畅性更强的一致性遵循模式。聊天需要低延迟。视觉任务需要一个能够处理图像的模型,这在质量之前就缩小了选择范围。

没有模型能在每个类别都领先。为所有任务选择一个模型会产生高成本的默认模型,它在演示中表现良好,但在你实际运行的工作中表现不佳。

下面的每一步都通过 MCP 服务器运行,所以请先连接它。

OpenRouter MCP 服务器(https://openrouter.ai/docs/guides/overview/mcp-server)由我们托管,因此本地无需安装任何内容。任何 MCP 客户端都可以连接。下面的设置涵盖 Claude Code、Cursor 和 Codex CLI,文档还涵盖 OpenCode 和 Claude Desktop。你连接一次后,你的助手就可以拉取实时模型、定价、积分、排名、基准和文档,发送测试提示,而无需离开编辑器。在选择模型时使用它。发布时,按正常方式调用 API(https://openrouter.ai/docs/api_reference/overview)。

你也可以在会话内通过运行 /mcp,选择 openrouter,并点击 Authenticate 来进行认证。

Cursor:将此添加到 ~/.cursor/mcp.json,然后使用 cursor-agent mcp list 进行验证。

认证只需在浏览器中操作一次,在三种编辑器中方式相同。在 Cursor 中,它在你的第一次请求时运行,而不是通过登录命令。未经认证的请求会返回 401 并启动我们的 OAuth 流程,审批界面会说明你同意的内容,然后再进行确认。

我们为该客户端铸造一个标记为 OpenRouter MCP: 的密钥,密钥作用范围限定于该客户端,拥有七天的有效期以及默认 10 美元的信用额度,你可以在该界面上更改(MCP 公告:https://openrouter.ai/blog/announcements/openrouter-mcp-server)。该密钥是短期的且默认有限额,你可以随时断开连接,并可在你的密钥仪表板上撤销:https://openrouter.ai/settings/keys。

流程会重定向到 localhost,这对于 Claude Code 或 Cursor 这样的桌面客户端来说是正常的,但这意味着我们无法验证哪个本地应用程序接收了密钥。仅在你刚刚自己发起连接时批准它。

大多数调用是针对实时数据的只读查询。例外情况包括 send-message、generate-image、transcribe-audio 和 generate-speech,它们会产生可计费的推理调用,send-feedback 会对你自己的一些生成内容写入反馈(MCP 文档:https://openrouter.ai/docs/guides/overview/mcp-server)。

助手会为 code:general_impl 标签调用 list-task-classifications 并返回领先模型及其使用情况和令牌份额,然后继续查看每个提供商的定价。此过程不涉及浏览器。

按顺序运行这些步骤。步骤 2 到 5 每一步都映射到助手可以对实时数据进行的特定调用。步骤 1 和 6 取决于你的判断:你要定义需求,然后决定要交付的内容。

从任务开始,而不是模型名称。写下输入内容、你期望的输出、什么算是好的表现、你的延迟目标,以及在成本与质量冲突时你倾向的选择。

最后一项会影响后续每一步。向客户展示的总结可以证明较高的价格。每晚处理百万条记录的提取任务,即使在质量上有些牺牲,也可以证明低价格,因为量占账单的主导地位。说明你正在构建哪种类型的任务。

候选名单来源于两个问题:人们在执行此任务时使用什么,以及哪些在此任务中得分较高?

首先,调用 list-task-classifications。它返回我们在最近七天内的29个任务标签,每个标签都有其使用份额和提供该任务的模型排名列表,这些数据来源于实际流量。其次,调用 list-benchmarks,并将 task_type 设置为 coding、intelligence 或 agentic,它会返回人工分析与设计竞技场的评分以及定价。这三类的粒度刻意比29个流量标签粗,两个调用是要配合使用的。基准过滤器会在广泛类别中去掉分数较低的模型,而流量标签则显示人们在你特定部分使用哪些模型。

list-daily-model-rankings 对趋势分析很有用。默认情况下,它返回前50款模型的每日令牌总数,以及每天的一个汇总其他行。你可以按用例类别(如编程或角色扮演)、模态或工具调用活动来缩小范围,但类别划分来自每周汇总的采样数据,因此这些总数应视为估算。它告诉你哪些在增长,而不是哪些在你的工作中表现良好。同样的视图可在 openrouter.ai/rankings 查看:https://openrouter.ai/rankings。

对于每个入围者,调用 list-model-endpoints。你将获得每个提供该模型的供应商的价格、上下文长度、吞吐量和过去三十分钟的延迟、运行时间、量化和支持的参数。相同的模型在不同供应商之间的价格、速度和可靠性可能不同,因此最好在这里发现这些差异,而不是在生产中。

比较页面:https://openrouter.ai/compare 当你需要与他人分享时,会在浏览器中显示相同的数据。

基准测试为你提供了候选列表,而你的提示语决定最终选择。

对你实际拥有的工作运行 send-message:真实工单、真实文档、真实模式,包括那些通常会出错的。一个干净的评估集会让每个模型看起来都很称职,这也是它无法区分模型优劣的原因。

测试时有三种变体可供使用。:floor:https://openrouter.ai/docs/guides/routing/provider-selection#floor-price-shortcut 路由到提供该模型的最便宜的供应商,从而降低评估成本。:nitro:https://openrouter.ai/docs/guides/routing/model-variants/nitro 路由到最快的供应商,这用于检查延迟预算。:online:https://openrouter.ai/docs/guides/routing/model-variants/online 在任务需要当前上下文时添加网页搜索。

注意 :online 的费用。运行相同的简单提示三种方式,:floor 的费用是 $0.0000030,:nitro 是 $0.0000024,而 :online 是 $0.0052576。对于单个提示,这大约是普通调用的两千倍,所以要有意识地使用,而不是默认开启。

临时测试调用只回答一次问题。Ori Eval:https://openrouter.ai/docs/guides/ori/eval 使此步骤可重复。你可以用普通语言提出问题,例如“哪个模型最适合我的客户支持助手”,你的编程代理会在项目中找到测试材料,写出 *.eval.ts 文件的评估,运行候选模型,并根据分数、耗时和费用推荐一个模型。要从编辑器启动它,给你的编程代理以下指令:

Ori 会为一次运行解析一个测试框架和一个模型,并在该运行的所有测试中保持不变,因此同一评估文件的两次运行使用相同配置。它通过 OpenRouter 发送请求,因此一次比较可以包括来自多个供应商的模型。上述指令适用于临时目录。如果改为手动操作:https://openrouter.ai/docs/guides/ori/eval,评估文件会像普通代码一样保留在项目中,并且当新的模型发布后可以重新运行,可以使用 --baseline 对比早期运行结果,也可以在 CI 中按计划运行。

每次测试调用后,将生成 ID 传给 get-generation。你可以获得精确费用、提示和完成的令牌数、提供商以及延迟。在一组代表性提示上取平均值,调整任务成功频率,并将该数字记录在决策文档中。

有两点需要注意。生成记录在调用返回时不会立即可查询,因此紧接着进行查询会返回404,并在几秒钟后才会解决。遇到第一次返回404时应重试,而不是将其视为失败。此外,完成响应已经包含 usage.cost,因此如果你只需要调用的价格,省去额外的往返请求即可。当你还想了解提供者、延迟或原生令牌数量时,请使用 get-generation。

如果一个模型在你运行的工作中明显优胜,就使用它。

如果结果接近,如果你的流量混合了多种工作,或者如果你不想在每次发布更好模型时都重新做决定,可以使用 Auto Router:https://openrouter.ai/docs/guides/routing/routers/auto-router,模型字符串为 openrouter/auto-beta。旧版 openrouter/auto 仍然可用,但文档中标注已弃用,因此请使用当前版本。

路由器并非随机选择。它将每个请求分类为大约30种细化任务类型,根据过去七天的实际支出份额对候选模型进行排序,应用你的成本和质量偏好,并进行路由备选(Auto Router 文档:https://openrouter.ai/docs/guides/routing/routers/auto-router)。以上框架基于每个请求运行,使用的任务分类数据与步骤2中查询的数据相同。

按任务成本,而非按令牌成本,才是比较模型经济性的正确单位。

人们按每令牌价格比较,是因为比较简单,而且以前很难测量全面成本。现在 get-generation 在每次调用时返回真实数值,这一难题已不存在。

单价低的模型在重试、生成的完成结果超出你的令牌预算,或者需要更强的模型来弥补其失误时,就不再便宜。而更昂贵但首次就能完成任务的模型,通常总成本更低。

2026年对推理模型定价的研究测量了这一点。在32%的模型对比中,标价较低的模型总成本反而更高,极端情况下这种逆转可达28倍(陈等,《价格逆转现象》:https://arxiv.org/abs/2603.23971)。作者将其归因于模型在思考过程中消耗令牌的方式不同:对同一个查询,一个模型可能使用的令牌比另一个多900%,而单个查询的重复运行差异可达9.7倍。标价并不反映这些。

大多数比较忽略了预期尝试次数,而该因素通常决定结果。

以下是基于实际价格的计算,检查日期为2026年7月27日。GPT-5.4 mini:https://openrouter.ai/openai/gpt-5.4-mini,每百万输入令牌$0.75,每百万输出令牌$4.50。Claude Sonnet 5:https://openrouter.ai/anthropic/claude-sonnet-5,每百万输入$2.00,每百万输出$10.00,大约贵2.4倍。以一个包含2000输入和800输出令牌的任务为例。如果Sonnet 5在第一次尝试中成功率为95%,每完成1000个任务的成本约为$12.63。为了与之匹配,mini必须在第一次尝试中成功率达到40%。低于40%,每令牌便宜2.4倍的模型反而成为完成工作的更昂贵方式。

向他人报告时,使用每完成1000个任务的成本。令牌最便宜的模型往往不是完成工作的最便宜方式。

下图绘制了整条曲线,而非单点。曲线更有用,因为盈亏平衡率会随你比较的两个候选模型价格差变化。价格差越大,廉价模型在失去优势之前可容忍的成功率越低。

同一个例子,但绘制在每个成功率下而非单一点。Sonnet 5固定为95%作为参考,而mini的成功率变化。标价以2026年7月27日数据为准,任务为2000输入和800输出令牌,成功率是被扫过的变量,而非我们测量的数据。

这是一个起点,而非排名。每一行告诉你优化目标和调用方式,实时数据提供名称。我们不打印获胜者,因为任何获胜者列表在下一次发布时都会过时。

编码:决定你指的是哪种编码。我们的任务标签将代码生成与调试、审查、前端和仓库扫描区分开来,领导者各不相同。考生应考的是你积压的真实工单,而不是玩具题。

总结:把输入价格和上下文长度一起看,因为单独看都会误导你。价格较便宜、窗口大的型号通常比高输入价格的更强型号更好。

提取:一个每次返回有效 JSON 的较小模型,比每天两次破坏字段的更强模型更强。测试难题输入:缺失字段、记录模糊和原始文本格式错误。

愿景:多模态质量因领域而异,所以先过滤图像输入,然后自己截图。一套现成的演示套装让每个候选人看起来都很出色。

无论如何,运行查询,查看本周的数据,从中选择。

你根本不必只选择一种模型。

一次集成就能覆盖整个目录:https://openrouter.ai/models 跨供应商。下个月有更好的模型发布时,你只需更换模型字符串,而不是集成另一个SDK并重新测试集成路径。选择和执行都在同一平台上,而在MCP中,选择数据可以在你已经操作的编辑器中获得。你还能获得提供者冗余和自动备份:https://openrouter.ai/docs/guides/routing/model-fallbacks,以及足够精确的每次请求成本数据,使上述任务成本计算更准确,而非估算。

如果你确定只想从一个地方买到一个型号,且这一点不会改变,直接找供应商是合理的选择。新型号不断发布,所以要考虑你的信心。

大多数糟糕的模型决策源于测量错误,或者测量正确因素太晚。这五个人是我们看到最多的。

将排行榜位置视为制作决策:公开排行榜上的高排名将获得入围名单,而非制作流量。先把提示词输入模型。

按代币价格购物:低单价隐藏重试次数、长时间完成和退回次数。在get-generation告诉你每个完成任务的成本之前,你并不知道模型的成本。

情报判断

Aioga 编辑摘要

OpenRouter提出的模型选型方法不是寻找永远第一的模型,而是围绕具体任务建立候选清单,再综合实时使用情况、第三方基准、价格、延迟和自有提示词测试进行判断。

背景分析

材料指出,不同任务需要不同能力,摘要、编码、信息抽取和聊天对质量、格式稳定性或首个令牌延迟的要求并不相同;因此,笼统询问“最佳模型”可能缺少可执行的任务边界。

Aioga 观点

Aioga判断,这套框架的关键价值在于把模型采购从单一排行榜比较,转向任务结果与总成本评估。以“每完成任务的成本”替代“每token成本”,可能更贴近实际应用决策。

影响与后续

对开发者而言,模型评估需要持续更新,因为新模型发布后结论可能变化。编辑器内查询排名、价格和基准并测试提示词,可能降低跨工具切换的成本,但不能替代针对自身任务的验证。 值得关注的是,团队是否能先明确任务、预算和可接受延迟,再用少量真实提示词比较候选模型的完成质量、格式可靠性与单任务成本,并记录结果以便后续复测。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: openrouter.ai

来源: OpenRouter:Announcements(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-25T00:00:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

OpenRouter 提出一套模型选型框架:先定义任务,从实时用量和第三方基准中筛选候选,再对比各提供商的定价与延迟,最后用自有提示词测试。判断标准是"每完成任务的成本"而非"...

OpenRouter:Announcements(RSS)2026-08-25T00:00:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。