{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-23T07:21:26.498Z","headline":"EdgeBench：AI智能体基准测试与缩放定律分析","description":"EdgeBench 是一个评估 AI 智能体的基准，涵盖 51 个任务、多种运行时环境和交互时间预算。分析显示，Claude Opus 4.8、GPT-5.5、GPT-5.4、GLM-5.1 和 DS-V4-Pro 等模型在 2-12 分钟时间预算下性能差异显著，其中 Claude Opus 4.8 在多数类别中领先。","url":"https://www.aioga.com/news/cmrwmg6qm00exrobhystiexl7/","mainEntityOfPage":"https://www.aioga.com/news/cmrwmg6qm00exrobhystiexl7/","datePublished":"2026-07-22T21:53:58.000Z","dateModified":"2026-07-22T21:53:58.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://www.marktechpost.com/2026/07/22/research-grade-edgebench-analysis-ai-agent-benchmarking-leaderboard-analytics-scaling-laws-and-evaluation-metrics","https://aihot.virxact.com/items/cmrwmg6qm00exrobhystiexl7"],"canonicalUrl":"https://www.aioga.com/news/cmrwmg6qm00exrobhystiexl7/","directAnswer":{"@type":"Answer","text":"Aioga 编辑摘要：EdgeBench 是一个评估 AI 智能体的基准，涵盖 51 个任务、多种运行时环境和交互时间预算。 Aioga 将其归入「技巧观点」方向，重点关注它对真实使用和行业竞争的影响。","url":"https://www.aioga.com/news/cmrwmg6qm00exrobhystiexl7/","dateCreated":"2026-07-22T21:53:58.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"marktechpost.com source article","url":"https://www.marktechpost.com/2026/07/22/research-grade-edgebench-analysis-ai-agent-benchmarking-leaderboard-analytics-scaling-laws-and-evaluation-metrics","datePublished":"2026-07-22T21:53:58.000Z","provider":{"@type":"Organization","name":"marktechpost.com","url":"https://www.marktechpost.com/2026/07/22/research-grade-edgebench-analysis-ai-agent-benchmarking-leaderboard-analytics-scaling-laws-and-evaluation-metrics"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmrwmg6qm00exrobhystiexl7","datePublished":"2026-07-22T21:53:58.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmrwmg6qm00exrobhystiexl7"}}],"aggregationSource":"MarkTechPost（RSS）","originalPublisher":{"name":"marktechpost.com","url":"https://www.marktechpost.com/2026/07/22/research-grade-edgebench-analysis-ai-agent-benchmarking-leaderboard-analytics-scaling-laws-and-evaluation-metrics"},"article":{"id":"cmrwmg6qm00exrobhystiexl7","slug":"cmrwmg6qm00exrobhystiexl7","url":"https://www.aioga.com/news/cmrwmg6qm00exrobhystiexl7/","title":"EdgeBench：AI智能体基准测试与缩放定律分析","title_en":"Research-Grade EdgeBench Analysis： AI Agent Benchmarking， Leaderboard Analytics， Scaling Laws， and Evaluation Metrics","summary":"EdgeBench 是一个评估 AI 智能体的基准，涵盖 51 个任务、多种运行时环境和交互时间预算。分析显示，Claude Opus 4.8、GPT-5.5、GPT-5.4、GLM-5.1 和 DS-V4-Pro 等模型在 2-12 分钟时间预算下性能差异显著，其中 Claude Opus 4.8 在多数类别中领先。","source":"MarkTechPost（RSS）","sourceUrl":"https://www.marktechpost.com/2026/07/22/research-grade-edgebench-analysis-ai-agent-benchmarking-leaderboard-analytics-scaling-laws-and-evaluation-metrics","aiHotUrl":"https://aihot.virxact.com/items/cmrwmg6qm00exrobhystiexl7","publishedAt":"2026-07-22T21:53:58.000Z","category":"技巧观点","score":62,"selected":false,"articleBody":["In this tutorial, we explore EdgeBench ：https://huggingface.co/datasets/ByteDance-Seed/EdgeBench as a practical benchmark for evaluating advanced AI agents across diverse task categories, runtime environments, and interaction-time budgets. We begin by downloading the dataset snapshot from Hugging Face, parsing the released task specifications, and examining the benchmark taxonomy, execution settings, internet requirements, judging logic, and scoring metadata. We then extract the leaderboard data directly from the repository README, standardize model names, reshape task-level results into an analysis-ready format, and compare performance across multiple time budgets. Finally, we fit log-sigmoid scaling curves, measure category-level score improvements, inspect the tasks with the largest gains, and study how SForge rescale functions transform raw evaluation outputs into normalized benchmark scores.","We install the required Python libraries, import the analytical tools, and configure the notebook display settings. We define the dataset repository, interaction-time budgets, model names, and helper functions to format output and standardize model labels. We then download the complete EdgeBench dataset snapshot from Hugging Face and store its local cache path for the remainder of the workflow.","We parse every task specification into a structured table containing its category, runtime image, internet access, submission paths, judge configuration, and agent query. We summarize the benchmark taxonomy by counting tasks across categories, execution environments, rescaling methods, and game modes. We also visualize these distributions and inspect one representative task to understand how an EdgeBench evaluation is defined.","We read the repository README and extract its Markdown tables into structured Python records. We convert the task-level leaderboard into a tidy dataset containing task, category, model, interaction time, and score values. We also parse the aggregate 51-task leaderboard table to compare the README summary with our task-level calculations.","We calculate the mean score for each model at every interaction-time budget and fit a log-sigmoid scaling curve to the resulting trajectories. We evaluate the goodness of each fit using the coefficient of determination and visualize both the observed scores and fitted curves. We then measure category-level score gains and plot the individual tasks that benefit most from longer interaction time.","We examine the scoring rescale configurations used by the SForge judging system and implement the linear normalization formula. We demonstrate how raw scores map to normalized benchmark scores for both linear and piecewise-style configurations. We finish the tutorial by printing the official EdgeBench and SForge resources required for running complete evaluations.","In conclusion, we built a complete analytical workflow for understanding both the structure and the reported results of EdgeBench. We moved beyond simply viewing a leaderboard by connecting task specifications, runtime configurations, scoring rules, model performance, and interaction-time scaling within a single reproducible Colab pipeline. We also identified where additional interaction time yields the greatest performance improvements and visualized how different models scale across the released benchmark tasks. It provides a technically grounded foundation for interpreting EdgeBench results, comparing agent capabilities, and preparing for deeper evaluation using the full SForge execution harness.","Need to partner with us for promoting your GitHub Repo OR Hugging Face Page OR Product Release OR Webinar etc.? Connect with us ：https://forms.gle/wbash1wF6efRj8G58","Sana Hassan, a consulting intern at Marktechpost and dual-degree student at IIT Madras, is passionate about applying technology and AI to address real-world challenges. With a keen interest in solving practical problems, he brings a fresh perspective to the intersection of AI and real-life solutions.","Build an Agentic Event Venue Operator [Full Codes]：https://pxllnk.co/twdn5","Thanks! Our team will contact you soon 🙌"],"articleImages":[{"sourceUrl":"https://www.marktechpost.com/wp-content/uploads/2026/07/blog19132-1-8-100x70.png","alt":"Google Releases Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber","afterParagraph":8,"url":"/media/articles/cmrwmg6qm00exrobhystiexl7/39896896ab8c8014.webp"}],"mediaStatus":"ok","articleBodyZh":["在本教程中，我们探索 EdgeBench：https://huggingface.co/datasets/ByteDance-Seed/EdgeBench 作为评估高级 AI 代理在不同任务类别、运行时环境和交互时间预算下的实际基准。我们首先从 Hugging Face 下载数据集快照，解析发布的任务规范，并检查基准分类、执行设置、互联网要求、评判逻辑和评分元数据。然后，我们直接从仓库 README 中提取排行榜数据，标准化模型名称，将任务级结果重塑为分析可用的格式，并比较不同时间预算下的性能。最后，我们拟合对数- sigmoid 缩放曲线，衡量类别级得分提升，检查得分提升最大的任务，并研究 SForge 重缩放函数如何将原始评估输出转换为标准化的基准分数。","我们安装所需的 Python 库，导入分析工具，并配置笔记本显示设置。我们定义数据集仓库、交互时间预算、模型名称以及用于格式化输出和标准化模型标签的辅助函数。然后，我们从 Hugging Face 下载完整的 EdgeBench 数据集快照，并存储其本地缓存路径以供工作流程其余部分使用。","我们将每个任务规范解析为包含其类别、运行时镜像、互联网访问、提交路径、评判配置和代理查询的结构化表格。我们通过统计各类别、执行环境、重缩放方法和游戏模式的任务数量来总结基准分类。我们还可视化这些分布，并检查一个代表性任务以理解 EdgeBench 评估的定义方式。","我们读取仓库 README 并将其 Markdown 表格提取为结构化的 Python 记录。我们将任务级排行榜转换为整齐的数据集，其中包含任务、类别、模型、交互时间和分数值。我们还解析 51 任务的汇总排行榜表，以将 README 概要与我们的任务级计算进行比较。","我们计算每个模型在每个交互时间预算下的平均分数，并将对数-西格玛缩放曲线拟合到得到的轨迹中。我们使用决定系数评估每个拟合的优度，并可视化观察到的分数和拟合曲线。然后，我们测量类别级别的分数增益，并绘制从更长交互时间中受益最大的各个任务。","我们检查 SForge 评审系统使用的分数重缩放配置，并实现线性归一化公式。我们演示了原始分数如何映射到线性和分段风格配置下的标准化基准分数。我们在教程最后打印了运行完整评估所需的官方 EdgeBench 和 SForge 资源。","总之，我们建立了一个完整的分析工作流程，用于理解 EdgeBench 的结构和报告结果。我们不仅仅是查看排行榜，而是将任务规范、运行时配置、评分规则、模型性能和交互时间缩放在一个可复现的 Colab 流程中联系起来。我们还确定了额外交互时间带来最大性能提升的点，并可视化不同模型在发布的基准任务中的缩放情况。这为解释 EdgeBench 结果、比较智能代理能力以及使用完整 SForge 执行框架进行更深入评估提供了技术基础。","需要与我们合作推广你的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等？请联系： https://forms.gle/wbash1wF6efRj8G58","Sana Hassan 是 Marktechpost 的咨询实习生，也是 IIT 马德拉斯的双学位学生，他热衷于将技术和人工智能应用于解决现实世界的挑战。凭借解决实际问题的浓厚兴趣，他为 AI 与现实生活解决方案的交汇带来了新的视角。","构建智能事件场馆运营者 [完整代码]：https://pxllnk.co/twdn5","谢谢！我们的团队将很快与您联系 🙌"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"Aioga 编辑摘要：EdgeBench 是一个评估 AI 智能体的基准，涵盖 51 个任务、多种运行时环境和交互时间预算。 Aioga 将其归入「技巧观点」方向，重点关注它对真实使用和行业竞争的影响。","background":"背景分析：产品与工具类动态的价值取决于它是否解决明确场景、能否进入工作流，以及交付、价格和数据安全是否可接受。","viewpoint":"Aioga 判断：这条动态更适合作为行业观察信号，当前信息足以建立线索，但不足以推导长期结论。","implications":"影响分析：对相关团队而言，短期应先核对来源、可用范围和实际成本，再判断是否值得接入或跟进。","nextStep":"后续观察：继续观察产品是否开放使用、用户反馈、定价、集成能力和后续版本更新。","evidenceRefs":["title","summary","articleBody"],"confidence":"medium","status":"published","aiGenerated":false,"autoApproved":true,"generatedBy":"rule-safe-fallback","generatedAt":"2026-07-23T07:30:40.425Z","sourceHash":"1122efb2b2d92a31","validation":{"passed":true,"mode":"rule-safe-fallback","checks":["schema","length","source-attribution","no-html"]}},"tags":["技巧观点","MarkTechPost（RSS）"],"translations":{"zh-CN":{"title":"EdgeBench：AI智能体基准测试与缩放定律分析","summary":"EdgeBench 是一个评估 AI 智能体的基准，涵盖 51 个任务、多种运行时环境和交互时间预算。分析显示，Claude Opus 4.8、GPT-5.5、GPT-5.4、GLM-5.1 和 DS-V4-Pro 等模型在 2-12 分钟时间预算下性能差异显著，其中 Claude Opus 4.8 在多数类别中领先。","category":"技巧观点","source":"marktechpost.com","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench：AI智能体基准测试与缩放定律分析 - Aioga AI资讯","description":"EdgeBench 是一个评估 AI 智能体的基准，涵盖 51 个任务、多种运行时环境和交互时间预算。分析显示，Claude Opus 4.8、GPT-5.5、GPT-5.4、GLM-5.1 和 DS-V4-Pro 等模型在 2-12 分钟时间预算下性能差异显著，其中 Claude Opus 4.8 在多数类别中领先。","url":"https://www.aioga.com/news/cmrwmg6qm00exrobhystiexl7/"},"en":{"title":"EdgeBench: AI Agent Benchmarking and Scaling Law Analysis","summary":"EdgeBench is a benchmark for evaluating AI agents, covering 51 tasks, multiple runtime environments, and interaction time budgets. Analysis shows that models such as Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1, and DS-V4-Pro exhibit significant performance differences under a 2-12 minute time budget, with Claude Opus 4.8 leading in most categories.","category":"Insights","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: AI Agent Benchmarking and Scaling Law Analysis - Aioga AI News","description":"EdgeBench is a benchmark for evaluating AI agents, covering 51 tasks, multiple runtime environments, and interaction time budgets. Analysis shows that models such as Claude Opus 4....","url":"https://www.aioga.com/en/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:02:31.480Z"},"ja":{"title":"EdgeBench：AIエージェントのベンチマークテストとスケーリング則の分析","summary":"EdgeBench は AI エージェントを評価するベンチマークで、51 のタスク、さまざまなランタイム環境、およびインタラクション時間の予算をカバーしています。分析によると、Claude Opus 4.8、GPT-5.5、GPT-5.4、GLM-5.1、DS-V4-Pro などのモデルは 2～12 分の時間予算でパフォーマンスに大きな差があり、その中で Claude Opus 4.8 がほとんどのカテゴリでリードしています。","category":"ヒントと視点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench：AIエージェントのベンチマークテストとスケーリング則の分析 - Aioga AIニュース","description":"EdgeBench は AI エージェントを評価するベンチマークで、51 のタスク、さまざまなランタイム環境、およびインタラクション時間の予算をカバーしています。分析によると、Claude Opus 4.8、GPT-5.5、GPT-5.4、GLM-5.1、DS-V4-Pro などのモデルは 2～12 分の時間予算でパフォーマンスに大きな差があり、その中で C...","url":"https://www.aioga.com/ja/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:02:36.781Z"},"ko":{"title":"EdgeBench: AI 에이전트 벤치마크 테스트 및 스케일링 법칙 분석","summary":"EdgeBench는 AI 에이전트를 평가하는 벤치마크로, 51개의 과제, 다양한 실행 환경 및 상호작용 시간 예산을 포함합니다. 분석에 따르면 Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 및 DS-V4-Pro 등의 모델은 2-12분 시간 예산 하에서 성능 차이가 뚜렷하며, 그중 Claude Opus 4.8은 대부분의 카테고리에서 선두를 차지합니다.","category":"인사이트","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: AI 에이전트 벤치마크 테스트 및 스케일링 법칙 분석 - Aioga AI 뉴스","description":"EdgeBench는 AI 에이전트를 평가하는 벤치마크로, 51개의 과제, 다양한 실행 환경 및 상호작용 시간 예산을 포함합니다. 분석에 따르면 Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 및 DS-V4-Pro 등의 모델은 2-12분 시간 예산 하에서 성능 차이가 뚜렷하며, 그중 Claude...","url":"https://www.aioga.com/ko/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:03:20.867Z"},"es":{"title":"EdgeBench: Pruebas de referencia de agentes de IA y análisis de la ley de escalamiento","summary":"EdgeBench es un benchmark para evaluar agentes de inteligencia artificial, que abarca 51 tareas, diversos entornos de ejecución y presupuestos de tiempo de interacción. El análisis muestra que modelos como Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 y DS-V4-Pro presentan diferencias de rendimiento significativas bajo presupuestos de tiempo de 2 a 12 minutos, destacando Claude Opus 4.8 como líder en la mayoría de las categorías.","category":"Ideas","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: Pruebas de referencia de agentes de IA y análisis de la ley de escalamiento - Aioga Noticias de IA","description":"EdgeBench es un benchmark para evaluar agentes de inteligencia artificial, que abarca 51 tareas, diversos entornos de ejecución y presupuestos de tiempo de interacción. El análisis...","url":"https://www.aioga.com/es/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:03:20.890Z"},"fr":{"title":"EdgeBench : Test de référence des agents intelligents AI et analyse des lois d'échelle","summary":"EdgeBench est une référence pour évaluer les agents intelligents en IA, couvrant 51 tâches, plusieurs environnements d'exécution et des budgets de temps d'interaction. L'analyse montre que des modèles tels que Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 et DS-V4-Pro présentent des différences de performance significatives avec des budgets de temps de 2 à 12 minutes, Claude Opus 4.8 étant en tête dans la plupart des catégories.","category":"Analyses","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench : Test de référence des agents intelligents AI et analyse des lois d'échelle - Aioga Actualités IA","description":"EdgeBench est une référence pour évaluer les agents intelligents en IA, couvrant 51 tâches, plusieurs environnements d'exécution et des budgets de temps d'interaction. L'analyse mo...","url":"https://www.aioga.com/fr/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:04:04.746Z"},"de":{"title":"EdgeBench: Benchmarking von KI-Agenten und Analyse der Skalierungsgesetze","summary":"EdgeBench ist ein Benchmark zur Bewertung von KI-Agenten und umfasst 51 Aufgaben, verschiedene Laufzeitumgebungen und Interaktionszeitbudgets. Die Analyse zeigt, dass Modelle wie Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 und DS-V4-Pro bei Zeitbudgets von 2-12 Minuten erhebliche Leistungsunterschiede aufweisen, wobei Claude Opus 4.8 in den meisten Kategorien führend ist.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: Benchmarking von KI-Agenten und Analyse der Skalierungsgesetze - Aioga KI-News","description":"EdgeBench ist ein Benchmark zur Bewertung von KI-Agenten und umfasst 51 Aufgaben, verschiedene Laufzeitumgebungen und Interaktionszeitbudgets. Die Analyse zeigt, dass Modelle wie C...","url":"https://www.aioga.com/de/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:04:05.068Z"},"pt-BR":{"title":"EdgeBench: Benchmark de agentes de IA e análise das leis de escalonamento","summary":"EdgeBench é um benchmark para avaliar agentes de IA, abrangendo 51 tarefas, múltiplos ambientes de execução e orçamentos de tempo de interação. A análise mostra que modelos como Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 e DS-V4-Pro apresentam diferenças de desempenho significativas com orçamentos de tempo de 2 a 12 minutos, sendo que o Claude Opus 4.8 lidera na maioria das categorias.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: Benchmark de agentes de IA e análise das leis de escalonamento - Aioga Notícias de IA","description":"EdgeBench é um benchmark para avaliar agentes de IA, abrangendo 51 tarefas, múltiplos ambientes de execução e orçamentos de tempo de interação. A análise mostra que modelos como Cl...","url":"https://www.aioga.com/pt-BR/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:04:56.438Z"},"ru":{"title":"EdgeBench: тестирование эталонных показателей ИИ-агентов и анализ законов масштабирования","summary":"EdgeBench — это эталон для оценки ИИ-агентов, охватывающий 51 задачу, различные среды выполнения и бюджет времени взаимодействия. Анализ показывает, что модели, такие как Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 и DS-V4-Pro, демонстрируют значительные различия в производительности при бюджете времени от 2 до 12 минут, причём Claude Opus 4.8 лидирует в большинстве категорий.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: тестирование эталонных показателей ИИ-агентов и анализ законов масштабирования - Aioga Новости ИИ","description":"EdgeBench — это эталон для оценки ИИ-агентов, охватывающий 51 задачу, различные среды выполнения и бюджет времени взаимодействия. Анализ показывает, что модели, такие как Claude Op...","url":"https://www.aioga.com/ru/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:04:54.398Z"},"ar":{"title":"EdgeBench: اختبار قياس الأداء لوكلاء الذكاء الاصطناعي وتحليل قوانين المقياس","summary":"EdgeBench هو معيار لتقييم وكلاء الذكاء الاصطناعي، يغطي 51 مهمة، والعديد من بيئات التشغيل، وميزانيات زمنية للتفاعل. تُظهر التحليلات أن النماذج مثل Claude Opus 4.8 وGPT-5.5 وGPT-5.4 وGLM-5.1 وDS-V4-Pro تظهر فروقًا كبيرة في الأداء ضمن ميزانيات زمنية تتراوح بين 2 إلى 12 دقيقة، حيث يتصدر Claude Opus 4.8 أغلب الفئات.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: اختبار قياس الأداء لوكلاء الذكاء الاصطناعي وتحليل قوانين المقياس - Aioga أخبار الذكاء الاصطناعي","description":"EdgeBench هو معيار لتقييم وكلاء الذكاء الاصطناعي، يغطي 51 مهمة، والعديد من بيئات التشغيل، وميزانيات زمنية للتفاعل. تُظهر التحليلات أن النماذج مثل Claude Opus 4.8 وGPT-5.5 وGPT-5.4...","url":"https://www.aioga.com/ar/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:05:41.648Z"},"hi":{"title":"EdgeBench: एआई एजेंट बेंचमार्किंग और स्केलिंग कानून विश्लेषण","summary":"EdgeBench एक AI एजेंट का मूल्यांकन करने वाला बेंचमार्क है, जिसमें 51 कार्य, विभिन्न रनटाइम वातावरण और इंटरेक्शन टाइम बजट शामिल हैं। विश्लेषण से पता चलता है कि Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 और DS-V4-Pro जैसे मॉडल 2-12 मिनट के समय बजट में प्रदर्शन में महत्वपूर्ण अंतर दिखाते हैं, जिसमें Claude Opus 4.8 अधिकांश श्रेणियों में सबसे आगे है।","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: एआई एजेंट बेंचमार्किंग और स्केलिंग कानून विश्लेषण - Aioga AI समाचार","description":"EdgeBench एक AI एजेंट का मूल्यांकन करने वाला बेंचमार्क है, जिसमें 51 कार्य, विभिन्न रनटाइम वातावरण और इंटरेक्शन टाइम बजट शामिल हैं। विश्लेषण से पता चलता है कि Claude Opus 4.8, GPT-...","url":"https://www.aioga.com/hi/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:05:54.889Z"},"it":{"title":"EdgeBench: Benchmarking degli agenti AI e analisi della legge di scala","summary":"EdgeBench è un benchmark per valutare gli agenti AI, che copre 51 task, diversi ambienti di esecuzione e budget di tempo di interazione. L'analisi mostra che modelli come Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 e DS-V4-Pro presentano differenze di prestazioni significative con un budget di tempo da 2 a 12 minuti, con Claude Opus 4.8 in testa nella maggior parte delle categorie.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: Benchmarking degli agenti AI e analisi della legge di scala - Aioga Notizie IA","description":"EdgeBench è un benchmark per valutare gli agenti AI, che copre 51 task, diversi ambienti di esecuzione e budget di tempo di interazione. L'analisi mostra che modelli come Claude Op...","url":"https://www.aioga.com/it/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:06:37.958Z"},"nl":{"title":"EdgeBench: Benchmarking van AI-agents en analyse van schaalwetten","summary":"EdgeBench is een benchmark voor het evalueren van AI-agenten, die 51 taken, meerdere runtime-omgevingen en interactietijdbudgetten omvat. Analyses tonen aan dat modellen zoals Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 en DS-V4-Pro aanzienlijke prestatieverschillen vertonen bij tijdsbudgetten van 2-12 minuten, waarbij Claude Opus 4.8 in de meeste categorieën de leiding heeft.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: Benchmarking van AI-agents en analyse van schaalwetten - Aioga AI-nieuws","description":"EdgeBench is een benchmark voor het evalueren van AI-agenten, die 51 taken, meerdere runtime-omgevingen en interactietijdbudgetten omvat. Analyses tonen aan dat modellen zoals Clau...","url":"https://www.aioga.com/nl/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:06:34.807Z"},"tr":{"title":"EdgeBench: AI Akıllı Ajanı Başlangıç Testi ve Ölçekleme Kanunu Analizi","summary":"EdgeBench, 51 görevi, çeşitli çalışma zamanı ortamlarını ve etkileşim süresi bütçesini kapsayan bir AI ajan değerlendirme kriteridir. Analizler, Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 ve DS-V4-Pro gibi modellerin 2-12 dakikalık zaman bütçesi altında performans farklılıklarının belirgin olduğunu göstermektedir; bu modeller arasında Claude Opus 4.8 çoğu kategoride öndedir.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: AI Akıllı Ajanı Başlangıç Testi ve Ölçekleme Kanunu Analizi - Aioga AI Haberleri","description":"EdgeBench, 51 görevi, çeşitli çalışma zamanı ortamlarını ve etkileşim süresi bütçesini kapsayan bir AI ajan değerlendirme kriteridir. Analizler, Claude Opus 4.8, GPT-5.5, GPT-5.4,...","url":"https://www.aioga.com/tr/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:07:24.753Z"},"vi":{"title":"EdgeBench: Đánh giá chuẩn và phân tích quy luật tỉ lệ của tác nhân AI","summary":"EdgeBench là một chuẩn đánh giá các tác nhân AI, bao gồm 51 nhiệm vụ, nhiều môi trường chạy khác nhau và ngân sách thời gian tương tác. Phân tích cho thấy, các mô hình như Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 và DS-V4-Pro có sự khác biệt rõ rệt về hiệu suất dưới ngân sách thời gian 2-12 phút, trong đó Claude Opus 4.8 dẫn đầu ở hầu hết các hạng mục.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: Đánh giá chuẩn và phân tích quy luật tỉ lệ của tác nhân AI - Tin tức AI Aioga","description":"EdgeBench là một chuẩn đánh giá các tác nhân AI, bao gồm 51 nhiệm vụ, nhiều môi trường chạy khác nhau và ngân sách thời gian tương tác. Phân tích cho thấy, các mô hình như Claude O...","url":"https://www.aioga.com/vi/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:07:29.112Z"},"id":{"title":"EdgeBench: Pengujian Tolok Ukur Agen AI dan Analisis Hukum Skala","summary":"EdgeBench adalah tolok ukur untuk menilai agen AI, mencakup 51 tugas, berbagai lingkungan runtime, dan anggaran waktu interaksi. Analisis menunjukkan bahwa model seperti Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1, dan DS-V4-Pro menunjukkan perbedaan kinerja yang signifikan dalam anggaran waktu 2-12 menit, di mana Claude Opus 4.8 unggul di sebagian besar kategori.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: Pengujian Tolok Ukur Agen AI dan Analisis Hukum Skala - Berita AI Aioga","description":"EdgeBench adalah tolok ukur untuk menilai agen AI, mencakup 51 tugas, berbagai lingkungan runtime, dan anggaran waktu interaksi. Analisis menunjukkan bahwa model seperti Claude Opu...","url":"https://www.aioga.com/id/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:08:09.779Z"},"th":{"title":"EdgeBench: การทดสอบมาตรฐานและการวิเคราะห์กฎหมายการขยายของปัญญาประดิษฐ์","summary":"EdgeBench เป็นมาตรฐานการประเมินหน่วยปัญญาประดิษฐ์ (AI) ครอบคลุม 51 งาน สภาพแวดล้อมการทำงานหลายแบบ และงบประมาณเวลาในการโต้ตอบ การวิเคราะห์แสดงให้เห็นว่า โมเดลอย่าง Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 และ DS-V4-Pro มีความแตกต่างอย่างมีนัยสำคัญในประสิทธิภาพภายใต้งบประมาณเวลา 2-12 นาที โดยที่ Claude Opus 4.8 นำในหลายหมวดหมู่","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: การทดสอบมาตรฐานและการวิเคราะห์กฎหมายการขยายของปัญญาประดิษฐ์ - ข่าว AI Aioga","description":"EdgeBench เป็นมาตรฐานการประเมินหน่วยปัญญาประดิษฐ์ (AI) ครอบคลุม 51 งาน สภาพแวดล้อมการทำงานหลายแบบ และงบประมาณเวลาในการโต้ตอบ การวิเคราะห์แสดงให้เห็นว่า โมเดลอย่าง Claude Opus 4.8,...","url":"https://www.aioga.com/th/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:08:22.144Z"},"pl":{"title":"EdgeBench: Testy porównawcze agentów AI i analiza praw skalowania","summary":"EdgeBench jest benchmarkiem do oceny agentów AI, obejmującym 51 zadań, różne środowiska uruchomieniowe i budżety czasu interakcji. Analiza wykazała, że modele takie jak Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 i DS-V4-Pro wykazują znaczące różnice w wydajności przy budżetach czasowych od 2 do 12 minut, przy czym Claude Opus 4.8 przoduje w większości kategorii.","category":"技巧观点","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"EdgeBench: Testy porównawcze agentów AI i analiza praw skalowania - Aioga Wiadomości AI","description":"EdgeBench jest benchmarkiem do oceny agentów AI, obejmującym 51 zadań, różne środowiska uruchomieniowe i budżety czasu interakcji. Analiza wykazała, że modele takie jak Claude Opus...","url":"https://www.aioga.com/pl/news/cmrwmg6qm00exrobhystiexl7/","contentTranslated":true,"sourceHash":"281d8928033b86fd","translatedAt":"2026-07-22T22:09:10.143Z"}}}}