Aioga
AI资讯 / 行业动态
返回 AI资讯

webAI 发布 TwIL-LM:1.7B 和 3B 形式逻辑模型家族,可在本地硬件上运行

MarkTechPost(RSS)Aioga 编辑团队2026-08-11T06:20:09.000Z热度 58

webAI 发布 TwIL-LM 形式逻辑模型家族,含 1.7B 和 3B 两个版本,均可在本地硬件运行,仅限非商业使用。其中 TwIL-LM3 为 SmolLM3-3B 的合...

行业动态MarkTechPost(RSS)

今日 AI 情报摘要

webAI 发布 TwIL-LM 形式逻辑模型家族,含 1.7B 和 3B 两个版本,均可在本地硬件运行,仅限非商业使用。

其中 TwIL-LM3 为 SmolLM3-3B 的合并微调版本,在六项平均得分上以 0.4488 落后于 gpt-oss-120b 的 0.5192,但生成效率更高,每秒可处理 32.9 个答案,而后者仅为 4.2。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsoasx090jnrrofwelid3gei

中文正文 · AI 翻译

webAI 发布了 TwIL-LM:https://huggingface.co/webAI-Official/TwIL-LM,这是一个参数为 1.7B 和 3B 的形式逻辑推理器双模型系列:https://www.webai.com/blog/webai-releases-twil-lm-a-family-of-formal-logic-models-that-outreason-a-120b-model-and-run-on-an-iphone。3B 成员 TwIL-LM3:https://huggingface.co/webAI-Official/TwIL-LM3,是 SmolLM3-3B:https://huggingface.co/HuggingFaceTB/SmolLM3-3B 的合并微调版本;1.7B 成员是 SmolLM2-1.7B-Instruct:https://huggingface.co/HuggingFaceTB/SmolLM2-1.7B-Instruct 的 PEFT LoRA 适配器。两者都针对自动形式化:https://arxiv.org/abs/2205.12615,旨在将英文翻译成一阶逻辑并检查结论是否从前提中得出。两者均可本地运行,1.7B 的量化版本为 1.06 GB,3B 的 Q4_K_M GGUF 为 1.78 GiB。webAI 的公告:https://www.webai.com/blog/webai-releases-twil-lm-a-family-of-formal-logic-models-that-outreason-a-120b-model-and-run-on-an-iphone 以在五条形式推理赛道中的四条击败 gpt-oss-120b 为发布重点。

部分。现阶段仅限非商业用途。

两个检查点均在 webAI 非商业许可 ver. 1.0 下发布:https://huggingface.co/webAI-Official/TwIL-LM3。产生收入的部署需与 webAI 签订单独协议。

四个阶段位于基础模型之上。首先在合成形式逻辑语料库上进行 LoRA 监督微调。检查点融合,在参数空间中平均中间 SFT 检查点。WiSE-FT 插值回到预训练基础模型,λ = 0.25。然后是 MGPO,即加权熵 GRPO:https://arxiv.org/abs/2402.03300 阶段,在程序化验证器上运行。公开的检查点为第 2071 步。

该 λ 值至关重要:仅保留微调增量的四分之一。跳过插值的兄弟分支在领域内得分更高,宏门控 0.515,但牺牲了大约十二点的外部能力。webAI 并未发布该分支。

webAI 的公告列出性能:规则归纳 96.4,语义解析 87.6,Lean 形式化 64.6,精确格式回答 52.0,蕴含标注 68.7。

它报告了两条赛道。在赛道A,即领域内形式逻辑方面,TwIL-LM3在六条 lanes 的平均得分为 0.4488,宏门控(训练流程依赖的指标)得分为 0.4218。它在所有六条客观 lanes 上超过了包括 LFM2.5-8B-A1B 在内的每个模型,0.4218 对比 0.3757,仅使用了约三分之一的参数。它并未领先两个最大模型。Qwen3-8B:https://huggingface.co/Qwen/Qwen3-8B 的宏门控得分达到 0.5336 对比 0.4218,但大部分属于宽松匹配分;在严格-7 条件下,两者得分分别为 0.2093 和 0.1971。gpt-oss-120b:https://huggingface.co/openai/gpt-oss-120b 的六条 lanes 平均分从 0.4488 提升至 0.5192。

效率方面模型卡说明明确。TwIL-LM3 生成的文本最短,在赛道B上为 482 个 token,因此每秒回答数最多,为 32.9,而 120B 仅为 4.2。

webAI 发布 TwIL-LM:1.7B 和 3B 形式逻辑模型家族,可在本地硬件上运行

TwIL-LM3 在领域内相对提升 +26%,宏门控由 0.336 提升至 0.422,同时在保留核心平均分上也增加 +0.022。模型卡称它是项目中唯一在两条赛道上都有提升的模型。LogicBench 从 0.6467 提升至 0.7167。GSM8K 轻微下滑至 0.8733(原为 0.8833),IFEval 回退至 0.6433(原为 0.6767)。

1.7B 模型属于不同的权衡。其宏主指标得分为 0.361,而未经适配的基线为 0.185。分布外的结果表现参差:LogicBench BQA 提升至 0.590(原 0.563),而 GSM8K 下滑至 0.380(原 0.413),ARC-C 思维链下滑至 0.463(原 0.587)。

需要与我们合作推广你的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会等?请联系我们:https://forms.gle/wbash1wF6efRj8G58

webAI 发布 TwIL-LM:1.7B 和 3B 形式逻辑模型家族,可在本地硬件上运行

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的努力是推出人工智能媒体平台 Marktechpost,该平台以深入报道机器学习和深度学习新闻而著称,既技术上可靠又便于广泛受众理解。该平台每月访问量超过 200 万,显示了其在受众中的受欢迎程度。

Meta AI Releases Muse Glimmer: A 30B Open-Weights Agentic Model That Runs on One Consumer GPU
ByteDance Seed Introduces SeedRealtime

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:webAI 发布 TwIL-LM 形式逻辑模型家族,含 1.7B 和 3B 两个版本,均可在本地硬件运行,仅限非商业使用。 Aioga 将其归入「行业动态」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-11T06:20:09.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

webAI 发布 TwIL-LM 形式逻辑模型家族,含 1.7B 和 3B 两个版本,均可在本地硬件运行,仅限非商业使用。其中 TwIL-LM3 为 SmolLM3-3B 的合...

MarkTechPost(RSS)2026-08-11T06:20:09.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。