{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-23T06:40:50.084Z","headline":"小鹏集团发布 TuringViT 高效视觉编码器","description":"小鹏集团发布面向 VLM/VLA 时代的 TuringViT 视觉编码器，推出 18L 和 24L 两个规格。该编码器在 1536×1536 分辨率下推理吞吐量达 Seed1.5-ViT 的 3.04 倍，仅用 0.85B 图文对便在六项零样本分类基准上取得 83.6% 平均准确率，超越使用 10B 数据的基线。","url":"https://www.aioga.com/news/cmru6c51y5ih7bihzkeae18ju/","mainEntityOfPage":"https://www.aioga.com/news/cmru6c51y5ih7bihzkeae18ju/","datePublished":"2026-07-21T04:23:59.000Z","dateModified":"2026-07-21T04:23:59.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://www.ithome.com/0/979/451.htm","https://aihot.virxact.com/items/cmru6c51y5ih7bihzkeae18ju"],"canonicalUrl":"https://www.aioga.com/news/cmru6c51y5ih7bihzkeae18ju/","directAnswer":{"@type":"Answer","text":"Aioga 编辑摘要：小鹏集团发布面向 VLM/VLA 时代的 TuringViT 视觉编码器，推出 18L 和 24L 两个规格。 Aioga 将其归入「模型更新」方向，重点关注它对真实使用和行业竞争的影响。","url":"https://www.aioga.com/news/cmru6c51y5ih7bihzkeae18ju/","dateCreated":"2026-07-21T04:23:59.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"IT之家 source article","url":"https://www.ithome.com/0/979/451.htm","datePublished":"2026-07-21T04:23:59.000Z","provider":{"@type":"Organization","name":"IT之家","url":"https://www.ithome.com/0/979/451.htm"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmru6c51y5ih7bihzkeae18ju","datePublished":"2026-07-21T04:23:59.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmru6c51y5ih7bihzkeae18ju"}}],"aggregationSource":"IT之家（RSS）","originalPublisher":{"name":"IT之家","url":"https://www.ithome.com/0/979/451.htm"},"article":{"id":"cmru6c51y5ih7bihzkeae18ju","slug":"cmru6c51y5ih7bihzkeae18ju","url":"https://www.aioga.com/news/cmru6c51y5ih7bihzkeae18ju/","title":"小鹏集团发布 TuringViT 高效视觉编码器","title_en":"小鹏集团发布 TuringViT，宣称重构视觉大模型训练范式","summary":"小鹏集团发布面向 VLM/VLA 时代的 TuringViT 视觉编码器，推出 18L 和 24L 两个规格。该编码器在 1536×1536 分辨率下推理吞吐量达 Seed1.5-ViT 的 3.04 倍，仅用 0.85B 图文对便在六项零样本分类基准上取得 83.6% 平均准确率，超越使用 10B 数据的基线。","source":"IT之家（RSS）","sourceUrl":"https://www.ithome.com/0/979/451.htm","aiHotUrl":"https://aihot.virxact.com/items/cmru6c51y5ih7bihzkeae18ju","publishedAt":"2026-07-21T04:23:59.000Z","category":"模型更新","score":60,"selected":false,"articleBody":["IT之家：https://www.ithome.com/ 7 月 21 日消息，小鹏集团今日发布 TuringViT 高效视觉编码器 ，面向 VLM / VLA 时代系统性重构视觉编码器的架构设计、数据范式与训练流程。","小鹏集团表示， TuringViT 将全面支撑智能驾驶、智能座舱、IRON 人形机器人三大业务场景 ，同时为行业提供了一条可复现、低成本训练 SOTA 级（State-of-the-Art，最新技术水平）视觉 Transformer 的技术路径，推动先进视觉大模型从“头部团队专属”走向“行业普惠”。","据介绍，TuringViT 从架构、数据、训练三个维度同步突破，打造了“线性注意力主导 + 高质量数据治理 + 原生动态分辨率”的完整技术体系，实现了效果、效率与落地性的三重提升。","TuringViT-18L 包含 3 组 Turing Block（共 15 层 TLA+3 层 MHA），主打动态分辨率下的高效部署；","TuringViT-24L 包含 4 组 Turing Block（共 20 层 TLA+4 层 MHA），在保持线性计算主导的前提下进一步提升表征能力。","实测数据显示，随着输入分辨率提升，TuringViT 的延迟增长曲线远平缓于标准 softmax ViT，高分辨率下的效率优势愈发显著。在 1536×1536 分辨率下，TuringViT-18L 的推理吞吐量达到 Seed1.5-ViT 的 3.04 倍，相比 SigLIP2-ViT-L 提升 2.16 倍，为高分辨率感知、多摄像头输入、长时序视频处理的端侧部署扫清了核心障碍。","不同于行业“堆数据规模”的粗放路线， TuringViT 打造了 VISTA-Curation 多模态数据治理流水线 ，通过提升单样本的监督价值实现数据效率的量级提升，从“用更多数据”转向“用更优质的监督”。","第三步在统一对比池中通过相对图文对齐度、文本信息量、歧义度综合打分，筛选出视觉贴合度高、语义信息密度高的优质标注，淘汰模糊、泛化、弱对齐的样本。","针对视频数据，流水线同样进行全流程治理：先将长视频切分为连续短片段并均匀采样代表帧；再通过语义一致性与运动一致性双重过滤，保留语义连贯、变化信息有效的片段；最后融合局部帧级细节字幕与全局时序语义字幕，生成具备变换感知能力的视频标注，让模型从连续画面中学习更鲁棒的视觉表征。","最终，TuringViT 仅用 0.85B 图文对（约为 SigLIP2-L 训练数据规模的 10%），便在 ImageNet-1K 等六项零样本分类基准上取得 83.6% 的平均准确率， 超越使用 10B 数据训练的主流开源基线 ；在 COCO、Flickr30K 图文检索任务上同样优势显著，真正实现了“十分之一数据，更优效果”的突破。","TuringViT 还采用四阶段渐进式原生动态分辨率训练范式，从预训练之初就适配下游 VLM / VLA 的输入特性，告别“固定分辨率预训练 + 事后适配”的传统模式。","在智能驾驶领域， TuringViT 是第二代 VLA 模型的核心视觉编码器 ，负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入，为预测式世界模型提供视觉 token。","面向智能座舱与驾泊一体化场景，TuringViT 的 VLM 原生特性让视觉特征与语言模型实现更高效的对齐， 可以提供更高的识别精度、不同画幅和比例的视觉输入 ，以支撑更多未来的车辆与用户交互的丰富座舱功能。","在小鹏 IRON 人形机器人的技术体系中， TuringViT 充当着“视觉视网膜”的核心角色 ，为具身智能提供物体细粒度识别、空间关系理解、可操作区域检测、动态环境追踪等基础感知能力。","https://turingvit.github.io/ ：https://turingvit.github.io/"],"articleImages":[{"sourceUrl":"https://img.ithome.com/newsuploadfiles/2026/7/8f2162e1-9606-4bc5-ae29-5f71aec5fd5c.png?x-bce-process=image/format,f_auto","alt":"TuringViT 的块架构和模型配置","afterParagraph":1,"url":"/media/articles/cmru6c51y5ih7bihzkeae18ju/88bd7206d25fd9bb.webp"},{"sourceUrl":"https://img.ithome.com/newsuploadfiles/2026/7/1256837a-7042-4f75-81bb-85c345eca963.png?x-bce-process=image/format,f_auto","alt":"图像-文本筛选及处理流程","afterParagraph":7,"url":"/media/articles/cmru6c51y5ih7bihzkeae18ju/10c699833f645fa2.webp"},{"sourceUrl":"https://img.ithome.com/newsuploadfiles/2026/7/09e017cf-64bf-4da7-9521-43ee4bf72e2b.png?x-bce-process=image/format,f_auto","alt":"视频-语义筛选及处理流程","afterParagraph":8,"url":"/media/articles/cmru6c51y5ih7bihzkeae18ju/122a2b4fa2a37c0e.webp"},{"sourceUrl":"https://img.ithome.com/newsuploadfiles/2026/7/4fdee943-8b0a-4910-9ecc-b82040a81f11.png?x-bce-process=image/format,f_auto","alt":"图片","afterParagraph":9,"url":"/media/articles/cmru6c51y5ih7bihzkeae18ju/34f8e3a5c43a46de.webp"}],"mediaStatus":"ok","articleBodyZh":[],"translationStatus":"","bodyOrigin":"source-page","editorial":{"summary":"Aioga 编辑摘要：小鹏集团发布面向 VLM/VLA 时代的 TuringViT 视觉编码器，推出 18L 和 24L 两个规格。 Aioga 将其归入「模型更新」方向，重点关注它对真实使用和行业竞争的影响。","background":"背景分析：模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断，单项指标领先不等于已经形成稳定采用。","viewpoint":"Aioga 判断：这条动态更适合作为行业观察信号，当前信息足以建立线索，但不足以推导长期结论。","implications":"影响分析：对相关团队而言，短期应先核对来源、可用范围和实际成本，再判断是否值得接入或跟进。","nextStep":"后续观察：继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。","evidenceRefs":["title","summary","articleBody"],"confidence":"medium","status":"published","aiGenerated":false,"autoApproved":true,"generatedBy":"rule-safe-fallback","generatedAt":"2026-07-23T06:49:19.086Z","sourceHash":"24d0d6e6e0639c80","validation":{"passed":true,"mode":"rule-safe-fallback","checks":["schema","length","source-attribution","no-html"]}},"tags":["模型更新","IT之家（RSS）"],"translations":{"zh-CN":{"title":"小鹏集团发布 TuringViT 高效视觉编码器","summary":"小鹏集团发布面向 VLM/VLA 时代的 TuringViT 视觉编码器，推出 18L 和 24L 两个规格。该编码器在 1536×1536 分辨率下推理吞吐量达 Seed1.5-ViT 的 3.04 倍，仅用 0.85B 图文对便在六项零样本分类基准上取得 83.6% 平均准确率，超越使用 10B 数据的基线。","category":"模型更新","source":"IT之家","aggregationSource":"IT之家（RSS）","pageTitle":"小鹏集团发布 TuringViT 高效视觉编码器 - Aioga AI资讯","description":"小鹏集团发布面向 VLM/VLA 时代的 TuringViT 视觉编码器，推出 18L 和 24L 两个规格。该编码器在 1536×1536 分辨率下推理吞吐量达 Seed1.5-ViT 的 3.04 倍，仅用 0.85B 图文对便在六项零样本分类基准上取得 83.6% 平均准确率，超越使用 10B 数据的基线。","url":"https://www.aioga.com/news/cmru6c51y5ih7bihzkeae18ju/"},"en":{"title":"XPeng Group releases TuringViT efficient visual encoder","summary":"Xpeng Group released the TuringViT visual encoder for the VLM/VLA era, offering two specifications: 18L and 24L. The encoder achieves 3.04 times the inference throughput of Seed1.5-ViT at a resolution of 1536×1536, and with only 0.85 billion image-text pairs, it attains an average accuracy of 83.6% across six zero-shot classification benchmarks, surpassing the baseline that uses 10 billion data pairs.","category":"Models","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"XPeng Group releases TuringViT efficient visual encoder - Aioga AI News","description":"Xpeng Group released the TuringViT visual encoder for the VLM/VLA era, offering two specifications: 18L and 24L. The encoder achieves 3.04 times the inference throughput of Seed1.5...","url":"https://www.aioga.com/en/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:02:16.744Z"},"ja":{"title":"小鵬グループ、TuringViT 高効率ビジュアルエンコーダーを発表","summary":"小鹏グループはVLM/VLA時代向けのTuringViTビジュアルエンコーダを発表し、18Lと24Lの2つの仕様を導入しました。このエンコーダは1536×1536の解像度での推論スループットがSeed1.5-ViTの3.04倍に達し、わずか0.85Bの画像-テキストペアで6つのゼロショット分類ベンチマークで平均精度83.6%を達成し、10Bデータを使用したベースラインを上回りました。","category":"モデル更新","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"小鵬グループ、TuringViT 高効率ビジュアルエンコーダーを発表 - Aioga AIニュース","description":"小鹏グループはVLM/VLA時代向けのTuringViTビジュアルエンコーダを発表し、18Lと24Lの2つの仕様を導入しました。このエンコーダは1536×1536の解像度での推論スループットがSeed1.5-ViTの3.04倍に達し、わずか0.85Bの画像-テキストペアで6つのゼロショット分類ベンチマークで平均精度83.6%を達成し、10Bデータを使用したベ...","url":"https://www.aioga.com/ja/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:02:28.444Z"},"ko":{"title":"샤오펑 그룹, TuringViT 고효율 비주얼 인코더 발표","summary":"샤오펑 그룹은 VLM/VLA 시대를 위한 TuringViT 비주얼 인코더를 발표했으며, 18L와 24L 두 가지 사양을 출시했습니다. 이 인코더는 1536×1536 해상도에서 추론 처리량이 Seed1.5-ViT의 3.04배에 달하며, 단 0.85B 이미지-텍스트 쌍만으로 여섯 가지 제로샷 분류 벤치마크에서 평균 정확도 83.6%를 달성하여 10B 데이터를 사용한 기준선을 능가했습니다.","category":"모델 업데이트","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"샤오펑 그룹, TuringViT 고효율 비주얼 인코더 발표 - Aioga AI 뉴스","description":"샤오펑 그룹은 VLM/VLA 시대를 위한 TuringViT 비주얼 인코더를 발표했으며, 18L와 24L 두 가지 사양을 출시했습니다. 이 인코더는 1536×1536 해상도에서 추론 처리량이 Seed1.5-ViT의 3.04배에 달하며, 단 0.85B 이미지-텍스트 쌍만으로 여섯 가지 제로샷 분류 벤치마크에서 평균 정확도 8...","url":"https://www.aioga.com/ko/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:03:11.883Z"},"es":{"title":"XPeng Group lanza el codificador visual eficiente TuringViT","summary":"Xiaopeng Group lanzó el codificador visual TuringViT para la era VLM/VLA, con dos especificaciones: 18L y 24L. Este codificador alcanza un rendimiento de inferencia de 3,04 veces el de Seed1.5-ViT a una resolución de 1536×1536, y con solo 0,85 mil millones de pares de imagen-texto logra un promedio de precisión del 83,6 % en seis benchmarks de clasificación en cero disparos, superando la línea base que utiliza 10 mil millones de datos.","category":"Modelos","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"XPeng Group lanza el codificador visual eficiente TuringViT - Aioga Noticias de IA","description":"Xiaopeng Group lanzó el codificador visual TuringViT para la era VLM/VLA, con dos especificaciones: 18L y 24L. Este codificador alcanza un rendimiento de inferencia de 3,04 veces e...","url":"https://www.aioga.com/es/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:03:07.621Z"},"fr":{"title":"XPeng Group publie l'encodeur visuel efficace TuringViT","summary":"Xiaopeng Group a publié l'encodeur visuel TuringViT destiné à l'ère VLM/VLA, proposant deux spécifications : 18L et 24L. Cet encodeur atteint un débit de calcul 3,04 fois supérieur à celui de Seed1.5-ViT à une résolution de 1536×1536, et n'utilisant que 0,85 milliard de paires image-texte, obtient une précision moyenne de 83,6 % sur six benchmarks de classification zero-shot, surpassant la baseline utilisant 10 milliards de données.","category":"Modèles","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"XPeng Group publie l'encodeur visuel efficace TuringViT - Aioga Actualités IA","description":"Xiaopeng Group a publié l'encodeur visuel TuringViT destiné à l'ère VLM/VLA, proposant deux spécifications : 18L et 24L. Cet encodeur atteint un débit de calcul 3,04 fois supérieur...","url":"https://www.aioga.com/fr/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:03:56.389Z"},"de":{"title":"XPeng Group veröffentlicht TuringViT effizienten visuellen Encoder","summary":"Xiaopeng Group hat den TuringViT-Vision-Encoder für das VLM/VLA-Zeitalter veröffentlicht und bietet zwei Versionen mit 18L und 24L an. Dieser Encoder erreicht bei einer Auflösung von 1536×1536 eine Inferenzdurchsatzrate, die 3,04-mal so hoch ist wie die von Seed1,5-ViT, und erzielt mit nur 0,85 Milliarden Bild-Text-Paaren eine durchschnittliche Genauigkeit von 83,6 % in sechs Zero-Shot-Klassifizierungsbenchmarks, was den mit 10 Milliarden Daten erreichten Basiswert übertrifft.","category":"模型更新","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"XPeng Group veröffentlicht TuringViT effizienten visuellen Encoder - Aioga KI-News","description":"Xiaopeng Group hat den TuringViT-Vision-Encoder für das VLM/VLA-Zeitalter veröffentlicht und bietet zwei Versionen mit 18L und 24L an. Dieser Encoder erreicht bei einer Auflösung v...","url":"https://www.aioga.com/de/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:03:51.867Z"},"pt-BR":{"title":"O Grupo XPeng lança o codificador visual eficiente TuringViT","summary":"O Grupo Xpeng lançou o codificador visual TuringViT voltado para a era VLM/VLA, disponibilizando dois modelos: 18L e 24L. Este codificador alcança um throughput de inferência 3,04 vezes maior que o Seed1,5-ViT em resolução de 1536×1536, e, utilizando apenas 0,85B de pares imagem-texto, obtém uma precisão média de 83,6% em seis benchmarks de classificação zero-shot, superando a linha de base que utiliza 10B de dados.","category":"模型更新","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"O Grupo XPeng lança o codificador visual eficiente TuringViT - Aioga Notícias de IA","description":"O Grupo Xpeng lançou o codificador visual TuringViT voltado para a era VLM/VLA, disponibilizando dois modelos: 18L e 24L. Este codificador alcança um throughput de inferência 3,04...","url":"https://www.aioga.com/pt-BR/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:04:35.203Z"},"ru":{"title":"Группа XPeng выпустила высокоэффективный визуальный кодировщик TuringViT","summary":"Компания Xpeng представила визуальный кодировщик TuringViT для эпохи VLM/VLA, выпустив два варианта: 18L и 24L. Этот кодировщик при разрешении 1536×1536 достигает пропускной способности инференса в 3,04 раза выше, чем у Seed1.5-ViT, и всего с 0,85 млрд пар изображение-текст достигает среднего уровня точности 83,6% на шести бенчмарках zero-shot классификации, превосходя базовую модель, использующую 10 млрд данных.","category":"模型更新","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Группа XPeng выпустила высокоэффективный визуальный кодировщик TuringViT - Aioga Новости ИИ","description":"Компания Xpeng представила визуальный кодировщик TuringViT для эпохи VLM/VLA, выпустив два варианта: 18L и 24L. Этот кодировщик при разрешении 1536×1536 достигает пропускной способ...","url":"https://www.aioga.com/ru/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:04:36.042Z"},"ar":{"title":"أصدرت مجموعة شياوبينغ مُشفّر الرؤية الفعّال TuringViT","summary":"أعلنت مجموعة شياوبينغ عن محرك الترميز البصري TuringViT لعصر VLM/VLA، وأطلقت مواصفتين 18L و 24L. يحقق هذا المحرك معدل استدلال يعادل 3.04 أضعاف Seed1.5-ViT عند دقة 1536×1536، وباستخدام 0.85 مليار زوج نصوص وصور فقط، حصل على متوسط دقة 83.6٪ في ستة معايير تصنيف بدون عينات، متجاوزًا خط الأساس الذي استخدم 10 مليارات بيانات.","category":"模型更新","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"أصدرت مجموعة شياوبينغ مُشفّر الرؤية الفعّال TuringViT - Aioga أخبار الذكاء الاصطناعي","description":"أعلنت مجموعة شياوبينغ عن محرك الترميز البصري TuringViT لعصر VLM/VLA، وأطلقت مواصفتين 18L و 24L. يحقق هذا المحرك معدل استدلال يعادل 3.04 أضعاف Seed1.5-ViT عند دقة 1536×1536، وباستخد...","url":"https://www.aioga.com/ar/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:05:25.969Z"},"hi":{"title":"XPeng Group ने TuringViT उच्च दक्षता वाली विज़ुअल एन्कोडर जारी किया","summary":"Xiaopeng Group ने VLM/VLA युग के लिए TuringViT विज़ुअल एन्कोडर जारी किया, जिसमें 18L और 24L दो विनिर्देश पेश किए गए। यह एन्कोडर 1536×1536 रेज़ोल्यूशन पर Seed1.5-ViT के मुकाबले 3.04 गुना अधिक इनफरेंस थ्रूपुट प्रदान करता है, और केवल 0.85B इमेज-टेक्स्ट जोड़ों का उपयोग करके छह शून्य-शॉट क्लासिफिकेशन बेंचमार्क पर 83.6% औसत सटीकता प्राप्त करता है, जो 10B डेटा का उपयोग किए गए बेसलाइन से आगे है।","category":"模型更新","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"XPeng Group ने TuringViT उच्च दक्षता वाली विज़ुअल एन्कोडर जारी किया - Aioga AI समाचार","description":"Xiaopeng Group ने VLM/VLA युग के लिए TuringViT विज़ुअल एन्कोडर जारी किया, जिसमें 18L और 24L दो विनिर्देश पेश किए गए। यह एन्कोडर 1536×1536 रेज़ोल्यूशन पर Seed1.5-ViT के मुकाबले 3.04...","url":"https://www.aioga.com/hi/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:05:19.804Z"},"it":{"title":"Il Gruppo Xiaopeng ha rilasciato l'encoder visivo efficiente TuringViT","summary":"Xpeng Group ha lanciato l'encoder visivo TuringViT per l'era VLM/VLA, disponibile in due configurazioni: 18L e 24L. Questo encoder raggiunge una produttività di inferenza di 3,04 volte quella del Seed1.5-ViT a una risoluzione di 1536×1536 e, utilizzando solo 0,85 miliardi di coppie immagine-testo, ottiene una precisione media dell'83,6% su sei benchmark di classificazione zero-shot, superando il baseline che utilizza 10 miliardi di dati.","category":"模型更新","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Il Gruppo Xiaopeng ha rilasciato l'encoder visivo efficiente TuringViT - Aioga Notizie IA","description":"Xpeng Group ha lanciato l'encoder visivo TuringViT per l'era VLM/VLA, disponibile in due configurazioni: 18L e 24L. Questo encoder raggiunge una produttività di inferenza di 3,04 v...","url":"https://www.aioga.com/it/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:06:06.998Z"},"nl":{"title":"XPeng Group brengt TuringViT efficiënte visuele encoder uit","summary":"Xiaopeng Group heeft de TuringViT visuele encoder gelanceerd voor het VLM/VLA-tijdperk, met twee specificaties van 18L en 24L. Deze encoder bereikt een verwerkingsdoorvoer bij 1536×1536 resolutie die 3,04 keer die van Seed1.5-ViT bedraagt, en behaalt met slechts 0,85 miljard beeld-tekst paren een gemiddelde nauwkeurigheid van 83,6% op zes zero-shot classificatie benchmarks, waarmee hij de baseline met 10 miljard gegevens overtreft.","category":"模型更新","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"XPeng Group brengt TuringViT efficiënte visuele encoder uit - Aioga AI-nieuws","description":"Xiaopeng Group heeft de TuringViT visuele encoder gelanceerd voor het VLM/VLA-tijdperk, met twee specificaties van 18L en 24L. Deze encoder bereikt een verwerkingsdoorvoer bij 1536...","url":"https://www.aioga.com/nl/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:06:10.128Z"},"tr":{"title":"Xiaopeng Grubu, TuringViT Yüksek Verimli Görsel Kodlayıcıyı Duyurdu","summary":"Xiaopeng Grubu, VLM/VLA çağını hedefleyen TuringViT görsel kodlayıcısını piyasaya sürdü ve 18L ile 24L olmak üzere iki model sundu. Bu kodlayıcı, 1536×1536 çözünürlükte, Seed1.5-ViT'in 3,04 katı çıkış hızı sağlıyor ve sadece 0,85 milyar görsel-metin çifti kullanarak altı sıfır örnek sınıflandırma ölçütünde %83,6 ortalama doğruluk elde ediyor; bu, 10 milyar veri kullanan referansın önüne geçiyor.","category":"模型更新","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Xiaopeng Grubu, TuringViT Yüksek Verimli Görsel Kodlayıcıyı Duyurdu - Aioga AI Haberleri","description":"Xiaopeng Grubu, VLM/VLA çağını hedefleyen TuringViT görsel kodlayıcısını piyasaya sürdü ve 18L ile 24L olmak üzere iki model sundu. Bu kodlayıcı, 1536×1536 çözünürlükte, Seed1.5-Vi...","url":"https://www.aioga.com/tr/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:06:52.925Z"},"vi":{"title":"Tập đoàn Xiao Peng ra mắt bộ mã hóa hình ảnh hiệu quả TuringViT","summary":"Tập đoàn Xiaopeng đã ra mắt bộ mã hóa hình ảnh TuringViT dành cho kỷ nguyên VLM/VLA, với hai cấu hình 18L và 24L. Bộ mã hóa này đạt thông lượng suy luận gấp 3,04 lần Seed1.5-ViT ở độ phân giải 1536×1536, chỉ với 0,85 tỷ cặp hình ảnh-văn bản đã đạt 83,6% độ chính xác trung bình trên sáu chuẩn phân loại không mẫu, vượt qua các chuẩn cơ sở sử dụng 10 tỷ dữ liệu.","category":"模型更新","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Tập đoàn Xiao Peng ra mắt bộ mã hóa hình ảnh hiệu quả TuringViT - Tin tức AI Aioga","description":"Tập đoàn Xiaopeng đã ra mắt bộ mã hóa hình ảnh TuringViT dành cho kỷ nguyên VLM/VLA, với hai cấu hình 18L và 24L. Bộ mã hóa này đạt thông lượng suy luận gấp 3,04 lần Seed1.5-ViT ở...","url":"https://www.aioga.com/vi/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:06:49.713Z"},"id":{"title":"Grupo Xiaopeng merilis TuringViT encoder visual efisien","summary":"Xpeng Group merilis pengkode visual TuringViT untuk era VLM/VLA, menghadirkan dua spesifikasi, 18L dan 24L. Pengkode ini memiliki throughput inferensi pada resolusi 1536×1536 yang mencapai 3,04 kali Seed1.5-ViT, hanya dengan 0,85 miliar pasangan gambar-teks sudah mencapai akurasi rata-rata 83,6% pada enam tolok ukur klasifikasi zero-shot, melampaui baseline yang menggunakan 10 miliar data.","category":"模型更新","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Grupo Xiaopeng merilis TuringViT encoder visual efisien - Berita AI Aioga","description":"Xpeng Group merilis pengkode visual TuringViT untuk era VLM/VLA, menghadirkan dua spesifikasi, 18L dan 24L. Pengkode ini memiliki throughput inferensi pada resolusi 1536×1536 yang...","url":"https://www.aioga.com/id/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:07:30.104Z"},"th":{"title":"กลุ่ม XiaoPeng เปิดตัว TuringViT ตัวเข้ารหัสภาพที่มีประสิทธิภาพ","summary":"กลุ่ม Xiaopeng เปิดตัว TuringViT ตัวเข้ารหัสภาพที่มุ่งสู่ยุค VLM/VLA โดยมีสองรุ่นคือ 18L และ 24L ตัวเข้ารหัสนี้มีประสิทธิภาพในการประมวลผลที่ความละเอียด 1536×1536 สูงกว่าของ Seed1.5-ViT ถึง 3.04 เท่า และใช้เพียง 0.85B คู่ภาพ-ข้อความก็สามารถทำคะแนนความแม่นยำเฉลี่ย 83.6% ในหกเกณฑ์การจำแนกประเภทแบบ zero-shot ซึ่งสูงกว่าพื้นฐานที่ใช้ข้อมูล 10B","category":"模型更新","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"กลุ่ม XiaoPeng เปิดตัว TuringViT ตัวเข้ารหัสภาพที่มีประสิทธิภาพ - ข่าว AI Aioga","description":"กลุ่ม Xiaopeng เปิดตัว TuringViT ตัวเข้ารหัสภาพที่มุ่งสู่ยุค VLM/VLA โดยมีสองรุ่นคือ 18L และ 24L ตัวเข้ารหัสนี้มีประสิทธิภาพในการประมวลผลที่ความละเอียด 1536×1536 สูงกว่าของ Seed1.5...","url":"https://www.aioga.com/th/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:07:37.695Z"},"pl":{"title":"Grupa Xiaopeng wprowadza wydajny kodownik wizualny TuringViT","summary":"Grupa Xpeng wprowadziła w erze VLM/VLA wizualny enkoder TuringViT, oferując dwa warianty: 18L i 24L. Ten enkoder przy rozdzielczości 1536×1536 osiąga przepustowość wnioskowania 3,04 razy większą niż Seed1.5-ViT, a przy użyciu zaledwie 0,85 miliarda par obraz-tekst osiąga średnią dokładność 83,6% w sześciu benchmarkach klasyfikacji zero-shot, przewyższając bazę danych korzystającą z 10 miliardów danych.","category":"模型更新","source":"IT之家（RSS）","aggregationSource":"IT之家（RSS）","pageTitle":"Grupa Xiaopeng wprowadza wydajny kodownik wizualny TuringViT - Aioga Wiadomości AI","description":"Grupa Xpeng wprowadziła w erze VLM/VLA wizualny enkoder TuringViT, oferując dwa warianty: 18L i 24L. Ten enkoder przy rozdzielczości 1536×1536 osiąga przepustowość wnioskowania 3,0...","url":"https://www.aioga.com/pl/news/cmru6c51y5ih7bihzkeae18ju/","contentTranslated":true,"sourceHash":"a941e6f24f24f8fe","translatedAt":"2026-07-22T23:08:17.316Z"}}}}