{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-07-23T07:21:26.498Z","headline":"Masked Visual Actions：统一世界模型的掩码视觉动作接口","description":"斯坦福大学李飞飞团队提出 Masked Visual Actions，将机器人动作表示为视频中实体轨迹的像素空间掩码。仅用15小时真实与仿真数据微调，单个视频模型即可同时作为前向动力学模型和逆向模型，用于策略评估与基于模型的规划。","url":"https://www.aioga.com/news/cmrvhhxue028gbihbquzbkj0y/","mainEntityOfPage":"https://www.aioga.com/news/cmrvhhxue028gbihbquzbkj0y/","datePublished":"2026-07-21T00:00:00.000Z","dateModified":"2026-07-21T00:00:00.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://arxiv.org/abs/2607.19343","https://aihot.virxact.com/items/cmrvhhxue028gbihbquzbkj0y"],"canonicalUrl":"https://www.aioga.com/news/cmrvhhxue028gbihbquzbkj0y/","directAnswer":{"@type":"Answer","text":"Aioga 编辑摘要：斯坦福大学李飞飞团队提出 Masked Visual Actions，将机器人动作表示为视频中实体轨迹的像素空间掩码。 Aioga 将其归入「论文研究」方向，重点关注它对真实使用和行业竞争的影响。","url":"https://www.aioga.com/news/cmrvhhxue028gbihbquzbkj0y/","dateCreated":"2026-07-21T00:00:00.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"arXiv source article","url":"https://arxiv.org/abs/2607.19343","datePublished":"2026-07-21T00:00:00.000Z","provider":{"@type":"Organization","name":"arXiv","url":"https://arxiv.org/abs/2607.19343"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmrvhhxue028gbihbquzbkj0y","datePublished":"2026-07-21T00:00:00.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmrvhhxue028gbihbquzbkj0y"}}],"aggregationSource":"HuggingFace Daily Papers（社区热门论文）","originalPublisher":{"name":"arXiv","url":"https://arxiv.org/abs/2607.19343"},"article":{"id":"cmrvhhxue028gbihbquzbkj0y","slug":"cmrvhhxue028gbihbquzbkj0y","url":"https://www.aioga.com/news/cmrvhhxue028gbihbquzbkj0y/","title":"Masked Visual Actions：统一世界模型的掩码视觉动作接口","title_en":"Masked Visual Actions for Unified World Modeling","summary":"斯坦福大学李飞飞团队提出 Masked Visual Actions，将机器人动作表示为视频中实体轨迹的像素空间掩码。仅用15小时真实与仿真数据微调，单个视频模型即可同时作为前向动力学模型和逆向模型，用于策略评估与基于模型的规划。","source":"HuggingFace Daily Papers（社区热门论文）","sourceUrl":"https://arxiv.org/abs/2607.19343","aiHotUrl":"https://aihot.virxact.com/items/cmrvhhxue028gbihbquzbkj0y","publishedAt":"2026-07-21T00:00:00.000Z","category":"论文研究","score":56,"selected":false,"articleBody":["arXivLabs is a framework that allows collaborators to develop and share new arXiv features directly on our website.","Have an idea for a project that will add value for arXiv's community? Learn more about arXivLabs ：https://info.arxiv.org/labs/index.html."],"articleImages":[{"sourceUrl":"https://arxiv.org/static/base/1.0.1/images/funders/simons-foundation.png","alt":"Simons Foundation","afterParagraph":1,"url":"/media/articles/cmrvhhxue028gbihbquzbkj0y/e2d7f38d62f5ca91.png"},{"sourceUrl":"https://arxiv.org/static/base/1.0.1/images/funders/simons-foundation-international.png","alt":"Simons Foundation International","afterParagraph":1,"url":"/media/articles/cmrvhhxue028gbihbquzbkj0y/1d56e29c5557cbdc.png"}],"mediaStatus":"ok","articleBodyZh":["arXivLabs 是一个框架，允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。","有一个可以为 arXiv 社区增加价值的项目想法吗？了解更多关于 arXivLabs 的信息：https://info.arxiv.org/labs/index.html。"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"Aioga 编辑摘要：斯坦福大学李飞飞团队提出 Masked Visual Actions，将机器人动作表示为视频中实体轨迹的像素空间掩码。 Aioga 将其归入「论文研究」方向，重点关注它对真实使用和行业竞争的影响。","background":"背景分析：模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断，单项指标领先不等于已经形成稳定采用。","viewpoint":"Aioga 判断：这条动态更适合作为行业观察信号，当前信息足以建立线索，但不足以推导长期结论。","implications":"影响分析：对相关团队而言，短期应先核对来源、可用范围和实际成本，再判断是否值得接入或跟进。","nextStep":"后续观察：继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。","evidenceRefs":["title","summary","articleBody"],"confidence":"medium","status":"published","aiGenerated":false,"autoApproved":true,"generatedBy":"rule-safe-fallback","generatedAt":"2026-07-23T07:30:40.513Z","sourceHash":"cb9e7ff961c41a01","validation":{"passed":true,"mode":"rule-safe-fallback","checks":["schema","length","source-attribution","no-html"]}},"tags":["论文研究","HuggingFace Daily Papers（社区热门论文）"],"translations":{"zh-CN":{"title":"Masked Visual Actions：统一世界模型的掩码视觉动作接口","summary":"斯坦福大学李飞飞团队提出 Masked Visual Actions，将机器人动作表示为视频中实体轨迹的像素空间掩码。仅用15小时真实与仿真数据微调，单个视频模型即可同时作为前向动力学模型和逆向模型，用于策略评估与基于模型的规划。","category":"论文研究","source":"arXiv","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Masked Visual Actions：统一世界模型的掩码视觉动作接口 - Aioga AI资讯","description":"斯坦福大学李飞飞团队提出 Masked Visual Actions，将机器人动作表示为视频中实体轨迹的像素空间掩码。仅用15小时真实与仿真数据微调，单个视频模型即可同时作为前向动力学模型和逆向模型，用于策略评估与基于模型的规划。","url":"https://www.aioga.com/news/cmrvhhxue028gbihbquzbkj0y/"},"en":{"title":"Masked Visual Actions: Masked Visual Action Interface for a Unified World Model","summary":"The team led by Fei-Fei Li at Stanford University proposed Masked Visual Actions, representing robot actions as pixel-space masks of object trajectories in videos. With only 15 hours of fine-tuning on real and simulated data, a single video model can serve both as a forward dynamics model and an inverse model, used for policy evaluation and model-based planning.","category":"Research","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Masked Visual Actions: Masked Visual Action Interface for a Unified World Model - Aioga AI News","description":"The team led by Fei-Fei Li at Stanford University proposed Masked Visual Actions, representing robot actions as pixel-space masks of object trajectories in videos. With only 15 hou...","url":"https://www.aioga.com/en/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:21:36.622Z"},"ja":{"title":"Masked Visual Actions：統一世界モデルのマスク視覚アクションインターフェース","summary":"スタンフォード大学の李飛飛チームはMasked Visual Actionsを提案し、ロボットの動作をビデオ中の物体軌跡のピクセル空間マスクとして表現しました。わずか15時間の実データとシミュレーションデータで微調整するだけで、単一のビデオモデルが順方向力学モデルおよび逆方向モデルとして同時に機能し、方策評価およびモデルに基づく計画に使用できます。","category":"論文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Masked Visual Actions：統一世界モデルのマスク視覚アクションインターフェース - Aioga AIニュース","description":"スタンフォード大学の李飛飛チームはMasked Visual Actionsを提案し、ロボットの動作をビデオ中の物体軌跡のピクセル空間マスクとして表現しました。わずか15時間の実データとシミュレーションデータで微調整するだけで、単一のビデオモデルが順方向力学モデルおよび逆方向モデルとして同時に機能し、方策評価およびモデルに基づく計画に使用できます。","url":"https://www.aioga.com/ja/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:21:48.798Z"},"ko":{"title":"Masked Visual Actions：통합 세계 모델의 마스크 시각 동작 인터페이스","summary":"스탠포드 대학교 리페이페이 팀은 Masked Visual Actions를 제안하여, 로봇의 동작을 비디오에서 객체 궤적의 픽셀 공간 마스크로 표현했습니다. 단 15시간의 실제 및 시뮬레이션 데이터를 미세 조정한 것만으로, 단일 비디오 모델이 동시에 순방향 동역학 모델과 역방향 모델로 사용되어 정책 평가 및 모델 기반 계획에 활용될 수 있습니다.","category":"연구","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Masked Visual Actions：통합 세계 모델의 마스크 시각 동작 인터페이스 - Aioga AI 뉴스","description":"스탠포드 대학교 리페이페이 팀은 Masked Visual Actions를 제안하여, 로봇의 동작을 비디오에서 객체 궤적의 픽셀 공간 마스크로 표현했습니다. 단 15시간의 실제 및 시뮬레이션 데이터를 미세 조정한 것만으로, 단일 비디오 모델이 동시에 순방향 동역학 모델과 역방향 모델로 사용되어 정책 평가 및 모델 기반 계획...","url":"https://www.aioga.com/ko/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:22:31.405Z"},"es":{"title":"Acciones Visuales Enmascaradas: Interfaz de Acciones Visuales Enmascaradas para un Modelo Mundial Unificado","summary":"El equipo de Fei-Fei Li en la Universidad de Stanford propuso Acciones Visuales Enmascaradas (Masked Visual Actions), que representa las acciones del robot como máscaras en el espacio de píxeles de las trayectorias de los objetos en el video. Con solo 15 horas de datos reales y simulados para ajuste fino, un solo modelo de video puede funcionar simultáneamente como modelo de dinámica directa y como modelo inverso, para la evaluación de estrategias y la planificación basada en modelos.","category":"Investigación","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Acciones Visuales Enmascaradas: Interfaz de Acciones Visuales Enmascaradas para un Modelo Mundial Unificado - Aioga Noticias de IA","description":"El equipo de Fei-Fei Li en la Universidad de Stanford propuso Acciones Visuales Enmascaradas (Masked Visual Actions), que representa las acciones del robot como máscaras en el espa...","url":"https://www.aioga.com/es/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:22:29.448Z"},"fr":{"title":"Actions Visuelles Masquées : Interface d'Actions Visuelles Masquées pour un Modèle Mondial Unifié","summary":"L'équipe de Fei-Fei Li à l'Université de Stanford a proposé les Masked Visual Actions, représentant les actions des robots comme des masques dans l'espace des pixels des trajectoires des entités dans la vidéo. Avec seulement 15 heures de données réelles et simulées pour l'ajustement, un modèle vidéo unique peut simultanément servir de modèle de dynamique directe et de modèle inverse, pour l'évaluation des stratégies et la planification basée sur le modèle.","category":"Recherche","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Actions Visuelles Masquées : Interface d'Actions Visuelles Masquées pour un Modèle Mondial Unifié - Aioga Actualités IA","description":"L'équipe de Fei-Fei Li à l'Université de Stanford a proposé les Masked Visual Actions, représentant les actions des robots comme des masques dans l'espace des pixels des trajectoir...","url":"https://www.aioga.com/fr/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:23:12.835Z"},"de":{"title":"Maskierte visuelle Aktionen: Eine einheitliche Schnittstelle für maskierte visuelle Aktionen des Weltmodells","summary":"Das Team um Fei-Fei Li an der Stanford-Universität schlug Masked Visual Actions vor, wobei Roboteraktionen als Pixelraum-Masken der Entitätsspuren im Video dargestellt werden. Mit nur 15 Stunden realer und simulierter Daten-Feinabstimmung kann ein einzelnes Videomodell sowohl als Vorwärtsdynamikmodell als auch als Inversmodell verwendet werden, um Strategiebewertungen und modellbasiertes Planen durchzuführen.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Maskierte visuelle Aktionen: Eine einheitliche Schnittstelle für maskierte visuelle Aktionen des Weltmodells - Aioga KI-News","description":"Das Team um Fei-Fei Li an der Stanford-Universität schlug Masked Visual Actions vor, wobei Roboteraktionen als Pixelraum-Masken der Entitätsspuren im Video dargestellt werden. Mit...","url":"https://www.aioga.com/de/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:23:12.324Z"},"pt-BR":{"title":"Ações Visuais Mascaradas: Interface de Ações Visuais Mascaradas para o Modelo de Mundo Unificado","summary":"A equipe de Fei-Fei Li da Universidade de Stanford propôs o Masked Visual Actions, que representa as ações do robô como máscaras de espaço de pixels das trajetórias de entidades em vídeo. Com apenas 15 horas de dados reais e simulados para ajuste fino, um único modelo de vídeo pode atuar simultaneamente como modelo de dinâmica direta e modelo inverso, sendo usado para avaliação de políticas e planejamento baseado em modelo.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Ações Visuais Mascaradas: Interface de Ações Visuais Mascaradas para o Modelo de Mundo Unificado - Aioga Notícias de IA","description":"A equipe de Fei-Fei Li da Universidade de Stanford propôs o Masked Visual Actions, que representa as ações do robô como máscaras de espaço de pixels das trajetórias de entidades em...","url":"https://www.aioga.com/pt-BR/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:23:51.005Z"},"ru":{"title":"Маскированные визуальные действия: интерфейс маскированных визуальных действий для единой мировой модели","summary":"Команда Ли Фэйфэй из Стэнфордского университета предложила Masked Visual Actions, представляя действия робота как маску в пространстве пикселей для траекторий объектов в видео. С помощью всего 15 часов реальных и симулированных данных модели видео могут быть дообучены и использоваться одновременно как модель прямой динамики, так и обратная модель для оценки стратегии и планирования на основе модели.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Маскированные визуальные действия: интерфейс маскированных визуальных действий для единой мировой модели - Aioga Новости ИИ","description":"Команда Ли Фэйфэй из Стэнфордского университета предложила Masked Visual Actions, представляя действия робота как маску в пространстве пикселей для траекторий объектов в видео. С п...","url":"https://www.aioga.com/ru/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:23:52.400Z"},"ar":{"title":"الإجراءات البصرية المقنعة: واجهة إجراءات بصرية مقنعة لنموذج العالم الموحد","summary":"فريق لي فيفي بجامعة ستانفورد اقترح Masked Visual Actions، حيث يتم تمثيل أفعال الروبوت كقناع في فضاء البكسل لمسار الكيانات في الفيديو. باستخدام 15 ساعة فقط من البيانات الحقيقية والمحاكاة للتعديل الدقيق، يمكن لنموذج فيديو واحد أن يعمل ك نموذج ديناميكي أمامي ونموذج عكسي في نفس الوقت، ويستخدم لتقييم الاستراتيجيات والتخطيط المبني على النموذج.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"الإجراءات البصرية المقنعة: واجهة إجراءات بصرية مقنعة لنموذج العالم الموحد - Aioga أخبار الذكاء الاصطناعي","description":"فريق لي فيفي بجامعة ستانفورد اقترح Masked Visual Actions، حيث يتم تمثيل أفعال الروبوت كقناع في فضاء البكسل لمسار الكيانات في الفيديو. باستخدام 15 ساعة فقط من البيانات الحقيقية والم...","url":"https://www.aioga.com/ar/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:24:30.677Z"},"hi":{"title":"मास्क किए गए दृश्य क्रियाएं: एकीकृत विश्व मॉडल की मास्क दृश्य क्रियाओं का इंटरफ़ेस","summary":"स्टैनफोर्ड विश्वविद्यालय की ली फेईफेई टीम ने Masked Visual Actions पेश किया, जिसमें रोबोट के क्रियाकलापों को वीडियो में वस्तुओं की ट्रैजेक्टरी के पिक्सेल स्पेस मास्क के रूप में प्रदर्शित किया गया। केवल 15 घंटे के वास्तविक और सिमुलेशन डेटा से फाइन-ट्यूनिंग करके, एकल वीडियो मॉडल एक ही समय में फॉरवर्ड डायनेमिक्स मॉडल और इनवर्स मॉडल के रूप में उपयोग किया जा सकता है, नीति मूल्यांकन और मॉडल-आधारित योजना के लिए।","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"मास्क किए गए दृश्य क्रियाएं: एकीकृत विश्व मॉडल की मास्क दृश्य क्रियाओं का इंटरफ़ेस - Aioga AI समाचार","description":"स्टैनफोर्ड विश्वविद्यालय की ली फेईफेई टीम ने Masked Visual Actions पेश किया, जिसमें रोबोट के क्रियाकलापों को वीडियो में वस्तुओं की ट्रैजेक्टरी के पिक्सेल स्पेस मास्क के रूप में प्र...","url":"https://www.aioga.com/hi/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:24:36.105Z"},"it":{"title":"Azioni Visive Mascherate: Interfaccia delle Azioni Visive Mascherate per il Modello del Mondo Unificato","summary":"Il team di Fei-Fei Li all'Università di Stanford ha proposto Masked Visual Actions, che rappresenta le azioni del robot come maschere nello spazio dei pixel delle traiettorie degli oggetti nel video. Utilizzando solo 15 ore di dati reali e simulati per il fine-tuning, un singolo modello video può fungere sia da modello di dinamica diretta che inversa, per la valutazione delle strategie e la pianificazione basata sul modello.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Azioni Visive Mascherate: Interfaccia delle Azioni Visive Mascherate per il Modello del Mondo Unificato - Aioga Notizie IA","description":"Il team di Fei-Fei Li all'Università di Stanford ha proposto Masked Visual Actions, che rappresenta le azioni del robot come maschere nello spazio dei pixel delle traiettorie degli...","url":"https://www.aioga.com/it/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:25:16.703Z"},"nl":{"title":"Gemaskerde Visuele Acties: Een uniforme wereldmodel-interface voor gemaskerde visuele acties","summary":"Het team van Li Fei-Fei aan de Stanford Universiteit stelde Masked Visual Actions voor, waarbij de robotacties worden weergegeven als pixelruimtelijke maskers van entiteitstrajecten in video's. Met slechts 15 uur echte en gesimuleerde gegevens voor fijnafstemming, kan het model van een enkele video tegelijkertijd dienen als een voorspellend dynamisch model en een omgekeerd model, gebruikt voor beleidsbeoordeling en modelgebaseerde planning.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Gemaskerde Visuele Acties: Een uniforme wereldmodel-interface voor gemaskerde visuele acties - Aioga AI-nieuws","description":"Het team van Li Fei-Fei aan de Stanford Universiteit stelde Masked Visual Actions voor, waarbij de robotacties worden weergegeven als pixelruimtelijke maskers van entiteitstrajecte...","url":"https://www.aioga.com/nl/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:25:12.144Z"},"tr":{"title":"Maskeli Görsel Eylemler: Evrensel Dünya Modeli İçin Maske Görsel Eylem Arayüzü","summary":"Stanford Üniversitesi'nden Li Feifei ekibi, robot hareketlerini videodaki nesne izlerinin piksel alanı maskesi olarak temsil eden Masked Visual Actions'ı önerdi. Sadece 15 saat gerçek ve simülasyon verisi ile ince ayar yaparak, tek bir video modeli hem ileriye dönük dinamik model hem de ters model olarak kullanılabiliyor ve politika değerlendirmesi ile model tabanlı planlama için kullanılabiliyor.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Maskeli Görsel Eylemler: Evrensel Dünya Modeli İçin Maske Görsel Eylem Arayüzü - Aioga AI Haberleri","description":"Stanford Üniversitesi'nden Li Feifei ekibi, robot hareketlerini videodaki nesne izlerinin piksel alanı maskesi olarak temsil eden Masked Visual Actions'ı önerdi. Sadece 15 saat ger...","url":"https://www.aioga.com/tr/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:25:59.017Z"},"vi":{"title":"Hành động Thị giác Mặt nạ: Giao diện hành động thị giác mặt nạ cho mô hình thế giới thống nhất","summary":"Nhóm của Lý Phi Phi tại Đại học Stanford đã đề xuất Masked Visual Actions, biểu diễn hành động của robot dưới dạng mặt nạ không gian điểm ảnh của quỹ đạo thực thể trong video. Chỉ với 15 giờ dữ liệu thực và mô phỏng điều chỉnh tinh chỉnh, một mô hình video đơn có thể vừa đóng vai trò như mô hình động lực học tiến và mô hình ngược, được sử dụng cho đánh giá chiến lược và lập kế hoạch dựa trên mô hình.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Hành động Thị giác Mặt nạ: Giao diện hành động thị giác mặt nạ cho mô hình thế giới thống nhất - Tin tức AI Aioga","description":"Nhóm của Lý Phi Phi tại Đại học Stanford đã đề xuất Masked Visual Actions, biểu diễn hành động của robot dưới dạng mặt nạ không gian điểm ảnh của quỹ đạo thực thể trong video. Chỉ...","url":"https://www.aioga.com/vi/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:25:59.778Z"},"id":{"title":"Tindakan Visual Bervariasi Tertutup: Antarmuka Tindakan Visual Bervariasi dengan Masker untuk Model Dunia Terpadu","summary":"Tim Li Fei-Fei di Universitas Stanford mengajukan Masked Visual Actions, yang merepresentasikan aksi robot sebagai topeng ruang piksel dari jejak entitas dalam video. Hanya dengan 15 jam data nyata dan simulasi untuk penyetelan, satu model video tunggal dapat berfungsi sekaligus sebagai model dinamika maju dan model invers, digunakan untuk evaluasi strategi dan perencanaan berbasis model.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Tindakan Visual Bervariasi Tertutup: Antarmuka Tindakan Visual Bervariasi dengan Masker untuk Model Dunia Terpadu - Berita AI Aioga","description":"Tim Li Fei-Fei di Universitas Stanford mengajukan Masked Visual Actions, yang merepresentasikan aksi robot sebagai topeng ruang piksel dari jejak entitas dalam video. Hanya dengan...","url":"https://www.aioga.com/id/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:26:36.772Z"},"th":{"title":"การกระทำทางสายตาที่มีหน้ากาก: อินเทอร์เฟซการกระทำทางสายตาที่มีหน้ากากสำหรับโมเดลโลกแบบรวม","summary":"ทีมของ Li Fei-Fei ที่มหาวิทยาลัยสแตนฟอร์ดได้นำเสนอ Masked Visual Actions ซึ่งแสดงการเคลื่อนไหวของหุ่นยนต์เป็นมาสก์ในพื้นที่พิกเซลของเส้นทางวัตถุในวิดีโอ โดยใช้การปรับแต่งเพียง 15 ชั่วโมงจากข้อมูลจริงและจำลอง โมเดลวิดีโอเดียวสามารถทำงานได้ทั้งเป็นโมเดลพลศาสตร์ไปข้างหน้าและโมเดลย้อนกลับ สำหรับการประเมินนโยบายและการวางแผนตามโมเดล","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"การกระทำทางสายตาที่มีหน้ากาก: อินเทอร์เฟซการกระทำทางสายตาที่มีหน้ากากสำหรับโมเดลโลกแบบรวม - ข่าว AI Aioga","description":"ทีมของ Li Fei-Fei ที่มหาวิทยาลัยสแตนฟอร์ดได้นำเสนอ Masked Visual Actions ซึ่งแสดงการเคลื่อนไหวของหุ่นยนต์เป็นมาสก์ในพื้นที่พิกเซลของเส้นทางวัตถุในวิดีโอ โดยใช้การปรับแต่งเพียง 15 ช...","url":"https://www.aioga.com/th/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:26:46.316Z"},"pl":{"title":"Maskowane działania wizualne: zunifikowany interfejs maskowanych działań wizualnych w modelu świata","summary":"Zespół Li Feifei z Uniwersytetu Stanforda zaproponował Masked Visual Actions, przedstawiając ruchy robota jako maski w przestrzeni pikseli trajektorii obiektów w wideo. Po zaledwie 15 godzinach dostosowywania na rzeczywistych i symulowanych danych, pojedynczy model wideo może służyć zarówno jako model dynamiki w przód, jak i jako model odwrotny, wykorzystywany do oceny strategii i planowania opartego na modelu.","category":"论文研究","source":"HuggingFace Daily Papers（社区热门论文）","aggregationSource":"HuggingFace Daily Papers（社区热门论文）","pageTitle":"Maskowane działania wizualne: zunifikowany interfejs maskowanych działań wizualnych w modelu świata - Aioga Wiadomości AI","description":"Zespół Li Feifei z Uniwersytetu Stanforda zaproponował Masked Visual Actions, przedstawiając ruchy robota jako maski w przestrzeni pikseli trajektorii obiektów w wideo. Po zaledwie...","url":"https://www.aioga.com/pl/news/cmrvhhxue028gbihbquzbkj0y/","contentTranslated":true,"sourceHash":"0dd51ecc5ab4526d","translatedAt":"2026-07-23T01:27:31.882Z"}}}}