• 美团智播——数字人直播技术创新与实践

    ·

    引言 随着大语言模型、生成式AI与多模态交互技术的快速发展,数字人直播已突破早期形象僵硬、交互单一的瓶颈,在本地生活、电商、文娱等领域展现出巨大的商业潜力。美团智播,是面向本地生活场景的AI数字人直播解决方案,融合大模型、数字人与多模态交互技术,提供丰富的行业专属数字人形象,支持真人1:1复刻与门店实景定制,30秒生成直播素材,3分钟完成开播配置,7×24小时稳定上播。过去一年,依托生成式AI技术,数字人直播月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍,充分验证了AI数字人直播在本地生活商业闭环中的实际价值。 2026年7月8日至10日,美团智播在中国互联网大会上完成行业首秀,以“实时交互数字人+直播带货数字人”为主题亮相科技互动展区。展区中,实时交互数字人通过秒级语音问答与观众自然对话,数字人直播间则让参会者发出“完全看不出是数字人”的感叹——这一亮相标志着美团智播正式从内部打磨走向行业舞台。 如何让数字人直播达到真人级表现力,并满足大规模商业化落地的要求?本文将围绕美团智播的核心能力,系统介绍支撑产品的关键技术突破——涵盖高保真形象生成、自然动作驱动、语音手势协调、高效推理部署及系统架构设计,这些技术共同构成了数字人直播从“能用”到“好用”,再到“规模化量产”的完整技术闭环。凭借这些技术积累,美团智播荣获2026年度“中国多媒体企业创新技术奖”,这一奖项由中国计算机学会(CCF)和中国图象图形学学会(CSIG)指导,中国多媒体大会(ChinaMM)设立并颁发,是对美团在数字人直播领域自主创新能力的行业认可。 一、数字人直播的背景与挑战 1.1 业务背景:百万商家的“成本-效率-体验”困境 美团连接数百万商家与数亿消费者,数字人直播正加速渗透商家日常运营。然而,商家直播面临四重现实困境: 准入门槛高:专业数字人形象定制动辄数万元,7×24小时真人主播团队的人力成本更是中小商家难以承受之重; 时效性要求苛刻:限时秒杀、突发热点、天气突变等本地生活场景要求直播内容“分钟级”响应,传统真人主播排班与内容制作的周期无法满足实时营销节奏。 形象与内容同质化:大量商家依赖通用数字人模板,主播形象千篇一律,缺乏与品牌调性匹配的专属感,难以建立差异化认知。 规模化部署成本高:数万商家同时开播,若每路独占大量GPU,推理成本将线性膨胀,数字人直播的普惠化落地无从谈起。 更深层的问题是:现有大部分数字人方案普遍存在“一眼假”——面部僵硬、动作重复、手势与语音脱节,用户停留时长较真人主播明显偏低。如何让数字人直播媲美真人主播,是技术突破的核心方向。 1.2 技术挑战:高质量数字人直播的多维难题 数字人直播为上述问题提供了新思路,但要真正达到规模化商业可用,远非简单的视频生成任务,面临四大相互交织的技术挑战。 挑战一:形象高保真,从“一眼假”到“媲美真人” 任何面部僵硬、五官失调都会让观众一眼识破。更高要求在于:商家需要真人1:1复刻,以及换装、换背景时保持身份一致性。如何在生成与编辑全链路中同时保证高保真度与强一致性,是形象生成技术的核心难题。 挑战二:动作自然多样,从“木偶戏”到“真人感” 7×24小时直播对动作多样性要求极高。有限动作库循环播放导致观众疲劳、留存率下降;动态生成方案又面临质量不稳定、关节扭曲等问题。如何在单一模型中同时实现高质量与高多样性的动作生成,是长时直播的重大挑战。 挑战三:语音语义协调,从“念稿机器”到“音画一致” 优秀主播的手势与语义高度协调,现有技术能生成与节奏同步的自发性动作(点头、摆手),但无法产生与语义精准绑定的协调性手势。如何跨越语音与动作之间的“语义鸿沟”,是互动体验升级的关键瓶颈。 挑战四:规模化推理效率,从“单路昂贵”到“万路并发” 数字人直播系统是多智能体协同平台,如何在保证质量与实时性的前提下,高效协同多个子智能体,大幅压缩单路推理开销,是数字人直播走向普惠的最终门槛。 1.3 技术方案总览 面对上述挑战,美团智播自研关键技术,围绕数字人主播“长得真→动得准→演得活→卖得好”形成完整技术闭环,实现全链路跃升。 长得真:高保真数字人形象生成与编辑技术,协同攻克形象生成高保真、多元化难题; 动得准:文本驱动高质量动作生成技术,生成高可控、自然流畅的肢体动作,并通过动作迁移生成高表现力的数字人视频; 演得活:语音手势协调生成技术,跨越语音与动作的语义鸿沟,让手势与讲解形成语义级配合; 卖得好:面向规模化部署的Token压缩和推理加速技术,实现多智能体高效协同,打通万路并发瓶颈。 二、让AI主播“长得真”——高保真数字人形象生成与编辑 2.1 产品痛点与需求 商家对数字人形象有三层递进需求:快速可用(3分钟定制开播)、高度个性化(真人1:1复刻)、灵活可编辑(换装换背景时保持身份一致)。过去的定制化图像生成方法面临身份与姿态耦合、微调耗时长、编辑破坏身份特征等核心问题。 2.2 结构解耦身份个性化与自奖励精准编辑 针对数字人生成中身份保真与灵活编辑的双重挑战,美团智播研发团队提出了结构解耦身份个性化(SDIP)和自奖励精准编辑(SREdit)技术方案。 2.2.1 结构解耦身份个性化 SDIP(Structure-Decoupled Identity Personalization)的核心思想是将姿态、身份、背景三个维度进行结构性解耦,包含两个核心模块: 身份与姿态精确分离模块:在Diffusion-Based主干网络中,通过结构残差注入,将身份特征以残差形式融入,避免姿态空间污染;空间解耦正则化损失,以面部为重点,显式约束身份特征的空间分布;区域动态掩码,隔离不同语义区域的特征流动。 细节保真度增强模块:为解决细节保真度不足问题,通过视觉参考增强器将参考图像高频细节注入生成,提升纹理还原度;结合掩码感知质量校正策略,对遮挡和边界区域进行精细化修正。 2.2.2 自奖励精准编辑 商家日常运营中常需对数字人进行局部编辑——换应季服装、匹配活动背景、调整妆容。核心约束是:编辑前后身份特征必须保持一致,不能“换了衣服就认不出人”。 针对这一需求,团队提出了SREdit(Self-Rewarding Editing),被ACM MM 2026收录。其技术创新体现在三个层面: SIA指令原子化:在MLLM-DiT架构中,将复杂编辑指令分解为原子级操作单元,每个原子对应明确的空间区域和编辑语义,避免语义模糊导致身份信息被意外修改。 空间奖励重加权:根据编辑区域的空间分布动态调整奖励权重——编辑区域给予较高编辑质量权重,非编辑区域给予较高保真度权重,引导模型在“大胆编辑”与“谨慎保持”间找到最优平衡。 认知闭合架构:同一模型既做编辑器又做评判器,消除了传统方案中编辑器与评判器分离导致的reward…

    Read More

  • GeoRA: 为RLVR设计的LoRA——ACL 2026杰出论文解析

    ·

    ACL(Annual Meeting of the Association for Computational Linguistics)是计算语言学和自然语言处理(NLP)领域的国际顶级学术会议,是CCF-A类会议,也是中国计算机学会推荐的自然语言处理方向最高等级国际学术会议。ACL 2026杰出论文奖(Outstanding Paper)在圣地亚哥揭晓,全球共 18 篇入选,美团履约技术团队的《GeoRA:Geometry-Aware Low-Rank Adaptation for RLVR》 就是其中之一。 论文下载:GeoRA:Geometry-Aware Low-Rank Adaptation for RLVR 讲解视频:ACL2026 杰出论文分享(受智源社区邀请) RLVR已经成为提升大模型推理能力的关键范式,但它的训练开销较高,于是一个自然的技术就是用 LoRA 这类参数高效微调方法来做 RLVR。但是,LoRA 及其变体几乎都是在 SFT 场景下建立并验证的。而近期一系列机制研究表明,RLVR 与 SFT 的优化几何存在本质差异:RLVR 则更像一次受约束的优化,有效更新分散在稀疏的子空间中,并倾向于避开预训练权重的主方向。因此,把为 SFT 设计的先验直接搬到 RLVR 上,就构成了几何错位,后果是效果欠优、能力遗忘甚至训练崩溃。 针对这个问题,美团与北京大学的研究者提出了 GeoRA(Geometry-Aware Low-Rank Adaptation),把低秩适配显式地对齐到 RLVR 的更新几何上:先用几何先验定位出 RLVR 偏好的稀疏更新区域,再用 SVD(奇异值分解)把它压缩成低秩稠密的适配器。在 1.5B 到 32B 的 Qwen 与 Llama 模型上,GeoRA…

    Read More

  • 美团搜索3.0:LLM 语义表征在排序模型的探索与应用

    ·

    在大语言模型(LLM)技术的深刻影响下,搜索引擎正经历第三次范式跃迁:从 1.0 时代的“关键词文本匹配”,到 2.0 时代的“行为统计与个性化搜索”,再到 3.0 时代向“复杂意图理解与认知决策”的全面进化。 美团搜索团队正依托团垂融合新架构与生成式大模型新技术,全面重构本地生活搜索底座。本系列技术博客将持续介绍美团搜索 3.0 的技术探索,本文聚焦 LLM 语义表征在服务零售排序场景上的三期实践——从单点特征验证到系统性表征体系构建,再到跨场景迁移复用,探索语义匹配信号在搜索排序中的应用路径。 一、背景与动机 服务零售是将服务销售给最终消费者的商业活动,与之对应的概念为商品零售。服务零售和商品零售是美团零售业务的两个主要组成部分。 在美团搜索场景下,相较于到家和其他到店业务,服务零售具有以下显著特点: 品类丰富:覆盖丽人、休闲娱乐、家政、进场零售等众多细分行业。 搜索需求类型丰富:交易型、信息型、留资型并存。 供给非标准化程度高:交易内容的多维组合性(e.g. 券、时间、位次、场次、空间、技师等)以及基于”人”和”场所”进行履约,共同促使供给的个性化和非标准化。 传统精排模型的语义建模高度依赖文本匹配,但这类特征构建成本高、泛化能力弱,在面对服务零售大量长尾品类、复杂 Query 意图时尤为明显。例如,”宠物 SPA+洗澡”这个 Query 对应的商品名称可能是”萌宠清洁护理套餐”、”春节大扫除”这个 Query 对应的商品名称可能是”深度保洁服务套餐”,在这些 Case 中,搜索词和供给在文字上几乎没有重叠,但语义上是高度相关的。 这类语义 Gap 在美团服务零售搜索场景(生活服务、休闲娱乐等)尤为突出。服务零售的品类长尾分散、商品描述非结构化、Query 意图复杂多样,传统特征工程难以覆盖。而大语言模型(LLM)在语义理解方面的能力成熟度正在快速提升,给我们带来了新的解题思路。 从 2025 年 Q4 到 2026 年 Q2,服务零售搜索排序团队系统性地探索了 LLM 在精排模型中的应用,核心方向是用 LLM 为搜索词(Query)、商家(POI)和商品(Deal)生成高质量的语义向量表征,将语义匹配信息以 cosine 相似度的形式注入排序模型,弥补传统特征在语义理解上的不足。经过三期迭代,累计完成 3 个 Launch Review(LR),均已完成全量上线,带来了显著的线上收益。 下图展示了三期技术演进的整体脉络。每一期都在前一期的基础上进行系统性升级,从验证可行性到全面优化再到跨模块迁移复用,逐步构建起一套完整的语义表征体系。 二、一期:精排引入大模型语义表征(验证可行性) 2.1 核心思路 服务零售精排在语义层面的建模几乎为零,排序模型主要依赖少量文本匹配和 Query 统计类特征。所以一期的目标很纯粹:验证…

    Read More

  • KDD'26美团学术论文精选及KDD Cup'26 DataAgents赛道冠军思路解读

    ·

    KDD(ACM SIGKDD Conference on Knowledge Discovery and Data Mining)是数据挖掘与知识发现领域最具影响力的国际顶级学术会议。KDD 以其严格的论文录用标准和深厚的学术影响力著称,是推动数据驱动研究与应用创新的重要平台。大会为学术界和工业界提供了交流前沿成果的高水平论坛,论文录用率通常在 15%-20% 左右,属于计算机领域的 CCF-A 类顶级会议。 本文精选了美团技术团队被 KDD 2026 收录的 8 篇论文进行分享,这些论文覆盖了推荐大模型、生成与奖励建模框架、智能体搜索、Transformer 框架、元泛化框架等技术领域。 🏆 此外,大众点评技术部还荣获了 2026 KDD Cup 复杂数据分析 Data Agents 国际竞赛的冠军、季军,本文介绍了团队比赛思路和解题策略。希望以上这些内容能够对大家有所帮助或启发。 01 MTFM: A Scalable and Alignment-free Foundation Model for Industrial Recommendation in Meituan 论文下载:PDF 论文简介:工业推荐系统通常涉及多个场景,而现有的跨域(CDR)和多场景(MSR)方法往往需要大量资源且要求严格的输入对齐,限制了其可扩展性。该论文提出了MTFM(Meituan Foundation Model for Recommendation),一种基于Transformer的框架,旨在解决上述挑战。MTFM不预先对齐输入,而是将跨域数据转换为异质Token,以无对齐的方式捕捉多场景知识。为提升训练效率,MTFM引入了多场景用户级样本聚合机制,显著减少了总实例数量,大幅提升训练吞吐量;同时融合了Grouped-Query Attention和定制化的Hybrid Target Attention,有效降低了内存占用和计算复杂度。 此外,论文还实现了多项系统级优化,如kernel融合和消除CPU-GPU阻塞,进一步提升了训练和推理吞吐。在外卖等场景的离在线实验均验证了MTFM的有效性,证明了通过扩展模型容量和多场景训练数据可以实现显著的性能提升。基于MTFM,团队构建了服务于以上多个业务主场景的统一基座推荐大模型,替换各自的独立精排模型,并完成了全量。 02 CDRRM:…

    Read More

  • Agent评测漫谈 —— 由浅入深讲解Agent评测

    ·

    本篇博客是一篇科普文章,由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么,以及如何建立评测体系;其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验,是我们在两年实践过程中逐步打磨出来的认知。第三章重点介绍了龙虾/爱马仕这类长程Agent框架的出现对评测带来的变化。 本篇博客在美团内部发表之后获得了较多的关注,我们发现大家对Agent评测的热情非常高,因此我们决定将内部博客进行公开,想把这些经验分享给更多的同学,希望对大家有所启发或帮助。 一、Agent评测是什么 1.1 评测的核心目的 评测的核心目的是为了回答 Agent 的好不好?以及到底哪里好,哪里不好? 从而为下一轮迭代指明方向。评测是Agent效果的“精密量具”。 这也是为什么 Agent 评测不能只停留在离线打榜,更不能只看某次 Demo 的表现。它必须服务于真实业务中的研发、上线、回归、优化和规模化落地。 而Agent评测的基石是观测,因此我们得出了Agent研发公式 —— 观测 + 评测 = 持续迭代 1.2 Agent评测与传统模型评测的不同 评测方法会随着 AI 形态变化而变化,大致经历了三个阶段: 传统机器学习更像在回答“算得准不准”。 大模型评测开始回答“模型能力强不强”。 而 Agent 评测真正要回答的是: 当模型被放进一个真实系统里,和 Prompt、Skill、工具链、记忆、状态管理、业务流程耦合在一起后,它能不能稳定交付好的结果。 这意味着 Agent 的评测对象已经不再是单一模型,而是一个“模型 + 系统 + 工具 + 流程”的复杂系统。 1.3 为什么Agent评测不是只看结果,还要看行为和过程 在真实场景中,两个 Agent 可能最终都“做对了”,但工程价值完全不同: 一个路径清晰、工具调用稳定、耗时可控、可重复复现 一个反复试错、路径混乱、靠偶然命中结果、不可复现 如果只看最终答案,这两者会被误判为同一水平;但从规模化、成本优化、用户体验的角度看,差别非常大。 因此,Agent 评测至少需要覆盖四层内容: 结果层:任务是否完成,输出是否可用 过程层:规划是否合理,步骤是否稳定 效率层:耗时、Token、工具调用次数是否可接受…

    Read More

  • 让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层

    ·

    假如你出生在一片未知的森林,太阳即将下山,饥肠辘辘,前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。 此时如果你按下暂停,把截图发给所有顶级的多模态大模型,它们都能完美回答你:“黄昏、有怪物,面临威胁。” 我们发现,多模态大模型能看懂图像、解析视频、在复杂场景里推理,然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么? 为了深入探索,美团 LongCat 团队构建了MineExplorer——首个在开放世界中做到分钟级长程任务的评测基准,系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。 MineExplorer 核心看点: 一个能直接跑的评测基准:813 个人工验证的高质量实例(1-hop 到 4-hop),配套规则化的里程碑自动评测框架。 一套造题的方法论:多智能体数据合成流程的完整代码,可自动合成训练任务。 一个可扩展的训练环境:基于 Minecraft 的沙盒,既能当考场,也能当练兵场。 01 MineExplorer设计解密:让AI离开温室,走向动态世界 MineExplorer 不再是简单的看图问答,而是围绕一系列创新,构建了一个前所未有的评测体系。 1.1 创新设计:构建一个动态开放的世界 创新点一:构建一个具备完整物理规则、会动态演化的世界 MineExplorer不是让模型看一张 Minecraft 截图做选择题,模型面对的是一个实时运行的3D沙盒世界。在评测中,每个任务实例会运行1800个环境步,每步执行 0.1 秒,对应一段3分钟的连续交互视频。也就是说在这3分钟时间里,环境一直在变:模型每做一个动作,世界状态就更新一次,它必须根据最新的画面不断调整策略。 创新点二:隐藏前置条件的长程多跳任务 这是 MineExplorer 最核心的设计,我们把任务按「跳数(hop)」分级,代表完成最终目标需要经过的隐藏前置步骤数量: 简单任务:目标明确的单跳任务,智能体不需要根据场景和任务描述推理出隐式的子任务。 困难任务:由2-4跳任务组成的多跳推理任务。最终目标虽然给出,但要完成它,必须先推理并完成若干没有在指令里说明的前置子任务。 我们用一个数学化的方式来刻画这种结构。每个复合任务被定义为一个四元组 τ = (q, s₀, Gτ, Mτ):q 是自然语言指令,s₀ 是初始状态,Gτ 是任务之间的依赖图(DAG),Mτ 是规则化的里程碑检查器。关键在于:**指令 q 并不会枚举依赖图里的所有节点,智能体必须自己从环境里推断出隐藏的前置任务。**一个任务越难,意味着它需要越多样的能力、包含越多隐藏前置、依赖链越深。 创新点三:知识解耦——我们测的是「通用探索」,不是「背 Minecraft Wiki」 这是 MineExplorer 区别于以往所有 Minecraft 评测基准的一个关键设计。我们的做法是主动把游戏专有知识剥离掉。对每一个原子任务,我们用LLM裁判判断其主要依赖的是通用世界常识,还是Minecraft专有机制,并过滤掉后者。换句话说:我们测的不是「AI…

    Read More

  • 下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知

    ·

    过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。 BrowseComp 的题目由人工设计,局限在于只能基于标注者已知的实体和关系构思,无法站在全局知识网络视角判断:哪些条件真的难检索?哪些约束的候选空间足够大?正是这种局限,让我们开始思考另一种可能性:能不能让机器自己来出题? 美团 LongCat 团队在最新论文中提出的 LoHoSearch 基准,就是把这种可能性变成了现实。 LoHoSearch 的核心”硬核”看点 知识图谱自动化构造。 以覆盖762万维基百科实体的知识图谱为基础自动生成题目,替代人工出题。基准含544道经人工核验的题目,覆盖11个领域。 双维度难度控制。 在生成中系统控制搜索空间与结构复杂度。构建出难度显著高于现有基准的挑战性问题。 当前模型性能表现。 已评测模型中,GPT-5.5准确率为34.74%;现有上下文管理策略在LoHoSearch上提升幅度为6.8%,低于在BrowseComp上的14.03%。 01 设计原理:让机器出题,需要几部? 机器出题的前提,是让机器拥有全局视野。整个构建流程可以分为四个环节:建图 → 控制难度 → 质量把关 → 数据概览。下面逐一展开。 1.1 建图:搭建知识图谱,让机器获得全局视野 LoHoSearch 的第一步,是从完整的英文维基百科出发搭建一张大规模知识图谱: 762 万个实体(每个维基页面是一个实体节点) 2.65 亿条有向边(页面正文中指向其他维基页面的超链接) 每个实体的类型取自其 Wikidata P31 类别,实体热度用入度来衡量 这张图谱为后续在全局视角下挑选”难题”提供了基础。 有了图谱之后,下一个问题是:什么样的题目才算”难”?LoHoSearch 从两个维度来定义难度。 1.2 控制难度:搜索空间和结构复杂度两个维度 决定搜索难度的核心有两个维度,而它们恰恰是人工出题最难把控的: 搜索空间:满足一个条件的候选实体有多少。候选越多,排除成本越高。 结构复杂度:要同时满足多少条件才能锁定答案。条件越多、咬合越紧,求解链条越长。 针对这两个维度,LoHoSearch 设计了两种子图结构: 树结构主要通过放大”搜索空间”来制造难度。 图结构则在巨大搜索空间之上,通过引入环形依赖和交叉约束,进一步叠加了”结构复杂度”。 1.3…

    Read More

  • 美团正式发布 CatPaw:全场景 AI Agent,从个人提效到企业智能化

    ·

    本月,美团 LongCat 2.0 已正式开源,总参数 1.6T,平均激活约 48B,动态范围 33B 到 56B,原生支持 1M 超长上下文。这是首个在五万张国产算力卡上完成全流程训练与推理的万亿参数模型。开源只是第一步,让 LongCat 2.0 在真实的工作任务中成为可靠的“工作伙伴”,才是真正的考验。 现在,搭载 LongCat 2.0 的美团全场景 AI Agent 平台 CatPaw 正式上线,将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。 不仅如此,依托美团十余年深耕本地生活的行业积累,CatPaw 将商家经营、服务履约与消费决策的深度认知融入其中,助力企业构建 AI 数字员工、推进业务智能化升级。 目前,CatPaw 已在美团内部大规模落地:累计覆盖 9 万员工、搭建 Agent 3 万个,并在多个真实业务场景中完成验证。 全时段运行,多终端协作的 AI 智能工作台 01 移动/PC/云端,全时段多端协作 提供独立的移动端 App 与 PC 客户端,双端任务实时同步、无缝协作。移动端支持随时发起任务、查看进度与远程确认关键决策;PC 端专注本地深度执行,具备文件操作、浏览器控制与终端命令等完整能力。 云端模式支持 7 × 24 小时不间断运行,即使本地设备关机或断网也不受影响。长程任务与定时任务于云端持续运转,完成后随时打开手机或电脑即可查看成果。…

    Read More

  • 直播回放·含 ACL'26 杰出论文 | 美团 AI 顶会论文 32 篇精讲

    ·

    🏆 近日,ACL 2026 杰出论文奖在圣地亚哥揭晓,全球仅 18 篇入选,美团履约技术团队的《GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR》上榜啦,一键直达视频回放👉🏻 小红书 | B站 如果你正在关注 AI 前沿,这篇内容值得收藏。 2026 年,美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录。我们精选 32 篇,进行了 5 大专场直播。 内容涵盖了大模型推理、智能体记忆与自进化、代码智能、多模态交互、超高清视频生成、本地生活搜索等方向——既有底层能力的突破,也有贴近生活服务的落地探索。 如果你错过了直播,或者想再看一遍👇 五场回放都在这里啦,找到你感兴趣的议题,随时开始。 特别感谢所有讲师与筹备团队的倾力支持!也感谢每一位关注美团技术成长的你!❤️ 专场一:ACL’26 综合专场 👉 直播回放入口→ 小红书 | B站 📚 论文简介及下载→ 点这里 专场二:ACL’26 履约团队前沿技术专场 出品人| Jichong Gao 美团高级技术专家、Jun Xu 美团高级技术专家 👉 直播回放入口→ 小红书 | B站 📚 论文简介及下载→ 点这里…

    Read More

  • 正式开源!美团 LongCat-2.0 同步开放国产卡推理代码

    ·

    本周,美团万亿参数大模型 LongCat-2.0 正式开源! HuggingFace | GitHub | ModelScope 作为业界首个在五万卡国产算力集群上完成推理的万亿参数模型,LongCat-2.0 已全面开源。针对显存与带宽受限的国产算力芯片,我们在模型架构、芯片适配到部署策略上进行了深度协同优化,让万亿参数模型在存量卡上同样跑得稳、跑得快。 我们希望以真实 Agentic Coding 任务中的稳定表现为依托,通过开源将模型能力与推理优化成果完整开放,盘活更多存量国产算力,释放国产算力生态的长期价值。 美团 LongCat-2.0 总参数 1.6T,平均激活约 48B,为真实的 Agentic Coding 任务而生,架构上创新性引入 LongCat 稀疏注意力和 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力的同时,结合动态激活进一步强化了代码理解、生成以及执行的表现。 01 模型、芯片适配与部署三个方向逐一突破,实现了万亿参数模型的流畅推理 面对显存、带宽和互联的多重限制,LongCat-2.0 结合国产芯片特性,从模型、芯片适配与部署三个方向逐一突破,实现了万亿参数模型的流畅推理: 模型层面: Attention 通过 absorb 计算模式、Indexer 与 MLA prolog 并行处理以及 KVP 切分 KV-cache,有效缓解了超长上下文的 I/O 与显存压力。ScMoE 则利用国产芯片的控核能力,让 Dense 与 MoE 分支实现物理核心级并行执行,进一步压缩端到端延迟,实现了百万上下文在国产芯片上的高效推理; 芯片适配层面: 通过 Super Kernel…

    Read More