• 让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层

    ·

    假如你出生在一片未知的森林,太阳即将下山,饥肠辘辘,前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。 此时如果你按下暂停,把截图发给所有顶级的多模态大模型,它们都能完美回答你:“黄昏、有怪物,面临威胁。” 我们发现,多模态大模型能看懂图像、解析视频、在复杂场景里推理,然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么? 为了深入探索,美团 LongCat 团队构建了MineExplorer——首个在开放世界中做到分钟级长程任务的评测基准,系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。 MineExplorer 核心看点: 一个能直接跑的评测基准:813 个人工验证的高质量实例(1-hop 到 4-hop),配套规则化的里程碑自动评测框架。 一套造题的方法论:多智能体数据合成流程的完整代码,可自动合成训练任务。 一个可扩展的训练环境:基于 Minecraft 的沙盒,既能当考场,也能当练兵场。 01 MineExplorer设计解密:让AI离开温室,走向动态世界 MineExplorer 不再是简单的看图问答,而是围绕一系列创新,构建了一个前所未有的评测体系。 1.1 创新设计:构建一个动态开放的世界 创新点一:构建一个具备完整物理规则、会动态演化的世界 MineExplorer不是让模型看一张 Minecraft 截图做选择题,模型面对的是一个实时运行的3D沙盒世界。在评测中,每个任务实例会运行1800个环境步,每步执行 0.1 秒,对应一段3分钟的连续交互视频。也就是说在这3分钟时间里,环境一直在变:模型每做一个动作,世界状态就更新一次,它必须根据最新的画面不断调整策略。 创新点二:隐藏前置条件的长程多跳任务 这是 MineExplorer 最核心的设计,我们把任务按「跳数(hop)」分级,代表完成最终目标需要经过的隐藏前置步骤数量: 简单任务:目标明确的单跳任务,智能体不需要根据场景和任务描述推理出隐式的子任务。 困难任务:由2-4跳任务组成的多跳推理任务。最终目标虽然给出,但要完成它,必须先推理并完成若干没有在指令里说明的前置子任务。 我们用一个数学化的方式来刻画这种结构。每个复合任务被定义为一个四元组 τ = (q, s₀, Gτ, Mτ):q 是自然语言指令,s₀ 是初始状态,Gτ 是任务之间的依赖图(DAG),Mτ 是规则化的里程碑检查器。关键在于:**指令 q 并不会枚举依赖图里的所有节点,智能体必须自己从环境里推断出隐藏的前置任务。**一个任务越难,意味着它需要越多样的能力、包含越多隐藏前置、依赖链越深。 创新点三:知识解耦——我们测的是「通用探索」,不是「背 Minecraft Wiki」 这是 MineExplorer 区别于以往所有 Minecraft 评测基准的一个关键设计。我们的做法是主动把游戏专有知识剥离掉。对每一个原子任务,我们用LLM裁判判断其主要依赖的是通用世界常识,还是Minecraft专有机制,并过滤掉后者。换句话说:我们测的不是「AI…

    Read More

  • 下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知

    ·

    过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。 BrowseComp 的题目由人工设计,局限在于只能基于标注者已知的实体和关系构思,无法站在全局知识网络视角判断:哪些条件真的难检索?哪些约束的候选空间足够大?正是这种局限,让我们开始思考另一种可能性:能不能让机器自己来出题? 美团 LongCat 团队在最新论文中提出的 LoHoSearch 基准,就是把这种可能性变成了现实。 LoHoSearch 的核心”硬核”看点 知识图谱自动化构造。 以覆盖762万维基百科实体的知识图谱为基础自动生成题目,替代人工出题。基准含544道经人工核验的题目,覆盖11个领域。 双维度难度控制。 在生成中系统控制搜索空间与结构复杂度。构建出难度显著高于现有基准的挑战性问题。 当前模型性能表现。 已评测模型中,GPT-5.5准确率为34.74%;现有上下文管理策略在LoHoSearch上提升幅度为6.8%,低于在BrowseComp上的14.03%。 01 设计原理:让机器出题,需要几部? 机器出题的前提,是让机器拥有全局视野。整个构建流程可以分为四个环节:建图 → 控制难度 → 质量把关 → 数据概览。下面逐一展开。 1.1 建图:搭建知识图谱,让机器获得全局视野 LoHoSearch 的第一步,是从完整的英文维基百科出发搭建一张大规模知识图谱: 762 万个实体(每个维基页面是一个实体节点) 2.65 亿条有向边(页面正文中指向其他维基页面的超链接) 每个实体的类型取自其 Wikidata P31 类别,实体热度用入度来衡量 这张图谱为后续在全局视角下挑选”难题”提供了基础。 有了图谱之后,下一个问题是:什么样的题目才算”难”?LoHoSearch 从两个维度来定义难度。 1.2 控制难度:搜索空间和结构复杂度两个维度 决定搜索难度的核心有两个维度,而它们恰恰是人工出题最难把控的: 搜索空间:满足一个条件的候选实体有多少。候选越多,排除成本越高。 结构复杂度:要同时满足多少条件才能锁定答案。条件越多、咬合越紧,求解链条越长。 针对这两个维度,LoHoSearch 设计了两种子图结构: 树结构主要通过放大”搜索空间”来制造难度。 图结构则在巨大搜索空间之上,通过引入环形依赖和交叉约束,进一步叠加了”结构复杂度”。 1.3…

    Read More

  • 美团正式发布 CatPaw:全场景 AI Agent,从个人提效到企业智能化

    ·

    本月,美团 LongCat 2.0 已正式开源,总参数 1.6T,平均激活约 48B,动态范围 33B 到 56B,原生支持 1M 超长上下文。这是首个在五万张国产算力卡上完成全流程训练与推理的万亿参数模型。开源只是第一步,让 LongCat 2.0 在真实的工作任务中成为可靠的“工作伙伴”,才是真正的考验。 现在,搭载 LongCat 2.0 的美团全场景 AI Agent 平台 CatPaw 正式上线,将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。 不仅如此,依托美团十余年深耕本地生活的行业积累,CatPaw 将商家经营、服务履约与消费决策的深度认知融入其中,助力企业构建 AI 数字员工、推进业务智能化升级。 目前,CatPaw 已在美团内部大规模落地:累计覆盖 9 万员工、搭建 Agent 3 万个,并在多个真实业务场景中完成验证。 全时段运行,多终端协作的 AI 智能工作台 01 移动/PC/云端,全时段多端协作 提供独立的移动端 App 与 PC 客户端,双端任务实时同步、无缝协作。移动端支持随时发起任务、查看进度与远程确认关键决策;PC 端专注本地深度执行,具备文件操作、浏览器控制与终端命令等完整能力。 云端模式支持 7 × 24 小时不间断运行,即使本地设备关机或断网也不受影响。长程任务与定时任务于云端持续运转,完成后随时打开手机或电脑即可查看成果。…

    Read More

  • 直播回放·含 ACL'26 杰出论文 | 美团 AI 顶会论文 32 篇精讲

    ·

    🏆 近日,ACL 2026 杰出论文奖在圣地亚哥揭晓,全球仅 18 篇入选,美团履约技术团队的《GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR》上榜啦,一键直达视频回放👉🏻 小红书 | B站 如果你正在关注 AI 前沿,这篇内容值得收藏。 2026 年,美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录。我们精选 32 篇,进行了 5 大专场直播。 内容涵盖了大模型推理、智能体记忆与自进化、代码智能、多模态交互、超高清视频生成、本地生活搜索等方向——既有底层能力的突破,也有贴近生活服务的落地探索。 如果你错过了直播,或者想再看一遍👇 五场回放都在这里啦,找到你感兴趣的议题,随时开始。 特别感谢所有讲师与筹备团队的倾力支持!也感谢每一位关注美团技术成长的你!❤️ 专场一:ACL’26 综合专场 👉 直播回放入口→ 小红书 | B站 📚 论文简介及下载→ 点这里 专场二:ACL’26 履约团队前沿技术专场 出品人| Jichong Gao 美团高级技术专家、Jun Xu 美团高级技术专家 👉 直播回放入口→ 小红书 | B站 📚 论文简介及下载→ 点这里…

    Read More

  • 正式开源!美团 LongCat-2.0 同步开放国产卡推理代码

    ·

    本周,美团万亿参数大模型 LongCat-2.0 正式开源! HuggingFace | GitHub | ModelScope 作为业界首个在五万卡国产算力集群上完成推理的万亿参数模型,LongCat-2.0 已全面开源。针对显存与带宽受限的国产算力芯片,我们在模型架构、芯片适配到部署策略上进行了深度协同优化,让万亿参数模型在存量卡上同样跑得稳、跑得快。 我们希望以真实 Agentic Coding 任务中的稳定表现为依托,通过开源将模型能力与推理优化成果完整开放,盘活更多存量国产算力,释放国产算力生态的长期价值。 美团 LongCat-2.0 总参数 1.6T,平均激活约 48B,为真实的 Agentic Coding 任务而生,架构上创新性引入 LongCat 稀疏注意力和 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力的同时,结合动态激活进一步强化了代码理解、生成以及执行的表现。 01 模型、芯片适配与部署三个方向逐一突破,实现了万亿参数模型的流畅推理 面对显存、带宽和互联的多重限制,LongCat-2.0 结合国产芯片特性,从模型、芯片适配与部署三个方向逐一突破,实现了万亿参数模型的流畅推理: 模型层面: Attention 通过 absorb 计算模式、Indexer 与 MLA prolog 并行处理以及 KVP 切分 KV-cache,有效缓解了超长上下文的 I/O 与显存压力。ScMoE 则利用国产芯片的控核能力,让 Dense 与 MoE 分支实现物理核心级并行执行,进一步压缩端到端延迟,实现了百万上下文在国产芯片上的高效推理; 芯片适配层面: 通过 Super Kernel…

    Read More

  • 美团技术团队顶会论文分享:搜索推荐ASX专场

    ·

    美团业务研发平台/搜推 ASX (Agentic System X)团队聚焦构建大模型为基础的 Agent 技术体系,在大模型后训练、Agentic 强化学习以及多模态理解等核心前沿方向持续深耕,已在 ICLR、NeurIPS、CVPR、AAAI 等 AI 领域的国际顶会发表数十篇高质量研究成果。本文精选了6篇进行解读,希望对大家有所帮助或启发。 01 Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards 上下文轨迹老虎机:面向可验证奖励的强化学习 论文下载:PDF 论文简介:现有基于规则奖励的强化学习后训练通常直接使用最近一轮 rollout 进行策略优化,其中,低质量样本会引入噪声,高质量样本又常在单次使用后被丢弃,导致训练不稳定、样本利用不足。本文提出在线样本调度算法 CBS,将样本选择建模为上下文多臂老虎机问题,把每个候选样本视为 arm,并以训练后带来的性能增益作为奖励;通过轻量神经网络预测样本价值,并结合在线反馈动态调度。实验表明,CBS 可与多种策略优化方法结合,在 6 个数学推理数据集上稳定提升性能和训练效率。 02 ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning ResRL:通过负样本投影残差强化学习提升大语言模型推理能力 论文下载:PDF 论文简介:本文提出 ResRL,一个负样本强化学习的新算法,旨在解决RLVR 提升LLM推理能力却损伤了输出多样性的问题。我们发现根因是惩罚负样本时误伤了正负样本共享的有效语义。ResRL 用 SVD 正确子空间 +投影残差,让惩罚只打在“真正的错误方向”上–数学超 NSR 9.4%、代码刷新…

    Read More

  • 美团 LongCat-2.0 正式发布:在国产算力集群上完成全流程训练与推理的万亿参数模型

    ·

    6月30日,美团正式发布新一代万亿参数大模型 LongCat-2.0,并将对外开源。 作为业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型(总参数 1.6 T,平均激活约 48 B,动态范围 33B~56B),LongCat-2.0 从零开始预训练,原生支持 1M 超长上下文,其架构设计自始至终围绕一个核心目标:让模型在真实的 Agentic Coding 任务中,更高效、更稳定地完成代码理解、生成与执行。 正式版发布前,LongCat-2.0预览版本已通过 OpenRouter 平台和longcat.ai面向全球开发者开放调用——截至目前该模型已跻身 OpenRouter 全球大模型调用量前三,月调用量在 Hermes、Claude Code 和 OpenClaw 分列全球第一、第二和第三位,成为最受全球 Agent 开发者欢迎的模型之一。 01 国模国芯全栈协同:完成万亿参数 MoE 模型在国产算力上的稳定训练 LongCat 团队对国产算力的探索始于 2023 年,三年来,团队从千卡起步,逐步攻克算子适配、通信优化、分布式稳定性等基础难题,最终在五万卡集群上完成万亿参数模型的全流程训练与推理。 LongCat-2.0 预训练数据规模超过30Ttokens,覆盖中文、英文、多语言和代码等多类数据;面对万卡级训练中的硬件故障、通信异常、显存压力与数值波动,LongCat 团队从稳定性、正确性和效率三方面攻克国产算力训练难题。 在稳定性上,通过卡间通信异常处理、弹性扩缩卡和自动故障恢复,将月均日故障率降低70%以上; 在正确性上,通过自研设计确定性算子、Bitwise 一致性验证和参数检测,保障训练结果的可靠,同时基于实践提升关键模块计算精度、优化 Reduce 逻辑; 在效率上,通过流水线调度、显存优化和算子级控核,训练 MFU 提升 1.5 倍。 最终,LongCat 实现稳态日吞吐超过1T tokens/day,完成万亿参数 MoE 模型在国产算力上的稳定训练。 在推理阶段,LongCat-2.0 围绕模型、算子和框架进行协同优化:通过大规模专家并行聚合访存带宽,支撑万亿参数 MoE…

    Read More

  • LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆

    ·

    一个经常加班的白领,一个带着孩子出游的父亲,你的AI助理能分清他们需要什么样的服务吗? 现实是,它常常分不清。 AI能执行你明确的指令,却很难记住那些藏在场景和身份背后的真实需求。它们是真的无法理解,还是“情商”不够高呢? 自去年10月发布了 VitaBench 1.0,首次定义了生活场景下智能体任务的复杂度,美团 Longcat 团队再次推出 VitaBench 2.0,它不再仅仅关注任务有多难,而是将目光投向了更深层次的挑战。 VitaBench 2.0 是首个真实生活场景下面向长期动态用户建模的智能体评测基准,它系统性地评测大语言模型在长期、真实、动态的用户互动中个性化与主动性的能力。 VitaBench 2.0 的 核心“硬核”看点: 高难度业界首创:首次将智能体场景与丰富用户生态相结合,打造面向长期动态用户建模的智能体基准。其包含56名真实特征用户、819个复杂任务、超2000个动态偏好及66个可执行工具。 超长跨度动态追踪:平均每位用户包含 2093 个交互事件,平均时间跨度长达 1580 天,严格按时间线向 Agent 暴露,真实还原用户偏好的演进与漂移。 统一评测生态:针对长文本上下文学习(In-context learning)与智能体记忆策略(Memory Strategy)的统一评测平台。 01 设计原理:VitaBench 2.0的三维解构 能得出这些结论,得益于VitaBench 2.0的核心设计。它不再是简单的问答,而是围绕三大创新构建了一个前所未有的评测体系。 1.1 搭建“人生副本”:让AI在真实用户轨迹中接受考验 不同于一次性的问答,VitaBench 2.0为56位虚拟用户,在送餐、到店、差旅等多个真实领域中,构建了包含2000多种动态偏好、跨度长达数年的生活轨迹。 这背后是庞大而真实的数据支撑。如下图所示,这些图表直观地展示了我们构建的用户画像和偏好分布的真实性与复杂性。 具体来说,这个数据生态包含: 56个拟真用户,每个用户都拥有基于真实世界统计数据构建的独特身份、习惯和需求。 819个可执行任务,贯穿于用户的整个生命周期。 用户的偏好不是静态标签,而是会随着时间、事件而动态演变,平均每个用户的偏好会发生超过48次动态变化。 这些偏好被巧妙地嵌入到碎片化的互动历史中,包括对话记录和行为日志(如浏览、搜索、下单)。智能体必须像侦探一样,从这些混杂着“信号”与“噪音”的线索中,持续对用户进行理解。 1.2 引入“时间标尺”:将持续理解作为核心目标 传统的Agent评测关注“单个任务是否完成”,而VitaBench 2.0的核心目标是评测智能体是否在持续理解一个动态的人。 为此,我们将评测的时间轴拉长到了前所未有的尺度,用户的平均交互周期长达1580天(约4.3年),最长甚至达到 2,974 天。在这漫长的时间线里,智能体需要不断地提取、利用、并更新对用户的理解,才能在后续的任务中做出正确决策。这从根本上改变了评测的焦点,从单次任务的成功,转向了对用户偏好的考核。 1.3 设立“记忆擂台”:对决AI的两种记忆模式 为了探究记忆在长期用户建模中的作用,VitaBench 2.0搭建了首个真实用户场景下的统一长期智能体评测平台,通过可扩展的接口,让两种代表性机制在此对决: 智能体记忆: AI自己决定记住什么、忘记什么,主动维护一个精炼的用户档案。…

    Read More

  • ICML 2026 | 美团技术团队学术论文精选

    ·

    ICML(International Conference on Machine Learning,国际机器学习大会)是机器学习领域最具影响力的国际顶级学术会议之一。大会旨在探讨机器学习未来发展所面临的关键挑战与核心问题,并通过征集和评估具有重要理论价值和实际影响的前沿研究成果,推动领域发展并引领未来研究方向。2026年,ICML共收到全球篇论文23918投稿,最终6352篇被接收,接收率约为26.6%。本文解读了美团技术团队被收录的13篇论文,覆盖智能体推理、强化学习训练、复杂任务生成、智能体基准测试、监督微调等技术方向。 01 MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning MemOCR:面向高效长程推理的版面感知视觉记忆机制 论文下载:PDF 论文简介:长时间跨度的智能体推理需要将不断增长的交互历史有效压缩到有限的上下文窗口中。现有的大多数记忆系统将历史序列化为文本,其中token级别的开销是均匀的,且与长度线性增长。为此,我们提出了MemOCR,一种多模态记忆智能体,通过视觉布局实现自适应信息密度的记忆空间分配,从而在紧张的上下文预算下提升长时间跨度推理能力。在长上下文多跳和单跳问答基准测试中,MemOCR优于强文本基线方法,并在极端预算条件下实现了更有效的上下文利用。 02 ScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent Training ScaleEnv: 从零开始构建可扩展的环境合成系统用于通用交互式工具使用智能体的训练 论文下载:PDF 论文简介:为智能体配备交互式环境和可验证任务以进行自我探索,对于培养能够适应多样化场景的通用智能体至关重要。我们提出了ScaleEnv,一个完全从零开始构建全交互式环境和可验证任务的框架。ScaleEnv通过程序化测试确保环境的可靠性,通过工具依赖图扩展和可执行动作验证来保证任务的完整性和可解性。在未见过的多轮工具使用基准测试上展示了显著的性能提升,突显了强大的泛化能力。 03 V_0: A Generalist Value Model for Any Policy at State Zero V_0:一种适用于任意策略在初始状态下的通用价值模型 论文下载:PDF 论文简介:大语言模型的强化学习训练中的价值模型面临耦合困境:它们需要与更新中的策略同步训练。我们提出了V_0,一种通用价值模型,通过将任务重新定义为上下文学习来预测未见策略的性能,从而将价值估计与特定策略参数解耦。实验结果表明,V_0在GRPO训练过程中追踪策略演化方面优于耦合价值模型,能够优化冷启动预算分配,并在推理路由中逼近性能-成本的帕累托前沿。 04 Learning to Self-Verify Makes Language…

    Read More

  • 美团海报生成 AIGC 技术创新与实践

    ·

    一张商业海报,对设计师来说可能是半天工作;对百万中小商家来说,却可能是一道迈不过去的门槛。外包一张专业海报,少则数百、多则数千元;临时促销要求分钟级交付,传统设计流水线却要1到3天;好不容易批量生产出来,质量又参差不齐——这是美团平台上数百万商家每天都在面对的真实困境。AIGC 给了我们一个新的答案,但「生成一张看起来还行的图」和「生成一张真正可用的商业海报」之间,横亘着精准文字渲染、和谐版式布局、多任务统一支持、质量可量化评估等多项相互交织的技术挑战。过去两年,美团智能创作团队围绕这一问题,构建了覆盖「能生成、能编辑、能评判」的完整技术体系: PosterCraft(ICLR 2026):摒弃模块化流水线,端到端统一优化文字、视觉与版式,在文字渲染准确率上接近Top级别的闭源商业系统; PosterOmni(CVPR 2026):单一模型覆盖扩图、补全、比例调整、风格迁移等六类设计任务,更接近”基于参考稿工作的智能设计助手”; PosterReward(CVPR 2026):首个专门面向海报质量评估的奖励模型,在专项评测基准上达到 86% 准确率,远超现有基线,既驱动生成模型持续进化,也承担线上质检把关。 三者形成「生成-编辑-评判」的技术闭环,相互支撑、持续自我进化。目前三项工作均已全部开源于 MeiGen-AI 仓库,并在美团外卖套餐图生成、品牌 IP 袋鼠团团、点评信息流治理等多个真实业务场景中完成落地。本文将系统拆解这套技术体系的核心思路、关键创新与实战经验。 一、背景与挑战 1.1 业务背景:百万商家的”创意平权”难题 美团连接数百万商家与数亿消费者,海报作为核心视觉营销载体,贯穿商家日常运营全场景。然而,百万商家普遍面临四重困境: 设计资源匮乏:专业营销海报外包动辄数百至数千元,中小商家难以承受;即便是大型连锁品牌,面对多城市、多门店的差异化营销需求,设计师团队同样捉襟见肘。 时效性要求苛刻:天气突变、突发热点、临时促销等本地生活场景要求海报”分钟级”交付,传统设计流水线 1–3 天的周期已严重脱节。 内容同质化严重:大量商家依赖固定模板做简单文字替换,海报千篇一律,在信息爆炸时代难以触达消费者,营销转化率持续走低。 批量生产质量失控:从精雕细琢转向规模化生产后,如何保证每张海报达到商业可用标准,成为新的运营难题。 1.2 技术挑战:高质量海报生成的多维难题 AIGC 为上述问题提供了新思路,但高质量海报生成远非简单的文生图任务,面临五大相互交织的技术挑战。 挑战一:精准的文字渲染 海报文字要求”零容错”——任何错误、缺失或模糊都导致整张海报不可用。主流扩散模型在多行文字、中文字符和小字号文本上仍有明显短板,中文场景下难度尤甚。 挑战二:和谐的版式布局 优秀海报遵循对比、重复、对齐、亲密性等设计原则,这种”设计感”难以规则化,更多依赖对大量优秀作品的隐式学习,是一个开放性难题。 挑战三:统一的美学风格 色彩和谐、视觉层次、品牌调性等多维度共同构成美学判断,且不同行业标准迥异:餐饮要”食欲感”,美妆要”精致感”,科技要”未来感”。模型需在保持整体美学水准的同时适配多样化风格需求。 挑战四:多任务场景的统一 真实设计需求横跨”局部编辑”(文字排版叠加、局部填充)和”全局创作”(风格迁移、版式重组)两大范畴,如何在单一模型中同时支持所有场景,是模型设计和训练策略上的重大挑战。 挑战五:质量评估的可量化 现有图像质量指标(FID、IS 等)无法捕捉海报特有的排版质量、文字准确性和设计规范性,而人工评估成本高昂且难以规模化。我们需要一套既能驱动模型优化(作为 RL 奖励信号),又能承担线上质检的自动化评估体系。 1.3 我们的解法:构建”生成-编辑-评判”技术闭环 面对上述挑战,我们团队围绕海报生成构建了一套完整的技术体系,覆盖基础模型能力提升、多任务统一模型融合和质量评估模型三大核心环节,形成了”能生成、能编辑、能评判”的技术闭环。 能生成:端到端高美感海报生成,精准文字渲染;技术方案→ PosterCraft|Code(ICLR 2026) 能编辑:六大任务统一,局部编辑与全局创作融合;技术方案→ PosterOmni|Code(CVPR 2026) 能评判:真实海报结构化解析 + 生成海报偏好评估;技术方案→营销海报结构化 + PosterReward(CVPR 2026)…

    Read More