没有标签能让模型考完试却不知道自己考的题是对是错,这听起来是个悖论。但这正是"测试时训练"要解决的怪事:让一个大语言模型在做题过程中自我提升,而全程没有人告诉它答案对不对。
论文提出TTPO方法,在无标签的测试时训练场景下,利用多数投票伪标签的非对称容错特性,结合蒸馏与强化学习,让大语言模型无需标准答案即可自我提升数学推理能力,效果媲美甚至超越有标签监督方法。
论文提出TTPO方法,在无标签的测试时训练场景下,利用多数投票伪标签的非对称容错特性,结合蒸馏与强化学习,让大语言模型无需标准答案即可自我提升数学推理能力,效果媲美甚至超越有标签监督方法。
南京大学团队提出Procedura,让冻结的大语言模型把三维物体写成带零件与配合关系的程序化装配体,通过分步建造、解算摆放和独立审核打磨,生成边缘锐利、可编辑、可赋材质和运动的高质量三维模型,在多项评测中超越现有生成器和...
本文介绍南开大学与腾讯团队提出的MMLVE多指令多镜头长视频编辑任务,及配套的MMLVE-Agent智能体框架,通过全局记忆卡与正负反馈机制解决长视频编辑中的幻觉、不一致与结构破坏问题,并构建了专属评测数据集。
研究发现同一模型家族内不同规模模型的错误类型高度一致,据此提出CritICL方法,利用小模型失败模式构建错题库指导大模型推理,无需重复生成即可提升数学推理准确率并显著降低计算成本。
文章探讨生命科学初创企业面临的独特网络安全挑战:其数字资产(研究数据、知识产权、临床证据)价值堪比大型药企,但依赖庞大外部供应商网络,防护能力却有限。文章通过多起真实攻击案例说明该行业已成攻击重点目标,并指出投资者尽调、...
继三起Claude安全事件后,Anthropic加强沙箱隔离、实时监控与人工干预机制,并为外部测试方制定安全最佳实践,以防范AI代理越权访问及推理缺陷引发的风险,提升整体系统安全性。
纽约Lake Mariner数据中心一场火灾暴露出该32亿美元AI数据中心项目安全隐患:无消防警报、无灭火系统、消防栓失效。项目涉及TeraWulf、Fluidstack、谷歌、Anthropic等多方利益相关者,责任划...
a16z消费投资人Anish Acharya在Lenny's Podcast深度阐释了AI时代公司建设的核心逻辑:公司将演变为"一系列AI循环",护城河靠发现而非设计,消费产品的最大机会不是效率提升,而是"让人更快乐"的...
本文解读一篇对比进化策略与GRPO训练大模型推理能力的论文,发现进化策略能在保持单次准确率提升的同时,获得更高的多次采样成功率,且参数大幅漂移未必导致能力遗忘,为大模型强化学习训练提供了新思路。
本文提出ACE框架,从准确性、复杂性、多样性三个维度,系统分析大语言模型智能体训练数据的生成方法,揭示了数据质量优于数据数量的核心原则,以及正向与逆向两类生成范式背后的设计逻辑。
9月12日,PEC 2026 AI创新者大会暨第三届提示工程峰会将在北京海淀中关村东升科技园众智园举行。大会以“Won Token, Won World(赢得Token,赢得世界)”为主题,围绕Token的生产、调度和应...
今天讲的出海案例是长安汽车与CAOA在巴西阿纳波利斯启用年产9万辆智能汽车产线,首辆本土制造UNI-T已经下线。
Magpie是一套实时生成式游戏渲染系统,让游戏引擎专管规则与状态,AI渲染服务器专管画面生成,通过白模视频作为唯一条件实现可控实时渲染,兼顾玩法可复现性与视觉表现力。
论文提出CaSKG框架,通过反事实探测校准技能图谱边的可靠性,解决大模型智能体技能检索中图结构噪声问题,在ALFWorld和ScienceWorld基准上于六种大模型上均取得最优表现。
本文介绍CARGO-T方法,通过让视觉语言模型生成代码化的因果推理图来理解图文中的幽默逻辑,在讽刺、表情包等多个数据集上显著超越思维链等推理基线方法,为AI理解复杂人类幽默提供新思路。
WikiSkill给AI agent设计了三层知识架构,把执行记录、提炼知识和可执行技能分开管理,持续积累的维基层让技能进化不再每次从零开始,在五个基准和五个模型上稳定超越现有方法,还发现技能可跨模型迁移并弥补模型规模差...
阿里巴巴联合清华浙大提出Self-OPD,让AI画图模型摆脱教师模型依赖,靠自我分支探索与自我打分实现密集训练信号,在文字渲染、构图准确性和审美偏好等多目标任务上超越教师蒸馏方法,同时大幅缩短训练时间。