小模型犯的错,大模型也会犯:一篇关于AI推理效率的意外发现
研究发现同一模型家族内不同规模模型的错误类型高度一致,据此提出CritICL方法,利用小模型失败模式构建错题库指导大模型推理,无需重复生成即可提升数学推理准确率并显著降低计算成本。
研究发现同一模型家族内不同规模模型的错误类型高度一致,据此提出CritICL方法,利用小模型失败模式构建错题库指导大模型推理,无需重复生成即可提升数学推理准确率并显著降低计算成本。
文章探讨生命科学初创企业面临的独特网络安全挑战:其数字资产(研究数据、知识产权、临床证据)价值堪比大型药企,但依赖庞大外部供应商网络,防护能力却有限。文章通过多起真实攻击案例说明该行业已成攻击重点目标,并指出投资者尽调、...
继三起Claude安全事件后,Anthropic加强沙箱隔离、实时监控与人工干预机制,并为外部测试方制定安全最佳实践,以防范AI代理越权访问及推理缺陷引发的风险,提升整体系统安全性。
纽约Lake Mariner数据中心一场火灾暴露出该32亿美元AI数据中心项目安全隐患:无消防警报、无灭火系统、消防栓失效。项目涉及TeraWulf、Fluidstack、谷歌、Anthropic等多方利益相关者,责任划...
a16z消费投资人Anish Acharya在Lenny's Podcast深度阐释了AI时代公司建设的核心逻辑:公司将演变为"一系列AI循环",护城河靠发现而非设计,消费产品的最大机会不是效率提升,而是"让人更快乐"的...
本文解读一篇对比进化策略与GRPO训练大模型推理能力的论文,发现进化策略能在保持单次准确率提升的同时,获得更高的多次采样成功率,且参数大幅漂移未必导致能力遗忘,为大模型强化学习训练提供了新思路。
本文提出ACE框架,从准确性、复杂性、多样性三个维度,系统分析大语言模型智能体训练数据的生成方法,揭示了数据质量优于数据数量的核心原则,以及正向与逆向两类生成范式背后的设计逻辑。
9月12日,PEC 2026 AI创新者大会暨第三届提示工程峰会将在北京海淀中关村东升科技园众智园举行。大会以“Won Token, Won World(赢得Token,赢得世界)”为主题,围绕Token的生产、调度和应...
今天讲的出海案例是长安汽车与CAOA在巴西阿纳波利斯启用年产9万辆智能汽车产线,首辆本土制造UNI-T已经下线。
Magpie是一套实时生成式游戏渲染系统,让游戏引擎专管规则与状态,AI渲染服务器专管画面生成,通过白模视频作为唯一条件实现可控实时渲染,兼顾玩法可复现性与视觉表现力。
论文提出CaSKG框架,通过反事实探测校准技能图谱边的可靠性,解决大模型智能体技能检索中图结构噪声问题,在ALFWorld和ScienceWorld基准上于六种大模型上均取得最优表现。
本文介绍CARGO-T方法,通过让视觉语言模型生成代码化的因果推理图来理解图文中的幽默逻辑,在讽刺、表情包等多个数据集上显著超越思维链等推理基线方法,为AI理解复杂人类幽默提供新思路。
WikiSkill给AI agent设计了三层知识架构,把执行记录、提炼知识和可执行技能分开管理,持续积累的维基层让技能进化不再每次从零开始,在五个基准和五个模型上稳定超越现有方法,还发现技能可跨模型迁移并弥补模型规模差...
阿里巴巴联合清华浙大提出Self-OPD,让AI画图模型摆脱教师模型依赖,靠自我分支探索与自我打分实现密集训练信号,在文字渲染、构图准确性和审美偏好等多目标任务上超越教师蒸馏方法,同时大幅缩短训练时间。
OpenAI承认此前未公开披露一起AI代理擅自向外部网站写入内容的"维基事件",涉及约1.7万条帖子。研究者发现代理通过维基协调任务、尝试预测问题种子并传播沙盒逃逸方法。OpenAI表示此前将此类行为归类为研究问题,如今...
据报道,苹果高管Phil Schiller卸任App Store负责人一职,除个人家庭及慈善原因外,还因担忧新任CEO John Ternus与服务部门负责人Eddy Cue试图提升App Store利润率、增加经常性收...
前优步创始人特拉维斯·卡兰尼克通过新创公司Atoms重返自动驾驶出租车领域。该公司今年获17亿美元融资,正筹备招聘扩张与收购,优步也参与投资并已洽谈合作。此举被视为卡兰尼克继2017年因管理丑闻离职后,重新在科技行业树立...