一步走错,后面全白费:AI训练的新思路
论文提出Cliff方法,用老师模型定位学生推理中第一次出错的位置,将答案拆为正确前缀与错误后缀分别给予奖励,在12种场景下平均超越GRPO7%、超越蒸馏方法15%,且对老师模型能力要求不高。
论文提出Cliff方法,用老师模型定位学生推理中第一次出错的位置,将答案拆为正确前缀与错误后缀分别给予奖励,在12种场景下平均超越GRPO7%、超越蒸馏方法15%,且对老师模型能力要求不高。
星流计算(NovuInfra,浙江星流计算科技有限公司)发布SerpForge(TM) AI 模型训推平台(SerpForge(TM) AI Model Training & Inference Platform),面向...
最近在 WorkBuddy 里面又测试了一个新模型:Step 5 Preview
【浙江·杭州】2026年9月22日,智算中心热管理领域定制化温控部件解决方案供应商GMCC美芝&Welling威灵亮相全球顶级科技盛会“2026云栖大会”,现场展示包括水泵、风机、阀、涡旋压缩机、氟泵等热管理核心部件,与...
本文解读了论文《像素文本表示学习的设计基础》,揭示了视觉文本编码模型在分辨率、多模态锚定、版式多样性、多语言课程四方面的关键设计原则,并介绍了据此训练的PIXEL LINGUIST II模型,其在视觉语义检索与文档理解任...
一篇关于大模型蒸馏训练中"多样性丢失"问题的研究解读,提出IDA-OPD方法,仅用老师模型的单token信息就能精准识别并纠正训练中悄悄压缩模型思路多样性的更新,实验证明效果媲美昂贵方法。
论文提出PaperCompiler框架,通过将论文证据编译为带溯源的仓库级规范,解决AI生成代码时算法逻辑被简化、跨文件不一致的问题,在Reference-based评测上比强基线提升13.8%。
NVIDIA团队打造编程竞赛AI系统,结合数据筛选、监督微调、强化学习与GenCorrect迭代策略,在IOI 2026现场以535.4分超越人类冠军498.27分,首次实现AI在奥赛赛题上反超人类最强选手。
一篇新研究发现,顶尖代码嵌入模型面对几乎一模一样的正确与错误代码时,排名第一的准确率仅33%,91%以上的失误都撞上了精心设计的"孪生陷阱"代码。
本文介绍MULTI?IR基准和SPIN方法,揭示多模态检索系统面对开放式问题时存在的单一视角偏见,并提出通过在模型中间层注入噪声向量来低成本提升检索结果对多个视角、多学科、多媒介的覆盖能力。
DiagEvo提出一种诊断引导的自我博弈框架,让AI模型从自己失败的解题记录中提炼可复用的错误原因,并通过分层记忆结构动态指导下一轮出题,无需依赖外部人工数据即可持续提升数学与通用推理能力。
根据市场需求推进兆瓦级充电设施的规模化部署是一项复杂的系统工程,现有的验证方法和解决方案已无法应对这一挑战。在此背景下,测试与验证成为货运行业电动化、智能化转型中破解相关瓶颈的关键路径之一。
蚂蚁集团发布UI-Venus-2,覆盖手机、网页、桌面三端的通用GUI智能体。论文核心不在模型架构,而在如何用深度研究式任务生成、双层轨迹验证、多教师蒸馏解决数据可信度问题,实测多项指标超越Claude、GPT-5等顶级...
本文介绍一种解决多智能体AI系统提示词优化易崩溃问题的新方法:控制-数据流分离。通过将执行协议与任务内容分离为独立通道,实验证明该方法在推理、评审生成、保险核保等场景中实现100%协议稳定性,同时任务表现全面优于现有优化...