只用一个问题训练几百步,模型居然还在变强:一篇论文的意外发现
本文研究发现,仅用一道训练样本进行在线策略蒸馏,模型就能持续进步数百步,恢复全量数据训练大部分收益。研究者提出状态覆盖率概念解释这一现象:数据供给远超算法吸收速度,揭示了训练效率的新瓶颈所在。
本文研究发现,仅用一道训练样本进行在线策略蒸馏,模型就能持续进步数百步,恢复全量数据训练大部分收益。研究者提出状态覆盖率概念解释这一现象:数据供给远超算法吸收速度,揭示了训练效率的新瓶颈所在。
阿里通义团队提出Terminal-Universe框架,把AI智能体已产生的操作轨迹复原为可复用的编程环境,通过单工作空间、跨工作空间与多轮对话三种方式扩展任务,微调模型后在多个基准测试上取得显著提升。
论文研究小语言模型能否替代大模型做强化学习裁判。作者构建PointRubric和RaR-Science-Static两套数据集,发现1.7B探针裁判判断力超过生成式和对数概率方法,训练出的策略优于8B生成式裁判,且裁判耗...
2026中秋与国庆双节相继临近,受“请3休13”拼假方案带动,出境游市场提前升温。多家旅游平台数据显示,相关出境游搜索热度较今年“五一”假期激增约3倍。
论文提出Debias-SparseGPT,一种通过配对刻板印象文本构建偏见感知Hessian矩阵的模型剪枝方法,在九种大语言模型上验证,能在保持效率和性能的同时显著降低压缩带来的偏见放大问题。
今年云栖大会,闪迪带来了一些亮点产品,包括面向云数据中心的企业级SSD,以及面向智能汽车的车规级闪存产品。前者覆盖训练、推理和大规模数据存储,后者则进入车载AI和中央计算。
论文提出用公司新闻文本的语义分布差异,结合反利普希茨等假设桥梁,构建投资组合风险上限证书,无需估计资产间收益协方差矩阵,并在52只美股上验证了该配置方差排名显著优于等风险权重基准。
2026年,中国AI产业进入推理产能规模化、词元服务标准化、算力运营精细化的产业化深水区。科智咨询联合算力海洋发布《中国词元工厂发展白皮书(2026)》,首次构建了一套可复现、可审计的词元工厂全生命周期测算体系。
论文提出潜在状态内化方法,让大语言模型直接读取国际象棋引擎的内部激活值而非文字总结,训练出的LLAMIA模型在六项棋类协作任务上超越文字翻译方案和GPT-5.1,并揭示了语言化过程中存在的系统性信息损耗。
一篇让AI"看视频学折纸"的研究:给VLM配上模拟器、检查点和独立评审员,把折纸教学视频转换成可执行程序,可编译率从8%跃升到96%,为教AI理解人类手工技艺提供了新思路。
2026年9月22日,森马物流、富勒科技与万拿机器人在浙江嘉兴正式签署战略合作协议。浙江森马服饰股份有限公司物流中心高级总监刘勃如、上海富勒信息科技有限公司首席执行官师尊俐、万拿机器人(北京)有限公司创始人兼首席执行官程...
现在的全模态AI已经能够同时处理图像、视频、声音和文本,并完成越来越复杂的推理任务。
亚马逊在年度卖家大会上宣布,推出支持Claude和Amazon Quick的AI插件,卖家无需登录Seller Central即可管理库存、调价及更新产品列表。同时新增Seller Assistant画布功能及面向所有卖...
Meta在年度Connect大会上发布VR Glasses,搭载Snapdragon Reality Elite处理器,重量仅为Quest 3的五分之一,售价1299美元,明年春季上市。同期还推出无摄像头AI音频眼镜Ra...