训练大模型做数学题时,为什么"表现好的能力"反而被过度关照?
这篇论文指出,现有多目标强化学习训练大模型时存在"一刀切"分配优化精力的问题,提出SA-MRPO方法,根据每个奖励目标的饱和程度动态调整其权重,在数学推理、自适应推理、代码生成等任务上均取得优于现有方法GDPO的效果。
2026中国国际消费电子博览会即将开幕
NVIDIA 发布 Jetson Orin Nano 2 机器人计算机,重新定义入门级边缘 AI
NVIDIA Jetson Orin Nano 2 模组和开发者套件预计将于 2027 年上半年上市。
当AI听不懂"嘈杂世界"的时候:一套不用训练、9毫秒搞定的降噪魔法
这篇论文提出PRISM,一种无需训练、无需梯度、无需噪声标注的音频文本模型降噪方法。基于"仿射噪声假设",它用三步闭式几何修正压缩成静态矩阵,实现单样本0.0009毫秒的推理速度,在多个噪声基准上超越现有方法及需要特权提...
AgentHands:为XR智能体对话生成交互式手势,实现空间化引导
谷歌研究团队发布AgentHands,这是一款发表于CHI 2026的XR原型系统,通过LLM驱动为对话智能体生成与语音同步的表达性手势。系统利用眼动追踪和场景重建建立三维物体注册表,结合词级时间戳实现语音与手势的精准同...
Debian拟禁止AI辅助代码贡献,开源社区何去何从
Debian社区就是否允许大型语言模型(LLM)辅助代码贡献提出了八项议案,涵盖全面禁止到有条件允许等多种立场。禁止派认为AI助力的"快速迭代"文化与Debian追求稳定性的传统相悖,并担忧贡献者技能退化。反对派则指出,...
首席信息官如何在AI浪潮冲击下驾驭混乱的软件市场
Forrester研究显示,AI与自主智能体正深刻冲击传统软件市场。前沿模型正取代SaaS平台的内容生成功能,压缩企业所需的订阅数量。应用开发、技术服务等领域受冲击最大,开发者调试、单测等技能逐渐被替代。CIO需持续审计...
苹果推出专为AI工作负载设计的PC与芯片
苹果推出两款全新桌面芯片——Mac mini搭载M6芯片,Mac Studio搭载M5 Ultra芯片。M6芯片配备12核CPU与GPU及神经加速器,提升统一内存带宽;M5 Ultra内存带宽较M3 Ultra提升50%...
AI重塑网络管理:智能网络究竟能走多远?
AI正深刻改变企业网络管理方式。通过关联孤立信号、整合多系统数据,AI使网络管理更具响应力,可自动检测故障、优化性能并预测需求。数字孪生、Self-X自愈能力等技术支撑网络向高度自治演进。但专家指出,完全自治风险过高,多...
美能源部下令爱迪斯通电厂延迟退役,应对数据中心用电激增
美国能源部(DOE)发布第202(c)条命令,要求PJM互联和Constellation Energy将宾夕法尼亚州Eddystone发电站760兆瓦机组的可用期延长至11月20日。这是该电站预定2025年退役以来的第六...
液冷方案全解析:后门热交换器、直接液冷与浸没式冷却
随着AI与高性能计算推动服务器功率密度飙升,机柜密度从5-10千瓦跃升至30-60千瓦甚至更高,传统风冷已难以应对。数据中心正加速转向液冷技术。主流方案包括:后门热交换器(RDHx)——改造成本低、适合现有设施升级;直接...
谷歌抗晕车功能Motion Assist小圆点终于在Android上开始推送
Google旗下安卓防晕车功能Motion Assist终于开始向Pixel手机推出,目前仅限于运行Android 17的设备。该功能通过在屏幕边缘显示随车辆运动而移动的小点,模拟真实世界物体的视觉效果,帮助缓解因感官不...
化学如何防止夜光颜料褪色
印第安纳波利斯艺术博物馆与伍斯特学院科学家合作,针对设计师斯蒂芬·斯普劳斯作品中使用的磷光与荧光颜料展开研究。研究发现,荧光颜料中的光学增白剂比颜料染料降解更快,导致颜色变暗;而磷光颜料以矿物基无机化合物为主,湿度对其分...
托管VPS主机的优缺点全面解析
托管VPS与非托管VPS的选择远比看起来复杂。托管服务意味着提供商负责日常维护、安全补丁、数据库管理及合规支持,适合缺乏技术背景的团队;但代价是月费较高($40-$120 vs 自管的$10-$20),且通常限制root...
从垃圾堆里捡出一台能跑大模型的超级计算机
研究团队用128块二手V100 GPU搭建了一台成本仅2.2万美元的大模型推理集群,通过设备级流水线并行策略实现了LLaMA-70B的规模化服务。研究发现二手硬件在经济性上大幅领先新款GPU,但运营碳排放可能高出40倍以...
首届FILA青少年网球精英赛落幕,高质量赛事为梦想搭造全新舞台
世界模型的期末考试,谁来当监考老师?
HarnessEval-W是一套面向交互式世界模型的智能体化评估系统,它把评估任务拆解成可验证的子问题,由专门的子智能体分别核查证据,再汇总成透明可追溯的评分。研究团队构建了330个评估案例,测试了18个代表性世界模型,...














