问AI帮你建模之前,它有没有先问清楚你到底要什么
本文介绍OR-Clarify基准与InterOPT框架,研究AI在运筹优化建模前能否主动识别信息缺口并澄清,而非默默假设。InterOPT分两阶段追踪缺口并决策提问,选择题模式下恢复率大幅领先,开放式模式仍存在提前收工的...
本文介绍OR-Clarify基准与InterOPT框架,研究AI在运筹优化建模前能否主动识别信息缺口并澄清,而非默默假设。InterOPT分两阶段追踪缺口并决策提问,选择题模式下恢复率大幅领先,开放式模式仍存在提前收工的...
针对自动驾驶和机器人常见的视觉定位难题,提出AdaptVPR框架,用AI生成同一地点不同天气遮挡的困难训练样本,并配合几何验证机制过滤不合格图片,在多个基准上显著提升识别准确率。
AllSpark团队推出Iris-mini与Iris-pro搜索智能体,通过网页超链接反向构造多跳难题、双重过滤训练数据、结合强化学习与上下文管理,在BrowseComp等四大基准上取得开源模型最佳成绩。
谷歌团队推出MaxKernel,一套用大语言模型配合真实编译反馈自动生成TPU硬件内核的多智能体系统。它支持人机协作、全自动优化、图搜索三种模式,在JaxBench基准上实现1.58倍加速,部分任务甚至超越人类专家手工调...
大模型修bug时常把代码改得面目全非。研究者用400道注入bug的编程题构建评测框架,发现顶级模型普遍存在过度编辑现象,提示词能显著缓解,强化学习则能让模型学会更持久的克制编辑习惯。
RISE是一种让大模型用自身强化学习训练轨迹外推出"未来教师",再逐字蒸馏回当前模型的训练方法。无需外部模型或答案提示,在数学、理科、代码、智能体任务上全面超越RLVR训练和已有自蒸馏方法,且额外计算开销仅1.3到1.6...
从Alpaca的600美元实验到日均10万亿token的推理网关,OpenRouter联合创始人Alex Atallah与a16z合伙人Anjney Midha回顾了开源模型崛起、Discord早期AI部署、以及toke...
Cerebras团队通过2400余次实验证明,配置得当的层级Dropout能让大模型训练节省最高25%算力且精度不降,还能解锁早退、层跳跃、自投机解码等推理加速技术,最高提速1.5倍。
MIPS发布了Acies、Actus、Aegis三款“工作负载原生”平台,并将每瓦Token数(tokens-per-watt)作为衡量能效的核心指标。
2014年,深度学习在视频动作识别上被手工特征甩开近20个百分点。牛津大学团队提出双流网络,把视频拆成空间流和时间流分别处理再融合,准确率达88%,首次实现反超,成为视频理解领域的里程碑工作。
这篇论文发现强化学习训练模型时,固定的裁剪阈值会误伤稀缺却珍贵的正确答案。作者提出GAPO方法,让裁剪区间根据答案优势值动态调整,在多个模型和数学编程任务上稳定提升了准确率与多样性。
Ricursive Intelligence联合创始人Anna Goldie与Azalia Mirhoseini将出席TechCrunch Disrupt 2026,探讨AI自主设计芯片的前景。该公司已融资3.35亿美元...
初创公司Vonder推出无摄像头智能眼镜,重量仅30克,内置骨传导麦克风可区分自身声音与外部对话,AI功能可转录并整理对话摘要。售价299至399美元,另需每月5至30美元AI订阅费。
Gartner调查显示,69%的企业怀疑或已有证据证明员工在使用被禁止的公共生成式AI工具,预计2030年前超过40%的企业将遭遇影子AI引发的安全或合规事件。专家建议CIO建立持续发现机制、控制平面及评估循环,将AI治...
随着AI Agent在企业中自主执行决策、调用工具、跨系统协作,传统的信任架构已难以满足需求。文章指出,企业应从"信任计算"转向"可验证计算",通过密码学签名、哈希等技术手段,为Agent的关键行为建立可独立核验的完整审...
AI基础设施竞争正从GPU层面扩展至系统层面。CPU、HBM、先进封装、网络、散热与电力正融合为一体化"AI工厂"架构,算力瓶颈不断转移,能效与系统整合能力成为新核心指标。AMD、Broadcom、三星及OpenAI等巨...
ChatGPT、Gemini和Claude均提供个性化设置功能,可调整语气、禁用emoji、添加自定义指令。测试显示,ChatGPT在遵循个性化指令方面表现最佳,Gemini首次即自动引用信息来源,Claude则需手动提...
谷歌宣布Gemini新增"Call for me"功能,可代用户致电商家查询营业时间、预约餐厅等,但不会处理支付信息。该功能目前仅限美国英语用户、Pixel 11及以上机型,需订阅Google AI(每月5美元起)并安装...