KV缓存里,扔掉的那些token真的重要吗?答案可能会让你意外
论文发现KV缓存淘汰的关键不在打分算法,而在是否保护好提示词。随机保留推理轨迹配合完整保留提示词,就能匹敌最强的打分方法,同时服务吞吐量提升32%到43%。
论文发现KV缓存淘汰的关键不在打分算法,而在是否保护好提示词。随机保留推理轨迹配合完整保留提示词,就能匹敌最强的打分方法,同时服务吞吐量提升32%到43%。
腾讯混元团队提出环境进化方法,通过场景、技能、步数三个维度自动生成难度递增的终端任务环境,无需依赖模型试错即可持续产生训练信号,助力Qwen3.6系列模型在Terminal-Bench 2.1上提升14.4至18.0个百...
一篇研究发现,社区在4-bit量化大模型时一直刻意保护的Gated DeltaNet门控参数,实际上是架构里最不怕量化误差的部分,全量化后模型性能几乎无损,体积更小、速度更快。
本文介绍加州大学圣地亚哥分校团队提出的零数据对话推荐系统构建方法,利用商品评论、元数据和用户交互记录,通过大语言模型生成合成对话数据,无需真实对话语料即可训练出高效的对话式推荐模型。
论文提出WHALE方法,让AI智能体的模型权重与执行代码(harness)交替优化,而非孤立调整。在问答、数学推理、棋类任务上均超越单独优化方案,揭示不同任务瓶颈各异,两者协同能互相催化潜力释放。
PEC 2026 AI创新者大会“FDE实战营”分论坛,从医疗Agent的效果,到智算中心每百万Token的成本;从一个产品最后1%的落地,到甲方能不能接手系统;再到需求不断增加以后,乙方的人力该怎么投入。
读完这篇论文,最触动我的其实不是SRP这套方法本身有多精巧,而是它揭示的一个更基础的事实:我们过去很多关于"模型在想什么"的判断,可能从一开始就建立在一个没被检验过的假设上。 "模型内部用哪种语言思考"这类结论,曾...
一篇介绍腾讯混元等机构提出的Editable Visual Design方法的解读:用AI大模型做设计决策,图像模型按需生成独立素材,最终产出图层分离、文字可编辑的海报和信息图,兼顾美感与工程可维护性。
Caijing报道称,Unitree创始人王兴兴以事无巨细的微观管理和严格控成本策略,推动公司成为全球低价人形机器人及机器狗领导者,但该模式也带来质量控制与员工流失问题。
安全公司Socket发现Twitch浏览器扩展JeeBot将用户OAuth令牌经代理发往俄罗斯服务器,且刻意豁免10个俄罗斯主播频道,开发者已发布修复版本,建议受影响用户撤销令牌。
macOS 27 Golden Gate发布,新版Siri可感知屏幕内容、支持视觉框选提问,并优化Spotlight搜索与Safari页面追踪等功能,即日起向多款Mac机型推送。
亚马逊宣布Prime Video新增按需短视频新闻,涵盖本地与全国新闻,先登陆电视端,后续拓展至网页与移动应用,意图吸引Z世代用户。
黑客劫持HBO Max官方Reddit账号投放虚假广告,诱导用户在终端粘贴恶意代码,窃取密码、账号及加密钱包信息,该手法已成2026年新兴网络威胁。
Dell Technologies联合Intel推出面向中小企业的整合数据中心基础设施,涵盖PowerEdge服务器、PowerStore存储与网络安全防护方案,助力企业简化运维、控制成本。
面向中型企业的基础设施升级需综合考虑可扩展性、安全性、能效与成本等因素,戴尔PowerEdge服务器搭载英特尔Xeon 6处理器,助力企业为AI负载与未来增长做好准备。
面向AI时代,中型企业需淘汰老旧服务器与存储设备,采用Dell PowerEdge、PowerStore等方案,兼顾性能、安全与能效,为AI负载做好准备。
Syskit调研显示,90%受访企业曾遭遇或疑似遭遇因Microsoft 365配置错误引发的安全事件,而AI工具部署加剧了权限过度共享风险。