LMSM:给大模型装一套"内核安全模块",让可解释性研究真正管住输出
本文解读LMSM框架:借鉴Linux Security Modules设计,将大模型可解释性证据、安全策略、执行拦截三层分离,无需重训模型即可大幅降低攻击成功率,同时保持推理吞吐效率。
给AI换个大脑没用,先看看它手里的工具够不够趁手
论文提出StarHarness框架,通过分层任务搜索进化AI智能体外壳而非模型权重,在三个企业级基准上提升20至35个百分点,且能跨模型迁移、覆盖未参与训练的任务,揭示了接口设计对智能体表现的关键作用。
给AI装一个安全员,怎么让它既不误伤又不失职
论文提出AI代理安全护栏StepGuard,通过自动数据引擎StepGen构造对照轨迹,配合Balance-GRPO动态平衡训练,在保证低攻击成功率的同时大幅降低误伤,实用性损失极小。
当AI帮你写代码时,它到底在优化什么
蚂蚁团队提出RCCA强化学习框架,把网页应用生成任务里分散的功能对错反馈,精确映射到代码具体片段,训练出的Ling-RCCA-Flash模型在MiniAppBench和ArtifactsBench两大测评上均超越Clau...
视频生成模型突然学会了看穿世界的深度
本文解读GeoNeXt研究:把视频生成模型改造成统一的深度与表面法线估计工具,将几何预测重新定义为下一帧预测任务,仅用不到6万张训练图片就超越了动辄百万数据训练的判别式与生成式模型。
特斯拉Cybacab正式上路却遭遇监管调查
特斯拉Cybercab无人驾驶出租车在奥斯汀正式上路,但资本市场反应平淡,马斯克本人也未出席发布会。美国国家公路交通安全管理局已就该车缺少方向盘和踏板一事展开调查。本期还汇总了自动驾驶、出行领域多起融资并购动态及一周行业...
小米SkyNomad SUV系列在华发布 四款车型齐上市
小米在华发布SkyNomad增程SUV系列,共四款车型,起售价209900元人民币,低于理想和问界同级车型。该系列搭载昆仑平台,全系标配英伟达Thor芯片、激光雷达等辅助驾驶硬件,最高续航达1705公里,并推出配备电动天...
机器人只记住最近11帧,却能在4.8万帧的街景里走完27分钟不迷路
阿里团队提出ABot-Recon,仅缓存最近11帧特征即可完成超长视频的流式三维重建。通过局部预测目标、旋转修正器与组合感知损失,在Oxford Spires等基准上将误差降低约40%,同时兼顾更快速度与更低显存占用。
機器人怎么才能"记住"十秒钟前发生的事
论文提出PonderPounce,用预训练多模态大模型Ponder的原生上下文作为机器人情景记忆,通过异步认知令牌连接动作模型Pounce,在RoboMME和RoboCasa-DC基准上验证了预训练上下文可作为可扩展的机...
机器人捏一个滴管,才过了1.17秒,触觉信号已经面目全非
机器人挤滴管仅1.17秒,触觉信号剧变0.55而画面几乎不变。TacForcing用流式生成和执行感知触觉注意力,让机器人动作能实时响应接触变化,无需额外控制器,仿真与真实任务成功率均超越现有方法。
Arm如何为Agentic AI时代重写芯片逻辑?|Arm Everywhere China观察
此次,Arm最新发布了多款新品:包括面向边缘AI场景的新一代移动计算平台CSS for Mobile 2,以及其中的C2 CPU集群和Mali G2-Ultra NX GPU;面向物理AI场景的新设计(Arm Total...
印度高光谱卫星初创公司Pixxel获1亿美元融资
印度地球观测卫星研发商Pixxel Space Technologies完成1亿美元C轮融资,由淡马锡和Seraphim领投,公司总融资额达1.92亿美元。其Firefly卫星星座采用高光谱成像技术,分辨率是传统多光谱卫...
AI术语速查:从大语言模型到不透明循环
本文梳理了AI领域常见术语的通俗解释,涵盖AGI、AI代理、思维链、扩散模型、MoE、MCP协议、强化学习、权重等概念,并特别介绍了因OpenAI新模型引发关注的"不透明循环"推理技术,帮助读者理解AI快速演变中的专业词...
一份跑通的评测报告,到底能证明什么?
论文对Inspect Evals仓库124个评测单元做全面排查,发现110个因缺失历史证据或语义标准无法验证结论,提出claim-replay框架区分可确定与不可确定的评测结论层次。
直播换脸这件事,能做到实时又不崩脸吗?
一篇聚焦直播场景实时人物视频编辑的研究,提出EditaLive框架,通过外观动作解耦、流式生成改造和两步蒸馏技术,解决表情失真、离线延迟高、长视频画面漂移三大难题,实现低延迟高质量的实时人物换装换风格。
宁波华翔汽车零部件聚焦北美:墨西哥一厂与美国两厂亏损持续收窄
今天讲的出海案例是汽车零部件企业宁波华翔,它把北美确定为海外重心,以墨西哥一座工厂和美国两座工厂继续开拓客户,区域经营性亏损近年持续收窄。
PILOT:让AI智能体一边干活一边被人盯着改,而不是干完再挨批
本文介绍PILOT系统,它让AI智能体在执行长周期任务时,由独立监督者实时纠偏并同步积累可复用经验,相比传统事后复盘方法,在多个基准测试上显著提升准确率并大幅降低计算成本。
没有标签能让模型考完试却不知道自己考的题是对是错,这听起来是个悖论。但这正是"测试时训练"要解决的怪事:让一个大语言模型在做题过程中自我提升,而全程没有人告诉它答案对不对。
论文提出TTPO方法,在无标签的测试时训练场景下,利用多数投票伪标签的非对称容错特性,结合蒸馏与强化学习,让大语言模型无需标准答案即可自我提升数学推理能力,效果媲美甚至超越有标签监督方法。




















