给代码仓库当老师,教AI怎么把活干好
该研究提出Code2Skill流水线,从191,769个GitHub仓库自动提炼可验证的操作技能,构建含百万级记录的CodeSkillBank,实验证明其能显著提升AI智能体在编程、推理、系统操作等任务上的表现。
该研究提出Code2Skill流水线,从191,769个GitHub仓库自动提炼可验证的操作技能,构建含百万级记录的CodeSkillBank,实验证明其能显著提升AI智能体在编程、推理、系统操作等任务上的表现。
阿里团队提出RECREATIONWORLD,让AI通过重建正在运行的软件同时锻炼图形操作与代码实现能力,并配套250任务的RECREATIONBENCH评测,揭示当前最强模型全通过率仅2.8%,静态界面易还原而动态逻辑难...
本文介绍GraphSkillEvo框架,它把AI智能体的技能表示成图结构的自然语言文档,配合种群式进化算法中的变异和交叉操作进行优化,在五个基准测试中相比SkillOpt平均提升1.76%至4.01%的准确率,同时降低了...
腾讯联合港科大推出OmniVBench评测基准和Omni-R2V数据集,针对AI视频生成中日益复杂的多参考控制能力,首次提出因子级细粒度评测方法,覆盖7大任务18个子任务,并公开34万条训练样本,揭示当前主流模型在多参考...
论文提出RiskChainBench基准,测试十个大模型破译网络伪装暗语并追踪调查可疑网站的能力,发现文字复原准确率与网页调查能力常常不匹配,入口识别错误会严重拖累端到端表现,执行失败是探案环节最大瓶颈。
论文提出JEPA-Anything框架,用正交预测因子分解统一视觉、生物、临床、控制、分子、物理场、天气七大领域的预测建模,实验覆盖十项动力学任务、千余临床事件预测及湿实验室生物验证。
本文介绍EvoSkill-GUI,一个训练免费的GUI智能体技能进化框架,通过结构化技能包、即时修订、信息隔离的批评诊断和元数据检索,让智能体从执行失败中自我反思并持续改进,在多个手机电脑基准测试上取得显著成功率提升。
研究团队用标准nnU-Net模型测试脑肿瘤分割在跨病种场景下的泛化能力,发现验证集表现比内部测试低7.47个百分点,集成与增强等技巧收效甚微,小体积且碎片化的肿瘤是主要失败原因。
在PEC 2026 AI创新者大会暨第三届提示工程峰会期间,《原点Talk》迎来了一场特别版,以“2027 出海的机遇和路径”为主题,把这些问题摆上了桌面。
MIT 博士生 Alex Zhang 以 Recursive Language Models 和 GPU Mode 社区闻名,在 Latent Space 播客中回顾了自己从一次无聊实习误打误撞进入 GPU 编程社区的经...
Barrett Lyon 曾经历飞机引擎空中骤停的生死瞬间,如今他把同样的冗余思维用在了重建互联网协议上。这篇文章梳理了他创办 DoxxNet 的动机:协议层创新停滞、VPN 治标不治本、运营商级 NAT 扼杀应用潜力,...
论文提出全景接地式描述任务,构建人工标注数据集PanoCaps与gPQ评价指标,并提出PANORAMA模型,将短语接地转化为掩码候选选择,在多项分割与描述基准上取得领先表现,兼顾描述完整性与定位精确度。
本文解读Salesforce提出的四种显存优化技术,针对MoE长上下文训练中专家调度、词表投影、梯度检查点、优化器状态四大内存瓶颈逐一攻克,实现百万token上下文训练,吞吐量最高提升10.4倍。
RAND Corporation发布21页政策分析报告,指出AI驱动的变革、公众对专业知识信任的侵蚀及政治权威格局的转变,正动摇政策分析的制度基础,呼吁该领域回归基本原则,推动制度设计、培训与研究治理现代化。
北京人形机器人创新中心提出Pelican-Sim 1.0,一个通用世界模型模拟器,融合28维统一动作数值与URDF渲染动作视频,配合稀疏MoE架构,实现跨机器人型号的动作预测,并在数据生成、策略评估、动作选择等下游任务中...
本文解读ReMoMask与ReMoMask-2,一种检索增强的文本驱动人体动作生成方法,提出分层双向动量对齐、拓扑结构化掩码、语义时空注意力等模块,并将检索空间迁移至生成器潜变量空间,实现更高保真度与更快推理速度。
AI智能体在正式接任务前能否自主决定如何预习陌生环境?论文提出任务无关的环境预处理框架,用元智能体在六大基准上对比固定策略,发现开放式自主学习总体更优,且能省去测试时的重复尝试。
论文提出ActionSplice框架,通过反事实状态迁移技术,让交互式视频世界模型能在生成过程中即时响应新动作指令,无需等待或重复计算,大幅提升画面响应速度与准确度。
北大团队用591次训练实验严格测试了8种RLVR数据挑选方法和3种自适应策略,发现它们均未能稳定超越简单的均匀随机训练,同时揭示评测题库覆盖不全会导致排名结论截然相反。