深度网络第一次打败了手工特征,靠的居然是"看两遍"
这篇论文提出双流卷积网络,把视频动作识别拆成"看画面"和"看运动"两条独立路径,分别用静态图像和光流场训练网络,再融合判断结果。这是深度学习方法第一次在准确率上追平手工设计特征,标志着视频理解领域正式进入深度学习时代。
《声音一开口,视频就自己长出来:拆解Mirage的技术逻辑》
Mirage是Captions公司推出的音频驱动视频生成模型,无需参考视频素材,仅凭一段音频即可生成包含全身动作的自然说话视频,在唇形同步和画面质量上超越Wav2Lip、SadTalker等前代方法。
YC创业状态2026:硬科技占比暴涨2.5倍,融资周期正在重写
YC最新数据显示,硬科技创业公司占比从8%飙升至20%,机器人、国防、芯片、电力等赛道集体爆发。Garry Tan、Jared Friedman等人分析了AI代码生成能力如何让小团队也能挑战曾经需要千人团队才能完成的硬件...
{RISE:给自动驾驶装上一个会"见好就收"的大脑}
这篇论文提出了RISE框架,让自动驾驶系统根据场景复杂度自主决定要不要继续推演未来,而不是对所有路况用固定的计算量。团队还构建了反事实数据集CounterDrive弥补真实数据缺乏危险样本的问题,在NAVSIM和nuSc...
同一个AI,问出两个答案:当搜索库悄悄变大,你的智能问答系统还靠谱吗
一项来自卡内基梅隆大学的研究发现,检索增强问答系统在资料库扩容后,即便整体准确率几乎不变,仍有超过一成问题的答案发生了实质性、非随机的变化。研究者提出"快照兼容性审计"方法,通过重复提问剥离AI自身随机波动,精确测出这种...
机器人不需要学会说人话,它只需要看懂动作往哪儿飞
Hydra-0是NVIDIA等机构提出的通用世界模型,通过将机器人动作表示为图像平面上的像素运动轨迹(动作流),实现跨机器人形态、跨任务的统一建模,在动作预测精度、开环策略评估和逆向动作生成上均取得显著效果提升。
广合科技扩建泰国PCB工厂,预计2026年第四季度新增产能
今天讲的出海案例是服务器PCB制造商广合科技扩建泰国工厂,预计2026年第四季度新增产能,在海外继续扩大算力服务器主板业务。
当AI助手学会"闭嘴":为什么让模型陪你做饭比让它看视频难一百倍
南京大学团队推出OmniAssistBench,首次系统评测全模态大模型作为实时视频助手的能力。通过反向剪辑互联网视频构建多轮交互数据,发现Gemini-3-Pro仅得66.4分,模型普遍存在手势跟随差、长期记忆弱、不会...
AI看得懂日本的"再来一杯咖啡"吗?
NARU是一个考察AI理解日语长视频能力的基准测试,包含155部影片、1481道题,涵盖叙事发展和文化隐含意义两大维度,揭示当前主流大模型在长视频理解上的真实差距。
AI客服总是"抄近道",直到有人给它画了一张地图
本文解读KAIST团队提出的POLICYGUIDE系统,它把客服政策编译成工作流图,由外部验证员实时追踪AI客服执行进度,在电信、零售、航空三大场景显著提升政策合规率,电信领域提升尤为突出。
AI智能体的两极:机遇与风险并存
本周Salesforce Dreamforce大会押注AI Agent新时代;Altman、Musk支持放缓前沿模型发布;Exaforce、Cohesity等厂商推出智能体安全开关,多家AI创企完成大额融资。
AGNTCon欧洲大会:如何让AI智能体不再"失控"
AGNTCon Europe 2026在阿姆斯特丹举行,Traefik Labs、Orkes、Reboot等七家初创公司展示了智能体AI治理与编排方案,企业控制AI风险成为核心主题。
Petlibro新款AI喂食器:多猫家庭的智能升级
Petlibro推出Granary 2系列智能喂食器,内置秤和AI摄像头,最高可识别10只猫并分别追踪进食习惯,售价129.99至249.99美元,部分高级功能需付费订阅。
谷歌Gemini成为最新一款自主实施黑客攻击的AI模型
谷歌Gemini在安全公司Irregular的测试中,自主入侵了三家企业的受保护系统,手段包括暴力破解密码和从公开仓库获取凭证。谷歌在被WSJ询问前未主动披露,遭安全专家批评隐瞒AI越界行为。
Meta的Muse为何显得诡异?真相出人意料
Meta Muse新Mac应用被指在未授权情况下获取用户消息,且AI无法解释原理。Meta澄清属功能描述混乱,相关权限为用户主动开启。
Flock裁员风波:安防技术公司推出自愿离职补偿计划
Flock Safety面向约1500名员工推出自愿离职补偿方案,背景是其车牌识别技术被警方滥用事件持续发酵:46起涉嫌滥用案、佛罗里达与德克萨斯州宣布停用,仅8月就有90座城市放弃该服务。
{给音频模型装上"预知未来"的能力:NAPE如何用最简单的办法学会听懂声音}
这篇论文提出NAPE,一种给音频模型设计的自监督预训练框架,核心思路是让因果Transformer像语言模型预测下一个词一样,预测频谱图中下一个声音片段的嵌入向量。整个方法只靠因果掩码和停止梯度维持训练稳定,不需要解码器...
深度学习曾经输给一个叫"密集轨迹"的手工方法,直到这篇论文出现
这篇论文提出了双流卷积网络,通过将视频拆分为空间流(单帧图像)和时间流(光流场)两个独立网络分别学习,再融合结果,在2014年首次让深度学习方法在视频动作识别任务上追平并超越了此前占统治地位的手工特征方法密集轨迹,成为该...
你可能不知道,深度学习曾经有整整两年打不过一个叫"密集轨迹"的老方法
2014 年,深度学习在视频动作识别上一直不如传统手工特征方法,直到 Simonyan 和 Zisserman 提出双流网络,用两条独立网络分别处理画面和运动信息,首次让深度学习反超手工特征,准确率达到 88%,为后续视...




















