给大语言模型装一个"情绪翻译器":跨语言功能向量如何破解多语言情感识别难题
本文介绍了一项关于跨语言功能向量的研究:通过提取大语言模型内部的任务表征并跨语言注入,在多语言情感识别任务中显著提升零样本和少样本表现,揭示了功能向量具有语言无关的任务理解能力。
本文介绍了一项关于跨语言功能向量的研究:通过提取大语言模型内部的任务表征并跨语言注入,在多语言情感识别任务中显著提升零样本和少样本表现,揭示了功能向量具有语言无关的任务理解能力。
一个2B小模型玩文字游戏总失误,研究者用广泛模仿加精准修复的三步法,把公开评测分从10.67提到38.92,同时几乎不损失通用能力,但跨领域泛化仍是难题。
本文对比发现,无需训练的滑动窗口注意力配合注意力汇聚点,在知识问答和长文本推理任务上普遍优于耗费大量算力后训练的线性注意力模型,且速度更快、显存更省,为大模型长文本处理提供了更简单高效的方案。
PEC 2026 AI创新者大会将举办“FDE实战营”平行专题论坛,将围绕FDE项目的需求诊断、系统改造、交付过程和业务结果展开,现场案例也会尽量把一个项目讲完整:从项目起点,到系统改造、人员投入、交付周期,再到最终上线...
论文对十种语言、十一个大模型做了25万次测试,发现英语训练的提示词压缩工具在非英语文本上效果大幅下降,中文压缩后甚至比不给上下文还差,而多语言训练的压缩器能消除这一差距。
比亚迪旗下高端品牌腾势将于9月9日推出全新腾势Z9 GT车型。新款三电机版本预计起售价约为5万美元,将填补现有顶配性能版与旗舰后驱版之间的价格空白。
DeepMind推出AI工具AlphaGenome Atlas,可预测人类基因组中九十亿种DNA变异的分子影响,助力疾病研究与新疗法开发。
Bluecore Energy成立仅数月即完成5000万美元超额认购种子轮融资,此前曾获千万美元种子前融资。该公司研发可移动小型核反应堆,搭载于浮动驳船为港口及AI数据中心供电,目前正与美国核管会及海岸警卫队推进产品认证...
DeepMind推出AlphaGenome Atlas,预先计算人类参考基因组全部90亿种单碱基变异的调控影响预测,并提供简明影响评分,助力疾病研究。
美国能源部批准19亿美元贷款支持NextEra重启爱荷华州杜安·阿诺德核电站,该615兆瓦电站为满足数据中心用电需求,计划2029年一季度恢复商业运营,此前已与谷歌签订25年购电协议。
海事核能初创公司Bluecore Energy完成5000万美元种子轮融资,将用于设计、测试并申请首个约10兆瓦浮动反应堆系统许可。
Google威胁情报小组报告称,攻击者利用多代理AI框架自动化扫描与凭证窃取,6小时内攻陷大量账户,人工干预明显减少,供应链与AI资产本身也成为新攻击目标。
Team8研究显示,2025年全球有限合伙人仅6%资金投向5000万美元以下小型基金,创网络泡沫后最低水平,尽管首次基金历史回报常优于大型机构。
NVIDIA发布CUDA Rust,提供cuda-oxide(SIMT)与cutile-rs(Tile)两条技术路线,支持原生Rust编写GPU内核并编译至PTX,两项目均处早期阶段。
Polestar发布Formula 2030概念车,预示2027年新Polestar 2与2028年Polestar 7设计方向,作为其提振投资者信心、迈向盈利的战略核心。公司H1净亏损8.42亿美元,同比收窄29%。
一篇关于AI视频目标定位的研究,揭示了为什么让AI在视频里画框又慢又容易出错,并提出并行生成整条轨迹的新方法,把延迟砍到原来的1/79,准确率反而更高。
本论文提出Falcon框架,重新审视循环序列模型中记忆更新的时序对齐问题,发现常见做法存在预测时机错位,并推导出六种归一化快速权重更新规则,在语言建模上保持竞争力,在数字加法长度外推任务上显著提升。
通义千问团队推出Qwen3.8-Flash-Next,125B参数仅激活6B,性能追平397B旗舰模型。文章拆解其GDN混合注意力、稀疏索引QSA、门控残差GR、n-gram嵌入表及Muon优化器设计,揭示损失与下游表现...