Google DeepMind 宣布推出 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber 三个模型。此次更新扩充了 Gemini 模型阵容。
主题频道
研究
值得追踪的研究成果与工程突破
20 条已发布信号Hugging Face 发布文章介绍 Grabette:一套用于记录机器人操作数据的开放系统。该项目聚焦为机器人操作相关研究与开发提供数据记录能力。
MIT Technology Review 报道称,多名现任及前任特朗普政府AI顾问近日公开批评美国主要AI公司。报道摘要未披露争执的完整内容与各方回应,相关说法仍需核验。
Anthropic宣布承诺投入1000万美元支持加拿大人工智能研究。该承诺涉及资金投入,具体执行安排仍需以原始公告为准。
Anthropic 宣布开放“AI for Science”罕见病研究资助项目申请。该项目面向罕见病研究,具体资助范围和申请条件需以原始公告为准。
BetaKit 报道称,Mila 将与 PolArctic 合作,结合 AI、传统知识与海洋科学测量高北极海冰。该合作关注 AI 在极地环境研究中的应用。
BetaKit 报道称,Mila 举办的原住民 AI 聚会讨论了如何在不进行数据提取的前提下开发 AI 解决方案。该议题关注原住民社群对数据使用与治理的控制权。
《麻省理工科技评论》报道称,天气预报支撑航空调度、电网运营和农业等关键决策,天气数据遭破坏的风险值得关注。输入未提供具体事件、攻击方式或证据细节。
VentureBeat对101家员工规模超过100人的企业进行的调查显示,57%的受访者称,其AI代理曾因业务上下文缺失或不一致而给出自信但错误的回答。该调查认为,企业正在采用混合检索与受治理的语义层来改善这一问题,但多数相关能力仍在建设或试点阶段。
VentureBeat基于157家企业的自选样本调查称,部分受访组织报告其通过内部评估的AI代理曾在面向客户的生产环境中失效。该调查反映了企业在提高代理自主性时,对自动化评估可靠性的担忧。
Ars Technica 报道称,投资者正将能源企业视为参与 AI 热潮的途径,相关 IPO 活动升温。输入未提供公司名单、融资金额或可独立核验的具体数据。
Google DeepMind与Isomorphic Labs公布其针对AI模型与生物韧性的联合方法。该举措显示两家公司正将生物安全考量纳入模型相关工作。
Ars Technica 报道称,美国便利店连锁 Sheetz 计划将约 11,000 台虚拟机迁出 VMware,转而使用 StorMagic。该消息反映出 Broadcom 收购 VMware 后,部分企业用户对产品与商业安排不确定性的担忧。
IBM Research 在 Hugging Face 发布文章称,面向智能体的模型路由不能只按任务难度或模型标价选择模型,还需同时考虑缓存、延迟、基础设施与合规等因素。文章以 AppWorld Test Challenge 上的实验说明其优化式路由方法的取舍。
MIT Technology Review 报道称,OpenAI 构建了名为 GPT-Red 的模型,用于帮助其他模型提升对网络攻击的防御能力。由于信息仅来自单一媒体摘要,相关细节尚无法独立核验。
Hume AI 在 Hugging Face 博文中介绍 Real World VoiceEQ,用于评估语音 AI 在情绪、语调、说话人身份和复杂声学环境等方面的表现。该基准覆盖多类语音任务,并以人工评分为核心,反映传统指标难以覆盖的真实对话质量。
Ars Technica 报道称,微软未撤销的旧版 Secure Boot“shim”可能让绕过 Secure Boot 变得更容易。若报道属实,这将影响依赖该启动完整性机制的设备安全。
Ars Technica 报道称,一种被称为“context bombing”的方法试图诱导用于攻击的代理在造成伤害前自行停止。该信息来自单一媒体摘要,尚不足以独立核验其技术细节与实际效果。
OpenAI 宣布推出 GeneBench-Pro,用于测试 AI 在基因组学、生物学和科学研究中的表现。该基准采用复杂的真实世界数据集,关注模型在相关科研任务中的能力。
Google DeepMind表示,英国政府正与其合作开发一款由AI驱动的原型工具,目标是加快住房规划相关决策。该项目涉及公共规划流程,实际效果与后续部署仍待验证。