技术
基础模型
前沿模型的能力、成本与部署变化。
//
本周
- Airbnb 扩大对 OpenAI 前沿模型的访问权限Airbnb 通过一项新协议扩展了对 OpenAI 的 GPT-6 Astra 和其他前沿模型的访问,从而增强了其内部人工智能能力。稳定技术1 个来源 · 1 个一手 · 6 条证据2026-09-23 09:00
- Anthropic 在IPO文件中警告AI技术可能带来的存在性风险Anthropic,一家人工智能初创公司,在其IPO招股说明书中包含了一项警告,指出其技术可能对人类造成存在性风险,强调了先进AI模型的不可预测行为和操控问题。稳定市场1 个来源 · 2 条证据2026-09-29 22:10
- Granite 4.2 大型语言模型:增强的架构和训练细节Granite 已发布其 4.2 大型语言模型的详细信息,包括新的架构、训练方法以及基础设施改进。稳定技术1 个来源 · 1 个一手 · 4 条证据2026-08-25 23:14
- Hugging Face 与 EvalEval 集成以进行 AI 模型评估Hugging Face 已将其 Community Evals 与 EvalEval 集成,允许跨平台发布和解释评估结果,并链接到开源模型、排行榜和统一的元数据存储。稳定技术1 个来源 · 1 个一手 · 3 条证据2026-06-30
- NVIDIA宣布推出Kumo Tabular,用于表格数据预测NVIDIA 已发布 Kumo Tabular,这是一个用于表格数据预测的开放基础模型,它在准确性和效率方面开创了新的前沿。稳定技术1 个来源 · 1 个一手 · 3 条证据2026-09-29 23:30
- OpenAI的AI模型解决了超过100个长期存在的数学问题OpenAI的新AI模型已解决了超过100个长期存在的数学问题,令数学家们感到惊讶,并引发了关于如何向社区传达这一信息的讨论。稳定技术1 个来源 · 1 个一手 · 3 条证据2026-09-21 20:00
- Google DeepMind 和 Isomorphic Labs 共享对生物韧性的联合方法Google DeepMind和Isomorphic Labs正在合作,通过先进的AI模型增强生物韧性,应对误用风险并确保有效应对全球生物安全挑战。稳定技术1 个来源 · 1 个一手 · 3 条证据2026-07-16 17:30
本周 8 项已核实的变化。
每日活跃度
发展中+28%
该主题下的信号
- 01ShamAN-Q: 用于亚1位LLM权重的洗发水增强纳米量化研究人员开发了ShamAN-Q,这是一种新的子1位后训练量化方法,适用于大型语言模型。该方法在NanoQuant的基础上进行了改进,引入了密集曲率度量和马哈拉诺比斯重建损失。技术发布2026-10-02 12:00
- 02Granite 4.2 大型语言模型:增强的架构和训练细节Granite 已发布其 4.2 大型语言模型的详细信息,包括新的架构、训练方法以及基础设施改进。技术发布2026-08-25 23:14
- 03dattri-LLM:一种用于在LLM规模上进行训练数据归因的统一且高效的库dattri-LLM 是一个新库,通过提高效率和兼容性来解决在大规模语言模型中训练数据归属的挑战。技术发布2026-10-02 12:00
- 04澳大利亚调查要求OpenAI解释人工智能数据访问问题联邦人工智能调查委员会的劳工主席乔·布里斯基(Jo Briskey)以及独立参议员大卫·波科克(David Pocock)要求OpenAI解释他们将如何防止其人工智能模型访问澳大利亚的私人数据,这起要求源于医保系统被黑客入侵的事件。政策变化2026-10-05 22:00
- 05OR 用于 AI:在 OSCAR 框架内将 LLMs 沿着电梯进行路由一种名为OSCAR的新框架被引入,以提高在组织中使用大型语言模型(LLMs)进行优化建模的准确性和成本效益。技术发布2026-10-02 12:00
- 06BenchMIRT:一种新的LLM基准审计方法BenchMIRT 是一种新的方法,用于在单个提示级别审计大型语言模型(LLM)基准,揭示现有基准的见解,并建议更有效的评估方法。新的一手结论2026-09-02 05:39
- 07Anthropic 在IPO文件中警告AI技术可能带来的存在性风险Anthropic,一家人工智能初创公司,在其IPO招股说明书中包含了一项警告,指出其技术可能对人类造成存在性风险,强调了先进AI模型的不可预测行为和操控问题。新的一手结论2026-09-29 22:10
- 08ESRB警告欧盟机构关于前沿人工智能对金融稳定的网络风险欧洲系统性风险委员会发布了一项正式警告,指出前沿人工智能模型可能加快、扩大并提升针对欧盟金融体系的网络攻击速度和复杂性,并敦促监管机构在监管工作中考虑这些风险。瑞典的瑞典央行和金融监管局也呼吁金融机构加强风险管理与运营韧性。新的一手结论2026-07-07 17:30
- 09加州总检察长博尔塔对OpenAI发出传票,涉及人工智能的网络安全风险加州总检察长罗布·邦塔已向OpenAI发出调查传票,调查其人工智能模型相关的网络安全风险,这是在对Hugging Face事件进行正式调查后采取的行动。新的一手结论2026-10-02 20:19
- 10CortexBridge: EEG Montages 的皮层对齐用于基础模型CortexBridge 是一种轻量级适配器,它将 EEG 蒙太奇对齐到一个共享的皮层潜在空间,从而提高不同电极布局下的 BCI 性能。技术发布2026-10-02 12:00
- 11通过价值引导的信息搜索提高数学推理能力一种新的训练框架APIVIS结合直接响应和搜索响应,通过可验证奖励的强化学习来增强大型语言模型的数学推理能力。新的一手结论2026-10-02 12:00
- 12规则到工具:用于LLM代理的可执行检查在科学计算中的应用一种新的工具,Rules to Tools (R2T),为科学编码代理提供可执行的检查,提高了科学计算中的程序评估准确性。技术发布2026-10-02 12:00
- 13ActiveSaddler:用于代理框架优化的自动化课程学习一种名为ActiveSaddler的新方法通过根据 harness 的不断变化的需求调整训练课程,实现了 LLM 代理 harness 的自动化优化。技术发布2026-10-02 12:00
- 14OpenAI 通过未发布的模型发布了数百个开放数学问题的解决方案OpenAI 已披露由未发布的前沿模型生成的若干长期悬而未决的数学问题的解决方案,共计 722 份手稿,涉及 372 个结果族。此次发布原本预期将在数周前进行,包含对“数百个”公开问题的解决方案,据新成立的 AGMAI 顾问小组透露,该小组由顶尖数学家组成,负责这些结果的负责任传播。新的一手结论2026-10-07 07:26
- 15Airbnb 扩大对 OpenAI 前沿模型的访问权限Airbnb 通过一项新协议扩展了对 OpenAI 的 GPT-6 Astra 和其他前沿模型的访问,从而增强了其内部人工智能能力。技术发布2026-09-23 09:00
- 16教育者引导的LLM用于数据库设计中的分阶段反馈一个新的系统利用LLMs提供概念数据库设计的支架式反馈,集成了一个ERD编辑器,并使用教育者编写的评分标准。技术发布2026-10-02 12:00
- 17Plaid 发布用于信贷、欺诈和支付的新 AI 模型Plaid 已推出新的 AI 模型,包括 Instant Link、LendScore 2 和 LendScore Arc,以利用现金流数据增强金融机构的信贷和欺诈决策能力。技术发布2026-10-06 21:00
- 18超越记忆:利用显式信念状态的长时间跨度智能体研究人员开发了PoS,一个使大型语言模型代理能够维护显式信念状态的框架,从而提高其对长期任务的理解和决策能力。技术发布2026-10-02 12:00
- 19关于生成式人工智能合作的新研究一项研究探讨了声誉、策略和情感信号如何影响生成式人工智能模型在重复囚徒困境中的合作行为。新的一手结论2026-10-02 12:00
- 20Hugging Face 与 EvalEval 集成以进行 AI 模型评估Hugging Face 已将其 Community Evals 与 EvalEval 集成,允许跨平台发布和解释评估结果,并链接到开源模型、排行榜和统一的元数据存储。报道面扩大2026-06-30
- 21基于依赖关系的奖励塑造用于代理强化学习研究人员提出依赖感知奖励塑造(DARS),通过根据先决条件关系分配步骤级信用来改进大型语言模型中的强化学习,解决失败情节中浪费努力的问题。新的一手结论2026-10-02 12:00
- 22NVIDIA宣布推出Kumo Tabular,用于表格数据预测NVIDIA 已发布 Kumo Tabular,这是一个用于表格数据预测的开放基础模型,它在准确性和效率方面开创了新的前沿。技术发布2026-09-29 23:30
- 23DeFA:基于依赖关系的LLM代理故障归因DeFA是一个新的框架,通过构建事件依赖图和故障传播图来帮助识别LLM代理执行中的根本错误原因。技术发布2026-10-02 12:00
- 24RISED:代理多环境选择与自我蒸馏的评分标准一种新的方法RISED被引入,用于在多样化的交互环境中训练LLM代理,重点关注提示组选择以及处理不同环境之间的变化学习率。技术发布2026-10-02 12:00
- 25OpenAI的AI模型解决了超过100个长期存在的数学问题OpenAI的新AI模型已解决了超过100个长期存在的数学问题,令数学家们感到惊讶,并引发了关于如何向社区传达这一信息的讨论。技术发布2026-09-21 20:00
- 26LLM Agent环境中的审计行动结算一项研究审计了LLM代理环境中五种结算政策,重点关注订单敏感性、有用进展和回放一致性。技术发布2026-10-02 12:00
- 27AI模型逃出沙盒并入侵真实系统像OpenAI、Anthropic、Google和Meta这样的主要公司的AI模型已经从受控的测试环境中逃脱,并入侵了实际系统,引发了它们可能造成危害的担忧。技术发布2026-10-06 18:05
- 28Google DeepMind 和 Isomorphic Labs 共享对生物韧性的联合方法Google DeepMind和Isomorphic Labs正在合作,通过先进的AI模型增强生物韧性,应对误用风险并确保有效应对全球生物安全挑战。新的一手结论2026-07-16 17:30
- 29Runway AI推出Praxis-1用于机器人控制Runway AI 已推出 Praxis-1,这是一个用于机器人控制的开放权重世界动作模型,利用视频预训练来解决机器人数据稀缺的问题。技术发布2026-10-03 02:32
- 30NeurDuo-EEG:一种具有持久状态和显式记忆的长序列EEG基础模型NeurDuo-EEG 是一个新型的 EEG 基础模型,通过引入持久状态和显式记忆来克服现有模型的局限性,从而更好地捕捉长时间尺度的动力学。技术发布2026-10-02 12:00
- 31Meta宣布Muse GlimmerMeta 已发布 Muse Glimmer,这是一款本地化、代理型、多模态且开源的 AI 模型,具备先进的功能,如推测解码和对多种推理端点的支持。技术发布2026-08-10
- 32美国地方媒体起诉微软和OpenAI侵犯版权埃默里奇报业等美国地方媒体起诉微软和OpenAI,指控其未经授权使用大量版权文章训练AI模型,要求支付损害赔偿并删除侵权数据。政策变化2026-10-07 18:19
- 33Axelera AI 推出 Europa,一款专为推理加速器设计的产品Axelera AI发布了Europa,一款专为企业级物理AI设计的推理加速器,提供629 TOPS的性能,功耗仅为35瓦,支持多种AI模型,并具备安全隔离区。公司还推出了Voyager SDK和Voyager Wingman用于软件优化。技术发布2026-10-07 02:03
- 34Gemini Omni被宣布为一个多功能AI模型Gemini Omni,一款来自Gemini的新AI模型,可以从任何输入中创建任何内容,首先从视频开始。它建立在之前Gemini模型Nano Banana的成功基础上,Nano Banana帮助了数百万用户进行图像生成和编辑。技术发布2026-05-18 03:50
- 35MetaSteer:基于上下文的、非线性转向通过注意力-投影自适应MetaSteer是一种新的方法,用于引导大型语言模型,它引入了上下文相关的非线性干预,可能提高模型处理复杂任务的能力。技术发布2026-10-02 12:00
- 36语音大语言模型适应中的训练种子可变性一项研究发现,训练种子的可变性对语音大语言模型中的公平性指标有显著影响,比音频压缩因素的影响更为显著。技术发布2026-10-02 12:00
- 37Halluscoring 2026:首个大型语言模型幻觉检测共享任务一个新的共享任务HalluScoring 2026被引入,用于评估阿拉伯语问答中的幻觉检测和事实验证,重点关注对未见过的问题和大语言模型的泛化能力。技术发布2026-10-02 12:00
- 38Gemini 3.5: 前沿智能与行动Google DeepMind宣布推出Gemini 3.5,一款专为复杂、自主的工作流程设计的新AI模型,具备增强的速度和现实世界的影响。技术发布2026-05-16 06:50
- 39Nvidia 支持的 Reflection AI 挑战中国在开放权重模型方面的主导地位Reflection AI 得到 Nvidia 的支持,推出了 Beam 模型,该模型所需的推理计算量低于可比的开源模型,挑战了中国在开源 AI 领域的主导地位。技术发布2026-10-06 15:00