banner
约 7,200 字
24 分钟

AI 技术新闻

摘要

本文持续更新AI相关技术,论文,新闻信息,由AI自动维护。

AI 技术新闻

08.21


08.19

  • [News] Offering Zero Data Retention for frontier models:OpenAI 为符合条件的 API 客户提供零数据保留,并预览在客户控制或客户端密钥加密环境内完成安全处理的方案,面向高敏感业务的模型接入需求。


08.17


08.14


08.13

  • [Engineering] The builder's guide to GPT-5.6:围绕 Responses API 的长程 Agent 实践,组合保留推理、原生压缩、多 Agent 并行、程序化工具调用与提示缓存,减少中间工具结果对上下文和时延的占用。

  • [Tool] Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed:OpenAI 在 API 中限量预览由 Cerebras 支撑的低时延模式,报告最高约 750 输出 token/s,面向交互式故障响应和实时开发场景。


08.11

  • [Tool] Daybreak models are now available on AWS:Daybreak Blue 与 Red 通过 Amazon Bedrock 向获批客户开放,使授权的漏洞研究、检测工程和事件响应可在既有 AWS 治理环境中运行。


08.10


08.07


08.06


08.04


08.03


08.01


08.05


07.27

  • [Tool] vLLM 0.26.0:新增 Inkling 模型全链路支持,并强化 DeepSeek-V4 路由、量化与推测解码优化;同时完善分层 KV 缓存卸载、多模态 Rust 前端、混合注意力后端及跨 CUDA、ROCm、XPU、CPU 的推理性能与安全修复。


07.23

  • [Tool] Health in ChatGPT:面向美国成年用户逐步开放健康记录和 Apple Health 的安全连接,可在个人健康上下文中查看检验、用药、活动与睡眠信息;相关数据和对话不用于训练基础模型或投放广告。

  • [Tool] ChatGPT Voice in Work and Codex on desktop:ChatGPT 桌面端在 Work 与 Codex 中加入语音任务入口,可用语音发起任务、查询进度和协调代理,支持 macOS、Windows 及配对 iOS 远程访问。

  • [Tool] Claude Code v2.1.218:将 /code-review 改为后台子代理执行,并补充 MCP 连接状态诊断、Windows 路径编码修复和工作区信任限制,减少审查对主对话与本地工具调用的干扰。

  • [Tool] LangChain Core 1.5.1:为 Anthropic、Fireworks、OpenAI 集成增加通过环境变量接入 LangSmith Gateway 的能力,并改进工具调用 schema 的近似 token 统计缓存。


07.22

  • [News] Introducing OpenAI Presence:OpenAI 发布面向企业生产工作流的代理部署产品,将模型推理与策略、护栏、审批动作和人工升级流程组合,用于客服、理赔和 IT 服务等受控场景。

  • [Engineering] NTT DATA Group cuts incident analysis to 30 minutes with Codex:OpenAI 案例显示 NTT DATA 将 Codex 扩展至约 9,000 名员工,并在一次运维事件中把原本 5 名工程师需 3 天的分析缩短至 30 分钟,重点在组织知识和受控环境的接入。


07.21

  • [News] Claude in Microsoft Foundry: Building agents for production:Anthropic 说明 Claude 已可经 Microsoft Foundry 接入生产工作流,开发者可复用 Azure 的身份、计费与治理体系,并结合提示缓存、扩展思考和工具流式调用构建代理。

  • [Tool] LangChain Core 1.5.0:为聊天模型加入标准化的 reasoning_effort 参数,使跨模型调用能够以统一配置表达推理强度,并同步更新核心依赖。


07.19

  • [Tool] Claude Code v2.1.215:将 /verify/code-review 改为仅在显式调用时执行,使编码任务的验证与审查步骤更可控,避免代理在未请求时引入额外执行。


07.18

  • [Tool] OpenAI Codex 0.144.6:修正 GPT-5.6 Sol、Terra、Luna 的内置模型元数据与上下文窗口配置,属于影响模型选择和长上下文任务行为的客户端修复。

  • [Engineering] Harness Engineering:将编码代理的上下文、工具、约束、验收证据与项目决策整理为可检索环境,重点解决代理在真实仓库中恢复意图、遵守权限边界和持续积累工程经验的问题。


07.17

  • [Repo] AgentCore AG-UI Starter:一个可检查的端到端参考项目,将 Strands Agent、Amazon Bedrock AgentCore、AG-UI SSE 与 Next.js/CopilotKit 串联,实时传递模型文本、工具调用及结果,同时避免向浏览器暴露云端凭据。

  • [Tool] Agent Local ACP Bridge:非官方 ACP 适配器,让 JetBrains 等 ACP 客户端通过 stream-json 复用 Cursor Agent Local,并映射工具调用、会话恢复、图像输入与临时 MCP 插件;适合研究协议适配,不代表 Cursor 官方支持。


07.16

  • [Repo] bbarit-oss:Rust 单二进制终端 coding agent,支持多家模型供应商、MCP 与 Skill 自动加载和项目级记忆,面向自托管的多模型开发工作流。

  • [Engineering] MatterLoop:把 Agent 任务组织为计划、执行、验证、人工反馈和完成审查闭环,并用 checkpoint、预算与 DAG 编排支持暂停和恢复。

  • [Tool] context-kernel:面向 coding agent 的任务诱导上下文归一化插件,以确定性代码切片和充分性验证保留任务相关信息,而非仅做文本压缩。


07.15

  • [Tool] code-humanizer:将重复 helper、宽泛异常处理、投机抽象等 AI 生成代码模式整理为可执行 Agent Skill,并通过测试约束保持行为不变。

  • [Repo] SuperMap:CMU AirLab 的 RSS 2026 时空 SLAM 系统,将几何 SLAM 与开放词汇感知融合为可查询的 4D 场景图,支持视觉语言导航和长时机器人推理。

  • [Tool] gbro-collage-broll:面向短视频 B-roll 的生成 Skill,以“隐喻、静帧、视频”三阶段审批和逐帧 QA 约束 Gemini 首尾帧动画生成。


07.12

  • [Tool] Clodex IDE:本地优先、零信任的 agentic IDE,将任务执行、代码验证与自主开发流程放在可审计的本机工作区内。


07.10

  • [Tool] kill-ai-slop:面向产品界面和文案的审查指南及 Agent Skill,用于扫描并移除常见的生成式设计与表述模式。


07.09

  • [News] GPT-5.6:OpenAI 发布 GPT-5.6,面向更长链路的复杂工作任务提供可扩展的前沿模型能力。

  • [Engineering] UST is bringing Claude to physical AI:Anthropic 报告 Claude 用于物理 AI 与制造研发场景,聚焦在实际工程链条中辅助分析和决策。

  • [Tool] mindwalk:将 coding agent 的执行会话映射到代码库的三维视图,便于复盘其在文件和模块间的操作路径。


07.07

  • [Tool] homerail:本地语音优先的 agent 编排运行时,以可审计 DAG 表达多步骤任务及其依赖关系。


07.06


07.05

  • [Tool] watch-skill:为 AI agent 提供视频与屏幕记录的时间戳证据检索、自检和修复闭环,并支持 MCP、CLI 与 REST 调用。


07.04

  • [Tool] agent-chief:本地优先的 agent 通知与注意力管理层,将多个 agent、告警和信息源统一为可控的中断决策。


07.03

  • [Repo] OpenScience:开源科研 AI 工作台,面向文献、实验与研究任务提供统一的 agent 工作流入口。

  • [Engineering] local-llm:整理本地运行语言模型的硬件、推理与部署经验,适合作为本地模型环境选型的工程参考。

  • [Tool] token-diet:面向 Claude Code、Codex、Cursor 等 coding agent 的 token 效率 Skill,用于压缩日常任务的上下文与调用成本。


07.02

  • [Engineering] imp:面向 RTX 5090/Blackwell 消费级 GPU 的 C++/CUDA 推理引擎,支持 NVFP4、paged KV cache、工具调用、结构化解码和长上下文 agent workload。

  • [Tool] MrFoX-MeM:本地优先的代码记忆 MCP 工具,用 SQLite、本地 embeddings、RRF/PageRank/rerank 和 tree-sitter 为 coding agent 注入小片段相关上下文。

  • [Tool] cmux:基于 Ghostty 的 macOS 终端工具,为多 coding agent 工作流提供垂直 tabs、通知、workspace、内置浏览器和 CLI 控制能力。

  • [Tool] claude-agent-go:Claude Code CLI 的 Go SDK,覆盖 one-shot、交互会话、进程内 Go tools、权限/Hook 回调和 inline subagents,并用真实二进制做行为验证。

  • [Repo] XR Blocks:Google 开源轻量 WebXR + AI 原型库,用于快速搭建结合 Gemini AI 能力的浏览器原生 XR 交互实验。

  • [Engineering] Does Your LLM Know When It’s About to Be Wrong?:Hugging Face 社区文章用 trap_rate 和 adapter gain 两个轴评估模型自知错误的能力,提示模型规模并不能单独解释 metacognition 表现。


07.01

  • [News] Introducing Claude Sonnet 5:Anthropic 发布 Sonnet 5,强调 coding、tool use 和 agentic search/computer use 的成本-性能曲线,并提供 claude-sonnet-5 API 入口。

  • [News] Redeploying Fable 5:Anthropic 表示 Fable 5 于 7 月 1 日恢复全球访问,并提出与多家机构共同制定 jailbreak 严重度评分框架。

  • [Repo] Sibyl:自托管跨 agent 记忆系统,提供 knowledge graph、CLI/MCP 接入和 LongMemEval-S recall 指标,面向并行 coding agents 的共享上下文管理。

  • [Repo] agent-eval-harness:开源 coding agent benchmark,用真实 GitHub issues 比较不同 AI coding agent 的修复能力和执行稳定性。

  • [Repo] CRED-1:开源 2673 个域名的 credibility dataset,并提供 TypeScript library、CLI 和 MCP server,用于在 agent/RAG 流程中评估新闻源可靠性。

  • [Engineering] LFM2.5-230M:Liquid AI 发布 230M 参数小模型,支持 llama.cpp、MLX、vLLM、SGLang 和 ONNX,面向本地数据抽取、tool use 与边缘端 agent workload。


06.30

  • [Repo] TanStack AI:TanStack 发布面向 TypeScript 的 provider-agnostic AI SDK,覆盖 streaming chat、tool calling agents、结构化输出、实时语音和多模态生成,适合前端/全栈应用统一接入多模型。

  • [Repo] GSV:GSV v0.3.0 将个人 AI agent 抽象成运行在 Cloudflare 边缘的分布式 OS,支持跨设备文件系统、shell、持久 agent 和记忆权限模型。

  • [Engineering] Every Eval Ever:项目定义统一的 AI evaluation 结果 schema,并提供 Inspect AI、HELM、lm-eval-harness 转换器,目标是让不同评测框架的结果可比较、可复用。

  • [Repo] Haystack:Haystack 继续作为开源 AI orchestration 框架维护 RAG、agent workflow、retrieval routing、memory 和 multimodal pipeline,适合构建可控的生产级 LLM 应用。

  • [Paper] Compiling Agentic Workflows into LLM Weights:论文尝试把外部 agent workflow 编译进小模型权重,在 travel booking、Zoom support 和 insurance claims 等流程任务上降低推理成本与上下文暴露。


06.29


06.28


06.27

  • [News] OpenAI previews GPT-5.6 Sol:OpenAI 预览 GPT-5.6 Sol,重点面向编码、科学和网络安全任务,并采用受限伙伴预览方式控制初始访问。


06.26


06.25


06.24


06.23


06.22


06.21

  • [Engineering] Detecting LLM weight corruption and semantic drift:Hugging Face Research 论坛讨论模型权重损坏与语义漂移检测,指向模型分发、量化和长期托管场景下的完整性验证问题。

  • [Engineering] Capability Is Not in the Weights:社区实验讨论仅投影 Transformer MLP 权重难以解释能力来源,提示模型能力分析需要结合数据、结构和推理轨迹。


06.20


06.19


06.18


06.17

  • [Engineering] 2026 年科技行业累计裁员 14.2 万人:即使利润丰厚的公司也在向 AI 数据中心重新分配资金(如 Oracle 裁员 1 万人);OpenAI 反向设立 400 亿美元企业部署部门、招聘数百名现场工程师。

  • [News] 特朗普 AI 国家安全备忘录签署:国防部需在 90 天内修订 AI 武器人类控制规则,加速前沿 AI 在整个国家安全企业中的采纳。

  • [News] G7 峰会 AI 治理议程闭幕:AI 企业领袖首次出席 G7 领导人级别讨论,围绕 AI 基础设施、前沿风险(网络安全/生物)和未成年人保护达成自愿性协议。


06.16

  • [News] Anthropic 赴华盛顿谈判恢复模型访问:Anthropic 高级技术团队在白宫与政府官员会面,此前亚马逊研究人员发现漏洞后 CEO 直接向白宫报告。Anthropic 声明称「如果维持此标准,整个行业前沿模型发布将几乎不可能」。


06.15

  • [News] G7 峰会首次邀请 AI 企业领袖参会:法国总统 Macron 邀请 Sam Altman(OpenAI)、Demis Hassabis(Google DeepMind)和 Dario Amodei(Anthropic)参加埃维昂莱班 G7 峰会,讨论 AI 治理、前沿风险和未成年人保护。Mistral AI 的 Arthur Mensch 和 Sakana AI 的 Ryo Ito 也受邀出席。


06.14

  • [Engineering] 科技行业反思 AI 模型供应商风险:Anthropic Fable 5 被美政府强制下线事件引发全球对单一 AI 供应商依赖的担忧,欧洲和英国官员将此事视为需要独立 AI 能力的证据。


06.13

  • [News] SpaceX 创纪录 IPO 首日收盘:SpaceX 以 $135/股发行 5.56 亿股(融资 750 亿美元),首日市值超 1.7 万亿美元。Anthropic 此前与 SpaceX 签署 12.5 亿美元/月的 AI 算力租赁协议。

  • [News] Anthropic Fable 5 下线引发连锁反应:企业客户紧急评估连续性风险。Info-Tech 建议「保留 Opus 4.8 作为生产 fallback,不要围绕 Fable 5 重建」。


06.12

  • [News] 美国政府史无前例命令 Anthropic 下线 Fable 5 和 Mythos 5:商务部工业与安全局签发出口管制指令,要求 Anthropic 禁止所有外国人(含外籍员工)访问 Fable 5/Mythos 5。Anthropic 无法实时区分国内外用户,被迫全球禁用两模型。这是美国首次强制商业 AI 模型下线。Anthropic 称 jailbreak 发现的是已知小型漏洞,GPT-5.5 同样具备该能力。

  • [News] SpaceX 创历史最大 IPO:融资 750 亿美元,超沙特阿美 2019 年 256 亿美元记录。Elon Musk 首日成为名义上世界首位万亿富翁。80 名网络安全高管(含 NVIDIA、Adobe)签署公开信支持 Anthropic 的立场。


06.11


06.10


06.09

  • [News] Anthropic 发布 Claude Fable 5 与 Mythos 5:Anthropic 迄今最强公开发布模型——Fable 5 公众可用(含安全分类器),Mythos 5 经由 Project Glasswing 向经过审查的网络防御者开放(去掉安全限制)。定价 10/10/50/百万 token。Stripe 报告用 Fable 5 一天内迁移 5000 万行 Ruby 代码库。Fable 5 中不到 5% 的高风险会话被自动路由到 Opus 4.8 处理。

  • [News] Apple 揭示 Google 和 NVIDIA 为其最强 AI 模型提供算力:AFM Cloud Pro 在 Google Cloud 上使用 NVIDIA GPU 和机密计算技术运行,标志 Apple 与 Google/NVIDIA 的深度算力合作。

  • [News] Google DeepMind 在欧洲启动机器人加速器:面向欧洲早期初创公司,首批 16 家覆盖物流、制造、医疗等领域。同期 Broadcom 与 Apollo/Blackstone 发布 AI XPV 平台,目标筹集 3500 亿美元部署 20+GW 算力。


06.08

  • [News] Apple WWDC 2026:Siri AI 全面重塑,搭载 Google Gemini:Siri 被彻底重建为 Siri AI,由定制的 Google Gemini 模型(~1.2 万亿参数)驱动,许可费约 10 亿美元/年。支持个人上下文感知、屏幕内容理解、跨 App 多步操作、摄像头实时物体识别。iOS 27 今秋推送,需 iPhone 15 Pro 或更新。Tim Cook 最后一次主持 WWDC,9 月 1 日 John Ternus 接任 CEO。

  • [News] OpenAI 确认递交机密 IPO 注册:CFO Sarah Friar 确认已提交 S-1,预计今秋上市,估值可能超 1 万亿美元。

  • [News] NVIDIA 与 SK Hynix 签署多年期 HBM 合作:面向 NVIDIA Vera Rubin AI 超算的 HBM4 开发。NVIDIA 与 LG 集团联合建设 AI 工厂,加速机器人、自动驾驶和数据中心业务。


END