09-13-日报
AI 日报中心

爱窝啦 AI 日报

每日 AI 行业动态、产品更新、前沿研究、开源项目与社媒信号

今日摘要

OpenAI 把 Agents API 独立拆分,开发者可按需组合工具调用与状态管理。
产品线拆分、系统提示词泄露和评测争议指向同一件事:开发者正在争夺对 AI 能力的定义权和使用权。
今天先看开源项目栏的 AI 代理工具,再读焦点第 6 条关于 AGI 瓶颈的讨论。

🔥 今日焦点 TOP 10

1. OpenAI 把 Codex 能力拆成四条产品线

Agent 不再打包卖了。 OpenAI 昨天 发布四条产品线 ,包括 Agents API、GPT-Live-1 API、Data agent 和 ChatGPT for Financial Services。Agents API 把原本集成的多步骤执行、工具调用和状态管理拆成独立模块。开发者可以按需组合。语音 API 支持实时对话,数据 agent 处理结构化查询。金融版针对合规场景定制了权限与审计功能。四条线各自解决具体问题。

OpenAI 产品线发布
OpenAI 产品线发布

2. 系统提示词泄露仓库收录主流模型内部指令

又一轮提示词被扒出来了。 asgeirtj/system_prompts_leaks 收录了主流模型的系统提示词 。包括 Claude Fable 5.1、Opus 5,GPT-6-Astra、Codex,Gemini 3.8 Flash、3.1 Pro,以及 Grok、Cursor、Kimi 等工具。仓库今天新增 217 Stars,总计 65406 Stars。这些提示词揭示了各家在角色定位、安全边界和交互风格上的差异。适合研究模型行为设计的开发者参考。

3. 苹果新 CEO 首次受访谈折叠屏与 AI 布局

Ternus 接手后首次受访。 John Ternus 刚在秋季发布会上推出 iPhone Duo 折叠屏、iPhone 18 Pro 可变光圈和新 Apple Watch。随后 接受 Tom’s Guide 与 TechRadar 采访 。他解释了折叠屏的技术权衡、AI 功能如何融入硬件设计。以及苹果在隐私与设备端计算上的长期布局。Ternus 是库克时代培养的产品与工程负责人。这次访谈展现了他比前任更愿意讨论技术细节的风格。

苹果新品发布会
苹果新品发布会

4. 汗青 AI 虚拟演唱会大屏呈现没有恐怖谷

半身人脸在巨幕上依然精细。 歸藏在汗青的 Yuri 虚拟演唱会现场看到, AI 生成的人脸在大屏幕上呈现时表现精细 。唱歌声音与说话声音保持一致。音频质量和音乐制作水平都很高。这场演唱会展示了 AI 在视频、音频和音乐结合上的完整工作流。汗青在这个方向上的技术积累已经可以支撑线下大型活动。

汗青 AI 演唱会现场
汗青 AI 演唱会现场

5. Assistant Benchmark 从真实任务评测 AI 助手

不看跑分,看实际干活。 Assistant Benchmark 从 邮件处理、旅行规划、购物、记忆和多步骤任务 等维度评估 AI 助手。这个榜单不测推理速度或参数量。而是看模型能否在真实使用中完成完整任务。各家助手在不同场景的表现差异明显。有的擅长结构化任务,有的更适合开放问题。想了解 AI 助手实际能帮到什么程度可以参考这个榜单。

Assistant Benchmark 榜单
Assistant Benchmark 榜单

6. 三位 AI 研究员讨论 AGI 瓶颈与时间表

现实任务比编程题难得多。 Dwarkesh Patel 邀请三位研究员 探讨 AI 发展瓶颈 。他们指出,模型在编程和数学上进步快是因为结果易验证。但现实工作充满模糊性,需要理解人际背景、判断优先级和直觉。这些目前很难通过训练快速掌握。高质量人类数据正在耗尽,未来依赖模拟环境和强化学习。但 AI 相互生成数据可能导致局部最优。关于 AGI 时间表,有人认为两三年内 AI 能带来十倍效率提升。也有人认为独立接管复杂综合工作还需五到十年

7. 菲尔兹奖得主抨击 AI 公司基准设计

数学家不满被当成跑分工具。 陶哲轩发文称,25 位菲尔兹奖得主 联合签署公开信 。抨击 AI 公司将解决著名数学难题当作衡量模型能力的基准。认为这对数学科学和共同体造成伤害。矛头指向 OpenAI 本月初的高调发布。数学界认为,这些基准不反映真实数学研究过程。也不尊重数学问题本身的价值。

菲尔兹奖得主公开信
菲尔兹奖得主公开信

8. SemiAnalysis 指 Gemini 和 Muse 刷榜痕迹明显

榜单数据出现反常波动。 SemiAnalysis 在 9 月 8 日 连发五条推文 。点名 Gemini 3.8 FlashMuse Spark 1.3 是刷榜痕迹最明显的两个模型。在 Terminal-Bench 2.1 榜单上,这两个模型的表现与其他评测结果差异较大。分析机构提供了具体数据对比作为证据。这次质疑引发了关于评测透明度和模型真实能力的讨论。

刷榜证据对比
刷榜证据对比

9. 向阳乔木在 AGI Bar 录制播客第二期

除了不能聊的,都聊了。 向阳乔木今天上午 在 AGI Bar 录制播客 ,预计明天发布。现场有到场朋友参与。这是『Next Token』第二期。延续了上期的开放讨论风格

播客录制现场
播客录制现场

10. AGI Bar 出现 logo 互压小插曲

酒吧墙上的 logo 位置也是战场。 有人在上海 AGI Bar 发现, 某家公司的 logo 被贴在了另一家上面 。这种朴实的争夺方式引发了不少调侃。AGI Bar 是 AI 从业者常去的线下据点。墙上贴满了各种项目和公司标识。这次小插曲反映出即使在非正式场合,品牌曝光的竞争也没有停下。

AGI Bar logo 墙
AGI Bar logo 墙


⚡ 产品与功能更新

Tripo 官方发布三维角色完整制作教程

拆开生成比一次成型更稳。 Tripo 官方刚刚发布了 三维角色模型制作教程 。从图生成 3D 模型到组装、绑定、表情和动画,覆盖完整流程。关键技巧是先把角色拆成身体、头部和头发三个部件。分别在 Tripo 生成 3D 资产,再导入 Blender 用 Astra 完成组装。整个人物一次生成容易出现脸崩、头发粘连或服装细节混乱。拆开后每部分可以单独检查和重新生成。教程分 7 步,从准备参考图到最终渲染动画。

土区 ChatGPT Plus 订阅费回落至 499 里拉

部分用户续费价格恢复低价。 有用户在 V2EX 发帖称, 土区 ChatGPT Plus 自动续费按 499 里拉扣款 。此前曾涨至 999 里拉。该用户最早以 499 里拉订阅,后升级为 5x Pro 用了一个月。回归 Plus 时遇到涨价,现在续费价格又回到 499。目前不清楚这是个别账号调整还是全面恢复低价。需要确认自己账号实际扣款金额。

土区 ChatGPT 订阅价格截图
土区 ChatGPT 订阅价格截图


⌘ 开源 TOP 项目

Shubhamsaboo/awesome-llm-apps:100+ AI 代理与 RAG 应用集合

Shubhamsaboo/awesome-llm-apps 收录了 100 多个 AI 代理、技能和 RAG 应用 。项目免费开源,提供 Python 实现。今天新增 230 Stars,总计 137629 Stars。适合需要快速找到参考实现或学习 LLM 应用开发模式的开发者。

max-sixty/worktrunk:专为并行 AI 代理设计的 Git 工作树管理工具

max-sixty/worktrunk 是一个 用 Rust 编写的 Git 工作树管理 CLI 工具 。专为并行 AI 代理工作流程设计。今天新增 54 Stars,总计 7236 Stars。当多个 AI 代理同时处理不同分支时,这个工具可以简化工作树切换和管理。适合正在构建多代理协作系统的开发者。

vxcontrol/pentagi:自主执行渗透测试的 AI 代理系统

vxcontrol/pentagi 是一个 完全自主的 AI 代理系统 。能够执行复杂渗透测试任务。项目用 Go 编写,今天新增 189 Stars,总计 23452 Stars。适合安全研究人员和渗透测试工程师探索 AI 在安全领域的自动化能力。


◉ 社媒精选

Gergely Orosz 观察到的软件行业趋势

IDE 使用频率在下降。 Gergely Orosz 列出了几个软件行业趋势 :VSCode 和 IntelliJ 这类 IDE 的使用频率越来越低。公司不再追求 Token 消耗排行榜。代码审查因 AI 生成代码过多而名存实亡。开源模型能力接近商业模型,可以大幅节约成本。中层管理岗位大幅减少。有 AI 后工作反而更累。招优秀工程师还是很难。这些是他从多个公司观察到的变化。

软件行业趋势
软件行业趋势

AGI Bar 出现 logo 互压现象

除了浇发财树,还能贴 logo。 有人在上海 AGI Bar 发现, 某公司的 logo 被贴在了对手上面 。这种朴实的品牌竞争方式引发了调侃。AGI Bar 是 AI 从业者常去的线下据点。墙上贴满了各种项目和公司标识。

AGI Bar logo 墙
AGI Bar logo 墙


😄 AI趣闻

渗透测试专家方法论被打包成 Claude 技能

安全研究者最近做了件事。把 SQL 注入、shellcode、EDR 绕过这些攻击手法整理成结构化的 SKILL.md 文件。让 Claude 直接学会渗透测试专家的方法论 。这个叫 Claude-Red 的项目已经有 3585 Stars。每个技能文件像是给 AI 准备的攻击教科书。从侦察到利用都有模板。开发者的初衷可能是辅助安全测试。但这也意味着攻击门槛又降了一截。以前需要多年经验积累的技能,现在 AI 翻翻文档就能复现。安全研究和实际攻击之间的界限,现在只剩下使用者的意图。


❓ 相关问题

OpenAI Agents API 国内怎么用?

OpenAI Agents API 需要有效的 OpenAI API 密钥才能调用。 36氪 对这项消息的报道 包括 Agents API、GPT-Live-1 API、Data agent 和 ChatGPT for Financial Services。API 按实际调用的 Token 和功能模块计费。国内开发者通常需要解决网络访问和支付方式问题。具体费率参考官方价格页。

需要进一步比较当前公开的 AI 账号或订阅服务时,可查看 爱窝啦·AI账号店 ;商品、价格与可用状态以官网实时页面为准。

Last updated on