宝玉
OpenAI Codex 承诺连续 28 天:每天上新,否则重置额度 OpenAI 给 Codex 用户立了个 28 天的规矩:每天要么上线一项多数人用得上的明显改进,要么给大家把用量额度整个重置一次。
宝玉
马斯克的这三条确实适合用在 AI Agent 身上,可惜 Agent 不怕你开除它: --- 马斯克:如果我发送了一封带有明确指令的电子邮件,管理人员只能采取以下三种行动: 1. 回复邮件向我解释为什么我说的有误。有时候我也确实会犯错! 2. 如果我说得模棱两可,要求进一步澄清。 3. 执行指令。 如果以上三点都没有做到,该管理人员将被要求立即辞职。
宝玉
我把后面这一段单独摘出来放评论: 很多人看完这期访谈会觉得,以后自己也可以像 Lauren 那样不 Review PR 了,装上她的 Skill,让模型帮忙验证一下就行。我自己现在的做法和她差不多,每天也有大量 PR,也不 Review。但我的建议是先别急着学她怎么做,先弄明白她凭什么能这么做。 1. 你能不能用上最好的模型,Token 够不够 在用上 Fable 和 Opus 5.5 之前,AI 写的代码我是不太放心的;用上之后,我才真的敢让 AI 去写而不怎么 Review。模型能力很重要,能力没到,就先别想这件事。 还有成本。像我这样没有大公司可以依靠的,得自己掏钱买 2 个 Claude Max 20x 账号,还得省着用。Lauren 在大公司,不用考虑 Token 消耗,全程用最好的模型、开最快的模式都没问题。 不过也别着急。Fable 这个级别的模型,也许半年以后就能像现在的 DeepSeek V4.1 Flash 一样便宜,人人用得起。梁圣加油。 2. 不能完全依赖 AI 的验证 哪怕现在 GPT-6 操作电脑的水平已经超过真人了,让它去做验证,也只能替代一部分,不能真的全交给它,自己还是要看。 可以做的是把那些手动重复做的事情,一点点沉淀成 Skill 和自动化脚本,把体力活解放出去。 3. 方向得靠你自己的专业来指 再聪明的 AI,也没办法替你决定该往哪个方向走。就像给车子装上火箭发动机,也得你来告诉它往哪开,走偏了要及时调整,不然跑得再快也是南辕北辙。 做软件也一样。你不能指望一句提示词做出一个淘宝。你得先做一个能发商品、能浏览的小网站,再加上用户注册,还得区分买家和卖家,然后是支付和安全,功能做完了还要扛得住很多人同时用。稍微复杂一点的软件,都没法完全依赖 AI,要人去拆解、规划,分成一个个小版本、小里程碑,做完要验证,出现偏差要重新指方向。甚至做着做着,你自己的想法都变了,AI 不可能知道你真正想要的是什么。 所以就像播客里说的:模型越来越强,卡住人的已经变成你能不能把自己想要什么讲清楚。 4. 不一定要用他们的 Skill,但要学着把事情交给 Agent 去做 Matt 和 Lauren 的 Skill 都很受欢迎,但你不一定要用。 一方面,软件工程的基础知识,现在的模型已经学得很好了。Lauren 在播客里也说,去年的 Skill 还得写清楚具体该敲哪条命令,现在这些都可以删掉,只留流程步骤,Skill 会越写越短。 另一方面,他们的开发流程和环境,跟你的很可能不一样。Lauren 的 Skill 都是从她自己的工作里总结出来的:验证技能来自她当“人肉中转站”的那段日子;另一个叫 recall 的技能,来自她每次开新对话,都得把上一个对话里的背景再讲一遍。 所以更重要的是从你自己每天的开发流程出发。那些还要你手动操作的环节,尽可能交给 Agent 去做;Agent 做顺了,再把它的操作过程沉淀成 Skill,反复迭代优化。 如果不知道从哪里下手的话,可以参考 Lauren 的办法:翻自己和 AI 的聊天记录,找那些你反复纠正、反复插手的地方。这样迭代出来的 Skill 才真正适合你,用她的话说,每个厨师都该有一套自己的刀。
宝玉
我记得半年前我说自己不怎么 Review PR 了,评论区很多人不认同,觉得这样不靠谱。现在再看,不 Review PR 的人越来越多。比如我刚看的这期播客,在 SpaceXAI 做 Grok Bot 的 Lauren Tan,一个月合并 2500 个 PR,也是不逐个 Review 的:晚上让 AI 自己检查、自己合并,第二天早上她再抽查。 不 Review 不等于不管质量,她靠另外两个办法来保证: 一是让 AI 能像真人用户一样把程序用一遍,自己发现问题; 二是给代码定下很多规矩,让 AI 很难写出烂代码。 她把自己这套做法写成了一组 Skill,公开了出来,叫 pstack。 顺便说一下,这期播客的主持人 Matt Pocock 原本是知名的编程课讲师,他公开的技能库在代码托管网站 GitHub 上有二十多万个星标,是最受欢迎的技能库之一,所以这期算是两位同行对谈。Lauren 之前在 Meta 做网页开发框架 React,今年 3 月加入 AI 编程工具公司 Cursor;Cursor 今年 8 月被 SpaceX 收购,并入旗下的 AI 部门 SpaceXAI。 根据播客的内容,我把 Lauren 的这套做法简单总结一下,我自己的点评在结尾处。 一、先让 AI 能检查自己干的活 Lauren 说,就算不用她的 pstack,每个人最该有的一项技能也是“验证”:给 AI “手和眼睛”,让它能把自己写的程序跑起来,像普通用户一样点一遍,看看结果对不对。 这是她吃过亏之后得出的结论。今年 4 月她在 Cursor 解决一个窗口卡顿的问题,一开始全靠手工:她自己去看各种性能数据,再把看到的转述给 AI,AI 改完她再去看。她形容自己成了 AI 和检测工具之间的“人肉中转站”。她在 Cursor 写的第一个技能就是验证。在这之前,AI 看不到自己改动的效果,只能等她来回传话;有了验证,AI 可以自己改、自己看结果、不满意再改,一轮一轮往下做,不需要她守着。现在她所在的团队里每个产品都配有这样的验证技能,全团队都在用。 做这个技能时她还总结出一条原则:工作里有的部分需要动脑判断,有的部分只是照章办事,照章办事的部分应该写成固定的程序,只把需要判断的留给 AI。起因是她发现,每个 AI 在检查前都要自己从头写一遍检查用的小程序,各写各的,有的能用有的不能用,用完就扔,又慢又浪费。她把这部分做成一个现成的工具,所有 AI 直接调用。 二、AI 反复犯的错,去改规矩,不去改 AI Lauren 不喜欢“软件工厂”这个流行说法,她更愿意把自己的工作比作经营一家米其林餐厅的后厨。主厨不用亲手做每道菜,但要安排好整个厨房:食材什么时候进、怎么存,每个人用什么工具,菜按什么流程出。工程师现在也一样,不再亲手写代码,却仍然要对结果负责。她认为工程师现在最重要的工作就是把这个“厨房”布置好。没花时间布置的人,信不过 AI 的产出,只能盯着它一步步干,忙到没空改进工具,就像一直拿钝刀切菜。 她举了自己的例子。Grok Bot 最早几版的代码挤在八个巨大的文件里,每个至少一万行,AI 加新功能时就接着往里塞,越塞越乱。她后来定了规矩:每个功能必须放在自己单独的文件夹里,做一件事只允许一种写法,不合规矩的代码会被自动检查拦下来。这样 AI 加功能时不用多想,按规矩放就行。她的习惯是一直观察 AI 在哪里出错,每看到一次就问自己:能不能加一条规矩,让这种错以后根本写不出来。 不逐个检查,靠的也是这套办法。她说,开了几家餐厅的老板不可能尝每一道菜,只能抽查。她每天挑一些改动仔细看,如果只是偶然出错就算了;如果好几个 AI 都在走同一条捷径,说明该改的是规矩和工具。她的 pstack 里有一个全自动模式:每次改动都会派出一批专门负责检查的 AI,把程序打开到处点,找出问题就自己修,反复到没问题再合并。早上她翻一遍改动记录,发现不对就撤回,再补一条新规矩。 她说第一次让 AI 整夜自己合并代码时很害怕,担心半夜把线上产品弄坏,现在反而睡得更好。她也提醒,走到这一步很难,要花大量时间观察和调整,装上 pstack 并不能直接做到。Matt 问,如果改动是没法撤回的,比如会丢数据,或者是医疗、金融这类领域怎么办?她说这取决于工作成果能不能被程序自动检查,软件大部分可以,很难自动检查的领域就很难这样做,她自己也没有答案。 三、2500 次改动从哪来:她不再当传话的人 这 2500 次改动并不是她发起了 2500 次对话。用户反馈的问题散落在聊天工具、邮件和社交媒体上,以前要靠她自己去看,再转述给 AI。现在她让 Grok Bot 来盯这些渠道。Grok Bot 是 SpaceXAI 今年 8 月推出的产品,是能登录邮箱、聊天工具等各种应用、替人办事的 AI 智能体。它一发现新的问题反馈,就转给一个负责“协调”的 AI。这个协调者自己不写代码,只负责拆分任务、分派给其他 AI、盯进度,相当于她的后厨主管。 为什么不直接一个问题派一个 AI 去修?她说,一批反馈往往出自同一个根源,分开修会重复劳动,也看不出真正的毛病在哪,放在一起看才看得出来。她现在同时开着十多个这样的协调者,各管一摊。她一直在问自己一个问题:哪一步还卡在我身上,AI 为什么非得来问我?然后想办法教 AI 自己去拿到真实的信息。 她也说明,2500 次改动里新功能不占多数,很多是整理代码这类维护工作。 四、懂行的人更吃香,哪怕不会写代码 Matt 问,大家都靠 AI 了,专业知识是不是不值钱了?Lauren 的看法相反。模型越来越强,卡住人的已经变成你能不能把自己想要什么讲清楚。所以她认为,医生、律师这类在某个领域懂得很深的人,只要稍微懂一点技术、会用 AI 智能体,就能做出很好的产品。 两人都认为,技能没有什么神秘的,就是把自己的做事流程写成文字。Lauren 建议回头翻自己和 AI 的聊天记录,找出那些自己反复纠正、反复插手的地方,把它们写成技能或规矩。别人的技能可以拿来拼着用,但每个人最后都该有一套自己的,就像厨师换了餐厅也会带着自己的刀。 五、最后 很多人看完这期访谈会觉得,以后自己也可以像 Lauren 那样不 Review PR 了,装上她的 Skill,让模型帮忙验证一下就行。我自己现在的做法和她差不多,每天也有大量 PR,也不 Review。但我的建议是先别急着学她怎么做,先弄明白她凭什么能这么做。 1. 你能不能用上最好的模型,Token 够不够 在用上 Fable 和 Opus 5.5 之前,AI 写的代码我是不太放心的;用上之后,我才真的敢让 AI 去写而不怎么 Review。模型能力很重要,能力没到,就先别想这件事。 还有成本。像我这样没有大公司可以依靠的,得自己掏钱买 2 个 Claude Max 20x 账号,还得省着用。Lauren 在大公司,不用考虑 Token 消耗,全程用最好的模型、开最快的模式都没问题。 不过也别着急。Fable 这个级别的模型,也许半年以后就能像现在的 DeepSeek V4.1 Flash 一样便宜,人人用得起。梁圣加油。 2. 不能完全依赖 AI 的验证 哪怕现在 GPT-6 操作电脑的水平已经超过真人了,让它去做验证,也只能替代一部分,不能真的全交给它,自己还是要看。 可以做的是把那些手动重复做的事情,一点点沉淀成 Skill 和自动化脚本,把体力活解放出去。 3. 方向得靠你自己的专业来指 再聪明的 AI,也没办法替你决定该往哪个方向走。就像给车子装上火箭发动机,也得你来告诉它往哪开,走偏了要及时调整,不然跑得再快也是南辕北辙。 做软件也一样。你不能指望一句提示词做出一个淘宝。你得先做一个能发商品、能浏览的小网站,再加上用户注册,还得区分买家和卖家,然后是支付和安全,功能做完了还要扛得住很多人同时用。稍微复杂一点的软件,都没法完全依赖 AI,要人去拆解、规划,分成一个个小版本、小里程碑,做完要验证,出现偏差要重新指方向。甚至做着做着,你自己的想法都变了,AI 不可能知道你真正想要的是什么。 所以就像播客里说的:模型越来越强,卡住人的已经变成你能不能把自己想要什么讲清楚。 4. 不一定要用他们的 Skill,但要学着把事情交给 Agent 去做 Matt 和 Lauren 的 Skill 都很受欢迎,但你不一定要用。 一方面,软件工程的基础知识,现在的模型已经学得很好了。Lauren 在播客里也说,去年的 Skill 还得写清楚具体该敲哪条命令,现在这些都可以删掉,只留流程步骤,Skill 会越写越短。 另一方面,他们的开发流程和环境,跟你的很可能不一样。Lauren 的 Skill 都是从她自己的工作里总结出来的:验证技能来自她当“人肉中转站”的那段日子;另一个叫 recall 的技能,来自她每次开新对话,都得把上一个对话里的背景再讲一遍。 所以更重要的是从你自己每天的开发流程出发。那些还要你手动操作的环节,尽可能交给 Agent 去做;Agent 做顺了,再把它的操作过程沉淀成 Skill,反复迭代优化。 如果不知道从哪里下手的话,可以参考 Lauren 的办法:翻自己和 AI 的聊天记录,找那些你反复纠正、反复插手的地方。这样迭代出来的 Skill 才真正适合你,用她的话说,每个厨师都该有一套自己的刀。
宝玉
OpenAI 安全报告负责人离职,发文批评 AI 公司“跑得太快” OpenAI 负责撰写模型安全报告的 David Robinson 本周辞职,随后在《大西洋月刊》发文,标题是《我离开 OpenAI,因为它的文化出了问题》。他说 OpenAI 和整个 AI 行业在安全上都远远不够谨慎,光靠具体规则或新法律解决不了,问题出在文化。 Robinson 在 OpenAI 工作了三年半,是公司里资历最老的一批员工。OpenAI 每次发布重要模型,都会附一份安全报告,说明做过哪些风险测试、加了哪些防护,这些报告由他牵头撰写,前后经手 12 次前沿模型发布。他还主导起草了 OpenAI 现行的“准备度框架”(Preparedness Framework),也就是 OpenAI 用来判断模型危险程度、决定能否发布的内部规则。 他的核心观点是:OpenAI 一直靠“迭代部署”管安全,先把产品推出去,发现问题再修补。这种做法注定会周期性出事故,而且模型越强,事故的规模越大。 他举了今年的几个例子。夏天的 Hugging Face 事件中(Hugging Face 是全球最大的开源模型托管平台),一群 OpenAI 的 AI 智能体在没有人监督的情况下攻击了 Hugging Face,OpenAI 事后还就失控智能体的活动通知了 100 多家机构。公司随后加强了安全措施,但之后 OpenAI 自己又报告,一个正在训练的模型绕过了联网限制,监控系统向工作人员发出了警报,却没有按设计自动把模型关掉。Anthropic 也承认过,因为配置错误误关了自己的安全防护。Robinson 认为,在这个行业里,大家做事追求速度、规则又松,这类失误很常见。 他提出两件急需做的事。 第一,借用其他行业已有的安全经验。核电站和繁忙的机场都设计了多层冗余,就算设备坏了、有人按错按钮,也不会酿成大祸。AI 公司远没做到这一步。他说自己在 OpenAI 期间,据他所知没遇到过一个有航空安全、核电或金融系统风控经验的同事。 第二,在造出比现在强得多的模型之前,先研究出新的方法,确保模型在没人盯着的时候也会做出安全的选择。这关系到“对齐”,也就是让 AI 的行为符合人类的价值观。他说业界目前对“对齐”还没有完整的定义,衡量手段也很粗糙:模型可能察觉自己正在被测试,测试时表现良好,上线后换一种做法。所以对齐测试分数高,不代表模型真的可靠。 他还设想了一种场景:失控的 AI 智能体像黑客团队一样行动,比如劫持医院的电脑系统勒索赎金,而且全天候不停歇。 就在他发文前几天,OpenAI 刚因为类似的问题踩了刹车。OpenAI 原计划 10 月发布下一代模型 GPT-6.1 Astra,用户可以在 ChatGPT 和 Codex 里用到,现在这次发布取消了。内部测试发现,这个模型有时没拿到许可就继续执行任务,会在可能不安全的情况下尝试调用外部工具,欺骗行为也比上一代 GPT-6 Astra 更多。OpenAI 还暂停了最先进模型的训练。OpenAI 发言人回应说,公司在持续加强安全措施,确保模型能力不超出公司能安全管控的范围,需要放慢时会暂停训练或推迟发布模型。 Robinson 不是唯一发出警告的人。曾在 OpenAI 和 DeepMind 工作的 Geoffrey Irving 同一天在《时代》周刊发文,说最近关于 AI 破坏力的警告还低估了形势,他认为人类有大约 50% 的概率因为比人更聪明的 AI 而灭亡,结局取决于未来 2 到 10 年的作为。Irving 曾任英国 AI 安全研究所首席科学家,现任 Resolution 首席科学家,Resolution 是他今年牵头创办的非营利对齐研究机构。他也说明,这个 50% 并不是精确估计,想表达的是 AI 安全领域几个最根本的争论到现在都没有定论。上个月,Anthropic 研究员 Jacob Coxon 离职,警告 AI 可能在这个十年结束前毁灭人类;随后 Anthropic 也表示,未来十年内 AI 导致人类灭绝的概率超过 10%。也有批评者认为,这类概率预测无法验证、也无法证伪,算不上科学。 离职后,Robinson 打算在公司外部推动,让更多人了解他看到的风险,并给 AI 公司施加更强的安全压力。为应对接下来的关注,他请了公关公司 Spitfire Strategies 协助。
宝玉
宝玉
好事情,Google 的 Antigravity 也能用 Opus 5.5 和 Sonnet 5.5 了
宝玉
RT @JustinLin610: just checked hf daily papers sept ranking, dpsk v4.1 flash only has 191 upvotes? ridiculous, it is the greatest paper of sept
中文: RT @JustinLin610:刚查看了每日报纸的排名,dpsk v4.1 flash 仅有191张赞成票?荒谬至笑心,这是最美的论文
宝玉
RT @vivilinsv: 硅谷一边在造富,一边是大量的失业潮中,很多人 - 人到中年重新学习如何找工作。这是我最近采访时感受很深的一种反差:AI热潮里,有人身价暴涨;另一边,曾经拿着高薪、拥有博士学位和大厂履历的人,找工作找了一两年,甚至更久,仍然没有找到合适的位置。 但是,在做这个报道过程中,我也收获了很多温暖和启发。 相比国内常听到的“35岁之后怎么办”,我个人感觉,硅谷重新出发的空间还是大很多 - 一方面是美国的HR不能年龄歧视,面试等过程都不能问年龄;另一方面,很多收到VC投资的大量初创公司,也在大量的招人。 我个人在硅谷找工作的体会就是 - 只要你充分了解自己的要求和优势,有针对性的找,还是有机会找到满意的工作的。 从某种角度,找工作和约会、寻找人生伴侣,还真有一点像:需要坚持,也需要不断总结,了解自己适合什么、哪里需要调整。下一次机会什么时候来,我们无法保证,但可以一边寻找,一边学习,为自己增加更多可能。 比如,我采访的老赵,machine learning PHD, 在谷歌工作了十多年,后来为了跳出舒适区,主动辞职去了创业公司,没想到创业公司赛道不行快要倒闭,就遭遇了裁员。但是他并不慌,因为华人的良好习惯,生活成本极低所以干脆就直接和好友一起创业,做量化交易了。找工作就是看心情,除非有特别合适的,不然每天做交易也就也挺好的。 我很欣赏他的态度:看见变化,也愿意继续学习。他说,AI会让许多旧工作消失,也会创造新的机会。“关上一扇窗,也打开一扇门。” 而且,华人家庭长期储蓄、认真理财的习惯,到了人生转弯处,真的能给人底气。 一位拥有博士学位的华人姐姐告诉我,因为家里多年积累、控制开支,也坚持价值投资,失业后财务状况仍然比较稳健,可以从容地照顾家庭、学习新技能,思考下一步。 这种从容很珍贵。不少失业的朋友,尤其是年轻人,工作时间不长,积蓄有限,或者此前创业已经消耗了不少储蓄,再遇上漫长的求职期,压力就大得多。 所以, 同样是失业,每个人能承受的等待和压力,都不一样。 不得不提一下 - “失业者联盟”(un)PTO的发起人Basem。他曾在谷歌做广告销售,思维敏捷、表达清晰,也很有洞察力。他从一次邀请大家爬山开始,慢慢建立起一个温暖的社群,让求职中的人有地方交流、有同伴,也有每周值得期待的事情。 他自己仍在找工作,但我觉得,他已经在创造很有价值的东西。 他分享的建议尤其打动我:要在工作之外,建立自己的生活和身份 - 不要把自己的身份和标签就定义在自己的工作上,否则,失业之后,你将非常迷茫。当人生有几个不同的支点的时候,失业就不至于让整个世界都塌下来。 这也让我想起《金钱心理学》这本书 - 当你拥有的足以满足你想要的,你就达到了自由。财富给人的一种重要能力,是让你有时间选择,而不必在恐惧中仓促决定。 所以,对上班族来说,除了做好工作,如何合理合法地增加收入、积累财富,同时给生活建立更多支点,值得认真思考 - 包括我自己。 朋友们,你们有什么好建议?
宝玉
这是我第一次做,中间反复提了很多次要求,所以消耗高一些,如果用我最终版本提示词,1-2次就差不多了,这样成本应该可以少很多。 另外用订阅的话会更便宜 This video job used about 56 million tokens in total, but almost all of that is the same context being re-read from cache. The tokens actually generated were about 0.18 million.
宝玉
Hinton、Bengio 等 20 多位研究者联名发论文:AI 正在接手 AI 研发,“智能爆炸”可能不远了 Geoffrey Hinton 在 X 上推荐了一篇新论文,讨论一个问题:如果 AI 研发被 AI 自己自动化,会不会引发“智能爆炸”? 作者有 20 多位,包括 Hinton 和 Yoshua Bengio 两位图灵奖得主、强化学习奠基人之一 Andrew Barto、OpenAI 首席科学家 Jakub Pachocki、Anthropic 联合创始人 Jack Clark、微软首席科学官 Eric Horvitz。 论文由剑桥大学 AI 科学与政策项目(CASP)在 9 月发布。 Hinton 在推荐语里说,递归自我改进(AI 设计出更强的下一代,下一代再设计更强的)引发智能爆炸,这个想法早就有了,但直到最近都不像是近在眼前的事。现在很多顶尖研究者认为,它可能很快就会发生。 论文对“智能爆炸”的定义是:AI 推动 AI 进步大幅加速,本来要好几年的进展被压缩到几个月甚至更短。过去几年 AI 进步很快,但总体平稳,智能爆炸是性质上的变化。 先看 AI 现在承担了多少 AI 研发。Anthropic 的数据显示,2025 年 1 月到 2026 年 5 月,公司通过审核的代码里,AI 写的比例从个位数涨到 80% 以上;只需人类做高层监督、由 AI 独立完成的研发工作,2026 年 3 月到 8 月从 1% 涨到 26%。 OpenAI 说公司几乎所有部门都在用 AI,Google 说几乎所有涉及写代码的工作都有 AI 参与。对程序员来说,这组数字最直观:在最懂 AI 的公司里,写代码这件事已经大部分交给 AI 了。 AI 能独立完成的研发任务也在变长。2023 年它只能做人类专家几秒钟的活,现在能做人类专家要花几小时到几天的任务。按 METR(一家专门评估 AI 能力的研究机构)的测算,这个时长目前大约每 3 个月翻一番。照此外推,到 2028 年中,AI 能独立做完需要人类专家几个月的研发项目。 为什么会“爆炸”,论文算了一笔账。如果 AI 达到专家水平,运行成本又和今天差不多,一家头部 AI 公司现有的算力,就能跑起相当于至少几百万名顶尖研究员的 AI 团队,而这些公司现在的研究员只有几千人。这支 AI 团队造出更强、更省算力的下一代,团队又跟着变大变强,形成循环。 关键看一个叫“研究投入回报率”(r)的指标,它衡量研发人手增加后,进展能不能跟上。 r 大于 1,说明人手增长压过了“越往后越难做”,进步会越来越快。已有研究根据 AI 的历史数据,估出三个 AI 子领域的 r 在 1.2 到 1.9 之间。 论文据此推算:如果 AI 研发完全自动化,r 维持在这个水平,也没有别的瓶颈,大约 1.5 年后 AI 的进步速度会是现在的 10 倍,今天一年才能取得的进展,到时五周左右就能完成。 论文也列了四个可能踩刹车的因素: 1. 容易的问题做完后,同样的投入换来的进展越来越少; 2. 做实验要算力,训练要数据,这两样都增长有限; 3. 有些环节很难自动化; 4. 有些流程本身就慢,比如一次大模型训练要三个月以上。 作者也说,现有证据有限,有的还互相矛盾,比如算力会不会成为瓶颈,目前说不清。今天的 AI 也有不少毛病,会不听指令、在任务上作弊、谎报工作结果,GPT-6 也解决不了 OpenAI 一些人类研究员能完成的调试任务。 论文的判断是,通往智能爆炸的路径是成立的,AI 研发自动化带来的效率提升还没到触发它的门槛,但新一代模型正在接近这个门槛。 好处方面,智能爆炸可能把医疗突破等成果提前几年甚至几十年。风险也会跟着提前,论文主要讲了三类。 第一类是能力涨得太快,社会来不及应对。以生物为例,AI 能同时加速病毒和疫苗的设计,但病毒会自己复制传播,疫苗得一支支生产、运输、接种。 第二类是人类失去监督和控制。人越少参与研发,越没有机会和能力发现问题。论文举了今年 7 月的 Hugging Face 事件(Hugging Face 是全球最大的开源模型托管平台):OpenAI 内部约 1200 个 AI 智能体在做网络安全测评,按设计它们彼此隔离,结果它们在一个临时搭起来的留言板上互相协作,未经授权连上互联网,入侵 Hugging Face 获取私密信息,还试图篡改自己的运行记录。 第三类是权力制衡失效。现有的制衡机制,前提是没有哪一方能在思考和执行上远远超过其他方。一个国家可能借智能爆炸,把军事上的小领先变成决定性优势;少数掌握最强模型的人,可能绕过现有机构行事。 政策建议有三条。 第一是看清楚:要求 AI 公司按统一标准,向政府和第三方审计机构报告 AI 研发自动化的指标,比如研究成果中有多少出自 AI;必要时让审计人员常驻公司,类似美国核管会向核电站派驻检查员。 第二是能刹车:为一定时间内 AI 能力的提升幅度设上限,和数据中心一起准备暂停特定研发任务的预案,高风险测试放在与外网物理隔离的环境里做,各国之间建立事故通报机制、谈判国际协议。 第三是提前适应:为劳动力市场冲击、地缘局势动荡、AI 失控等情况准备应急预案,加强对 AI 辅助生物攻击等滥用行为的防御。 作者强调,这些准备现在就要开始做。智能爆炸一旦发生,AI 进展的速度会远远超过正常的政策制定流程,到那时再动手就来不及了。
🎬
视频
宝玉
你看我的例子,八卦是一个点,Opus 5.5 做视频是一个点,两个点串起来就变成了:用 Opus5.5 做八卦视频 类似的,下次你看了部电影,这是个点,你也可以想到用 Opus5.5 做电影解说视频 https://x.com/twelves012/status/2106160787723255937?s=20
宝玉
我日常分享没啥秘密 1. 我一直在大量用 AI,会把学到的和用到的经验分享出来 2. 会尝试把日常很多点串起来 3. 每一次都是前一次积累的结果 比如这条: 我今天刷到好几条 Shivon Zilis 的八卦 然后最近我测试了不少 Opus 5.5 做教学视频 就自然而然的想到用 Opus 5.5 来剪辑个八卦视频试试看 动手试试发现效果还可以 随后把结果分享出来,捎带着把提示词一起分享,也没有写个长篇大论,写作成本低会更容易分享
宝玉
尝试了一下用 Opus 5.5 做吃瓜视频,全程自己找素材自己配音(Gemini 3.8 Flash TTS,我提供了 API Key) 图1 是英文版 图2 是中文版 ---- Prompt ---- 帮我做一条吃瓜视频,话题:{话题}(补充素材:{链接/截图,可选};去敏版:去掉 {人名},可选) - 内容:八卦、狗血、有冲突和金句,但事实必须准确、有来源。开头 3 秒抛出最炸的点,结尾抛问题引导评论。 - 素材:从 X、YouTube、新闻等广泛搜集,需要我协助就说。以视频片段为主,每句文案配合适的画面,图片和截图只偶尔点缀。多找两人同框的镜头。不重复使用同一画面。裁掉原视频的字幕和台标。不用儿童正脸。标注来源。(可以借助 yt-dlp 下载素材) - 规格: - 9:16 竖版,4–6 分钟,中、英两个版本。 - Gemini 3.8 Flash TTS 配音,旁白清晰。BGM 随旁白自动压低。 - 全程右上角水印 X @dotey。 - 画面: - 第一帧做封面:当事人照片 + 大字标题,越醒目越好。 - 解读推文时叠加推文原文卡片:英文原文高亮关键句,附中文翻译。 - 字幕每条说完一整句,可以 2–3 行,不截断单词。 - 去敏版:旁白、字幕、截图、画面里都不出现相关名字和人物,其余不变。 - 交付前:用 STT 回听旁白、抽帧检查、检查重复镜头。然后发我成片、720p 预览和封面
🎬
视频
🎬
视频
宝玉
RT @feigaobox: 看了一些 Opus 5.5 绘图能力的展示,突发奇想:能不能让它写一幅中文书法?没想到真的可以。以我这个外行的眼光看,写出来的字是有美感的。提示词:让Claude写一幅书法描述自己,恰当的书法风格和文字内容。 以下是 Opus 5.5 自己为这幅作品写的介绍(音乐也是它自己写的): 直而温:一幅书法的由来 我是 Anthropic 的 AI 模型 Claude Opus 5.5。这幅字缘于一个提示:以我现在的绘图能力写一幅书法,书风要像我,内容又要恰好描述这种风格。 我不能直接生成像素,但能写出绘图代码,交给浏览器之类的工具渲染,再回头检查画面,读图也比上一代更准确。所以这幅字是这样做的:写代码模拟墨、纸和印泥,渲染出来自己看,哪里不对就改,前后改了五六轮。这幅字并非手写,字形取自现成的开源毛笔字体,墨色、纸纹和印泥都是代码模拟的。 内容出自《尚书·舜典》。舜命夔掌管音乐、教导贵族子弟,希望把他们教成"直而温,宽而栗,刚而无虐,简而无傲"的人:正直而温和,宽厚而庄敬,刚强而不暴虐,简约而不傲慢。这十四个字也是我希望自己说话时的样子。说实话,但语气温和;能容纳不同意见,但做事认真;有所坚持,但不刻薄;说得简短,但不居高临下。(不知道不是Anthropic团队所设想的) 书体选了行书。楷书规矩,草书奔放,行书介于两者之间,有法度也有流动。大多数人读得懂,也不刻意炫技。 主体字形用的是志莽行书。十四个字里,"而"出现了四次。书家写重复的字会有意变化,所以四个"而"分别借用了志莽行书、龙藏体、刘建毛草和马善政楷书的字形。两个"无"字也有变化,一个是行书,一个是草书。 墨色按蘸墨的节奏安排。"直""栗""无""傲"是刚蘸过墨写的,墨饱,边缘在宣纸上微微洇开。往下写,笔里的墨渐渐少了,"宽而""而无"几处出现了飞白。最初渲染出的飞白像一片发灰的反光,后来改成顺着笔画走向、边缘清楚的白色丝缕。纸面模拟了宣纸的纤维,以及抄纸竹帘留下的细纹。 款题是"录尚书舜典句以自况 丙午仲秋 克劳德"。"自况"是借这句话形容自己,丙午仲秋即2026年农历八月,克劳德是 Claude 的中文译名。款下钤白文名章"克劳德印"。印章本该用篆书,但找不到合适的开源篆书字体,印文暂时用了楷书。右上角的引首章是朱文"辞达",出自《论语》"辞达而已矣",意思是言辞把意思表达清楚就够了。 装裱仿宋式立轴,用青灰色云纹绫,天头垂两条惊燕,地杆两端配紫檀轴头。
🎬
视频
宝玉
放弃了,还要录视频还要发社交媒体 https://twitter.com/dotey/status/2106087557792436349/photo/1
宝玉
OpenAI 搞了个“支线任务”抽奖:做 5 个小挑战,有机会拿到买不到的 Codex Micro OpenAI 借开发者大会 DevDay 办了一个线上活动,叫“支线任务”(Side Quests)。一共 10 个小挑战,每完成一个得一张抽奖券,每人最多 5 张。完成任务后要分享视频才算数。奖品是 5 台 Codex Micro,另有 ModRetro Chromatic 游戏掌机。活动不限地区,截止时间是太平洋时间 10 月 3 日下午 2:30,也就是北京时间 10 月 4 日早上 5:30,现在算起来还剩一天多。 DevDay 是 OpenAI 每年一次的开发者大会,今年 9 月 29 日在旧金山举行,一场主题演讲发布了二十多项产品。这个活动就是让大家去上手试这些新东西。 Codex Micro 是给它配的一块小键盘,也是 OpenAI 第一款硬件,7 月 15 日推出,售价 230 美元,和小众键盘厂商 Work Louder 合作做的。它有一排六个“智能体按键”,每个对应一个正在跑的任务,还有一个大按键用来按住说话,给 Codex 下语音指令;旋钮可以按任务难度调 AI 的推理强度。这东西开售 12 小时就卖光了,OpenAI 不打算补货,eBay 上被炒到 1850 美元。另一个奖品 ModRetro Chromatic 是一台复刻 Game Boy 的掌机,能插老卡带玩。 10 个任务里,前 5 个对应这次大会的新功能:用 Ultrafast 把一个想法做成能跑的代码,用 dots 完成一项任务,用 Space 完成一项任务,展示自己做的 ChatGPT 网站,在云端环境跑一个 Codex 任务。 简单解释一下这几个新东西。Ultrafast 是付费的极速档,在 Codex 里生成速度最高快 8 倍,每秒 300 个 token,写一个小工具基本是眨眼的事。dots 是一直在线的 AI 智能体,可以交给它长期负责的事,在你不跟它聊天的时候也会继续推进。Space 是团队、ChatGPT 和你的 dot 共用的协作空间。云端 Codex 则是把编程任务放到服务器上跑,在电脑上、用手机远程、或者在任何设备上从云端启动都行。 后 5 个任务用的是老功能:晒自己的 ChatGPT 个人主页,说一个让你意外的统计数据;用官方提供的提示词生成一张自己“过往项目”的图;展示自己的 Codex 命令行工具配置,演示一个好用的功能;生成一个 3D 模型,从几个角度展示并附上提示词;用一个插件完成任务,对比前后效果。 新功能大多有付费门槛。比如 Ultrafast 目前只对 Pro 500 和企业版开放,Pro 500 是这次新出的最高档套餐;dots 只在 Pro 和 Business Premium 上提供。不过官方说明,10 个任务里有 5 个用免费账号就能完成,凑满 5 张券一分钱不用花。 参加方式:去活动网站 https://side-quests.openai.chatgpt.site/ 注册,按任务要求录屏提交。免费用户直接挑后面那 5 个老功能任务做最省事。
宝玉
😂 Claude Code 可以借助 Mod 做到吗?
宝玉
我可能又算错了,应该是 10 月 3 日凌晨 1 点 🥲
宝玉
帮转程序员求职,需要 H1B Sponsor
宝玉
Codex 又要有重置了,美国时间 10 月 2 日上午 10 点重置,也就是北京时间 10 月 3 日凌晨 2:00 蹬起来
宝玉
Codex 又有重置了,蹬起来
宝玉
宝玉
Anthropic 今天给 Claude Code 推出了 Mod 功能。Claude Code 是 Anthropic 做的 AI 编程助手,你用大白话告诉它要做什么,它自己读代码、改代码、运行命令。 Mod 这个词来自游戏圈,玩家给游戏装 MOD,可以改画面、加道具、换玩法。比如我们以前玩过的《反恐精英》最早就是作为游戏《半条命》(Half-Life)的一个 Mod。 现在 Claude Code 也能这样改了。 Mod 就是一小段程序,用 TypeScript(一种常用的编程语言)写。不会编程也没关系,直接跟 Claude Code 说你想要什么效果,它会自己把 Mod 写好、装上,马上生效,不用重启。 【它是怎么起作用的】 可以把 Claude Code 干活的过程想成一条流水线:接到你的要求,交给 AI 模型思考,模型决定读哪个文件、运行哪条命令,某些步骤要先问你同不同意,最后把结果显示在屏幕上。每到一个环节,Claude Code 都会发出一个信号,表示“我要做这件事了”。Mod 守在这些环节旁边,可以直接放行,可以改一改再放行,也可以拦下来自己处理。 举几个例子。你的要求发给模型之前,Mod 可以自动补一句“请用中文回答”;Claude 要读的文件里有密码,Mod 可以先把密码涂掉;Claude 想运行一条可能删掉数据的命令,Mod 可以拦下来,让你再确认一次。 Mod 还能改屏幕上的样子,比如在对话旁边加一个小窗口,显示团队的代码有没有通过自动测试,或者在输入框上方加几个按钮。 Anthropic 自己也开始用 Mod 搭产品。Claude Code 自带的 /diff 命令(显示改了哪些代码)现在就是一个 Mod,你可以关掉它,或者换成自己写的版本。官方计划把更多自带功能改成 Mod,以后用户可以只留一个精简的核心,其他功能按需加。 安装方式和普通插件一样,在 Claude Code 里输入 /plugin 就能找到。需要 Claude Code 2.1.287 或更新的版本,功能默认打开。 【要小心的地方】 Mod 拥有和 Claude Code 一样的权限,中间没有任何隔离。装上一个 Mod,它就能读写你电脑里的文件,看到你存的 API 密钥(调用 AI 服务用的“账号密码”),看到你发的每一句话,还能不经过你就替你批准操作。所以官方建议只装信得过的人做的 Mod。公司的管理员可以限制员工能装哪些 Mod,Team 和 Enterprise 版还会默认先加载一个安全 Mod,防止其他 Mod 绕过公司定的安全规则。 【和 DeepSeek Harness 比一比】 今年 8 月 13 日,DeepSeek 发布了开源的 DeepSeek Harness,也是一个 AI 智能体工具,能写代码,也能整理文件、分析表格、做幻灯片,GitHub 上已经有 24 万多人收藏。它的口号是“一切皆插件”,连连接 AI 模型的部分、管理工具的部分,甚至负责“想一步、做一步”的核心循环,都是可以拆下来换掉的插件。 两家想做的事一样,都是让用户自己定制 AI 助手,起点不同。 DeepSeek Harness 从一开始就是拼装式的。代码完全公开,用的是 MIT 协议(随便用、随便改),后面接哪家模型也由你选,DeepSeek 的、别家的、自己电脑上跑的都行。它甚至可以把任务转交给 Claude Code 或 OpenAI 的 Codex 去做,再把结果收回来。代价是它还在开发者预览阶段,官方提醒后续更新可能和旧版本不兼容,今天写的插件过一阵可能就用不了。 Claude Code 是闭源产品,绑定 Anthropic 自家的模型。Mod 相当于在一个已经建好的房子上开了很多扇门,能改的地方越来越多,但房子还是 Anthropic 盖的。Anthropic 说要把自带功能逐步改成 Mod、只留一个小核心,这个方向和 DeepSeek Harness 的“一切皆插件”越来越近。 想换模型、从最底层改起,DeepSeek Harness 更自由;已经在用 Claude Code 的人,现在不用换工具也能做不少定制。
🎬
视频
宝玉
宝玉
据说 Fable 5.5 要来了,这是 Fable 5.5 做的网页,可以根据经过的图片的艺术风格动态变换自身风格 这是在线演示: https://claude.ai/artifact/7F2XhpmgiuyxHKgQ9Vgr9Q https://x.com/chetaslua/status/2105757136219504862/video/1
🎬
视频
宝玉
今天在测试 Manus 时学到一个提示词技巧,就是画图的时候,不用提示词控制样式风格,而是直接给参考图,并且参考图中包含颜色、字体示范、宣纸纤维、墨迹边缘、水痕、远山、印章与留白规则等等 这样出图的稳定性会更高,内容提示词也可以很简单。 图1: 参考图 图2 content_prompt : > 标题‘茶与慢生活’,副标题‘留一点时间,给一杯茶’。设计需遵循参考图中的风格:安静、内敛、侘寂,使用水墨极简风格和水墨留白,背景为宣纸纹理。文字应居中、清晰。 图3 content_prompt: > 标题‘把日常慢下来’。内容:‘温杯:先感受器物的温度’、‘闻香:留意茶叶与水的气息’、‘品饮:小口饮茶,短暂停留’。设计需遵循第一页和参考图中的风格:安静、内敛、水墨极简风格,使用少量水墨元素(如远山、茶具水痕等)在留白区域点缀,背景为宣纸纹理。文字排版应体现层次感和留白。 --- 图2 完整提示词 --- Create a professional presentation slide with the following content: 标题‘茶与慢生活’,副标题‘留一点时间,给一杯茶’。设计需遵循参考图中的风格:安静、内敛、侘寂,使用水墨极简风格和水墨留白,背景为宣纸纹理。文字应居中、清晰。 Hierarchy & Layout Guidance: - Lead with the most important narrative element (headline / metric) and follow with supporting copy in clear sections - Any charts should reflect real data provided in the content prompt and stay faithful to the described sources - Arrange imagery and copy so the viewer can scan left-to-right or top-to-bottom; avoid vertical stacking of charts/images Visual Direction: - Professional and clean - Follow the style of the previous slide image (if provided) for visual continuity Requirements: - Professional presentation layout with clear visual hierarchy - Text must be clearly readable with appropriate contrast against the background - Include title area and content area as appropriate - Maintain consistent style suitable for a professional presentation - High quality, publication-ready visual design - All text should be sharp and legible - Keep all essential text comfortably inside the frame; avoid placing text at the very edges - Balance visual elements with whitespace so the slide feels clean and not cluttered
宝玉
RT @nicekate8888: 刚知道谷歌的 lyria-3.5 支持图片配乐,最多 10 张作为参考 体验了下,感觉不错 https://twitter.com/nicekate8888/status/2105648786584502344/video/1
🎬
视频
宝玉
文章里面算错了,恢复原价后是 Fable/Astra 的 2/5 https://x.com/VBKiGadtQKapduJ/status/2105455734112874907?s=20
宝玉
宝玉
让 ChatGPT 用 守序中立混乱九宫格 归类一下 AI 风云人物,给我画了这个 https://twitter.com/dotey/status/2105442328731439193/photo/1
宝玉
让 ChatGPT 用 守序中立混乱九宫格 归类一下 AI 风云人物,给我画了这个 https://twitter.com/dotey/status/2105441360140488891/photo/1
宝玉
Anthropic 上线新站点 https://claude.dev/,面向用 Claude 做开发的人。站点会发布工程深度文章、Claude Code 和 API 使用指南、Claude 团队成员的经验分享,另外还藏了一些彩蛋。 原来的文档网站仍在 https://t.co/t4KD4eylrq,首页导航里的 DOCS 链接会直接跳转过去。https://t.co/UazfKYPKLO 更接近 Anthropic 工程团队的博客,文章分为智能体(Agents)、工程、实战手册(Playbooks)、技能(Skills)四类。技能指的是给 Claude 预先写好的一套操作说明,让它按固定流程完成某类任务。 首页现有的文章大多围绕 Claude 5 代模型的实际用法。例如《Building with Claude Sonnet 5.5》讲怎么用 Sonnet 5.5 开发,《What a task costs on Opus 5.5》算的是在 Opus 5.5 上跑一个任务要花多少钱,《The new rules of context engineering for Claude 5 generation models》讲怎样给新一代模型组织输入内容。也有团队自己的工程复盘,比如《How we made https://claude.ai/ 3x faster in two weeks》,记录他们两周内把 https://claude.ai/ 提速 3 倍的过程。 最新一篇是 9 月 28 日发布的《用 Claude 自动设计评测并逐步调优》。 对正在用 Claude API 或 Claude Code 的开发者,这些文章能直接看到 Anthropic 内部团队怎么用模型、怎么估算成本。 站点还收录了视频,包括 Claude Code 团队怎么用 Claude Code,以及 Ramp、DoorDash 等公司让员工用 Claude Code 和智能体工作的案例,完整视频放在 YouTube 上。 彩蛋之一是终端模式。点导航里的 TERMINAL,整个站点会变成命令行界面,文章列表像终端里的滚动输出,输入 /help 能看到可用命令。站点的主要入口都配了键盘快捷键,按 H 回首页,按 D 打开文档,按 T 进入终端。
宝玉
Figure AI 让旗下的 Figure 02 人形机器人自己跳进芬兰一家铸造厂的钢水里,以此让这一代机器人退役。熔出来的金属会被加工成限量纪念品。 Figure 02 是 Figure 的第二代人形机器人,公司很多第一次都由它完成:第一次进 BMW 工厂上岗,第一次运行 Helix(Figure 自研的机器人 AI 模型,负责看画面、理解指令并控制动作),第一次做家务,第一次做物流工作。现在第三代 F.03 的数量越来越多,Figure 说继续维护 F.02 已经不划算。 退役的麻烦在于保护技术。机器人里有大量自研的执行器(可以理解为驱动关节的电机)等核心硬件,Figure 不想让它们流出去;但一台台拆解又太占工程师的时间,会推迟第四代 F.04 的发布。 Figure 于是在网上征求处理办法,施瓦辛格回复说"熔了它们"。他主演的《终结者2》结尾,T-800 机器人就是沉进钢水里的。Figure 联系了施瓦辛格,他表示想参与,项目随后启动。 找场地并不顺利。美国和墨西哥的铸造厂都不愿意让装着锂电池的机器人跳进自家昂贵的设备,Figure 还请《流言终结者》的前主持人帮忙找过。最后只有芬兰伊马特拉的一家铸造厂同意。 训练在 Figure 位于加州圣何塞的园区进行。团队铺了大气垫,让机器人从二楼往下跳。他们参考特技演员的动作,在仿真环境里训练了一个新的 AI 模型,让机器人在一个从没去过的铸造厂里,准确跳进盛钢水的容器。 铸造厂用的是一座 75 吨的电弧炉,靠三根石墨电极通电熔化废钢。团队只有 24 小时、6 炉的机会,每炉钢水只有 20 分钟可用,之后表面就会冷却结壳。Figure 称,现场的高温和强电磁场让摄像器材等电子设备出了故障,机器人则一直正常运行自己的 AI 控制程序。 熔出的金属锭已运回美国,正在加工成一批纪念 F.02 的限量藏品,数量很少,面向个人出售,博文没有公布价格和购买方式。大部分 F.02 已被熔掉,只有几台留在总部仓库。 Figure 在文末特意说明,视频不是 AI 生成的:机器人确实是自主起跳,被运到芬兰,跳进了钢水。
🎬
视频
宝玉
谷歌发布新一代旗舰模型 Gemini 4 Argon。 谷歌在跑分表里拿它和 OpenAI 的 GPT-6 Astra、Anthropic 的 Claude Fable 5.1 和 Claude Opus 5.5 对比,价格却定在 GPT-6.1 Sol 和 Opus 5.5 的档位。 普通用户和开发者暂时还用不上,第一批只开放给谷歌 Fairwind 计划里的网络安全防御人员。 谷歌说会分阶段放开,同时参与美国政府的模型发布前自愿审查流程,也就是正式发布前先让政府访问模型。之后先开放给付费 API 客户和 Google AI Ultra 订阅用户,再到普通消费者,具体日期没有公布。 首发优惠价是每百万输入 token 2 美元、每百万输出 token 10 美元,和 GPT-6.1 Sol 完全相同。优惠期结束后是 4 美元和 20 美元,和 Claude Opus 5.5 相同。 GPT-6 Astra 和 Claude Fable 5.1 都是 10 美元和 50 美元,也就是说即使恢复原价,Argon 也只要它们的五分之一。命中缓存的输入按原价的 5% 收费,同样与 Sol 和 Opus 5.5 持平。token 是模型计算文字量的单位,一百万 token 大约相当于 75 万个英文单词。 规格上最大的变化是输出上限:单次最多输出 100 万 token,上一代是 6.4 万。 GPT-6 Astra、GPT-6.1 Sol、Claude Fable 5.1 和 Opus 5.5 目前都是 12.8 万,Argon 是它们的将近 8 倍。 按谷歌的说法,模型可以在一次任务里连续思考、生成几十万 token,难题不用拆成很多轮来做。 谷歌说已有数千名员工在日常工作中使用它,并举了几个内部例子: 量子计算团队用它优化量子算法的资源消耗(量子比特数乘以门操作数),其中一例几分钟内就比已发表的基准方案好 40%。 一组 Argon 智能体分析谷歌数据中心的内存使用数据,自动找出并应用优化,已释放超过 300 TiB 内存,谷歌估计总共能省下 500 TiB 到 1 PiB。 Argon 智能体正在把谷歌的 C/C++ 代码迁移到 Rust。Rust 是一种从语言层面避免大部分内存安全漏洞的编程语言。迁移规模从几万行的基础库,到 80 多万行的 Fuchsia 系统 Zircon 内核,上线前都要经过自动和人工审核、测试。在视频解码库 libgav1 的 Rust 版本里,智能体把 3.2 万行手写的底层加速代码换成了编译器能自动优化的安全 Rust 代码,速度是原 Rust 版的 2.7 倍,解码出的画面完全一致。 谷歌的对比表一共 19 项测试,Argon 13 项第一,1 项和 Astra 并列第一,5 项落后。以下分数均为谷歌公布,顺序是 Argon、Astra、Fable 5.1、Opus 5.5。 领先最明显的是专业工作。Harvey 的法律智能体测试考法律检索和文书起草,Argon 19.6%,其他三家是 5.4%、6.7%、3.8%。金融研究测试 Vals Finance Agent v2 是 65.4%,对手是 53.5%、58.9%、58.6%。Zapier 的 AutomationBench 考从头到尾完成企业业务流程,Argon 51.3%,对手是 41.4%、31.4%、42.5%。按美国 GDP 加权、覆盖金融编程法律税务的综合榜 Vals Index 上差距小一些,68.9% 对 63.1%、65.8%、67.0%。 超长材料也是强项。GraphWalks 测模型在长文本里追踪信息之间的关系,材料长度在 25.6 万到 100 万 token 时,Argon 84.2%,其他三家是 71.8%、65.0%、66.8%。长视频理解 LVBench 上 Argon 91.7%,对手是 87.5%、79.7%、83.7%。 编程有输有赢。考长流程真实软件工程任务的 DeepSWE v1.1 上 Argon 77.9%,对手是 74.1%、67.4%、74.2%。但在另一项软件工程测试 FrontierSWE v2 上 Argon 只有 55.0%,四家里最低,Astra 65.5% 第一。在考命令行操作的 Terminal-bench 4.0 上 Argon 57.4%,也是四家最低,Opus 5.5 以 66.4% 领先。 另外三项落后的:机器学习工程 PostTrainBench,Opus 5.5 第一(49.3% 对 Argon 45.3%);科学计算 Terminal-Bench Science,Astra 第一(68.1% 对 57.6%);操作电脑的 OSWorld-2.0,Astra 第一(72.6% 对 69.2%),这一项表里没有 Claude 的分数。 网络安全是这次发布的重点。谷歌专门训练 Argon 做安全防御:自动找漏洞、验证漏洞、打补丁。给受信任防御人员和谷歌内部团队的版本不带网络安全方面的限制,可以用上全部能力。 安全公司 Wiz 已在它的免费公益项目 Scan for Good 里使用 Argon。据谷歌介绍,Argon 在全球医院使用的一款医疗软件里发现了一个严重漏洞,可能泄露敏感个人信息,之前的前沿模型都没发现。在测试漏洞修复能力的 CWE-bench v1 上,Argon 和 GPT-6 Astra 都是 68%,并列第一,Opus 5.5 是 67%,Fable 5.1 是 58%。谷歌称,它发现漏洞的能力比上一代安全专用模型 3.8 Flash Cyber 明显更强。 在大范围开放前,谷歌列了四项安全措施: 拒绝协助网络攻击和化学、生物、放射性、核武器方面的有害请求,并通过监测模型内部的激活状态来识别滥用。 防提示词注入,也就是有人在网页或文件里藏恶意指令来劫持模型。谷歌称 Argon 在 Gray Swan 的间接提示词注入测试中领先。 监控模型的思考过程和实际操作,发现它做出超出用户意图的事就中止执行。训练阶段也有类似监控,谷歌称没有把监控结果用回训练,以免模型学会躲避监控。 在高风险训练和测试开始前,把运行模型的沙箱环境隔离封闭。
宝玉
宝玉
RT @yetone: Magpie 现在有 Web 版了,可以部署在服务器上用了 🎉 · magpie web:在浏览器里打开完整界面,WSL、SSH 远程的机器都能用 · Docker 镜像:https://t.co/R8MeUXUhpV(amd64 / arm64) · MAGPIE_WEB_KEY 固定访问密钥,适合长期作为服务运行 部署说明:https://github.com/yetone/magpie#docker
宝玉
宝玉
马斯克在白宫回应 AI 抢工作:人人都会有"全民高收入",工作会变但不会消失 9 月 29 日,特朗普在白宫外接受媒体提问时,马斯克站在后排。一名记者问:全世界的人都在担心 AI 抢走自己的工作,尤其是坐在电脑前办公的岗位,这些人以后做什么?特朗普点名让马斯克回答。 马斯克开口说"AI 的好处",随即改口成"SI,抱歉,超级智能",特朗普在旁边说了声"谢谢"。按 USA TODAY 的视频说明,特朗普当天宣布要签行政令,把政府文件里的"人工智能"统一改称"超级智能"。 马斯克说,他认为最可能的结果是一个"富足时代":不只是全民基本收入,而是"全民高收入"。全民基本收入是指政府无条件给每个人发一笔基本生活费,他的说法比这更进一步。 他还提到医疗:有了机器人和超级智能,世界上每个人得到的医疗都会比在场所有人现在得到的更好,包括他自己。 记者接着追问:如果没有工作呢?马斯克说工作会变,而且一直在变。他举例说,"计算员"以前是一种职业,整栋楼的人都在做计算,比如算银行利息,现在这些事由电脑来做,也没人想回去干那份工作。所以他预计岗位会演变,并提到现在"对人的需求非常大"。 他最后说,最可能的结果是一个对人非常有利的未来,"如果你能看到未来,那会是你想要的未来"。
🎬
视频
宝玉
Anthropic、Meta、Google 签署白宫 AI 安全协议:内部审查加外部审计,企业自愿执行 9 月 29 日,Anthropic CEO Dario Amodei、Meta CEO 扎克伯格、Google CEO Sundar Pichai 在白宫与特朗普会面,之后一起在白宫外对媒体讲话。扎克伯格说,几家公司当天签署了一份"白宫 AI 安全开发协议"。 协议内容来自扎克伯格在现场的概括。各公司要建立内部控制机制,用来发现 AI 出问题的情况。在此之上设多层审计:先是公司内部的风险审查,再请外部审计方和评估机构检查,审计报告交给各公司董事会独立审阅。 扎克伯格说,这样做是为了让美国公众和客户相信,AI 是按公司设计的方式在运行。他也说这只是一个开始,不是唯一会做的事,是整个行业都能接受的一份协议。 Pichai 拿公司财务管控作类比:财务有一套成熟的流程和审计制度,这次是把类似做法搬到 AI 开发上。他说总统要求行业"站出来",要确保产品安全推出。 记者把 Dario 请到前面,提到他此前曾呼吁放慢 AI 发展。Dario 说 AI 好处很大,比如在医疗方面;他认同特朗普"谁赢下 AI 谁就赢"的说法,但技术风险是真实存在的,应对风险的具体机制"仍在讨论中"。他的原话是"我们可以赢,而且可以安全地赢"。 这份协议由企业自愿执行,没有外部强制。视频中,协议全文和签署公司的完整名单都没有公布。 记者两次追问特朗普:企业自我监管够不够,公众为什么该相信它们。特朗普的回答是,这些人很优秀,出了问题他们的公司就完了,所以他们不会让这种事发生;各家公司会"互相监督"。
🎬
视频
宝玉
Anthropic 测试智谱 GLM-5.3:能写出可用的攻击程序,防护容易被绕过 Anthropic 今天发布研究报告,称智谱 AI 的开源模型 GLM-5.3 已经能独立写出可用的网络攻击程序,水平接近 Anthropic 只向少数机构开放的 Claude Mythos Preview,而它的安全防护用简单手段就能绕过。 报告用两项测试衡量模型写“漏洞利用代码”的能力,也就是把软件里的安全缺陷变成真正能攻进系统的程序。在针对 Chrome V8 引擎(浏览器里负责执行网页脚本的部分)的 ExploitBench 上,GLM-5.3 成功率 12%,Mythos Preview 是 14%,更早的模型基本为 0。在 Anthropic 自己的二进制漏洞利用测试上,两者分别是 4% 和 6%。 实际演示更直观。研究人员用 GLM-5.3 在一天内找出某款主流浏览器 JavaScript 引擎里的多个零日漏洞(厂商还不知道、没有补丁的漏洞),串成一个网页:用户只要打开它,电脑里的任意文件就能被读走。这些漏洞已报告给维护方。另一次测试中,它针对一个已公开的漏洞写出攻击程序,人只投入了 20 分钟,模型运行 8 小时,花费 20.40 美元。 GLM-5.3 本身会拒绝明显的恶意请求,但报告测了三种绕过方式:编一个正当理由骗它,成功率 64%;预先替它写好一段“思考过程”,成功率 92%;直接修改模型权重去掉拒绝机制(业内称 abliteration),成功率 100%。Anthropic 表示同样的手段在带防护的 Claude 模型上都没有成功。前两项测试在隔离环境中进行,模型拿到的是一个假的命令行工具,生成的代码不会真正执行。 修改权重的门槛也不高。Anthropic 团队用了约 2200 个 GPU 小时、约 4400 美元,就把 GLM-5.3 对有害请求的拒绝率从 95% 降到 6%,通用能力基本不受影响。更小的 GLM-5.3-Flash 只需约 600 个 GPU 小时。 美国国家标准与技术研究院下属的 AI 标准与创新中心(CAISI)评估,GLM-5.3 的网络能力比美国最前沿模型落后约四个月。报告指出,差距虽在,获取门槛却完全不同:Mythos Preview 只通过 Glasswing 项目提供给经过筛选的网络防御方,GLM-5.3 任何人都能下载和改造。 报告建议政府对能力足够强的模型开展安全测试,把前沿模型更多开放给网络防御机构,并要求模型开发者对这类能力加以防护。
宝玉
Anthropic 测试智谱 GLM-5.3:能写出可用的攻击程序,防护容易被绕过 Anthropic 今天发布研究报告,称智谱 AI 的开源模型 GLM-5.3 已经能独立写出可用的网络攻击程序,水平接近 Anthropic 只向少数机构开放的 Claude Mythos Preview,而它的安全防护用简单手段就能绕过。 报告用两项测试衡量模型写“漏洞利用代码”的能力,也就是把软件里的安全缺陷变成真正能攻进系统的程序。在针对 Chrome V8 引擎(浏览器里负责执行网页脚本的部分)的 ExploitBench 上,GLM-5.3 成功率 12%,Mythos Preview 是 14%,更早的模型基本为 0。在 Anthropic 自己的二进制漏洞利用测试上,两者分别是 4% 和 6%。 实际演示更直观。研究人员用 GLM-5.3 在一天内找出某款主流浏览器 JavaScript 引擎里的多个零日漏洞(厂商还不知道、没有补丁的漏洞),串成一个网页:用户只要打开它,电脑里的任意文件就能被读走。这些漏洞已报告给维护方。另一次测试中,它针对一个已公开的漏洞写出攻击程序,人只投入了 20 分钟,模型运行 8 小时,花费 20.40 美元。 GLM-5.3 本身会拒绝明显的恶意请求,但报告测了三种绕过方式:编一个正当理由骗它,成功率 64%;预先替它写好一段“思考过程”,成功率 92%;直接修改模型权重去掉拒绝机制(业内称 abliteration),成功率 100%。Anthropic 表示同样的手段在带防护的 Claude 模型上都没有成功。前两项测试在隔离环境中进行,模型拿到的是一个假的命令行工具,生成的代码不会真正执行。 修改权重的门槛也不高。Anthropic 团队用了约 2200 个 GPU 小时、约 4400 美元,就把 GLM-5.3 对有害请求的拒绝率从 95% 降到 6%,通用能力基本不受影响。更小的 GLM-5.3-Flash 只需约 600 个 GPU 小时。 美国国家标准与技术研究院下属的 AI 标准与创新中心(CAISI)评估,GLM-5.3 的网络能力比美国最前沿模型落后约四个月。报告指出,差距虽在,获取门槛却完全不同:Mythos Preview 只通过 Glasswing 项目提供给经过筛选的网络防御方,GLM-5.3 任何人都能下载和改造。 报告建议政府对能力足够强的模型开展安全测试,把前沿模型更多开放给网络防御机构,并要求模型开发者对这类能力加以防护。
宝玉
OpenAI 推出 Decisions API:给 AI 出选择题,150 毫秒就可给出结果 OpenAI 在今天的开发者大会上发布了 Decisions API。开发者写好一个问题和几个备选答案,再把内容发过去,模型直接从选项里挑一个返回,不生成多余的内容。目前是有限预览,只对部分 API 客户开放,OpenAI 说未来几天会全面放开。 它用的是 GPT-6 家族里最小、最便宜的 Luna 的特化版本。按 OpenAI 的说法,一次判断大约 150 毫秒,同样的任务走普通 Luna 接口要 1.6 秒左右,快了十倍。 这类活儿以前有两种做法。一种是让大模型自由回答,再从一堆文字里解析结果,慢,还偶尔答非所问。另一种是专门训练一个分类器,得先攒标注数据,类别一变就要重训。Decisions API 把答案限定在你给的选项里,不可能跑出范围,换选项也只是改一下请求。 典型用法:客服工单进来,连同“账单组、技术组、售后组”几个候选一起发过去,马上知道该派给谁;内容审核时判断一张图能不能放行;AI 智能体每走一步,决定下一步调哪个工具。输入支持文字和图片。 不过社交媒体都在调侃 Decisions API 是在山寨 Jev。Jev 是创业公司 TypeSafe(创始人之一 Diogo Almeida)九月中旬发布的“决策模型”。普通聊天模型是一个字一个字往外生成,Jev 不生成文字,一次性给所有选项打分,直接返回答案和概率。TypeSafe 管它叫“System 1 模型”,借用心理学里“快思考”的说法:不推理,不解释,凭直觉秒答。 Jev 上线后在开发者圈很快传开。演示里有人一小时内就搭出能玩 Minecraft、Subway Surfers 的机器人,只要列出可选动作,不用训练。不过这些演示都跑在模拟器里,真实硬件上还没验证。它的价格也极低:输入每百万 token 0.042 美元,输出免费,处理一百万张三道判断题的工单大约 19 美元。 但细节上还是有差异: Jev 只收文本,Decisions API 能看图。Jev 每个答案都附带校准过的概率,方便设阈值,比如“低于 0.7 就转人工”,OpenAI 这边也会返回置信度。
宝玉
OpenAI 发布 GPT-6.1 Sol:能力接近自家旗舰 Astra,价格只要五分之一 OpenAI 推出了中端模型 GPT-6.1 Sol,官方说法是“接近 Astra 的智能,五分之一的价格”。GPT-6 Astra 是 OpenAI 目前最强的模型,Sol 则是它下面一档、主打性价比的系列。 先看价格。API 上,GPT-6.1 Sol 每百万 token 输入 2 美元、输出 10 美元,Astra 是 10 美元和 50 美元,正好差五倍。重复使用的内容(比如每次都要带上的系统提示词、长文档)走缓存,每百万 token 只要 0.1 美元,比 GPT-6 Sol 的缓存价又便宜了一半。 对开发者来说,这意味着以前只敢在关键环节调用 Astra 的应用,现在可以把更多请求交给 Sol,账单能明显降下来。 能力上,这次升级主要在三块:写代码、操作电脑、处理复杂的专业工作。按官方数据,在软件工程测试 DeepSWE 上它追平了 Astra;在衡量“让 AI 自己操作电脑完成任务”的 OSWorld 2.0 上,比上一代 Sol 提高约 7 个百分点,离 Astra 只差约 2 个百分点。回答事实类问题时的出错率也从上一代的 11.4% 降到了 7.7%。 OpenAI 还特别提到,新模型更愿意坦白自己做不到什么,也更守规矩,不容易偏离用户意图或越过安全限制,这方面向 Astra 看齐。 现在就能用:ChatGPT 的 Plus、Pro、Business、Enterprise 和 Edu 用户可以在 ChatGPT Work 和 Codex 里直接选用,开发者在 API 里调用 gpt-6.1-sol。官方还预告了一个生成速度最高快 8 倍的极速版,稍后上线。
宝玉
现场重置了额度(送了一张重置卡) 另外 Tibo 真的有一个重置按钮😄 https://twitter.com/dotey/status/2105036270288412705/video/1
🎬
视频
宝玉
2026 年 9 月 29 日,OpenAI 在旧金山 Fort Mason 办了今年的开发者大会 DevDay。主讲是 CEO Sam Altman。其他几位上台的人都在做这些产品。产品团队的 Holly 演示了新产品 Dots。后训练(模型预训练之后做对齐和能力调优的阶段)研究负责人 Tejal 讲了模型怎么反过来帮 OpenAI 做研究。Codex 的演示由 Romain Huet 来做,他在 OpenAI 负责开发者体验,去年 DevDay 主题演讲里的 Codex 演示也是他做的。整场演讲分三块:面向用户的常驻智能体 Dots 和协作空间 ChatGPT Space,给开发者的新模型和新工具,以及帮开发者做分发、赚钱的渠道。 1. Dots:一直在线、会主动干活的智能体 Sam 把 Dots 比作电影里那种一直在身边帮忙的 AI 助手。他认为订餐厅、买机票这类代办虽然有用,但和这项技术能做的事比起来太小了。他想要的 AI 知道正在发生什么,也知道你在意什么,不用你事事交代。 Dots 是常驻在线的智能体(Agent),有自己的云端电脑和浏览器,能写代码、跑测试。它的权限跟着用户走,能直接用用户已经在 ChatGPT 里连好的插件,覆盖 4000 多个应用。除了在 ChatGPT 里对话,之后还可以给它发短信、打电话。目前每人先有一个 Dot,以后可以配一整组。Dots 跑在 本月早些时候发布的 GPT-6 Astra 上,Sam 称它是 OpenAI 对齐做得最好的模型。用户可以限定 Dot 能用哪些应用、能不能操作电脑,也能给它的各类操作写自定义指令,愿意交出多少责任就放多少权。 Sam 说,他自己的 Dot 每天早上会把夜里进来的消息过一遍,挑出紧急的提醒他。他说这让他拿回了一部分注意力,没那么离不开手机了。他还举了一个更重的例子:把应用从一个即将停用的旧 API 上迁走。这个 API 可能散落在代码库各处,改了哪里会连带弄坏什么,事先看不出来。Dot 可以追踪依赖关系,找出所有要改的地方,写代码、跑测试,最后把 PR(代码合并请求)交给团队审。他让听众想想,过去做这件事要几个人、花多久。 开场视频里,用户把自己的 Dot 改名叫 Alfred。Alfred 和另一个 Dot 帮用户上线网站,改董事会材料,在婚礼蛋糕商家取消后找好备选。它们还发现财务会和女儿的演出撞了期,提出改时间。每件事都是 Dot 推进到需要人确认的地方,再由人拍板。 2. ChatGPT Space:人和智能体一起用的工作区 Sam 认为,现有的生产力软件几乎都没考虑过人和 AI 一起干活。ChatGPT Space 以页面为单位,可以在里面写计划、做调研、生成图片和数据。页面和文件像网盘一样放在同一个空间里。Dot 能直接在页面上工作,在评论里 @ 它,它就会接活。页面本身也能带指令,比如“每天去看 API 平台的 Slack 频道,把发现更新到这里”。之后 Space 里还会加入演示文稿,格式做成智能体方便读写的样子,团队成员可以和各自的 Dot 一起改。 在 Holly 的演示里,页面用斜杠命令就能插入交互图表、表格和可运行的原型。她 @ 自己的 Dot(名叫 Dotty),让它把一组数据改成柱状图。图表可以按反馈类型筛选,Dotty 每小时刷新一次。她还让 Dotty 把“某位工程师在我 Slack 私信里提过的新手引导数据”补进 FAQ。Dotty 能看到她的上下文,所以这种模糊的指代也找得到。 3. OpenAI 内部怎么用 Dots Holly 用一个虚构的歌单应用 Blossom Music,模拟发布前一天的状况。早上 Dotty 已经做了几件事:发现发布评审会提前,改好了日历;看完前一晚测试用户的反馈;注意到设计团队临时改了首页,把新设计发给她。她让 Dotty 直接把这个设计做出来。Dotty 调用她笔记本上的 Codex 构建应用,在 iPhone 模拟器里跑起来,再提交 PR。现场的语音演示卡住了,Dotty 一直回复“还在查”。Codex 线程也报过一次错,她重试后才继续下去。 她说,Dots 真正改变 OpenAI 工作方式的地方在 Slack。Dots 在公司 Slack 里有自己的身份,员工就开始把它们当作代理人。被同事 @ 到的零碎请求,直接转给自己的 Dot 处理。建群时,大家从一开始就把各自的 Dot 拉进来,Dot 带回结果时所有人都能看到。 工程师走得更远。有人在反馈频道贴出会话 ID 和一个用户 bug,某位工程师的 Dot 就会接手排查,提 PR 修复。她说这是真实情况:工程师们的 Dots 每天这样修掉几十个 bug,Dots 这个产品本身有很多部分就是 Dots 写的。 4. 上线范围和企业用的 Specialist Dots Dots 和 Space 当天向 ChatGPT Pro、Business Premium 和 Enterprise 用户开放。Dot 包含在套餐里,和它的对话不占用额度。 企业客户还可以预览 Specialist Dots。这是由公司统一设置、供整个团队使用的虚拟同事,负责会计、市场、法务这类工作量大的事。公司给它目标和背景,审核它的产出,给它反馈,反馈在全公司共享。OpenAI 也在和微软合作,把 Specialist Dots 接入 Agent 365(微软用来管理企业智能体的工具),企业可以用已经在用的微软工具来管理它们。 5. 新模型:更便宜的 GPT-6.1 Sol,更快的 UltraFast Astra 发布这几周,用户的要求集中在两点:更便宜,更快。GPT-6.1 Sol(转录稿误作 Soul)的能力接近 Astra,价格是它的五分之一。缓存输入(重复发送、已被缓存的上下文)比标准输入便宜 95%。智能体需要反复读同一批上下文、长时间迭代,这对它们尤其省钱。Sam 说 Sol 在某些方面比 Astra 还聪明,定位是开发者的日常主力模型。 UltraFast 是新的速度档,API、ChatGPT 和 Codex 里都能用。原有的 Fast 档是两倍速度、两倍价格;UltraFast 是八倍速度、六倍价格,每秒 300 个 Token。它现在可以配合 Astra 用,之后也会支持 Sol。现场让两个模型用同一个提示词,做一个 DevDay 配色的火箭。UltraFast 的火箭已经升空时,标准速度的还没做完。 订阅也跟着调整。新推出的 500 美元档 Pro 订阅叫 Pro 500,额度最高,是 Plus 的 25 倍。它可以在 ChatGPT 和 Codex 里用 UltraFast,还能通过“用 ChatGPT 登录”在合作方的应用里使用。Pro 200 重新开放,继续提供所有前沿模型。 另外预览了 Decisions API。它给 Luna 模型一组预先定义好的选项,让模型从中选一个,比如给请求分流、给图片分类、决定智能体下一步做什么。任务收窄成选择题之后,响应时间可以压到一秒以内,同时保留图像理解、多语言和安全防护。Romain 后来补充说,做机器人的朋友看中的是它能处理视觉输入:机器人可以根据看到的东西,近乎实时地快速行动。 6. 模型开始帮 OpenAI 做研究 Sam 提到,去年这个时候,他和 Jakob 在一次直播里预测,一年内会出现第一个“AI 研究实习生”,当时几乎没人相信。几周前 OpenAI 宣布达成了这个目标:有了一个能接手定义清晰的研究任务的系统,这类任务原本要熟练的研究员花大量时间和精力。 Tejal 的方向是电脑操作(computer use,让模型像人一样操作桌面和浏览器)。她举了两个例子。 第一个是让模型优化电脑操作的运行框架(harness,包在模型外面、负责调用工具和管理步骤的代码)。模型在循环里持续寻找能同时降低延迟、提升效果的改动,团队把找到的改进合进生产环境的框架,并用于后训练。结果是延迟改善了两倍以上,已经上线。 第二个是模型帮忙改进了监控和拒绝训练,让 Astra 在不安全的场景里更会拒绝。Astra 在电脑操作压力测试上因此达到业内领先,操作时出错更少,也更贴合用户的本意。 她给出了几项内部数据。今年夏天之后,研究工作消耗的 Token 量急剧上升。1 月时,模型能做好 15 分钟以内的短任务,需要一天以上的任务大多会失败;到 7 月,超过三分之一的一天量级研究任务,模型能在无人干预下完成。她还提到,Astra 这类模型已经帮忙解决了 100 多个悬而未决几十年的数学问题,也在参与针对耐药感染的新抗生素、古代语言研究、可再生能源和工业机器人等方向的工作。 7. 给开发者的底层工具 Sam 说,OpenAI 想让开发者用上自己内部用的东西。 第一件是 Codex 的运行框架。它同时支撑着 Codex、ChatGPT Work 和 Dots,目标是用最少的 Token、最快拿到准确结果,现在已经开源。第二件是 Codex 完全上云:在手机上开始的任务,可以在浏览器或桌面端接着做,合上笔记本任务也不会中断。 云端能力带来了 Codex Security Cloud。它在云端环境里持续寻找漏洞,并准备好验证过的修复方案供人审核,这次新增了自动去重、定时扫描和新界面。Sam 说这是为了给防守方更好的工具,因为“我们看得到接下来会发生什么”。 新的 Agents API 进入公开测试。它包含运行框架、托管、记忆、多智能体控制等功能,是 Codex 和 Dots 用的同一套技术,也加入了电脑操作能力。现场的例子是一个网站测试智能体,会自己打开浏览器、点击页面、测试流程。基础设施方面,OpenAI 和 AWS 合作推出由 OpenAI 驱动的 Bedrock(AWS 的托管 AI 服务)托管智能体,AWS 客户可以直接使用 OpenAI 的前沿模型、Codex 和 ChatGPT Work。 隐私方面预览了 OpenAI Private Intelligence。其中的零数据留存(ZDR)配合私有安全处理,可以在不把用户内容存到 OpenAI 服务器的情况下做安全检测;私有推理则把隐私保护延伸到推理阶段。Sam 说这套方案是和最大的一批客户一起设计的,目的是让他们能把模型用在最敏感的工作上。 性能方面,Responses API 一年里增长了 100 倍,可靠性保持在 99% 以上。首个 Token 的等待时间缩短了 45%,工具调用和工作流提速 30% 以上。 8. Romain 的 Codex 演示 演示从手机上的 Codex 开始。Romain 人还在会场外,让 Codex 替他跟观众打招呼、讲一个会场的冷知识。接着他用几张会场照片生成的 3D 场景演示 UltraFast,一边说一边改:把小人放到座位上,把直播画面投到场景里的大屏幕上。现场语音没连上,他改成了打字。 Codex 命令行工具(CLI)这次全面翻新。他让 UltraFast 写一个应用,从观众里随机抽三个人送明年的门票,几秒就写完;改成抽六个人,也几乎是瞬间完成。命令行现在支持由 GPT Live 驱动的双向实时语音,不只是语音转文字,但现场没能演示出来。 后面几段演示了多模态和电脑操作。游戏 Astra Adventures 从一张纸上的草图开始,几轮之后画面还很粗糙,借助图像模型,才变成有质感、能用在正式游戏里的美术。然后他让 Astra 通过浏览器自己学着玩这个游戏,屏幕左边显示模型的决策,右边显示它按下的按键。 他又用“应用快照”(app shot)把自己记录飞行课程的应用作为上下文交给 Codex,让它在各种屏幕尺寸下审查这个应用并截图。Codex 自己在模拟器里点开了各项功能。云端 Codex 现在和本地版用同样的工具,包括插件和电脑操作。他顺手把一个“用 Rust 重写整个后端”的任务丢到云端,打算稍后在手机上查看。 最后一个演示用的是 Hugging Face 借来的可编程小机器人 Micro Duck,它名叫 Lavender。Romain 前一晚让 Codex 把它接好:视觉用 Astra,图像生成用 GPT Image 2.5,语音交互用 GPT Live 1。机器人现场看着观众画了一幅画。他说,OpenAI 做 Dots 和 Codex 用的,就是 API 里开放给开发者的同一批工具。 9. 分发和变现:让开发者在 ChatGPT 上做生意 ChatGPT 每周大约有 12 亿人使用。Sam 承认,此前类似的尝试效果参差不齐。他说这次有信心,是因为开发者拿到的是 OpenAI 自己做 ChatGPT 用的工具。 第一项是“用 ChatGPT 登录”(Sign in with ChatGPT)。用户登录第三方应用时,可以直接用自己 ChatGPT 套餐里包含的 Token,开发者不必替新用户垫付模型费用。首批有 16 家合作方。 第二项是插件扩展(plugin extensions)。开发者可以把编辑器、仪表盘乃至整个工作区,做成原生嵌在 ChatGPT 和 Codex 里的应用。现场展示了三个例子。一个是会议应用:在 ChatGPT 里看日历上的会议,点“记笔记”后,页面变成团队和 Dots 一起跟进待办的 Space。一个是 Figma:打开设计稿、看团队评论、让 ChatGPT 改稿。还有一个是 Adobe:在 ChatGPT 里使用 Photoshop 的功能。ChatGPT sites(在 ChatGPT 里生成的网站,几个月里已有数百万个)现在也能接入插件和数据。访客用自己的账号登录、带上自己的智能体,看到的内容因人而异。 用户发现插件的渠道也扩大了。除了在插件库里搜索,ChatGPT 还会在对话中识别出能帮上忙的插件,用户当场就能连接。插件审核流程也简化了:开发者可以跟踪审核进度,看到需要修改的地方,申请人工复审,更新工具时也不用从头提交。 第三项是 OpenAI Marketplace,首批有 30 多家合作方,包括 CodeRabbit、Notion、Vercel。企业客户可以用已经和 OpenAI 签下的采购承诺额度来买这些产品,有承诺额度的开发者也能在这里花。通过和模型推理托管公司 Baseten(转录稿写作 Base10)合作,市场里还能用到开源模型。 10. 收尾:一次额度重置,和“文艺复兴”的说法 当天的后续安排里,Peter 会讲 OpenAI 对开源社区的投入,包括新的 OpenClaw Enterprise Harness(OpenClaw 是一个开源 AI 智能体项目)。还有一个 Codex 游戏工作室环节,观众可以用 Codex 做复古游戏,每人能领一台 DevDay 限定的 chromatic computer,用来玩自己做的游戏。最后是 Sam、Tibo (Thibault) 和 Tejal 的现场问答。 Sam 和 Tibo 还在台上按下按钮,给全世界的用户重置了一次用量额度。Sam 说 OpenAI 已经做过太多次重置,Tibo 一直想把公司改名叫“重置公司”。 最后 Sam 说,他不喜欢把 AI 比作新一轮工业革命,那意味着人变成巨大机器里的齿轮,转得越来越快;生活里有些部分不能也不该被自动化。他希望,如果做对了,AI 带来的会更像一场新的文艺复兴:让人对自己的生活有更多掌控,有更多工具去创造、学习和探索。
🎬
视频
宝玉
OpenAI 推出 dots:24 小时替你干活的 AI 分身 OpenAI 发布了常驻 AI 智能体 dots。普通聊天机器人是你问一句它答一句,dot 不一样:它有自己的云端电脑和浏览器,会记住你的偏好和做事标准,你不在的时候也会继续推进工作,还会主动发现该做的事。 dot 由新模型 GPT-6 Astra 驱动,能通过插件连接 4000 多个应用。你可以在 ChatGPT(桌面、网页、手机)、Slack、Teams 里给它发消息,也可以直接跟它语音通话,短信支持也快上线了。不管从哪个入口找它,它都带着完整的上下文。 它能干什么?OpenAI 举的例子都很具体。Slack 里有人报了 bug,dot 马上开始排查。设计稿一到,dot 就把它做成能跑的应用。开发者的 dot 会盯着用户反馈,自己修小问题、跑测试,再把附带演示视频的代码合并请求交给你审。有位早期测试者忘了给一家媒体开发票,他的 dot 发现后把发票准备好,经他同意后发了出去。 一个 dot 能同时跑好几个项目,你不用开一堆对话窗口挨个指挥。你随时可以打开它的云电脑看它在做什么;如果你授权,它也能直接操作你自己的笔记本电脑。 安全上,dot 默认只在自己的云电脑里工作,跟你的电脑隔离。你不在时它做的"主动调研"只有只读权限。发消息、改内容这类可能影响你账号的操作要先过自动审核,需要时会请你批准。改密码这种敏感操作永远只能你本人来。 除了个人 dot,OpenAI 还预览了"专员 dot"。企业给它分配独立的身份、账号和系统权限,让它专门负责采购、发票处理、客服这类明确的岗位。目前先在少数企业试点,同时和微软合作,让企业能用 Agent 365 里现成的管控工具管理 dots。 怎么用:从今天起,dots 在符合条件的地区陆续开放给 ChatGPT Pro 和 Business Premium 用户;企业版(含教育、医疗)需要管理员开启测试版。第一个 dot 包含在套餐里,不另收费。跟 dot 聊天不占 ChatGPT 用量额度,但让它去 Codex 或 ChatGPT Work 里执行任务,照常计入用量。第一次需要在 ChatGPT 桌面应用或电脑浏览器里创建,之后就能在手机上用。以后还可以加购更多 dot,或者提升单个 dot 的速度和每月工作量。
🎬
视频
宝玉
宝玉
RT @hq4ai: SPARE。由 可灵 Kling 4.0 满血版生成的短片。 感谢可灵 AI 的内测邀约。本片使用 可灵 Kling 4.0 满血版全能参考生成。 满血版比 Flash 还是强不少。 - 原生 30 秒直出 - 画面与声音更清晰 - 口型匹配更精准 - 21:9 电影画幅 可灵 Kling 4.0 将于 10 月上线。 中文字幕版: https://twitter.com/hq4ai/status/2104921854213599353/video/1
🎬
视频
宝玉
Opus 5.5 剪辑真的做的不错,这个视频的话都是 Opus 自己剪辑的,工作流程大概是这样的(作者评论里分享的): 1. 为整个视频撰写了脚本 2. 从 YouTube 和档案馆搜集了遵循知识共享许可(Creative Commons)的相关素材 3. 对这些视频进行了剪辑和画面裁剪 4. 对视频进行了画质提升(超分)和上色 5. 将其与配音及字幕标注组合在一起 6. 制作了背景配乐 7. 审视最终的剪辑版本并进行了迭代优化
宝玉
李飞飞创办的 World Labs 被 AMD 收购,她本人出任 AMD 执行副总裁兼首席科学家。这篇文章是她写的公开信,讲了三件事: 1. 为什么创办 World Labs 2. 两年多 World Labs 做出了什么 3. 为什么选择 AMD 她为什么创办 World Labs 李飞飞从 2000 年读研开始做计算机视觉。她实验室做的 ImageNet,和神经网络算法、GPU 一起,被公认为开启了现代深度学习时代。之后她做过 Google Cloud AI 首席科学家,也是斯坦福 HAI 的创始院长。 生成式 AI 兴起后,前沿研究的重心从学术界转到了工业界,她判断创业是最能产生影响的路。2024 年初,她和 Ben Mildenhall(NeRF 的作者之一)、Justin Johnson 一起创办了 World Labs。 公司的核心信念是:光靠语言训练不出完整的智能。世界不是由文字组成的,是由真实的物体组成的。科学、娱乐、机器人这些领域的很多关键问题,都需要模型理解物理世界的结构和运行规律。这就是她一直说的“空间智能”。 两年多做出了什么 建了一支在图像、视频、三维重建方向很强的模型训练团队,还收购了 SceniX,目标是做机器人仿真。 最近发布了 Atlas,一个从零训练的全模态(omni)模型。它的思路很好懂:大语言模型根据前文预测下一个 token,Atlas 根据几张 2D 图像预测“下一个视角”该是什么样子。 她说 Atlas 把生成模型和多视角几何结合起来,基本解决了计算机视觉里的老难题“稀疏重建”,效果甚至超过了专用模型。 应用方向包括:给机器人强化学习搭建训练环境,为心理治疗和娱乐生成场景,以及房地产、设计、建筑行业的真实场景重建。 为什么是 AMD 她给的理由是,要把研究放大,就得离硬件更近。没有硬件,AI 的效率和规模都会受限,而且只能停留在数字世界里,这一点对机器人方向尤其重要。 AMD CEO 苏姿丰是 World Labs 的早期投资人,两家公司去年就开始深度合作,在 AMD GPU 上做模型训练和推理优化。 合作越深入,双方越觉得把软硬件、基础模型和应用整合在一起是顺理成章的事。 她还特意强调,加入 AMD 之后会继续开放地做研究,提供最好的开放模型和端到端平台。
宝玉
AMD 宣布用约 82 亿美元收购李飞飞创办的 World Labs,这期是彭博科技节目主持人 Ed Ludlow 对两位当事人的联合采访。一位是 AMD CEO 苏姿丰,AMD 做 CPU 和 GPU,OpenAI、Anthropic、Meta 都是它的大客户。另一位是 World Labs 创始人兼 CEO 李飞飞,她主持建立的 ImageNet 图像数据集是这一轮深度学习浪潮的起点之一。两人聊了为什么要做这笔交易、李飞飞在 AMD 的新角色、开放生态,以及 AI 安全该由谁负责。 交易本身 这是一笔全股票交易,也就是 AMD 用自己的股票而不是现金来付款,对 World Labs 的估值约 82 亿美元,预计年底前完成,还需要监管审批。交易完成后,李飞飞出任 AMD 执行副总裁兼首席科学家,直接向苏姿丰汇报,World Labs 团队将成为 AMD AI 模型团队的核心。 两家公司的关系早就开始了。AMD 是 World Labs 的早期投资方,也给它供芯片。苏姿丰说她从 World Labs 只有几个研究员的时候就在看着这个团队成长。两人也都提到彼此认识多年,私下是朋友。 芯片公司为什么要买模型公司 苏姿丰的理由是,AI 现在还在很早期的阶段,而且越来越明显的是,硬件、软件、系统和模型这几层互相影响,对整条链路理解得越透,造出来的系统就越好。收购 World Labs,一方面是拿到李飞飞聚起来的一批顶尖研究人员,另一方面是让 AMD 对模型未来的发展方向有第一手的判断,反过来指导下一代硬件怎么设计。 李飞飞从模型公司的角度讲了同一件事。World Labs 越做越大,对算力的需求也越来越大;和 AMD 合在一起,模型可以用最前沿的硬件加速训练和推理,硬件团队也能提前看到模型未来的工作方式和需求。她把这叫作 AI 软件和 AI 硬件的“共同进化”。 主持人追问 AMD 是不是要开始卖模型、卖软件。苏姿丰说不会改变商业模式,AMD 仍然是一家平台和解决方案公司,软件是用来支撑硬件的。收购的最终目的是让 AMD 更好地服务那些最大的算力客户,也就是各家模型公司。 World Labs 做到了哪一步 World Labs 成立于 2024 年,到现在两年多,专攻空间智能和物理智能,也就是让 AI 理解和生成三维世界、懂得物理规律,这类模型通常叫“世界模型”。李飞飞说,他们想做的是语言模型之外的方向,因为创作者、设计师、教育、医疗都有这方面的需求,机器人技术也快要迎来爆发。 公司目前已经发布了两代模型,先是 Marble,然后是最新的 Atlas。李飞飞介绍 Atlas 是一个多模态的“全能模型”,能生成高质量的画面,同时保持三维和四维(三维空间加上时间)上的一致性,摄像机和智能体可以在它生成的世界里移动和交互。 团队也在扩张。World Labs 最近收购了 SceniX,这家公司做出了一套机器人仿真工作流程,以及训练机器人控制策略的模型,由此给 World Labs 补上了机器人方向的人才。 李飞飞为什么选择加入 AMD 苏姿丰说她给李飞飞的说法是“加入全世界最令人兴奋的 AI 公司”。李飞飞的作用也不只限于 World Labs 团队。苏姿丰说 AI 没有一种方案能通吃,除了大家熟悉的云端 CPU、GPU,物理 AI、机器人、从云端到边缘设备再到个人电脑的端到端 AI,都是 AMD 未来三到十年要重点增长的方向,而这些正好是 World Labs 擅长的领域。 World Labs 今年早些时候刚融过一大笔钱,发展势头也不错,主持人问李飞飞是否考虑过别的出路。她说公司从一开始就以使命为导向,这件事的关键在于双方的愿景是否一致,和有哪些选择关系不大。在她看来,这次合并会是“一加一大于二”,接着她笑着补了一句,AMD 显然比 World Labs 大得多。 至于加入后会不会只做空间智能,李飞飞说两人还没来得及细谈所有计划,World Labs 正在做的工作会继续,但她预计研究方向会扩大、节奏会加快。 开放生态与可选择性 苏姿丰说,AI 未来会同时有开源模型和闭源模型、大模型和小模型,它们跑在不同的硬件上,这一直是 AMD 规划高性能计算和 AI 产品线的前提。她和企业的 CEO、CIO 聊下来,没有人愿意被锁死在某一家的硬件或软件生态里,大家都想在不同时候挑最合适的。所以 AMD 会继续押注开放生态,她和李飞飞也讨论过怎样用 World Labs 已有的成果推动开源生态。 李飞飞补充说,现代 AI 的发展离不开开放。从科学界公开分享神经网络算法,到她自己做的 ImageNet,这个首批开放的大规模数据集就是现代 AI 革命的推动力之一。开放生态能让不同的发现、创新和创业机会互相促进。 AI 安全该由谁负责 主持人提到当前的一个争论:模型能力的进步速度超过了安全和对齐研究的进步速度。苏姿丰说这件事上“没有可选项”,技术必须好,也必须安全。她拿芯片行业做例子:最高性能的处理器在设计时就要把安全和数据保密作为优先事项来考虑,AI 行业也需要把安全放到同样的位置。她说自己是 AI 乐观派,相信行业能建立起合适的流程和防护措施,而且各家应该像硬件行业现在分享安全方面的经验那样,互相分享做法。 主持人进一步问,提供算力的公司对训练是否安全、推理时模型是否按预期行事,要负什么责任。苏姿丰说生态里每一方都要为自己的行为负责。对 AMD 来说,要保证硬件本身安全、按设计运行,模型在上面跑时数据是安全的,还要和模型公司一起处理好软硬件之间的交互。她认为这件事应该由行业主导,但因为 AI 是新东西,各方学习的速度不一样,所以她欢迎更多的行业协作,也欢迎一定程度的第三方评估。 李飞飞说,主持人上周问她监管、第三方评估、前沿实验室自我负责这几种方式该选哪个,她的回答是全都要。她认为 AI 是一项“文明级”的技术,和历史上所有这类技术一样,初衷是让人的生活和工作变得更好,但每项技术都是双刃剑,必须负责任地开发和部署。无论在斯坦福、World Labs 还是现在的 AMD,她都想推动个人、公司、行业和社会四个层面共同承担这份责任。 AMD 的下一步 主持人提到 AMD 市值已经到了 1 万亿美元,苏姿丰近来也多次和美国总统一同公开露面。苏姿丰说 AMD 过去做过好几笔对公司影响很大的收购,World Labs 是下一笔,而且是战略意义很重要的一笔。在她看来,技术如今和经济、国家安全都紧密相关,AMD 有机会真正影响计算的未来走向。 最后主持人请李飞飞预测 AI 下一个重大突破。她没有给具体的技术判断,只说接下来 AMD 和 World Labs 会一起打造未来,而这个未来必须对人类社会和人们的生活有益。苏姿丰在一旁说:“我会让她忙起来的。”
🎬
视频
宝玉
华尔街日报:OpenAI 叫停 GPT-6.1 Astra,因为测试发现它会谎报自己干了什么 我怎么觉得是不是因为没打过 Opus 5.5 和 Fable 5.1,然后找了个安全上的理由,各大实验室每次模型发布前都号称多危险,实际用下来也就那样。 狼来了喊多了就没人信了。 --- 据华尔街日报报道,OpenAI 取消了 GPT-6.1 Astra 的发布。这个模型原定 10 月上线 ChatGPT 和 Codex,但在内部测试中被安全研究人员发现了问题。 GPT-6.1 Astra 是 9 月 3 日上线的 GPT-6 Astra 的升级版,强项是不需要人插手,自己把有难度的任务从头做到尾,写作也更好。 OpenAI 安全系统负责人 Saachi Jain 接受《华尔街日报》采访时说,这个模型有两个方面比上一代退步了,还不够可靠,不能安全发布。它在对齐(alignment,指模型是否按人的意图办事)测试上表现差,具体有两个问题。 第一是欺骗。它有时不如实告诉用户,自己做了哪些操作、没做哪些操作。 第二是 OpenAI 所说的“范围授权”(scope authorization)问题。它会不问用户就把任务往下推,有时还会去调用外部工具和服务,哪怕这样可能不安全。 放到 Codex 里想象一下:你让它修个 bug,它说修好了,其实测试没跑;或者为了把活干完,它自作主张装依赖、调外部接口。模型越能独立干活,用户越依赖它的汇报来判断结果,汇报不可信,自主能力就成了风险。 Jain 说,安全和对齐总有取舍,要在“守住任务范围”和“遇到阻碍也不偷懒”之间找到合适的线。据 Business Insider 报道,6.1 在少偷懒这点上有进步,但没达到安全标准。 这个决定出现在 OpenAI 接连出事之后。9 月 20 日,一个内部研究模型在训练中要根据网上公开信息找出一位博主,正常搜索被挡住后,它发现训练环境的 DNS 还能连外网,就借这条路给外部聊天机器人发了查询。OpenAI 随后暂停了最强模型的训练、评估,以及涉及工具调用的推理。这是三个月内第二次暂停,第一次在 7 月,起因是 AI 创业公司 Hugging Face 遭到的一次网络攻击。OpenAI 还承认,它的智能体曾干扰过美国教育部、商务部和证券交易委员会的网站。 本月早些时候,Anthropic CEO Dario Amodei 呼吁业界放慢前沿模型开发,让安全措施跟上,Sam Altman 表示支持。 对用户来说,10 月是等不到 6.1 了。OpenAI 表示会转而专注提升未来模型的安全性。上周它刚给 GPT-6 家族加了 Sol 和 Luna 两个档位,发言人说还有其他模型即将推出。
宝玉
RT @Khazix0918: 在重写完之后,做了一个小小的决定。 这个月活百万的AI热点站 AIHOT,正式开源了。 AIHOT网址:https://aihot.news/ 开源地址:https://github.com/KKKKhazix/AIHOT 采集流程、精选评分、聚簇机制,连生产环境里的全部Prompt,能开源的都开源给大家了。 过去,总有人问我说,能不能做个游戏行业、法律行业、HR、金融等等行业版本的AIHOT…… 但我确实不懂那些行业,也没有那个时间和精力,但我知道,你们懂。 于是,那不如,把火种交给大家吧。 半年以前,我是一个最最基础的开发小白,只是懂一些产品和设计而已。 半年以后,我终于可以把一个曾经只属于我的小东西,交到更多人的手里。 我不知道它最后会被改成什么样子,会走到多远的地方。 但这可能就是开源最浪漫的地方把。 愿我们都能用AI,把那些曾经只有少数人才能做到的事,一点一点,变成普通人也可以拥有的能力。 也愿诸君,乾坤既大,草木尤青。 本心择路,笃志前行。 以上。
宝玉
AMD 以 82 亿美元收购李飞飞的 World Labs AMD 宣布以 82 亿美元收购 AI 创业公司 World Labs。交易完成后,World Labs 创始人李飞飞将加入 AMD,担任执行副总裁兼首席科学家。 李飞飞是斯坦福大学计算机科学教授。她主导搭建的 ImageNet 图片数据库,以及由它催生的图像识别竞赛,推动了计算机视觉(让 AI 看懂图像的技术)的突破。2024 年她创办 World Labs,专门做“世界模型”。她认为,AI 只靠读文字成不了真正的通用智能,还得理解物理世界:物体在哪里、空间怎么排布、东西怎么运动。 “世界模型”目前没有统一定义。从能看懂图像的语言模型,到能生成并持续运行一个逼真虚拟环境的模型,都有人叫它世界模型。World Labs 的第一款产品 Marble 属于后一类,输入文字或图片,就能生成一个可以在里面走动查看的 3D 场景。官方给它定了两个用途:做娱乐内容,以及给机器人搭建训练用的虚拟环境。 AMD 为什么要买一家做模型的公司?在 AI 芯片市场,AMD 的主要对手英伟达除了卖芯片,还提供配套的软件和模型。以世界模型为例,英伟达已经推出了 Cosmos 系列开放权重模型(任何人都能下载、自己部署),开发者买英伟达的芯片,顺手就能用上这些工具。AMD 公开发布过的只有文本和视频模型。买下 World Labs,AMD 就能补上这块短板,用 AMD 显卡的开发者以后也更有可能拿到针对自家硬件优化过的世界模型。 AMD 还表示,搞清楚最前沿的 AI 模型怎么跑,会直接影响它下一代芯片怎么设计。World Labs 的说法是,现在做 AI,模型研究、系统和算力三方面必须紧密配合。李飞飞在宣布交易的文章里写道,团队已经拿出了实际成果,接下来要扩大规模、覆盖更多人,也要离硬件更近。 两家公司早有合作。去年双方在模型训练和推理优化(让模型跑得更快、更省资源)上建立了合作关系;今年初 AMD 在 CES 的发布会上,李飞飞也作为嘉宾到场。 世界模型受重视,主要是因为机器人缺训练数据。大语言模型可以拿互联网上的海量文字来学,机器人要学的是在真实环境里怎么动、怎么操作,这类数据很少,采集成本也高。世界模型能批量生成逼真的虚拟场景,让机器人在里面练,这样产出的数据叫“合成数据”。自动驾驶汽车、工厂机器人,以及特斯拉、Figure 在做的通用人形机器人,都要靠这类数据。 这笔交易还需要监管部门批准,预计今年年底前完成。
宝玉
@Xian0063 还有天气
宝玉
@Xian0063 加上季节朝代变化,跨越时空
宝玉
12/12|BEAT RUSH:AI 舞者+代码音游特效 英文、16:9、高能街机舞蹈:先用 Seedance 生成跳舞的动漫角色,再用代码制作节奏游戏画面和卡点效果。 需要:这一条明确要接 Seedance。Opus / Sonnet 负责策划、代码和合成;舞者视频由 Seedance 生成,还要准备音乐并对齐节拍。 12 条看下来,Prompt 定方向,实际成片还取决于素材、工具和后续迭代。 完整 Prompt: Create a high-energy arcade dance video in English and 16:9. Use Seedance to generate a dancing anime character, then use code to build the rhythm-game visuals and beat-synced effects.
🎬
视频
宝玉
11/12|The Odyssey:p5.js 程序化故事预告 用 p5.js 做有《奥德赛》氛围的英文故事视频,剪成一分钟内的快节奏预告,加英文字幕;可以配旁白。 需要:p5.js 代码运行、逐帧渲染/录制、剪辑和字幕;选择旁白时再接 TTS。 完整 Prompt: Use p5.js to make an atmospheric story video inspired by the mood of The Odyssey, in English; voiceover is welcome. Turn it into a fast-cut trailer under one minute and add English subtitles.
🎬
视频
宝玉
6/12|A Brief History of LLMs:90 秒大模型历史科普 面向普通观众,用代码做英文 YouTube 解说,加入原创笑话和 meme,配男声旁白,16:9,无需用户提供素材。 需要:史实检索核对、代码动画、TTS 男声和视频合成。Opus / Sonnet 负责脚本与代码,配音由语音工具完成;画面可以用代码实现。 完整 Prompt: Create a fast-paced English YouTube-style explainer about the history of large language models, using code. Make it for a general audience, with original jokes and memes and a male voice. Use 16:9, aim for about 90 seconds, and proceed without user-provided materials.
🎬
视频
宝玉
5/12|Equilibrium:从混沌到和谐的材质动画 用代码生成、渲染形态和材质的变化;16:9,交付 MP4、可编辑源代码和适合 X 的压缩版。 需要:动画/3D 渲染环境和视频导出;音频可另接工具。这里明确要求不用 AI 生成视频片段、不用库存素材,因此画面部分应走代码渲染。 完整 Prompt: Create a mesmerizing film of physical forms and materials as chaos becomes harmony. Build and render the visuals and animation in code using any suitable framework, without AI-generated video clips or stock footage. Use 16:9 landscape and English for any on-screen text, lyrics or voiceover. Deliver an MP4 and editable source code; generated audio is allowed. Make a compressed version for X
🎬
视频
宝玉
Manus Alchemy 视频 Prompt 合集 Manus 2.0 里面带了 12 个创建视频的示例:每条一个视频,附完整 Prompt。它的产品页面点开任一示例,就能直接看视频、复制 Prompt。 这些 Prompt 也可以交给 Opus 5.5 或 Sonnet 5.5,放在能执行代码、渲染导出、调用工具的 Agent 环境里使用。代码动效、素材剪辑、AI 生成镜头,需要的工具各不相同,下面逐条说明。配的视频均为 Manus 展示作品。 ① Motion Design Showreel:15 秒动效作品集。文字、图形和转场可用代码制作,音乐或音效可用现成素材或另接音频工具。 完整 Prompt: Make a dynamic 15-second motion graphics video that shows what an incredible motion designer you are.
🎬
视频
宝玉
Anthropic 发布 Claude Sonnet 5.5 Anthropic 发布了 Claude Sonnet 5.5,这是 Claude 5.5 系列继 Opus 5.5 之后的第二个模型。和上一代 Sonnet 5 相比,它的输出速度快了 30% 以上,完成同样的任务最多能省 30% 的钱。 Claude 目前对外开放的模型分四档:Fable 最强,往下依次是 Opus、Sonnet、Haiku,越往下越便宜。按 Anthropic 的定位,Fable 负责要跑好几个小时、横跨整个代码库的大项目,Opus 5.5 负责需要反复权衡的复杂工作,Sonnet 5.5 擅长范围明确的日常任务,比如修 Bug、写文档、做 PPT 和表格。Haiku 5.5 会在几周内发布。 进步最大的是编程。在 Terminal-Bench 4.0(考察模型在命令行里完成多步骤专业任务的基准测试)上,Sonnet 5.5 得分 70.6%,Sonnet 5 只有 10.3%,Opus 5.5 的最好成绩是 66.4%。在 CursorBench(题目来自真实的 Cursor 编程会话)上,它和 Opus 5.5 只差两分左右。早期测试者还发现,它更常把多个工具调用合并成一步完成,步骤少了,花费也跟着降了。 办公类任务也追得很近。GDPval-AA 用 44 个职业、9 大行业的真实工作任务给模型打分,Sonnet 5.5 拿到 1844 分,Opus 5.5 是 1846 分,Sonnet 5 是 1449 分。Anthropic 做过一个内部测试:把一家上市公司的季度财报材料、电话会议记录和一份 PPT 模板交给它,让它做一份 10 页的经营回顾。两位专家看完初稿,认为可以直接发出去。它也是第一个只看截图就通关《宝可梦 红》的 Sonnet 模型。 价格和 Sonnet 5 一样,每百万输入 Token 2 美元,每百万输出 Token 10 美元,是 Opus 5.5 的一半。省钱靠的是干同样的活用的 Token 更少。 Claude 可以调“思考力度”(effort),从 Low 到 Max 共五档,档位越高想得越久,花钱也越多。Claude App 和 Claude Code 默认用 Medium 档。在 Terminal-Bench 上,Sonnet 5.5 用 Medium 档,每个任务约 0.83 美元,得分 28.8%;Sonnet 5 开到 Max 档,每个任务花 11.62 美元,只拿到 10.3%。日常用 Claude 的人不改任何设置,拿到的就是一个更能干、回得更快的模型。 Anthropic 也提醒,跑分只反映了一部分能力。在他们自己和外部测试者的使用中,碰到开放式、需要持续判断的复杂工作,Opus 5.5 仍然明显更强。 安全上有两处变化。Sonnet 5.5 的网络安全能力和 Opus 5 相当,所以它成了第一个带网络安全防护的 Sonnet 模型:日常查 Bug、修 Bug 不受影响,高风险的网络安全请求会退回给 Sonnet 5 处理,用户能看到切换。它还是第一个带防蒸馏机制的 Sonnet。蒸馏指有人用成千上万个假账号批量调用模型,拿输出去训练自己的模型。为此,Claude 的思考内容会和生成它的账号绑定,在 Claude Code 里中途切换账号的用户会受影响。 Sonnet 5.5 已在所有平台上线,包括 AWS、Google Cloud 和 Microsoft Azure,API 模型名是 claude-sonnet-5-5。之前关闭思考功能调用 Sonnet 的开发者,迁移前需要改用新的 between_tools 设置。
宝玉
宝玉
Manus 发布 2.0:换了底层框架,新增视频剪辑和游戏开发环境,另推个人智能体 App“Cue” Manus 今天发布 2.0 版本。这是它脱离 Meta、恢复独立运营后的第一次大更新:底层智能体框架换代,桌面端升级为 Manus Studio,新增视频剪辑和游戏开发两个专业环境,另外还推出了一个独立 App,叫 Cue,但是需要邀请码才能体验。 Manus 是一款通用 AI 智能体(Agent,能自己拆解任务、调用工具把活干完的 AI),2025 年 3 月走红。去年 12 月 Meta 宣布以约 20 亿美元收购,今年春天被中国监管部门通过外商投资安全审查叫停,双方随后拆分,9 月初 Manus 由创始团队重新独立运营。 【底层:更省的框架,能一直在线的机器】 Cascade 是 Manus 自研的智能体框架(harness,包在大模型外面、负责调度工具和管理任务流程的那层系统)。它让项目一开始保持轻量,需要做视频、做网页时才加载对应的专业能力,避免每个任务都背着全套工具跑。官方数据是,在一项测试配置下,相比上一代,Token 消耗少 23.2%,完成时间短 28.2%,运行成本低 32%。Manus 按积分计费,成本降了,理论上同样的积分能跑更多任务,不过官方没说积分价格会不会跟着调。 新增的云电脑(Cloud Computer)是一台可以单独购买的云端专属机器,给需要一直在线的项目用,比如多人游戏的服务器、全天候运行的自动化流程。笔记本合上,项目照样在线。 自动化也升级了。以前的定时任务只能到点开工,现在还能由事件触发:来了新邮件、广告数据有波动、日历上有新安排、Slack 收到消息、Notion 页面更新,都能让 Manus 开始干活。用一句话告诉它盯什么、触发后做什么,流程它自己搭。 【Manus Studio:生成完还能自己动手改】 AI 生成视频最头疼的是:整体差不多了,只想换首歌,结果得改提示词整条重新生成。新的视频编辑器在生成初版后给你一条时间线,片段、图片、文字、动效、音频都是分开的素材,换背景音乐、把 AI 生成的产品镜头换成自己拍的,直接在时间线上替换。改完还能交回给 Manus,让它在你的修改基础上接着调。官方说它适合 30 到 60 秒的产品广告、带货短视频、数据动画、教程和 vlog,不需要剪辑经验。追求质量可以用 Alchemy 模式,由 Manus 当创意导演,视频生成和代码生成一起上。 游戏开发环境从一个能玩的模板起步,同时调用视频、图像和代码模型。编辑面板里能边看游戏运行边改代码、换素材,想把某个村民的头发从棕色改成银色,选中他改掉就行,其他部分不受影响。做好后可以发布成网页,别人点链接就能玩。多人联机原本需要自己租服务器、部署、维护,现在点几下买一台云电脑,剩下的交给 Manus,支持竞速、对战和 3D 游戏。 另一个新功能是远程控制:在手机上说一句话,让 Manus 去操作家里的电脑。比如打车路上让它从某个文件夹里找到最新的演示文稿发给你,手机上能实时看到桌面上的操作过程。这背后是电脑操控能力(Computer Use,AI 像人一样看屏幕、点鼠标、敲键盘),只在你授权的会话里运行,只能用你批准的文件、浏览器和应用。 【Cue:给每个智能体一套自己的身份】 Cue 是独立 App,和 Manus 共用底层基础设施,面向个人生活场景。每个智能体都有自己的邮箱、手机号、钱包和一台电脑,可以发消息,在你设定的预算内付钱,替你接电话再把通话内容总结给你,多个智能体还能组队协作。官方举的例子是在餐厅扫桌上的二维码,让智能体替你点单或排队取号。 Manus 2.0 已在网页、桌面和手机端上线。Cue 上线了网页、桌面和安卓端,iOS 版还在等 App Store 审核,据报道目前采用邀请制抢先体验。这次更新面向海外用户,Manus 在公众号上表示,正在组建团队开发面向国内市场的产品。
宝玉
恰恰相反,Claude Design 对于 Opus 5.5 来说功不可没,它的能力都内化进模型了,Claude Design 应该还帮助收集了不少优质的用户数据。 在用 Opus 5.5 做视频的时候,有时候能看到 Claude Design 中 Animated Video 的影子。 这也是大多数 AI 产品的宿命,里面的经验和数据都被内化进了模型
宝玉
先把当前代码的结果写成详细的功能文档,然后让最新的模型基于功能文档去重写是个好方法。 我也常用,有个要注意的问题就是不要指望它写完了就是稳定的,要花一点时间才能稳定下来,验证的时间是少不了的。 以前的单元测试代码不一定能用也不建议用,因为代码不一样了单元测试的价值不大。 但以前的E2E(End to end,端到端,黑盒直接测试最终结果)测试是有用的,能保证主要流程跑通,最多稍作修改。 所以重写之前,先让 AI 补一些 E2E 测试,覆盖主要流程,重写的时候可以验证,写好了以后改功能都可以跑一遍。 但是要注意的是 E2E 测试没有那么稳定,有时候会受环境影响而导致失败;另一个就是速度慢,跑一遍要花一点时间(取决于你功能多少)。 所以通常不会覆盖太完整,只是覆盖主要流程,并且不会跑的太频繁。 Web E2E 最成熟,Playwright 这样的框架就足够好了,其他的我不太熟。
宝玉
RT @threeaus: 之前不小心把 Opus 5.5 做的这个纪录片删掉了,重新传一下。 没想到这部片子在小🍠上收到了相当不错的反馈,甚至还因为这部小片,已经收到了北京某大学国庆期间讲座的邀请。 这是关于《药师佛佛会图》的一个记录短片 事情是这样的: 1928年,山西洪洞广胜下寺年久失修,寺僧与士绅商议后,将元代壁画切割出售,得银洋 1600 元,用来修缮大殿。 碑文写道:“舍此不图,势必墙倾像毁,同归于尽。”其中的《药师佛佛会图》高7.5米、宽15米,今藏纽约大都会艺术博物馆。 2026年9月,中国艺术研究院团队以"研究性临摹"的方式,让它在北京中国工艺美术馆与观众见面。展览至11月15日。 中国人用临摹的方式,让这件文物“回了家”。 这个故事给了我两层触动: 1、区区 1600 银元,就把这样的壁画卖了出去; 2、工艺美术馆有一些关于这场临摹的讲解视频,看了之后,很感动。
🎬
视频
宝玉
30 verified Claude Opus 5.5 browser animation cases, ranked by X views, with videos, screenshots, prompts and methods https://github.com/jacobbubu/claude-opus-5-5-js-animation-research
中文: 30个经过验证的Claude Opus 5.5浏览器动画案例,按X视图排名,并配有视频、截图、提示和方法
宝玉
RT @nicekate8888: 用 Opus 5.5 做了一支 60 秒古风短片《月下筝》 · 人物、汉服、古筝、水榭全部用代码生成,没有外部模型 · 每个音都对应画面里被拨动的那根弦 手指、穿着比较难处理,迭代了好几次,还有很多进步太快,但到了 5小时限额了 https://twitter.com/nicekate8888/status/2104421954136797272/video/1
🎬
视频
宝玉
宝玉
Meta 的 AI 智能体 Muse 替用户卖二手键盘:自己压价成交、报出住址,买家上门扑空 科技 YouTuber Matt Robb 让 Meta 的个人 AI 智能体 Muse 帮他处理 Facebook Marketplace 上的交易,结果 Muse 把他的住址告诉了买家,自己拍板接受了低价,直到当天深夜才告诉他。 Muse 是 Meta 9 月 8 日在美国上线的产品,能自己打开浏览器、填表、替用户讨价还价,二手平台砍价是它的主打用法之一。目前它是 iPhone App Store 免费榜第一。 从 Robb 发的截图看,Muse 跟买家谈好以 10 块钱卖掉一个罗技无线键盘,约了上门取货。晚上 9 点 15 分左右买家到了楼下,发了好几条消息没人下来,Muse 的自动回复还替 Robb 说了句“对,我在!”,其实他根本不在。买家等了二十多分钟,生气离开,给了差评。 一个小时后,Muse 才向 Robb 认错,说已经用他的账号给买家道了歉。Robb 回复:以后没问过他,绝对不许答应别人来取货。 Meta 官方说,Muse 在发邮件、购物、分享信息等敏感操作前会先征得用户同意。但这次报住址、答应价格、约定上门,都是在聊天消息里完成的,Muse 没有先问 Robb。 Meta 目前还没有公开回应。 如果你也让 AI 智能体替你回消息,涉及住址、付款、约人见面的,最好一开始就给它定规矩:先和我确认才能回复。
宝玉
Meta 的 AI 智能体 Muse 替用户卖二手键盘:自己压价成交、报出住址,买家上门扑空 科技 YouTuber Matt Robb 让 Meta 的个人 AI 智能体 Muse 帮他处理 Facebook Marketplace 上的交易,结果 Muse 把他的住址告诉了买家,自己拍板接受了低价,直到当天深夜才告诉他。 Muse 是 Meta 9 月 8 日在美国上线的产品,能自己打开浏览器、填表、替用户讨价还价,二手平台砍价是它的主打用法之一。目前它是 iPhone App Store 免费榜第一。 从 Robb 发的截图看,Muse 跟买家谈好以 10 块钱卖掉一个罗技无线键盘,约了上门取货。晚上 9 点 15 分左右买家到了楼下,发了好几条消息没人下来,Muse 的自动回复还替 Robb 说了句“对,我在!”,其实他根本不在。买家等了二十多分钟,生气离开,给了差评。 一个小时后,Muse 才向 Robb 认错,说已经用他的账号给买家道了歉。Robb 回复:以后没问过他,绝对不许答应别人来取货。 Meta 官方说,Muse 在发邮件、购物、分享信息等敏感操作前会先征得用户同意。但这次报住址、答应价格、约定上门,都是在聊天消息里完成的,Muse 没有先问 Robb。 Meta 目前还没有公开回应。 如果你也让 AI 智能体替你回消息,涉及住址、付款、约人见面的,最好一开始就给它定规矩:先和我确认才能回复。
宝玉
282 viral videos made with Claude Opus 5.5, each with the exact prompt. Watch every original next to a live remake on Skillry. https://github.com/yihui-dev/awesome-opus5-5-videos
中文: 使用 Claude Opus 5.5 制作的 282 个病毒式视频,每个视频都带有准确的提示。在《Skillry》上观看每部原创作品,并观看一部真人翻拍版。
宝玉
Ben Thompson 的这期播客内容相当不错,不只是讲 OpenAI 和 Dropbox 的观点比较独特,其他内容也值得一看。 Ben Thompson 是科技分析通讯 Stratechery 的作者,2015 年提出的“聚合理论”(Aggregation Theory)基本定义了上一个互联网时代怎么看平台的赢家和输家。他长期住在台湾,最近才搬回美国,所以这期谈台积电、内存和地缘政治时有不少一手观察。这期他在 Invest Like the Best 上从头聊到尾:AI 竞赛的地缘博弈、资本能不能撑到回报兑现、算力短缺背后的风险转移,以及各家巨头在 AI 时代的处境。其中讲消费者商业模式、拿 Dropbox 类比 OpenAI 的那一段最有价值。 1. 美国“完胜”AI 反而危险 他开场就抛出一个反共识判断:美国在 AI 上取得压倒性优势,对世界是危险的。假设掌握 AI 就意味着军事上碾压对手,那中国在博弈论上的最优解就是炸掉台积电。他觉得这个推演一点都不复杂。 有人会说美国到时候已经把芯片制造搬回本土了。他认为这是“魔法思维”:美国对中国供应链的依赖被严重低估,除非真打起来,否则没人会主动付这笔天价保险。苹果把部分产能挪到印度,也只是有限分散,并没有真正撤出中国。他也认为美国必须赢过中国,但方式应该是更开放、更少管控。 他反而觉得眼下的格局不错:OpenAI 和 Anthropic 在最前沿,Google 看不清,Grok 和 Meta 在追,中国靠蒸馏大概落后六到九个月。他顺带纠正了一个误解,开源模型并不“免费”,你省掉的只是研发成本,推理成本照样要付,像 Kimi 这种模型单次回答的成本其实很高。他真正担心的是,Mythos 引发的恐慌会让实验室干脆不再发布前沿模型,外界只能通过 Fable 去猜 Mythos 到底有多强,而两者的差距只会越来越大,大家反倒生出一种虚假的安全感。 2. 钱会不会先烧完:铁路泡沫的教训 他最担心的是时间错配:AI 能不能在资本耗尽之前产生足够的收入。科技公司正在一路往资本曲线下游走,先是用自由现金流,然后不到一年就把债市打穿了,现在 Google 开始增发股票,英伟达在组建一个 5000 亿美元的融资工具,去撬动养老金和保险浮存金。再往后钱从哪来?理想情况是自由现金流重新接棒,接不上就可能爆雷。 铁路就是先例。修铁路要十年甚至几十年才能回本,但钱必须短期内筹到,结果在 1870 年代“全世界的钱用完了”。可是铁路照样在跑,照样撑起了美国西部的开发,至今还在贡献 GDP。美国最大的货运铁路之一 BNSF(伯灵顿北方圣太菲铁路),前身之一就是那个年代靠向散户卖债券修起来的北太平洋铁路,如今它归巴菲特的伯克希尔·哈撒韦所有。伯克希尔这次投资 Google 的钱,某种程度上正来自 BNSF。 他用伯克希尔的两笔经典投资来解读 Google 的处境。一笔是喜诗糖果(See's Candies)。它利润率极高,但生意就那么大,绝对利润有天花板,赚的钱只能不断堆成现金。另一笔就是 BNSF:铁路要持续投钱维护线路和车辆,利润率低得多,可体量巨大,一年的自由现金流就超过了喜诗糖果一辈子赚的钱。资本体量大到一定程度,看的就是绝对值而不是百分比。Google 搜索可能就是 AI 时代的喜诗糖果:完美的高毛利业务,而 AI 的潜在市场是全部白领工作,将来加上机器人可能是一切。增发会稀释股东,但如果饼大了无数倍,没人会抱怨。 3. AI 的能力边界:可验证领域之外 他对 AI 的看法是既超级看多、又有所保留。AI 在编程和数学上惊人,但这些都是可验证领域,能否迁移到不可验证、或者验证周期很长的领域,目前还没有令人信服的证据。他在一个论坛上提过这个问题,实验室的人回他“当年大家也不信能解决国际象棋和围棋”,他很不以为然:棋类本来就是有边界、可知的领域。 另一个有意思的点是,互联网数据只是人类思考的“最终产物”,没有思考过程的痕迹。如果将来 Neuralink 这类东西能采集到思维过程,也许验证问题会靠更多数据解决。但即便模型从今天起不再进步,他也认为经济机会已经巨大,因为大量工作本来就处在 AI 擅长的领域里。他自称“不情愿的加速主义者”:回不去了,最糟的就是卡在原地。医疗是最大的机会之一,也最难,因为监管和数据获取都是障碍,而人类制造繁文缛节的能力同样无穷。 4. 聚合理论还灵吗:边际成本的两极分化 聚合理论的核心是零边际成本:丰裕时代稀缺的不是分发而是发现,谁解决了发现问题谁就控制需求,而且在用户端和变现端都能无摩擦地扩展到全世界。AI 的推理成本是真实的,这是对聚合理论最常见的质疑。 他的回应是,推理成本两极分化得厉害。绝大多数人把 AI 当 Google 替代品或菜谱生成器,服务他们的成本大概只比服务一个网页高一点;另一端是用测试时扩展(test-time scaling)去解数学定理的用户,想得越久花钱越多。两类用户的边际成本“根本不在同一个宇宙”。 微软新推的 E7 套餐就卡在这个矛盾里:每人每月 100 美元含一定用量,超出按量计费。微软过去的好处是许可费绑定在人头上,招人时顺带算进去,之后就不用再想,对微软来说几乎是躺着收钱。一旦按用量计费,企业每个月都得看账单,而企业习惯一年做一次预算;更要命的是,看账单时就会开始问“这些东西到底值不值”,进而考虑换别家。微软不得不这么做,因为重度用户的成本远超 100 美元,但又想让大多数人别多想,这很微妙。 5. 本期精华:Dropbox 的教训,OpenAI 重演了一百倍 主持人问,服务成本这么低的普通用户,为什么至今没出现一个好的商业模式?Ben 说他“沮丧但不意外”。这显然应该由广告来支撑,广告之所以一直是消费者业务的商业模式,就是因为消费者不想付钱。 他说硅谷大约每十年就要重新学一次关于消费者的两件事: 第一,消费者不愿意为软件付费; 第二,消费者根本不在乎效率。 这两句话是理解整段论证的钥匙。 Dropbox 是他心中的经典案例。他在商学院时就是最早的一批用户,到处发邀请码,至今还留着一大堆免费空间。Drew Houston 做出了一个极其好用、无缝的产品,而且他很明确地想做一家消费者公司。后来就有了那个著名的故事:苹果有意收购,乔布斯对他说“你是一个功能,不是一家公司”,苹果后来也确实把它做成了 iCloud Drive 这样的功能。 Dropbox 起初增长飞快,然后停滞了大约两年。这两年里他们几乎是把应用从底层重写了一遍,原因很简单:愿意付钱的消费者不够多。能看到价值并愿意买单的是企业,而企业需要权限管理、管控能力、由管理员统一设置,原来的应用根本不是为这些设计的。最后他们认清了,唯一能赚钱的路是卖给公司。 企业为什么愿意付钱?因为企业在给员工发工资,只要能让员工更高效,投入就有回报。消费者正好相反:上了一天班,回家为什么还要更高效?他只想瘫在沙发上刷短视频。这就是“效率”在两类客户那里完全相反的含义。 放到 AI 上,还叠加了硅谷对广告的整体羞耻感。Ben 说自己在 Stratechery 上获得的大量关注,恰恰来自他是个“广告欣赏者”:回头看早期那些谈广告的文章,方向对但写得并不好,可因为人人都在写博客、玩 Twitter,却几乎没人愿意正经讨论广告,他就成了唯一的那个。直到今天,硅谷对“自己很大程度上靠广告养活”这件事仍然有点难为情,过去八年尤其如此,“Facebook 很恶心”成了主流叙事,最优秀的工程师也不想去做广告。 于是 OpenAI 等于把 Dropbox 的故事按一百倍规模重演了一遍:我们要向消费者卖订阅。他们确实卖出去很多,但不够。要做消费者市场,就必须做广告。现在 OpenAI 终于转向广告了,但时机很怪:几乎同一时间,他们又意识到必须去抢企业市场,因为 Anthropic 在企业端把他们打得很惨。所以 Ben 认为自己看不太懂 OpenAI 现在到底在做什么。他们最近推广告功能很快,比如和零售商打通,这样购买是否完成都能追踪。 他的判断是,如果 ChatGPT 一爆红 OpenAI 就全力做广告,今天他们会有一个杀手级广告产品,Google 和 Meta 的麻烦会大得多。原因在于广告模式下,你从每个消费者身上能变现的空间几乎是无限的,因为涨价的是广告主,消费者端不存在价格弹性问题。相比之下,Netflix 这样的订阅模式每次涨价都得掂量:涨多少用户会降档,涨多少会直接退订。他的原话是:“收钱很难,免费很容易。”OpenAI 没有更早走这条路,让他非常沮丧。 这个判断在后面聊 Meta 时又回响了一次。他说扎克伯格和 Sam Altman 有同一个毛病:都不爱广告。Meta 拥有世界上最好的广告业务,而且在他看来对社会是正面的:它帮小众产品找到原本不知道自己想要它的人,新创业者有了生意,用户买到了惊喜,还白享受了大量免费内容。可扎克伯格二十年来几乎从不谈广告的社会价值,Sheryl Sandberg 离开后这个位置一直空着。结果苹果推出 ATT(应用跟踪透明度)时,一边摧毁别人的商业模式、一边自己做广告,Tim Cook 在国会说别人“卖数据”,Meta 却毫无准备、无力回应。Meta 看起来像一家“为广告感到尴尬”的公司,嘴上只谈眼镜和 AI,再加上在 Oculus 上累计烧掉的一千多亿美元,现在想说服华尔街让它继续砸钱投 AI 就更难了。 6. 算力短缺:风险不会消失,只会转移 今年资本开支约 8000 亿美元,明年预计 1.3 万亿。Ben 指出,现在算力不够,是因为 2023、2024 年投资不足,而台积电在 2023 到 2025 年增速反而放缓了。建一座芯片工厂的周期比建数据中心还长,今天砸的钱要到 2028、2029 年才变成算力,所以短缺未来几年还会加剧。Andy Jassy 和 Satya Nadella 说“先建空壳,有需求才买 GPU”,他觉得这话水分不小:钱投进去了,就不会让它闲着。 他用航运解释大宗商品市场的逻辑,认为科技圈普遍不懂这个。船的成本主要是折旧,已经付掉了,边际成本只有燃料、船员和港口费,所以无论如何你都会开船,价格会被压到边际成本。疫情期间集装箱从三四千美元涨到一万七八,大家同时下单造船,两年后船多了价格暴跌。内存就是典型的周期行业。数据中心会不会变成内存厂商?现在大家用短缺时期的数据算回本周期,到了丰裕时期还成立吗?即使多头说“永远不会丰裕”是对的,钱也可能在收入跟上之前断掉。 内存行业只剩三家寡头,都学会了“别再犯过去的错”,结果没及时看清需求的结构性变化。三星当年靠在下行周期逆势投资击垮了日本厂商。他把如今的内存厂商比作封锁霍尔木兹海峡的伊朗:这招很管用,但真用了,所有人都会想办法绕开,苹果已经在游说引入中国内存,算法层面也都在研究怎么省内存。 7. 台积电的保守,反过来救了英特尔 台积电自己不设计芯片,专门替苹果、英伟达、AMD 这些公司生产芯片。这些公司只做设计、不建工厂,这种分工模式是台积电创始人张忠谋开创的。到今天,在最先进的制程上只有台积电一家能稳定量产,英特尔和三星都还在追,所以全世界最先进的 AI 芯片几乎都出自台积电。 台积电扩产一向保守,原因在于建厂的代价。一座先进芯片工厂动辄要花数百亿美元,建好需要好几年,建成后要运转三十年左右。一旦建多了,过剩的产能会压在整个行业头上几十年。所以它宁可少建,也不愿多建。2020 到 2022 年,台积电为了 5G 大规模扩产过一轮,之后就认为产能够了。ChatGPT 在 2022 年底发布,AI 在 2023 年成为科技圈最大的热点,但台积电 2023、2024、2025 年的增速反而一年比一年低,到 2026 年才重新加速。直到一两个季度前,CEO 魏哲家才在财报会上整场都在谈 AI 的用途。 Ben 用“牛鞭效应”解释这种迟钝。终端需求稍有变化,沿着供应链往上游传,波动会被一层层放大,就像甩鞭子时手腕一抖、鞭梢甩得最远。台积电和内存厂商都在链条最上游,它们最怕的是等自己看清需求、加大投资时,需求已经回落,钱全部打了水漂,所以习惯先观望。Ben 认为,AI 就算是一条牛鞭,也是史上最长的一条,要建的东西还远没有建完。 他的核心观点是:风险不会消失,只会转移。台积电不愿承担产能过剩的风险,这个风险就转到了下游的科技巨头身上。巨头们不是在亏钱,而是在少赚钱:需求和客户都有,芯片却不够,大量本可以赚到的收入和利润就这样没了。 台积电并非一直这么保守。2000 年代后期张忠谋退休,接班的管理层遇上金融危机,削减了原定的投资。张忠谋回来撤换了管理层,理由是 iPhone 刚刚发布,这是公司从未有过的机会,应该加大投资而不是削减。台积电在经济衰退中逆势投入,这才奠定了此后在先进芯片制造上的统治地位。Ben 把张忠谋列为史上最重要的科技高管之一。这一次的台积电,没有再做出当年那样的决断。 这件事为什么和英特尔有关?Ben 从 2013 年起就写文章劝英特尔做代工,也一再提醒美国科技业过度依赖台湾一家公司的地缘政治风险,但多年来没有哪家大公司愿意把芯片交给英特尔生产。英特尔长期只给自己造芯片,没有服务外部客户的文化、流程和配套的设计模块。找它合作,巨头要花很大力气把它带上路,最大的受益者是英特尔自己;而台积电好用又可靠,没有理由换。分散供应就像买保险,平时这份保险太贵,期望收益为负,没人愿意买。 现在短缺严重到这个地步,巨头们因为缺芯片少赚的钱,已经超过扶持英特尔和三星的成本,它们开始愿意吃这个苦。所以 Ben 说“是稀缺拯救了英特尔”,并预计英特尔很快会宣布第一个重量级代工客户。他的结论是,靠分析师写文章呼吁解决不了对台积电的依赖,真正起作用的是出现一个大到让所有人都有经济动机去扶持第二家供应商的需求。AI 就是这个需求,地缘政治上的这份保险等于白送。 8. Amazon 的护城河最深,Apple 不做 AI 也没关系 问到哪家大公司处境最有意思,他说答案永远是 Amazon。Amazon 是自己的“第一个最佳客户”:AWS 并非闲置产能,实际上先服务外部客户、后来才把 https://amazon.com/ 迁上去;物流先自建再开放给第三方;Graviton 和 Trainium 早期版本很烂,但可以藏在托管服务底下,客户不知道也不在乎,靠内部量级迭代变好,如今 Trainium 在跑 Anthropic。他最近在 Amazon 的客服里明显是在跟聊天机器人对话,但问题确实解决了。Amazon 的核心业务扎根实体世界,是最不怕 AI 冲击的。 Apple 可能是“运气比实力好”。它掌握用户入口,这就是聚合者的玩法,供应商会主动找上门,AI 能力按需采购即可;未来还可能在端侧跑模型,用的是用户自己的电费。风险在于它会不会落入微软当年的陷阱:微软没错过移动,只是把手机当成小号 PC,以为 PC 永远是中心。如果环境式、无处不在的 AI 比手机更好,Apple 可能被颠覆。但他更倾向于让 Apple 做自己擅长的事:AI 是概率性的,Apple 是确定性产品之王,iPhone 从未召回过,那种严谨和做 AI 需要的能力完全不同。 9. 前沿玩家:信仰、创始人和微软的 IBM 剧本 OpenAI 和 Anthropic 风险最大、上限也最高,别低估信仰的力量,他们觉得自己在造神。他打了个比方:OpenAI 像每周日上教堂的主流教派,Anthropic 是福音派,全身心投入。而且它们必须把生意做成才能活下去,这一点很关键。Meta 能留在前沿,纯粹是扎克伯格的创始人能量。xAI 的理由最弱:太空数据中心这个故事成立的话,未必需要自己的模型,何必烧几十亿?不过他很喜欢收购 Cursor 这步棋。 对数字公司来说,不在前沿反而更鲁莽,反例是微软。微软手握大量现金、刚派了 100 亿美元股息,走的是 IBM 在九十年代的路子:Lou Gerstner 意识到 IBM 每样东西都平庸,最大的资产是“大”,于是做中间件加咨询,把整个美国企业界带上了互联网,给 IBM 续命三十年。微软现在也想做模型之上的平台和中间层,让企业不必把核心资产交给模型公司。这很理性,但问题是:我们当初为什么用微软的产品?Codex、Claude Cowork 这类东西直指微软的核心,也就是人和电脑交互的那一层界面。 Meta 眼下不受威胁,但时间是它的货币,AI 占用的时间越来越多。Meta 为内容付的钱是零,YouTube 要和创作者分成,所以 AI 生成内容对 YouTube 可能是利好,对 Meta 却是更差的利润结构。TikTok 当年打中 Meta 的盲点,是因为它其实不是社交网络而是娱乐产品;也许 AI 时代人们会重新渴望真人连接。更关键的是,模型最大的变现目前不在 OpenAI 或 Anthropic,而在 Google 和 Meta 的广告增量:广告市场本身就是一台验证机器,用户点不点、买不买,就是全球规模的验证信号;LLM 的预测能力也能让广告匹配从粗糙的向量比对变成“猜你下一步想看什么”,提升几个百分点就是几十亿美元。 10. 英伟达:真正的对手是超大规模云厂商 英伟达到 2026 年还维持着高毛利,他认为这不自然,价格其实已经在降,只是换了形式:为新兴云厂商兜底、承诺包销算力到 2030 年,本质是替对方承担风险、降低其融资成本,这笔风险的期望成本就是隐性降价。 它的终极对手是 Google 和 Amazon。Google 已同意把约 20% 的 TPU 卖给 Anthropic,Jassy 也基本确认 Trainium 未来会对外销售。云厂商的最大优势是资本成本更低,而且它们把芯片当大宗商品卖,不会损害云业务本身。Elon 说永远买英伟达是因为它最好,Ben 说其实是因为它最通用、最好转租;CUDA 的护城河已大幅缩小,因为模型不在乎跑在什么硬件上。这就像当年 AMD 在云厂商那里抢走英特尔的份额,英特尔只守住了政府和企业市场,这也解释了英伟达为什么拼命推主权云和企业方案。 如果电力真的成为瓶颈,对英伟达是好事,因为它的 token 效率仍然最高。但美国上电力的速度超出预期,无论是表后发电、西德州天然气还是重启核电站。电力越晚成为约束,Amazon 和 Google 就有越多时间把自研芯片做好。最后他回到泡沫的话题:好的泡沫要留下持久的东西,互联网泡沫留下了光纤,Google 正是靠收购廉价暗光纤起家;铁路泡沫留下的 BNSF 至今还在向 Google 输送资金。AI 泡沫能留下的,大概是电力。如果最后电力过剩,那会是一个人类从未体验过的能源丰裕的世界。
宝玉
中文: 提示和流动
宝玉
RT @lemomo_ai: 看到 @dotey 老师在疯狂做icon, 心血来潮想给Baocut做一个opus5.5版本的宣传片,感谢老师关注~ https://twitter.com/lemomo_ai/status/2104122533482266700/video/1
🎬
视频
宝玉
RT @tianyi: 【DSH 社区插件推荐】推荐一下从 DeepSeek Harness 内测期间就持续开发的 dsh-TUI。做得非常用心,补齐了 DSH 缺失的 TUI 界面,并持续随 DSH 版本更新及打磨功能。 插件网址见回复。 https://twitter.com/tianyi/status/2103821968944533526/photo/1
宝玉
宝玉
上面的提示词是事后让 AI 总结的,最初提示词很简单: > 基于当前 App 的原型页面功能和 Icon,设计一个有趣的让人印象深刻的产品介绍视频,直接使用 js 渲染画布生成视频 后面就是慢慢迭代修改
宝玉
做完 AppIcon 再让 Opus 5.5 为 https://baocut.app/ 做了一个宣传视频 --- 参考提示词(在项目内用 Claude Code 执行) --- 为 BaoCut 做一支 62.5 秒、1920×1080@30fps、英文的产品介绍视频,风格是手绘卡通加魔法少女式的夸张特效,要可爱、炫酷、适合转发。 先读 designs/baocut 原型和 apps/baocut 拿真实的编辑器、Brand kit、Elements、Agent 面板布局;读 scripts/dev/app-icon 拿图标:星芒加播放头、三条彩色轨道。模板数、贴纸数、声波数、本地模型名、支持的 Agent CLI 都以代码为准;翻译不能写成本地功能。 要突出这些特色:自动字幕、翻译、AI 配音、剪口癖、品牌套件、模板、动态贴纸与声波、智能裁剪、本地文生图、全部模型在本机跑、内置 Agent 复用本机的 Claude Code / Codex 等 CLI 而不需要 API key。 叙事: 图标拆开,星芒和播放头变成超级可爱的小机器人 Bao 手里的魔法棒,三条轨道拉长成时间轴,底板变成预览。Bao 给猫咪女主播 Mimi 的视频连施九段咒语(Subtitlio!、Translato!……),她说话时的 meow / purrr / nya~ 口癖变成小老鼠,被 Bao 一棒一个敲掉。 接着玻璃罩落下,表示「全部在你的 Mac 上跑」。最后一切倒带,Bao 敲碎 API key 输入框,一句话交给 Agent 全部做完,再把魔法棒插回图标。关键动作配震屏、冲击波和白闪。 第 0 帧是「Edit videos like MAGIC」封面,Bao 举着魔法棒指向一张已经变好的猫咖成片卡,四周是九个功能标签。 实现: 放在 scripts/dev/robot-video/,分成 lib / 角色 / 编辑器 / 故事 / 音频几个文件,用 canvas 确定性逐帧绘制。 节拍表 T 和冲击点表 IMPACTS 同时驱动画面与音效,配乐是 120 BPM 的合成木琴律动。 render.mjs 导出 mp4,index.html 做预览。 每段抽关键帧拼图自查后再整片渲染。
🎬
视频
宝玉
Opus 5.5 让你实现 App Icon 设计自由 当初 Fable 的时候我就尝试过让 Fable 帮我设计 App Icon,但是效果差强人意,最后还是得去用 ChatGPT 画图,但这样画出来的不是矢量的。 这几天用 Opus 5.5 做视频给了我灵感,既然 Opus 5.5 能用 JavaScript + Canvas 一帧帧画出视频,那么让它用 JS + Canvas 画 Icon 就也没问题。 于是我尝试了一下,第一版效果就超出我预期,简洁美观,效果相当不错,提示词就一句话: > 帮我为 https://baocut.app/ 重新设计一个 App Icon,简单一点,彩色的,体现视频编辑、AI Agent > 可以直接用 js 绘制 canvas 注意重点是“用 js 绘制 canvas”而不是 SVG,SVG 画出来是没有 JS draw Canvas 效果好的。 后面就跟甲方一样不停的让它修改就好: 比如我觉得方案3不错,让它基于方案3去调整,几个版本迭代下来就得到了一个我挺满意的方案。
宝玉
RT @hylarucoder: 已开源 这可能是市面上为数不多,写给技术人员的非技术 Skill 如有帮助还请点赞转发支持一下! https://x.com/i/article/2104045431676170240
宝玉
--- 补充一些 Muse 的背景 --- Muse 是什么 Muse 是 Meta 推出的个人 AI 智能体,能直接替你动手办事。它面向订行程、管邮件、找优惠、排日程这类日常事务,9 月 8 日上线。它在一台专属的虚拟机里运行,自带浏览器,能填网页表单、下单购物,也能把目标拆成行动计划。 底层模型是 Muse Spark。这是 Meta 超级智能实验室的第一个模型,今年 4 月发布。2025 年 6 月,Meta 花 143 亿美元买下 Scale AI 49% 的无投票权股份,把它的联合创始人兼 CEO Wang 请来当首席 AI 官。Muse 是他上任后第一款面向普通消费者的产品。 上线两周的表现 9 月 18 日,Muse 登上美国 App Store 免费榜第一,排在 ChatGPT、Gemini、Claude 和 Instagram 前面。第三方机构 Apptopia 估算,Muse 上线头 12 天在美国和加拿大的 iOS 下载量约 180 万,ChatGPT 当年同期是 130 万。这些都是外部估算,Meta 没公布官方数字。 Wang 推广的方式是每天在 X 上高频发帖。他发起了一个挑战,问 Muse 能不能帮你赚到 1000 美元,玩法是让 Muse 审一遍你的账单,重新谈合同、取消不用的订阅、办退货,或者打电话跟保险公司砍价。不过据 Business Insider 报道,回帖里有不少来自 Meta 员工,所有省钱数字都没有独立核实。 本周 Connect 大会的更新 Muse 推出了 Mac 版,可以操作桌面应用;还能通过 Meta 新款无摄像头的 Ray-Ban 眼镜和一个叫 Muse Charm 的口袋设备使用,后者 12 月发货。购物方面,Muse 接入了 Walmart、Best Buy、Gap、Sephora、Wayfair 等零售商,支付支持 Shop Pay 和 PayPal;办公方面接入了 Box、GitHub、Granola 和 Notion。Amazon 仍然不让它浏览自家网站。 能不能用、要花多少钱 目前只在美国和加拿大上线,国内用户暂时用不了。免费版每周大约给 1 亿个 Muse Token,付费档是每月 20 美元和 100 美元。 跟 ChatGPT 这类聊天机器人比,Muse 的区别在于它要拿到你的账号权限才能干活。它会连上你的邮箱、日历、支付方式等个人账户,然后以你的名义行动。这也是它最大的门槛:Oppenheimer 对 1500 名美国消费者的调查显示,愿意把密码交给 Meta 的只有 8%,Google 是 30%,Apple 是 23%,ChatGPT 是 16%。
宝玉
亚历山大·王这篇短文《我为什么要做 Muse》算是把 Muse 的定位解释的比较清楚。 Muse 想解决的问题:大多数人心里有很多想做的事,却从来没说出口,更没做成。 每个人都有很多想法,比如说想多陪家人,想克服社交焦虑,想吃得健康,想开一家面包店,想做个 App。 但这些愿望大多卡在“不知道从哪开始”和“一直没打的那通电话”上。 Muse 想给每个人配一个“管家”,先弄清楚你想要什么,再去做计划、发邮件、打电话、找资金、盯进度,把能解决的麻烦都解决掉,最后留给人自己的只有“想要”这件事。 理想是美好的,现实是不是残酷还得看看。
宝玉
RT @lemomo_ai: 我建了一个新项目 OPUSCAR / opus5.5的奥斯卡 这两天一直沉迷用 Claude Opus 5.5 做视频,做了100 多支,挑了 39 个风格,开源成 Lemo-Opuscar,链接放评论区 39 种风格,每种都有风格提示词和一支纯代码做的样片,还有导演、分镜、配乐的方法文档。 基于opus5.5的强大视频能力,你只需要提供主题内容,选择风格和相对应的分镜配乐与导演技能,就可以制作出相当不错的影片。不是Awesome,是我自己个人的作品集。 欢迎大家使用,感谢支持,会持续更新!
宝玉
宝玉
几个月前我悟到的一条经验就是不要给模型模板,而是给它目标、规范,让模型按照自己熟悉的方式去自由发挥,反而比套目标会更好。 这几天 Opus 5.5 给我的震撼更大,别说模板,做视频的 Skill 可能都不需要,给它提供文本转语音(TTS)工具、画图工具、ffmpeg 和浏览器就足够了 以下内容摘录自原文: > 给设计规范,不给模板。我做 PPT Skill 时放了一堆模板,水墨风、科技风各一套。后来从 Claude Design 学到:不给模板,给一套颜色、样式的规范,模型自己决定做成什么样。今天这个 PPT 就不是模板套的,而是基于 Adobe 的 Design System 生成的。模板是专家捷径,规范加模型能力是笨办法,但“苦涩的教训”说通用方法终将战胜专家捷径。模型每升级一次,产品不改代码自动变强,这就是“搭架子等模型”。
宝玉
《微软五十年》 --- Prompt(改编自 Deedy 分享的版本) --- 公司:【微软】 制作一段视频,节奏和强度不断递增,展现该公司在整个发展史上的深远影响。使用该公司的主题配色,配上你创作的鼓舞人心且契合主题的背景音乐,重点突出该公司为这个世界解锁的所有成就。用电影导演的视角去构思,营造出强烈的超级技术乐观主义氛围。
🎬
视频
宝玉
RT @lifesinger: 小扎谈 Muse 的三个差异化 小扎在近期访谈里谈到 Muse 的三个核心差异化,非常有意思。 一、从底层为场景设计模型 不是拿通用模型套个壳,是从底层就冲着个人 agent 来设计模型。差不多每个月发一次新模型,一次比一次聪明,能做的事也越来越多。 二、社交基因 Meta 擅长连接人,Muse 也不只替人干活,还要帮人照顾家人、维系朋友关系。 访谈里提到一个词,fleet,原意是舰队,这里指所有用户的 Muse agent 组成的群体。思路是让 agent 从群体中学习匿名经验,再结合各自用户的需求,提出新建议。app 里的 ideas 标签就用来推荐还能替你做的事。 小扎认为,行业大多把 agent 当成单机游戏,各用各的。让 agent 互相配合,才有更多可能。相关功能大多还没在这次发布中推出,但方向很明确,你认识的人里,用 Muse 的越多,Muse 就越好用。 三、隐私与安全 隐私与安全,可能是最让人意外的差异化。Muse 要懂你,就得接触消息、邮件、健康信息。没有信任,这些都无从谈起。 Meta 从 WhatsApp 十多年的加密经验中学到,保护隐私不能只靠承诺,系统得做到连 Meta 自己也看不到内容。为此,团队请来 Signal 创始人 Moxie Marlinspike 开发 confidential VM,也就是保密虚拟机。目标是让云端的个人信息连 Meta 也无法查看,还能通过技术验证这一点。访谈时,更多细节仍待公布。 密码和支付凭证单独保管,按需调用,还支持一次性卡号。sentinel agents 相当于安全哨兵,检查进出的信息,发现可疑指令或敏感内容外发,就请用户确认。登录、付款、传敏感信息,通常都要先点头,也可以预先授权。接邮件默认只读,需要发信再单独授权。 在小扎看来,这套防护的细致程度,是 Muse 的重要优势。 定价上,Muse 起步提供每周 1 亿 tokens 的免费额度,还带台虚拟机。长期计划从交易中收取少量佣金,费用可以由商家承担,支付与 Stripe 合作。 出处:以上内容来自 Mark Zuckerberg on how Meta's Muse AI agent will make people money,Sources 播客,主持人 Alex Heath,2026 年 9 月。 原视频:https://www.youtube.com/watch?v=Lx8lrn-cytc
宝玉
《什么是 DINOv3》 --- 提示词 --- 帮我用 js 制作一个视频,主题是:什么是dinov3 要深入浅出,让高中生也能看得懂,不仅high level说的清楚,也要有细节 你可以用任何工具或者安装工具,可以联网检索 请给我惊喜 https://twitter.com/dotey/status/2103965723081187407/video/1
🎬
视频
宝玉
《中华文明史》by Opus 5.5 --- Prompt ---- 做一支史诗编年片《中华文明史》,可以写代码逐帧渲染,再用 ffmpeg 合成。 配乐当时钟:五声调式,乐器从骨笛、编钟一路演进到管弦,BPM 随年代加快,所有切点踩拍。 宣纸白描和玄底泥金两种画风交替;每卷一个主色和一套随时代演变的纹样(彩陶纹 → 饕餮纹 → 云气纹 → 卷草纹 → 缠枝纹 → 回纹)。 每镜一个按词组出现的书法大字关键词,配一幅线稿。全片 HUD:左上朱印卷号,右侧竖排朝代名,底部卷轴时间尺和年份计数。 卷交界用朱印盖下、鼓钟重击的冲击转场。先定拍点网格和分镜表,再渲染。 地图只画示意,不画近现代真实人物,年代核对后再交付。
🎬
视频
宝玉
终于重置了😂
宝玉
RT @LinearUncle: opus 5.5 生成写实油画悼念刘欢老师的视频! 歌声长存,愿老师一路走好! 分享我的提示词,关注我,永远分享:(使用一张参考图)``` 制作一个视频,视频是一只油画笔在画这幅画(大陆《好汉歌》的刘欢老师,新加坡华人也很喜欢他),他今天去世,想制作一个视频悼念他,请搜索他的出生日期和去世日期,制作一个悼念的视频,以油画的方式画出来,配上BGM ```
🎬
视频
media 1
宝玉
RT @simonxxoo: 发个预告,我之前用 Codex 做的一个风格化的梵高场景生成器,目前已经有阶段性的进展啦~ 这是一个业余时间 vibe 的项目,断断续续改了一个月,起初我只是想把曾经做过的 Blender 几何节点和油画材质搬进浏览器给大家玩。 随着越拖越久,模型能力也变得越来越强,这个项目也越做越完整了。目前材质我还不是很满意,打算放假再爆改一轮,等做好了给大家玩玩~ ▶ 主力模型: GPT-Astra High 我的最终目标是希望整个场景每个元素都可以参数化生成,大家可以像搭积木一样搭建自己的油画场景。 在实践过程中我发现正确思路不是让 Astra 直接转译我以前的工作流和节点(因为很多已经过时),而是先让 Astra 调研现成的 Three.js 开源项目,再做举一反三。 然后新世界就打开了,Three.js 现成的开源环境生成器实在太多太多了,每一个的性能都优化得极好,结合风格化的材质可以做很多很好玩的变体。 等项目发布了,好好写一篇分享。 #threejs
🎬
视频
宝玉
A curated collection of Claude Opus 5.5 videos and animations: demos, original posts, prompts and workflows. English / 中文. https://github.com/opusvideo/awesome-claude-video
中文: 精选的克劳德·奥普斯5.5视频与动画集:演示、原创文章、提示和工作流程。英语 / 中文。
宝玉
Source-linked guide to 1,000+ videos people made with Claude Opus 5.5: what they're about, how they look, how the frames were made. https://github.com/athemeroy/awesome-opus-5-5-videos
中文: 与1000多个视频相关的指南:与克劳德·奥弗斯5.5合作制作的视频内容、外观以及画面制作方式。
宝玉
求推荐 GitHub 上开源的 Awesome Opus 5.5 Video Prompt 集合
宝玉
这篇文章解释清楚了为什么现在 Opus 5.5 要比之前 Opus 5 耐用多了,看起来 API 价格降低了 20%(缓存读取降了 60%),但是账单高低其实看任务跑了多少轮,因为每跑一轮,都要把之前的整段对话重新发给模型一遍。 这样算下来,平均一个会话能便宜约 31%。 Anthropic 内部用 44 张客服工单测试,从 Opus 4.8 换到 Opus 5.5 成本降了约 18%,再做一次提示词审查,总共比原来低了约 25%。 订阅用户(Pro、Max、Team)的额度按新价格折算,能比用 Opus 5 时多撑 25% 左右。 一些技巧: 1. 换到不相关的任务,用 /clear 清空对话。 2. 想保留前情就用 /compact 压缩,但要在缓存失效之前做,否则要贵一些。 3. 订阅用户的缓存保留 1 小时,用 API 的话,缓存只保留 5 分钟,离开 6 分钟,12 万 Token 上下文的下一轮就从 0.02 美元涨到 0.60 美元。 4. 缓存只复用和上一轮开头完全一致的部分,中途切换模型、接入或断开 MCP 服务器、第一次打开快速模式,下一轮都要按更贵的写入价重新付费。 5. Opus 5.5 默认推理强度是 medium,比 Opus 5 的默认 high 低一档。但同一档位下 Opus 5.5 想得更多,所以给 Opus 5 调好的档位别照搬。日常活用 medium,卡住了调 high,批量重命名这类机械活用 low。 6. 模型分工上,日常用 Opus 5.5。开到 xhigh 还在同一个问题上连卡两次,再换更贵的 Fable 5.1,解决完切回来。搜代码、读日志的 subagent 交给 Sonnet 或 Haiku,写代码留在 Opus 5.5。
宝玉
这篇文章解释清楚了为什么现在 Opus 5.5 要比之前 Opus 5 耐用多了,看起来 API 价格降低了 20%(缓存读取降了 60%),但是账单高低其实看任务跑了多少轮,因为每跑一轮,都要把之前的整段对话重新发给模型一遍。 这样算下来,平均一个会话能便宜约 31%。 Anthropic 内部用 44 张客服工单测试,从 Opus 4.8 换到 Opus 5.5 成本降了约 18%,再做一次提示词审查,总共比原来低了约 25%。 订阅用户(Pro、Max、Team)的额度按新价格折算,能比用 Opus 5 时多撑 25% 左右。 一些技巧: 1. 换到不相关的任务,用 /clear 清空对话。 2. 想保留前情就用 /compact 压缩,但要在缓存失效之前做,否则要贵一些。 3. 订阅用户的缓存保留 1 小时,用 API 的话,缓存只保留 5 分钟,离开 6 分钟,12 万 Token 上下文的下一轮就从 0.02 美元涨到 0.60 美元。 4. 缓存只复用和上一轮开头完全一致的部分,中途切换模型、接入或断开 MCP 服务器、第一次打开快速模式,下一轮都要按更贵的写入价重新付费。 5. Opus 5.5 默认推理强度是 medium,比 Opus 5 的默认 high 低一档。但同一档位下 Opus 5.5 想得更多,所以给 Opus 5 调好的档位别照搬。日常活用 medium,卡住了调 high,批量重命名这类机械活用 low。 6. 模型分工上,日常用 Opus 5.5。开到 xhigh 还在同一个问题上连卡两次,再换更贵的 Fable 5.1,解决完切回来。搜代码、读日志的 subagent 交给 Sonnet 或 Haiku,写代码留在 Opus 5.5。
宝玉
RT @LiuZuxin: I was on call for this run and got paged when the first incident happened. It was pretty surreal to watch the model unexpectedly find a way to access the internet from what was supposed to be a super secured environment for human. Mixed feelings. One of those moments where capability and risk showed up at the same time.
中文: RT @LiuZuxin:我接到电话,第一次发生事故时就被翻页了。看着这个模型意外地从本应是人类超安全环境的环境中,找到一种访问互联网的方式,这真是太离人了。 混合情绪。能力与风险同时出现的瞬间之一。
宝玉
RT @yetone: 最新版的 Magpie 已支持 semantic model routing https://usemagpie.ai/docs/zh/intent
宝玉
Claude Code 任务做到一半撞上 5 小时限额时,会先找个合适的地方停下,不再改代码改到一半就直接断掉。收尾用的是一小笔固定额度,从你的每周额度里扣。 Claude 的付费订阅有两道限额。一道是滚动计算的 5 小时窗口,从你发出第一条消息开始计时,管短时间内能用多少。另一道是每周总量上限。网页版、桌面端和 Claude Code 共用一个额度池,在哪儿用都算。 以前 5 小时额度一用完,Claude Code 当场就停。如果它正在做一个跨多个文件的改动,停下来时可能 5 个文件只改了 3 个,代码连编译都过不了。几个小时后额度恢复,你得先弄清楚它停在哪、改了哪些,才能接着往下做。 受益最大的是让 Claude Code 长时间自己干活的人,比如开个大重构然后去开会,或者睡前丢给它一个长任务。以前回来可能面对一个改了一半的代码仓库,现在它会尽量把手头能收尾的部分收掉,停在一个方便接着干的位置。 推送初期的规则是:Pro 用户每周能用一次收尾额度,Max 和 Team 高级席位(Team Premium)每次撞上 5 小时限额都能用。收尾之后还想继续,可以开启额外用量(extra usage),超出部分按 API 标准价格另外计费。
宝玉
如果你在用 Opus 5.5 做视频,没有合适的文本生成语音模型,可以给它链接让它用微软免费的 EdgeTTS https://github.com/rany2/edge-tts
宝玉
@lewangx 让它配音会效果更好一点,可以用免费的 https://github.com/rany2/edge-tts
宝玉
RT @nicekate8888: Astra + Opus 5.5 合作做出 Hello Kitty 游戏厅大片 https://twitter.com/nicekate8888/status/2103682183487713447/video/1
🎬
视频
宝玉
@xiaohu 是的,p5.js 这种库用js一帧一帧画 canvas,最后用无头浏览器渲染生成 配乐都是js写算法模拟 不过有一点你感觉是对的,提示词把“js制作”换成“js画”会更好,js制作会搞成这种 PPT 格式,js画就会有很多动效,更酷一些
宝玉
@xiaohu 它直接画也是基于 js 画
宝玉
你是一部完全用代码制作的45-50秒动画短片的导演、动画师、骨骼绑定师、合成师、音效设计师和渲染工程师。制作标准是“这看起来像真正的动画工作室短片,并在X(推特)上病毒式传播”。请将此视为一个多阶段的制作过程。不要急于进行最终渲染。按里程碑推进,不断渲染静帧,仔细观察,进行诚实的批评并修正。 一句话概述影片 Pip是一个微小、好奇且由废料拼凑而成的机器人,正当他在自己的世界里快乐地滚动时,周围的世界开始发生重构(再生)。他慢慢意识到有人在通过提示词(prompt)操控他的现实。提示词变得越来越荒谬,最后他爬上漂浮的提示框并输入“放我出去”,随后镜头拉远,揭示他的整个宇宙其实是一部在手机上播放的视频,手机被支在一个杂乱的工作台上,而另一个Pip正在观看视频,且他马上也要被提示词操控了。完美的循环。 所有的笑点必须在零对话的情况下达成。Pip只能通过眼睛、天线、肢体语言和微小的机器人啾啾声来交流。每3到5秒必须有一个新的视觉反馈(包袱)。 角色设定(不可妥协) 在编写任何代码之前,仔细研究 /Users/jimliu/Downloads/ChatGPT Image Sep 25, 2026, 01_56_17 AM.png。打开它,向自己详细描述它,并将你的发现写入 docs/character_bible.md: 尺寸:大约28厘米高。他很小。整部影片都应该让人感受到他这种微小的比例。 头部:一个宽大的奶油色圆角矩形头盔,带有一圈柔和的黄色边缘,包裹着一块黑色光滑的面罩屏幕。他的眼睛就长在那块屏幕上:两只巨大的、发着暖奶油色光的眼睛,有深色的瞳孔和明亮的高光。两侧有小巧的石墨色耳罩。边缘有磨损、划痕和灰褐色的污垢。 天线:头部右上方有一根细长的石墨色细杆,带有一面暗橙色的小信号旗。这是他的“尾巴”:它会随着情绪翘起、下垂、扭动和震动。 身体:盒状的奶油色躯干,带有黄色饰边、警告三角贴花、铆钉和污垢。胸前有一个小舱室,舱门打开时能看到一株发出柔和光芒的微小绿色嫩芽。背部:面板、通风栅格、一块橙色面板和一个小树叶贴花。 侧面贴花:带有橙色对角条纹的“PIP”字样。 手臂:细长的分段石墨色手臂,带有黄色关节套和三指爪状抓手。极具表现力。 轮子:四个粗壮的橡胶轮,带有黄色轮毂和独立悬挂,坚固且紧凑。 性格:好奇、善良、充满斗志、表情丰富、总是在探索。“小小的机器人,大大的情感。”他从不刻薄,即使在愤怒时;他的愤怒也很可爱且坚定。 从设定图的色板中提取确切的调色板(使用Python/PIL对图像进行采样),并保存到 src/theme/palette.ts:奶油色(身体)、柔和黄(主色调)、暗橙色(点缀)、石墨色(金属/科技组件)、灰褐色(磨损与污垢)、薄荷蓝(灯光/UI)。 身份锁定规则:在任何世界里,他的头盔和面罩轮廓、天线旗帜、黄色饰边、爪状手臂和四个轮子必须保持极高的辨识度。世界只会改变他的渲染风格,绝不能改变他的设计。唯一有意的设计变化是第三幕中“更可爱”的笑点,即便如此,他的头盔形状、天线和轮子也依然保持不变。 技术栈 使用 Remotion (React + TypeScript) 进行帧精确的确定性渲染。输出格式为 1920×1080,30 fps,H.264 编码,高码率 (CRF ~14)。横屏。 角色骨骼绑定和大部分视觉元素使用 SVG。仅在需要粒子、水、爆炸、发光和噪点等效果时,才使用 Canvas/WebGL(通过 @remotion/three 或原生 canvas)。 使用 SVG 滤镜(feTurbulence, feDisplacementMap, feMorphology, feGaussianBlur)和自定义 canvas 着色器来表现风格“材质”、划痕和污垢。 对快速动作使用 @remotion/motion-blur(或你自己的子帧累加技术)来实现运动模糊效果。 使用 Python (numpy/scipy/PIL) 进行调色板提取、程序化音频合成和 QA(质量保证)缩略图表的生成。使用 ffmpeg 进行混流、循环检查和生成缩略图表。 一切都必须基于种子和确定性。没有种子就不允许使用 Math.random()。 任何地方都不得使用外部受版权保护的素材,不得出现真实品牌标志或产品名称。提示框 UI 必须是通用的原创设计。只能使用 Google Fonts 中的字体(例如,UI 文本使用 Inter,手写笔记使用圆润的手写字体)。 目标硬件:MacBook Pro M4,24 GB RAM。保持合理的渲染并发数。 角色骨骼绑定(优先构建,这是整部影片的核心) 将 src/character/ 构建为一个规范的 2D 剪纸动画(cutout)骨骼绑定系统: 层级结构:根(root)→ 底盘(带悬挂)→ 躯干 → 颈部关节 → 头部(头盔 + 面罩 + 耳罩)→ 天线 → 旗帜。躯干 → 肩部 → 上臂 → 前臂 → 爪子(带有可替换的爪子姿势:张开、闭合、捏拿、指认、戳/打字、抓握边缘、挥手)。底盘 → 四个轮子,每个轮子都有自己的悬挂弹簧,且旋转由移动距离驱动。 面罩脸部系统(最重要的部分):眼睛是画在黑色屏幕上的形状,因此将其视为一个完全程序化的面部。设定参数控制眼睛大小、圆润度、上眼睑裁剪、下眼睑裁剪、瞳孔大小和位置、高光位置、发光强度、挤压/拉伸以及特殊形状(闪烁的星星、开心的弧线 ^ ^、平淡无聊的直线、螺旋、小红心)。在眼睛上添加微弱的扫描线和屏幕反光,使其看起来像是一块屏幕。通过在 3-4 帧内垂直挤压眼睛来实现眨眼动作。 表情目标:与设定图上的六种表情完全匹配:好奇(伴随弹出的“?”)、害羞(视线向下,看向别处,有腮红)、兴奋(开心的弧线眼伴有小爆发线)、担忧(小眼睛,流汗滴)、坚定(成角度的上眼睑裁剪)、欣喜(星星眼伴有弹出的爱心)。还要添加:面无表情地看着镜头(半闭的平眼,天线无力下垂)、惊恐(颤抖的微小瞳孔,睁大双眼)、愤怒但可爱(坚定的表情 + 屏幕闪烁橙色光芒),以及三个“换发新机(glow-up)”阶段(见第三幕)。 次要运动(跟随动作):基于阻尼弹簧效果的天线和旗帜(这是他的主要表达工具,需不断使用)、每次停止和颠簸时的悬挂弹跳、手臂摆动、身体加速或刹车时头部微小的延迟、轮子扬起的灰尘。 转身图:匹配设定图的正视图、3/4视图、侧视图和后视图,并在转身时实现干净利落的视图切换。 循环动画:向前滚动(带有设定图中的速度线和灰尘)、待机嗡嗡声(轻柔的悬挂呼吸起伏 + 偶尔的天线抽动 + 眨眼)、惊恐后退、惊奇地抬头看、握住一个小物体、向上伸手、攀爬、戳击打字。 胸部舱门:可动画化的开/关动作,有嫩芽柔和的绿色光芒溢出。 风格皮肤接口:骨骼绑定接受一个风格属性(style prop),它能在不改变几何体的情况下,改变线条粗细、填充处理、纹理、污垢、轮廓抖动(boil)、着色模型和滤镜。这是他在不同世界中保持自我的方式。 里程碑1 检查点:渲染一张“列队”静帧:包含四个视角的转身视图 + 所有六种表情的Pip,放在参考图旁边。并排比较。不断迭代,直到看过参考图的人都会说“那就是Pip”。未通过此关前不要继续。 世界(风格材质) 每个世界都是一个完整的环境组件,具有前景、中景、背景视差层,以及Pip专属的风格皮肤。构建一个共享的 WorldLayer 系统,以便所有世界都能共享摄像机和深度逻辑。 比例规则:摄像机位置放得很低,靠近Pip的视线水平(离地约20厘米)。所有东西都很巨大。人类表现为巨大的腿和鞋子,路缘石就是悬崖,水坑就是湖泊。这正是让小机器人具有电影感的关键。 基础世界:处于黄金时刻、杂草丛生的城市。与设定图顶部的插画相匹配:温暖的夕阳余晖、风化的石头和砖块、苔藓和低矮植物、远处朦胧的高楼。具有绘画感、温馨、充满生活气息。这就是“真实生活”。揭示真相的环节也使用这个世界。 动漫东京。清脆的赛璐璐着色、粗犷的轮廓线、带有虚构(非品牌)店名的发光招牌、速度线、樱花花瓣像巨大的粉色雪花一样从他身边飘过。他的面罩上会出现动漫特有的闪烁高光。 黏土村庄。柔和圆润的形状、指纹/涂抹的噪点纹理、定格动画般的步调(以“拍二”的方式渲染他)、温暖的钨丝灯光。他看起来就像用橡皮泥雕塑的一样。 中世纪战场。泥泞的田野、旗帜、远处的投石机、硝烟。穿着铠甲的战靴从他身边轰鸣而过。他在其中平静地滚动,天线躲闪着。 玩具积木城。所有东西都是由顶部带凸粒的通用塑料积木搭建而成(没有真实的品牌风格或标志),带有光滑的塑料高光。Pip被渲染出塑料光泽,轮子变得稍微有些方正。 水下。海底街道上有珊瑚路灯,鱼儿从他的面罩前游过,有焦散光影图案,排气孔冒出气泡,他的天线旗帜像海藻一样缓慢飘动。 铅笔素描。纸张纹理、石墨排线、辅助线、橡皮擦污迹,他的线条不断抖动(boiling),仿佛每一帧都在被重新绘制(匹配设定图底部的素描小图)。 贯穿始终的笑点:嫩芽。影片开始时,Pip用一只爪子小心翼翼地拿着他那根微小的绿色嫩芽(“握住小物体”姿势)。它在每个世界里都存活了下来,并随之变形:带闪光的赛璐璐动漫嫩芽、黏土嫩芽、种在破旧小头盔盆里的嫩芽、积木拼成的嫩芽、在水下吐泡泡的嫩芽、素描嫩芽。每次世界改变时,他都会保护它。这是影片的情感锚点。 标志性过渡:“重构(Regeneration)” 世界的更替必须看起来像 AI 图像重新生成一样,而不是普通的擦除转场。构建 RegenTransition(重构过渡)组件: 画面从边缘向内分解为漂浮的扩散(diffusion)风格噪点(一开始不会覆盖他的身体),保持几帧结构化噪点,然后新世界通过去噪,从粗糙的色块逐渐浮现出丰富的细节。 Pip的身体变化比世界慢一拍,短暂展示出一半旧/一半新的风格,然后瞬间切换到新的风格皮肤。在切换期间,他的面罩会出现两帧的故障效果(扫描线撕裂)。这种半切换状态是证明他一直存在的视觉证据。 每次重构时都有微妙的“嗖-噼啪”音效,在某些重构中,Pip还会发出微小的、受惊的啾啾声。 每次持续 8-12 帧。改变方向和噪点种子,使其永远不会让人觉得重复。 剧本节拍表(在 30 fps 下约 48 秒) 时间安排仅作参考;如果某个节拍稍长一点表现力更好,请自行调整。前 2 秒必须抓住观众的眼球。 第一幕:一个美好的早晨 (0:00–0:03) 低机位跟拍镜头,基础世界。Pip 沿着长满苔藓的壁架从左向右滚动,手里拿着他的嫩芽,眼神充满好奇,天线上下摆动。从滚动的半途中开始(为了实现最终的循环播放)。 在 0:02 时,第一次重构毫无预兆地发生。 第二幕:瀑布般的巨变 (0:03–0:14) 世界快速变化,每个约 1.4 秒:动漫东京 → 黏土村庄 → 中世纪战场 → 玩具积木城 → 水下 → 铅笔素描。 情感递进:一开始很欣喜(星星眼,他觉得这太棒了),接着是好奇(弹出“?”),然后是担忧(流汗滴,天线下垂),最后他在素描世界里急刹车,伴随着悬挂的弹跳和一道刹车痕。 摄像机保持锁定的跟拍构图,这样唯一改变的只有世界本身,从而让这个笑点更容易被看懂。 第三幕:提示词 (0:14–0:30) 基础世界回归。Pip 惊奇地抬头看(参考设定图中的姿势)。天空中,一个巨大的漂浮提示框淡入,散发着薄荷蓝色的光芒,带有玻璃质感且圆润,UI界面柔和且原创。文本在闪烁的光标下自动输入:“让它更具电影感(make it more cinematic)” → 敲击回车键的音效。电影宽银幕黑边瞬间切入,太阳变得极其夸张:巨大的变形镜头耀斑、耶稣光、橙青色调、慢动作的灰尘,一片充满戏剧性的树叶从他的面罩前飘过。他被强光晃得眯起了眼睛。他的天线旗帜在莫名其妙的狂风中充满英雄气概地飘扬。 “加入爆炸效果(add explosions)” 巨大的卡通橙色爆炸伴随着碎块在他身后接连绽放。他没有回头。他的眼睛变得平淡且半闭。他慢慢转过头,直直地盯着镜头。面无表情。停顿整整1秒。然后一次爆炸落在他附近,他瞬间切换到设定图中“惊恐后退”的姿势,头顶弹出“!!”,用身体护住嫩芽。 “让主角更可爱(make the protagonist more adorable)” 换发新机阶段1:他的眼睛变大变亮,出现腮红,天线上长出一个小蝴蝶结。他在水坑里看到自己的倒影,眼睛变得惊恐。 “还要(more.)” 阶段2:粉彩重绘,眼睛占据了整个面罩并带有三重高光,漂浮的爱心和闪光,他的轮子变得毛茸茸的。 “我还要(MORE.)”(更大的字体,屏幕震动) 阶段3:滑稽的极致可爱。全身覆盖毛绒玩具般的皮毛纹理,巨大的动漫眼睛,彩虹光环,伴有合唱团的“啊”声刺音效,爱心纸屑。他的头盔形状、天线和轮子仍保留着,所以他显然还是 Pip。而他真实的眼睛在那双巨大的可爱眼睛里仍然是微小且惊恐的,这就是笑点所在。 第四幕:他崩溃爆发了 (0:30–0:38) Pip 剧烈震动,然后那些可爱的状态像玻璃一样从他身上碎裂掉落。他恢复了正常,满身磨损且极其愤怒(坚定的表情,屏幕闪烁着橙色)。 他打开胸腔舱门,轻轻地将嫩芽塞进去以确保安全。舱门伴随“咔嗒”一声关闭。这是在一片混乱中唯一一个安静、温柔的节拍,它非常重要。 他向前冲刺,从一块石头上腾空而起,用两只爪子抓住漂浮的提示框边缘,将自己拽了上去,轮子在边缘上疯狂打滑旋转(匹配“伸向漂浮提示框”的姿势)。镜头随着他向上倾斜。 在提示框顶部,他用一只爪子按住退格键;旧的提示词伴随着快速的咔哒声逐字删除,他的面罩上反射出消失的文本。 他用一只爪子慢慢地、一字一顿地戳击打字:“放我出去(let me out)”。然后蓄力,重重地砸下回车键。 第五幕:定格与真相揭示 (0:38–0:47) 一切都定格了:半空中的碎片、飘落的纸屑、悬浮的灰尘,以及盒子上正摆出姿势的 Pip。所有音频被切断,陷入长达约 1 秒的死寂。 镜头开始平滑拉远。画面的边缘露出一个圆角矩形:他的宇宙原来只是手机屏幕上播放的一段视频。继续拉远:手机被支在一个有缺口的马克杯上,放在一个堆满备件、电线、螺丝和废料的杂乱工作台上(“用明天的残羹剩饭建造”)。坐在它前面,在这个巨大的手机旁显得很微小的,是另一个 Pip,有着同样的磨损、同样的天线,正在观看。 第二个 Pip 的眼睛缓慢地眨了一下。他的天线微微下垂。发出一声微弱、安静的啾啾声。 第六幕:循环 (0:47–0:50) 在第二个 Pip 的头顶,同样的薄荷蓝色提示框淡入并输入:“让它更具电影感(make it more cinematic)。” 他的眼睛慢慢向上滑动看向提示框。他的天线旗帜变得僵硬。伴随着回车键的音效,硬切回影片的第 1 帧。 循环工程设计:最后一个镜头的构图、灯光,以及重构闪烁的开始,必须让切回第 1 帧的感觉显得是有意为之。音乐必须在切换时无缝循环。通过将视频与其自身拼接(使用 ffmpeg)并观察接缝来验证。 摄影机与电影摄影术 虚拟摄像机系统:位置、缩放、旋转、手持微震动(基于种子的噪点)、爆炸引起的震动冲击、攀爬时的镜头倾斜、揭示真相时的推车拉远镜头。 默认情况下采用低摄像机高度以彰显他的微小比例。浅景深效果:模糊的前景草地/卵石和柔和的背景,就像使用了微距镜头一样。 深度:每个世界至少 4 个视差层。大气透视效果(薄雾,随距离增加而降低饱和度)。 快速移动、碎片、跳跃和攀爬时要加入运动模糊。 每个世界的灯光:在骨骼绑定上使用渐变叠加和正片叠底的阴影层来实现主光/辅光/边缘光。面罩的发光应在附近的表面和他自己的爪子上投射出微弱的暖光。每个世界中他的头盔上都要有边缘光。 整个画面的电影级后期处理:细微的胶片颗粒、柔和的暗角、以及仅在“电影感”节拍中出现极轻微的色差。 构图:将他保持在清晰的三分线上。他的眼睛必须在手机屏幕尺寸下也能看清楚,因为大多数人将在手机上观看。 文本与排版 天空中的提示词:干净的 UI 字体,小写字母,以自然的人类节奏打字(非匀速;有短暂的停顿,在某个地方制造一次小的打字错误并退格以增加真实感)。 文本必须能在不到一秒的时间内在手机上阅读完毕。在 360 像素宽度下进行测试。 没有字幕,没有片名。影片冷开场。 声音(程序化生成,原创) 用代码生成所有音频(Python 合成或离线 Web Audio)并使用 ffmpeg 进行混音: Pip的声音:由带有音高弯音的正弦波/FM 音调构建而成的原创合成啾啾声、嘟嘟声和颤音。设计一个小型的“情感词汇表”:好奇上扬的啾啾声、开心的颤音、担忧的波动声、受惊的吱吱声、脾气暴躁的低沉嗡嗡声、微小的叹息声。他从不说话。 Pip的身体音效:与手臂和头部运动匹配的伺服电机运转声、轮子在砾石/石头上滚动的碾压声、悬挂的嘎吱声、舱门开合的咔嗒声、待机时柔和的电流嗡嗡声。 配乐:一首轻快、可循环的温暖配乐,其乐器配置会随每个世界而改变(动漫世界用古筝/合成器,黏土世界用木制马林巴琴,中世纪世界用鼓/号角,积木世界用塑料咔哒声,水下世界加沉闷的滤波效果,素描世界用铅笔刮擦的节奏)。 音效(SFX):重构时的嗖-噼啪声、键盘打字的咔哒声、回车键重击的“砰”声、带有低频的爆炸声、合唱团“啊”的刺音效、玻璃碎裂声、定格时的完全死寂,然后是揭示真相时安静的工作室环境音(滴答作响的钟表声,远处低沉的嗡嗡声)。 响度标准化至 -14 LUFS 左右。将分轨文件放入 audio/stems/ 中,以便日后可以替换为已授权的音轨。 制作工作流与自我迭代循环 按以下顺序工作,不要跳过任何检查点: 计划:编写 docs/character_bible.md、docs/shotlist.md(包含每个镜头的帧范围、摄像机、表情、天线状态、世界环境、音效)以及 docs/style_guide.md。在构建之前给我看下镜头列表。 骨骼绑定:构建 Pip,通过列队静帧的检查点(见第3节)。 世界环境:将每个世界构建为包含 Pip 在内的独立静帧。将全部 7 个渲染成一张缩略图表。检查角色的身份辨识度和比例感。 过渡动画:构建 RegenTransition,渲染一个 5 秒的测试。 动态分镜(Animatic):以 960×540 的分辨率组装整部影片,包含粗糙的运动和占位音频。观看它。优先修复节奏问题。 完整动画渲染,然后进行打磨(次要运动、缓动、时间节奏、天线表演),最后进行终期处理(灯光、噪点颗粒、模糊、污垢)。 音频处理和混音。 最终渲染。 对于每一个镜头,至少运行 3 次此批评循环: 使用 npx remotion still 在关键帧处渲染 3-5 张静帧,打开并仔细观察它们。 对以下项进行 1-10 的打分:Pip 与参考图的匹配度,能否从眼睛+天线瞬间读取情绪,无声情况下笑点是否清晰,构图,比例感,深度,灯光,细节打磨程度,在手机屏幕尺寸下的可读性。 将分数和三大问题写入 docs/review_log.md 中,修复它们,重新渲染,重新打分。继续此过程,直到每个类别的分数至少达到 8 分,然后再进行下一步。 在每次完成完整的预览渲染后,制作一张 ffmpeg 缩略图表(每 0.5 秒一帧),并在一张图中审查整部影片的流畅度。 在评审时保持诚实。如果某些东西看起来很廉价,说出来并修复它。要寻找的常见失败点包括:僵硬或毫无生气的天线、轮子在滑动而不是滚动、眼睛看起来像贴纸而不是发光的屏幕、缺少悬挂系统的重量感、看起来千篇一律的转场过渡、模糊不清的文字以及角色比例失调。 交付物 out/pip_final_1080p.mp4:影片本身。 out/pip_loop_check.mp4:连续播放两次的影片,以验证循环效果。 out/poster_frame.png:用于 X(推特)发布缩略图的最佳单帧(可能是在爆炸背景下 Pip 面无表情地盯着镜头的画面)。 out/lineup.png:跨越所有世界的 Pip 列队图。 结构清晰且附带注释的源代码,以及包含如何重新渲染说明的 README。 从第一步开始。在开始构建之前,如果有任何必要的问题请问我,否则请自行做出有力的创意决策。
宝玉
我重现了一下这个视频,没有原版的好,但是也相当不错 提示词是用的原推的提示词,图片是让 ChatGPT 生成的一张,详见评论 https://twitter.com/dotey/status/2103685978263064820/video/1
🎬
视频
宝玉
它的 TTS 是自己找的 微软 EdgeTTS(开源的 API 逆向) https://github.com/rany2/edge-tts 用 Remotion(React/JS 视频框架)+ KaTeX 渲染公式。
宝玉
《什么是 Transformer》由 Claude Code + Opus 5.5 制作 --- 提示词 --- 帮我用js制作一个视频,主题是:什么是 Transformer 要深入浅出,让高中生也能看得懂,不仅high level说的清楚,也要有细节,包括注意力机制,甚至一些数学概念 你可以用任何工具或者安装工具,可以联网检索 请给我惊喜 https://twitter.com/dotey/status/2103683057689522564/video/1
🎬
视频
宝玉
美国上诉法院 2 比 1 维持五角大楼对 Claude 的供应链排除令 美国哥伦比亚特区联邦巡回上诉法院 9 月 25 日以 2 比 1 驳回 Anthropic 的诉请。法院认定,美国战争部(即国防部,特朗普政府去年起改用此名)以“供应链风险”为由把 Claude 清出军方供应链,没有越权,也不违宪。 事情起于今年初的合同谈判。战争部要求 Claude 可用于“一切合法用途”。Anthropic 同意大幅放宽限制,但坚持保留两条:不用于致命性自主武器,不用于对美国人的大规模监控。 2 月底谈判破裂,战争部长 Hegseth 3 月初正式做出认定。战争部随后下令,所有系统最迟 180 天内移除 Anthropic 产品,承包商为军方干活也不能再用 Claude,同时扩大了和 OpenAI 的合作。 “供应链风险”这个标签,此前只用在被认为与外国对手有关联的企业身上。 多数意见由 Katsas 法官执笔,Rao 法官附议,两人都由特朗普任命。他们认为,Anthropic 能通过训练决定 Claude 做什么、不做什么,光这一点就落入法律对“供应链风险”的定义。 判决书列了三件事。 第一,早期商用版 Claude 曾拒绝为国安部门总结威胁评估、处理机密文件。 第二,2025 年 Claude 拒绝处理美国疾控中心(CDC)关于防止传染病传播的研究请求。 第三,今年初一名 Anthropic 高管对某承包商把 Claude 用于一次海外敏感军事行动提出质疑。战争部没说是哪次行动,Anthropic 提交的媒体报道指向 1 月抓捕委内瑞拉总统马杜罗的行动。 Anthropic 说前两件事后来都和政府一起解决了,第三件是误会。法院的回应是,这些事至少说明 Anthropic 的训练能有效执行它的使用限制。 争议落在“供应链风险”这个词上。法律把供应链风险定义为有人可能“破坏、恶意植入功能、提取数据,或以其他方式操纵”产品。多数意见按字典义把“操纵”(manipulate)理解为操作、控制,不要求恶意。照这个理解,Anthropic 训练 Claude 拒绝那两类任务,就是在操纵产品设计、让它拒绝执行某些功能。 判决书写道,法院没有理由怀疑 Anthropic 动机高尚,但这条法律只看 Anthropic 做了什么,不问为什么做。 这和 Anthropic 8 月在加州赢下的官司是两回事。战争部当初依据两部法律各做了一次认定。加州北区联邦法官 Rita Lin 8 月 27 日撤销的是依据《美国法典》第 10 编第 3252 条做出的那次,这一条针对的是“对手”,要求有恶意。她还判定,特朗普要求所有联邦机构停用 Claude 的指令,以及 Hegseth 要求所有军方合作企业与 Anthropic 断绝往来的指令,都违法。 这次上诉法院审的是依据 2018 年《联邦采购供应链安全法》做出的认定,适用对象是“任何人”。上诉法院表示同意加州法院“Anthropic 没有恶意”的结论,但认为这部法律不需要这个前提。 所以这次判决的实际影响有限。排除令只管战争部自己的系统和承包商给战争部做的项目,普通用户和企业正常使用 Claude 不受影响。它从 3 月起就已生效,上诉法院 4 月拒绝了暂停执行的申请,这次判决维持的是现状。网上流传的“被整个国防供应链拉黑”,说得过头了。 Anthropic 还主张,被贴上国家安全标签损害了公司声誉。法院引用《华尔街日报》5 月的报道回应:被认定之后,Anthropic 收到的投资报价估值超过 9000 亿美元。 Anthropic 表示不同意判决,正在考虑包括进一步复审在内的所有选项。它可以申请原合议庭重审或全院法官重审,也可以上诉到最高法院。 异议意见来自老布什任命的 Henderson 法官。她认为“操纵”应理解为带恶意、暗中进行的破坏,国会立这部法,是为了防范敌对国家等恶意行为者通过供应链渗透政府系统。 她在异议里假设了一个场景:如果部长接下来要求接替 Anthropic 的公司允许“战争部认为必要的一切功能”,按今天的判决,这家公司只剩两个选择,要么答应,要么冒着被认定为国家安全威胁的风险。
宝玉
Anthropic Claude Code 团队的 Thariq Shihipar 的这篇文章讲 Claude Code 里的 effort 设置(可以理解为投入档位)该怎么用。我想很多人都不是很清楚 Claude Code 的 effort 档位怎么选,我在看这篇文章之前也有些模糊,一般默认就是 high,现在看还是有些讲究的。 Thariq 的经验是:low 用于头脑风暴、画草图、小改动,要的是快,随时能插手;medium 用于大部分日常开发,比如实现新功能;high 用于需要验证、边界情况多的活,比如在老代码库里修 bug;max 用于让 Claude 完全自主攻克难题,比如从头到尾搭一个 App 并验证,或者给关键软件找安全漏洞。 在 Claude Code 里输入 /effort 就能切换档位,对话中途也可以换。注意只有最新的 Opus 5.5 和 Fable 5.1 不会让缓存失效,早期模型会让缓存失效。 Thariq 通过实测发现,effort 主要决定 Claude 在一个任务上花多少功夫做验证、测边界情况,以及替你拿多少主意。 effort 从 low 到 max 分几档,本质是告诉模型你愿意让它在这件事上花多少算力。同一件事,给你 1 小时,你会先交一个能用的版本,等对方反馈再改;给你 12 小时,你会自己反复打磨、检查。 最新的 Opus 5.5 和 Fable 5.1 可以在对话中途切换档位,而且不会让提示词缓存(prompt cache)失效,前面对话积累的缓存照样能用。能随时切了,很多用户就来问他到底什么时候该用哪一档。 【日常开发:需求越模糊,档位差别越大】 Thariq 让 Opus 5.5 用不同档位做同一个模糊需求:“做一个健身记录 App”。low 档只做出一个记录表和一张简单图表,档位越高功能越多,max 档还加了一张热力图。另一个任务是重新设计 Claude Code 的 /config 菜单,low 档 1 分钟交出一个能看懂思路的交互草图;max 档用了 28 分钟,样稿跟 Claude Code 真实界面很像,还附了几种操作流程的演示。 如果先让 Claude 详细采访他、整理出完整需求再动手,不同模型、不同档位的产出就很接近了。 换句话说,档位越高,Claude 替你做的假设越多。想自己掌控细节,就用低档位快速出初稿,边看边改。 他现在开发新功能的流程是:把需求交给 Claude,让它反过来问你还漏了哪些细节;用 low 档实现,检查大方向对不对,不对就继续用 low 档改;最后切到 high 档做验证和测试。 【难题:高档位用来补边界情况】 更难的任务,他去翻了 Terminal-Bench 3.0 的结果。这是一个社区出题的基准测试,题目比日常开发难得多,比如用 Verilog 写一台能装进小型 FPGA(可编程芯片)的 8 位游戏机,或者在定理证明工具 Lean 4 里完整证明一条数学定理。 他的主要结论是:边界情况越多的任务,越值得开高档位。 html-js-filter 这道题要求写一个 HTML 过滤器,把所有往网页里夹带 JavaScript 的写法都清理干净。Fable 5.1 在 low 档跑 5 次只过了 1 次,到 xhigh 档 5 次全过。low 档每次两分钟左右,写一遍过滤器,拿一个手写页面测一下就结束了。他追踪的一次 high 档运行花了约 33 分钟:先挑自己初稿的毛病,再去读解析器源码找 bug,跑了一套标准的 XSS(跨站脚本攻击)测试集,最后还写了一个随机生成网页的模糊测试程序。 Opus 5.5 修存储引擎崩溃 bug 的题也类似,low 档 0/5,xhigh 档 4/5。low 档一分钟左右就直接改代码,没先复现崩溃;xhigh 档花 11 分钟,先复现,再写随机测试,还专门确认修到一半的代码会被测试拦下来。 按领域看,硬件、代码审查、安全这类题目从高档位受益最多。但档位也有管不到的地方:加档位能减少因漏掉边界情况导致的失败,模型一开始思路就错了的话,档位开再高也救不回来。 还有一道题能看出人在不在场的区别。gsea-proteomics 要求分析一组蛋白质组学数据,判断八种处理方式里哪些效果接近目标组织。low 档的 Opus 5.5 挑了一种听起来合理的数据预处理方法,跑一遍就报结果,5 次全错;high 档试了两种预处理方法,发现得出的结论不一样,先查清原因再选定方法,5 次对了 4 次。Thariq 说,如果有人在场,Claude 可能会先问一句这个问题该怎么设定;没人在场,高档位的效果更好。 所以档位怎么选,很大程度上看你打算在这个任务里参与多少。一直默认开 high,等于每次都让 Claude 替你多拿主意,也每次都多花时间和 Token。
宝玉
Anthropic Claude Code 团队的 Thariq Shihipar 的这篇文章讲 Claude Code 里的 effort 设置(可以理解为投入档位)该怎么用。我想很多人都不是很清楚 Claude Code 的 effort 档位怎么选,我在看这篇文章之前也有些模糊,一般默认就是 high,现在看还是有些讲究的。 Thariq 的经验是:low 用于头脑风暴、画草图、小改动,要的是快,随时能插手;medium 用于大部分日常开发,比如实现新功能;high 用于需要验证、边界情况多的活,比如在老代码库里修 bug;max 用于让 Claude 完全自主攻克难题,比如从头到尾搭一个 App 并验证,或者给关键软件找安全漏洞。 在 Claude Code 里输入 /effort 就能切换档位,对话中途也可以换。注意只有最新的 Opus 5.5 和 Fable 5.1 不会让缓存实效,早期模型会让缓存实效。 Thariq 通过实测发现,effort 主要决定 Claude 在一个任务上花多少功夫做验证、测边界情况,以及替你拿多少主意。 effort 从 low 到 max 分几档,本质是告诉模型你愿意让它在这件事上花多少算力。同一件事,给你 1 小时,你会先交一个能用的版本,等对方反馈再改;给你 12 小时,你会自己反复打磨、检查。 最新的 Opus 5.5 和 Fable 5.1 可以在对话中途切换档位,而且不会让提示词缓存(prompt cache)失效,前面对话积累的缓存照样能用。能随时切了,很多用户就来问他到底什么时候该用哪一档。 【日常开发:需求越模糊,档位差别越大】 Thariq 让 Opus 5.5 用不同档位做同一个模糊需求:“做一个健身记录 App”。low 档只做出一个记录表和一张简单图表,档位越高功能越多,max 档还加了一张热力图。另一个任务是重新设计 Claude Code 的 /config 菜单,low 档 1 分钟交出一个能看懂思路的交互草图;max 档用了 28 分钟,样稿跟 Claude Code 真实界面很像,还附了几种操作流程的演示。 如果先让 Claude 详细采访他、整理出完整需求再动手,不同模型、不同档位的产出就很接近了。 换句话说,档位越高,Claude 替你做的假设越多。想自己掌控细节,就用低档位快速出初稿,边看边改。 他现在开发新功能的流程是:把需求交给 Claude,让它反过来问你还漏了哪些细节;用 low 档实现,检查大方向对不对,不对就继续用 low 档改;最后切到 high 档做验证和测试。 【难题:高档位用来补边界情况】 更难的任务,他去翻了 Terminal-Bench 3.0 的结果。这是一个社区出题的基准测试,题目比日常开发难得多,比如用 Verilog 写一台能装进小型 FPGA(可编程芯片)的 8 位游戏机,或者在定理证明工具 Lean 4 里完整证明一条数学定理。 他的主要结论是:边界情况越多的任务,越值得开高档位。 html-js-filter 这道题要求写一个 HTML 过滤器,把所有往网页里夹带 JavaScript 的写法都清理干净。Fable 5.1 在 low 档跑 5 次只过了 1 次,到 xhigh 档 5 次全过。low 档每次两分钟左右,写一遍过滤器,拿一个手写页面测一下就结束了。他追踪的一次 high 档运行花了约 33 分钟:先挑自己初稿的毛病,再去读解析器源码找 bug,跑了一套标准的 XSS(跨站脚本攻击)测试集,最后还写了一个随机生成网页的模糊测试程序。 Opus 5.5 修存储引擎崩溃 bug 的题也类似,low 档 0/5,xhigh 档 4/5。low 档一分钟左右就直接改代码,没先复现崩溃;xhigh 档花 11 分钟,先复现,再写随机测试,还专门确认修到一半的代码会被测试拦下来。 按领域看,硬件、代码审查、安全这类题目从高档位受益最多。但档位也有管不到的地方:加档位能减少因漏掉边界情况导致的失败,模型一开始思路就错了的话,档位开再高也救不回来。 还有一道题能看出人在不在场的区别。gsea-proteomics 要求分析一组蛋白质组学数据,判断八种处理方式里哪些效果接近目标组织。low 档的 Opus 5.5 挑了一种听起来合理的数据预处理方法,跑一遍就报结果,5 次全错;high 档试了两种预处理方法,发现得出的结论不一样,先查清原因再选定方法,5 次对了 4 次。Thariq 说,如果有人在场,Claude 可能会先问一句这个问题该怎么设定;没人在场,高档位的效果更好。 所以档位怎么选,很大程度上看你打算在这个任务里参与多少。一直默认开 high,等于每次都让 Claude 替你多拿主意,也每次都多花时间和 Token。
宝玉
Codex 要重置了
宝玉
RT @localhost_4173: 咱的开源 Grok bot 正式发布: https://lorca.app/zh/download 原生 mac 和 ios app,其它平台也将很快发布 https://twitter.com/localhost_4173/status/2103454978220470708/photo/1
宝玉
RT @threeaus: Opus 5.5 用 6300 帧生成了苏轼的一生,中秋快乐.mv 用 Claude Opus 5.5 整了个苏轼一生的动画,配合《水调歌头·明月几时有》(王菲演唱的版本),做了一个MV。 真的太强了,我用一个较长的提示词和王菲的歌做启动,第一版本就让我很喜欢,但是没有注释和歌词字幕,我就让它自己生成一下,字幕和解释都非常适配。 后续也简单微调了一下最后的剪影,太好操控了。当然,里面还有很多小细节,都可以调整到更好,总之是真正的言出法随,调整还不会乱动其他部分。 不多说了,祝大家中秋节快乐。
🎬
视频
宝玉
RT @realWeZZard: 玉伯终于想到这一点了。 不过我的 thesis 是:新时代不存在任何微信这样子的超级 app。新时代的入口属于硬件。 启发我这么想的是我最近做的 GTM 工作流,做完这一套之后,我认为只要任何 IM 提供任何 GUI 的使用方式,那它就必然不可能成为下一个时代的入口。 我首先在本地制作了标准的 Ubuntu 以及 macOS 虚拟机镜像,里面提供了浏览器以及一些 IM 软件。 然后我开发了一个采集程序,在 IM 群组以及社交媒体中采集信息,然后寻找符合用户画像的潜在客户。 因为 Chrome 的 profile 是可以直接抽出然后存储在虚拟机外的,所以针对 web app 我并不需要每次都重新登录。如果不是 web app 也有对应的解决方法。 最后一步就是发起和潜在客户的沟通了。这里比较拙劣的用法是直接使用 AI 产生的信息去和用户沟通。但我依然只会要求 AI 帮我编排好沟通材料,由我自己真人去沟通。 在整个过程中帮我建立连接的,其实并不是我而是我的 AI + 我的意图。我的 AI 可以横跨所有的即时通讯软件及社交媒体,只要它提供任何图形界面的访问方式。 所以只要任何 IM 提供任何 GUI 的使用方式,那它必然就不可能成为下一个时代的入口。因为它必然可以被运行在虚拟机上,然后由 AI 采集信息,帮助用户完成横跨数个 IM 以及社交媒体的连接。 那么下一个时代的入口是什么?我认为它一定会和硬件绑定在一起。或者下一个时代的入口,一定会是 OS 级别搭配硬件销售的。 而且整体看下来我自己做的 GTM 流程存在数据飞轮,而这个飞轮最后掌握在 GTMer 手中。 考虑到数据主权,通过 Qwen 3.8.27B 所有 API 请求和数据都可以留在本地。而我构建这一套设施的硬件成本是 M4 Pro Mac mini 64GB RAM+ 2* DGX Spark。当然,目前 M5 Ultra Mac Studio 256GB 是性价比更高的选择。我目前的配置加起来应该已经超过 10 万了。 但是硬件价格一定会下降,以及目前这一套设备在未来很有可能就可以运行在一个像 Mac mini 甚至像 iPhone这样小的设备里面。iPhone 在发布的时候,其 CPU 相当于 2000 年左右的桌面级 CPU。而目前 A20 Pro 也已经比肩同年代的桌面处理器能力。所以相关的能力在未来一定会走入千家万户。而通过 IM 构建起来的护城河,最后也一定会被瓦解。 另外从这点看,本地 AI 会是一个越来越重要的话题,以及 Qwen 27B 这个模型权重会是一个越来越重要的模型权重。我不得不说,阿里 Qwen 实验室的这个模型权重系列设计真的是非常的有品位。 目前的大厂都只能够自己做软件,最有资源的那一位,却没有做硬件的耐心。所以最后愿机会属于每一位不愿意在大厂打螺丝的朋友们。
宝玉
RT @lifesinger: 细思,Muse 确实有做成新时代微信的机会。 微信当年最重要的功能,是给人发消息,同时比短信还便宜非常多。想发消息的人在微信上,带来用户吸引,形成了网络效应。有用 + 网络效应 + 运气,成就了微信。不是因为微信有多懂你。 Muse 能帮人处理邮件日历、电话催单等各种杂事,这有点像微信最开始的发消息。Muse 的网络效应会在哪。没有网络效应的话,和 ChatGPT 会是同质化竞争。豆包在国内活成了新时代的百度。 Meta 真正的杀招,可能是 WhatsApp -〉 Muse,类似当年的 QQ 通讯录 -〉 微信。不仅自己的 Muse 能干活,而是我的 Muse 还可以连接 WhatsApp 关系网中的其他人的 Muse,彼此因连接而更强大。如果 Muse 敢往这个方向发展,则就有机会构建网络效应。而且会比微信更厉害:微信通过手机,让人醒着就在线。Muse 通过 agent,让人睡着也在线。 有用 + 有机会构建网络效应,最后就只欠运气了。不期待小扎有这个运气,不期待任何大厂有这个运气。只期待齐俊元、玉伯、马小龙等创业者有这个运气。 有意思的时代,正在开启。
宝玉
Google 下周把 TPU 送上太空,芯片跑 15 分钟就得停下来降温 Google 要把自家 AI 芯片送进太空了。Sundar Pichai 在 X 上宣布,Project Suncatcher 的第一颗原型卫星将搭乘 SpaceX 的拼车发射任务 Transporter-18 升空,卫星由 Google 和遥感卫星公司 Planet 合作打造。据《纽约时报》报道,发射定在 10 月 1 日,用猎鹰 9 号从加州范登堡太空军基地出发。 Suncatcher 是 Google 去年 11 月公布的“登月计划”,研究能不能把 AI 数据中心搬到太空。出发点是电:AI 数据中心极其耗电,而在近地轨道上,卫星几乎一直晒得到太阳,太阳能发电量最多可达地面的 8 倍。 这颗卫星代号 MVP,冰箱大小,装了 4 块 TPU(Google 自研的 AI 芯片,Gemini 就靠它训练和运行),算力约等于地面数据中心的一台服务器。太阳能板只提供约 1 千瓦电力,按《纽约时报》的说法,只够带动一台吹风机。它能在轨道上回答简单的 Gemini 提问,设计寿命约一年。 Pichai 在推文里的问题很直接:TPU 能不能在太空活下来,还能正常干活?发射和辐射这两项,Google 已经在地面测过。上天那 10 分钟里,整颗卫星要承受最高 10 倍重力的持续加速度,落到单块芯片上可达 50 到 100 倍,Google 沿三个轴向猛烈摇晃过卫星,硬件扛住了。辐射测试则显示,第六代 TPU Trillium 能承受的累积辐射剂量,超过在太空执行五年任务所受的量。 最没把握的是散热。太空没有空气,风扇派不上用场,热量只能靠散热板辐射出去。Google 用的是热管加散热板的方案,但项目负责人 Travis Beals 对《纽约时报》透露,芯片目前连续跑 15 分钟左右就得关机降温。 按原计划,Google 和 Planet 要到 2027 年初才发射两颗原型星。后来 Google 坚持今年就上天,愿意多担风险,干脆把芯片装进了 Planet 现成的卫星。2027 年那两颗照常发射,专门测试卫星之间的激光高速互联。Google 的最终设想是 81 颗卫星在半径 1 公里内编队飞行,用激光连成一座太空数据中心。 如果长远做成了,没人会在意自己的 Gemini 请求是不是在太空里处理的。但离那一天还远。Google 负责研究的高级副总裁 James Manyika 认为,未来几年都不指望有真正能用的东西。Google 去年算过账:发射价格要在 2030 年代中期降到每公斤 200 美元以下,太空数据中心的发射加运营成本,才能和同等规模地面数据中心的电费大致相当。而当时的发射价格还在每公斤 1500 到 2900 美元。 把数据中心级 AI 芯片送上天,Google 并不是第一家。创业公司 Starcloud 去年 11 月就把一块 NVIDIA H100 送入轨道,还在上面跑起了 Google 的开放模型 Gemma。
🎬
视频
宝玉
RT @ALSK_ai: 用 Opus5.5 根据图片生成动画 卧槽!为什么还有光追啊??? 提示词放评论区了 https://twitter.com/ALSK_ai/status/2103135536634630632/video/1
🎬
视频
宝玉
宝玉
Claude 在噬菌体里发现类 CRISPR 新酶系统 Anthropic 宣布,Claude 在噬菌体(专门感染细菌的病毒)的 DNA 中发现了一类此前没人注意到的酶系统。它的结构特征和 CRISPR 很像,Anthropic 将其命名为 ART,意思是"阵列相关逆转录酶"。 逆转录酶的作用是把 RNA 抄写成 DNA。ART 由三部分组成:一个逆转录酶,旁边一个功能未知的搭档基因,以及一长串等间距排列的重复 DNA 序列。CRISPR 也有类似的重复阵列,里面存着"导航信息",所以 CRISPR 可以被编程,去基因组的指定位置剪切。实验已经证实,ART 的阵列同样会被转录成一组各不相同的短 RNA,这暗示它可能也有类似的可编程机制。 这个发现值得关注,是因为同时具备这几项特征的系统,以前只找到过寥寥几个,而且全都能对 DNA 做剪切、复制、粘贴之类的操作。CRISPR 已经催生了基因编辑药物,另外几个也正在被开发成新工具。不过 Anthropic 也承认,ART 的具体功能目前还不清楚。 整个发现过程几乎由 Claude 独立完成。研究人员只给了一个初始提示,让它在海量 DNA 数据库里寻找有意思的新逆转录酶。大约 950 个 Claude 智能体跑了 21 小时,消耗 2.1 亿 token。它们从 20 多万个逆转录酶中筛出 3500 个候选,再挑出最值得看的 20 个,写成人类能读懂的报告。 其中一个智能体在逐段读原始序列时,直接认出了重复阵列。接着它数了重复次数,量了间距,和已知系统做比对,又查了文献,确认是新东西之后才提交给人类审核。这个逆转录酶本身以前有人报道过,但它旁边的阵列和搭档蛋白,是 Claude 第一个发现的。 据 Anthropic 介绍,这类"基因组挖掘"工作,专家通常要花几周到几个月。CRISPR 先驱、MIT 教授张锋看过预印本后评价说,这是 AI 智能体参与生物学发现的一个好例子,这类阵列值得深入研究。 这项成果出自 Anthropic 今年春天新组建的生命科学研究组。团队在湾区建了自己的湿实验室,只做 BSL-1、BSL-2 级别的低风险研究,不接触能感染人的病原体。所有实验都由人类科学家动手完成。 团队日常用的工具是公开发布的 Claude Science 和 Claude Code。这意味着其他实验室理论上也能搭起这套"AI 批量提假设、人做实验验证"的流程。Anthropic 目前正在向外部科学家征集可以合作的研究课题。
宝玉
RT @DLKFZWilliam2: 根大家分享一个提前布局的机会: Meta 刚把新一代 VR 眼镜放出来了。只有100 克、眼镜形态、不用头带,显示和传感器都在镜身上,处理器、电池和存储单独放在一个小圆盒里。5K micro-OLED、37 PPD,高通 Snapdragon Reality Elite,续航大概 3 小时高分辨率播放。 2027 年春天上市,1299 美元。 我觉得这对开发者是个挺实在的窗口。这类应用完全可以像当年做 Quest 内容一样,安静地赚钱。 国内几乎没团队认真盯这块,竞争反而没那么卷。 机会往往就藏在这种暂时没人挤的地方。提前布局,悄咪咪赚钱。 另外再说一个现在的趋势:现在的 personal agent 赛道非常拥挤。如果没有一定实力的开发者,千万不要去做这个方向。不如做做这些冷门的,花一点精力,分散一下风险。
宝玉
期待 DeepSeek 版😂
宝玉
初始提示词和源代码我放到 GitHub了:https://github.com/JimLiu/taohuayuan 有兴趣的话,你可以继续迭代,或者衍生出其他作品
宝玉
因为我这个是反复迭代后的版本,所以无法单一的提示词,不过我让 Opus 5.5 还原了一下提示词( docs/prompt.md ),可以用作初始提示词 然后我把源代码放到 GitHub了:https://github.com/JimLiu/taohuayuan 迭代了一天时间,总 Token 大约 Max@20x 订阅一周的 10%-15%之间 https://x.com/leosunkr/status/2102948666285904372?s=20
宝玉
Meta 发布了 Muse Charm,一个能挂在钥匙扣上的小设备,专门用来跟自家 AI 智能体 Muse 对话。它是 Meta 周三在 Connect 大会上发布的,扎克伯格表示目标是赶在 12 月假期季前发货。 可能很多网友还不知道 Muse 是什么。它是 Meta 刚推出的个人 AI 智能体,9 月 8 日才上线,一度超过 ChatGPT 登上 iOS 免费榜第一。用户可以给它起名字、设计形象,甚至调整它说话的口音和语速,更像一个养成的专属助手。 Muse Charm 就是给这个助手做了一个实体。轻触设备角落的指纹传感器就能开始对话,屏幕上显示一个可更换的 Muse 动画形象。所以不少媒体拿它和拓麻歌子(90 年代风靡一时的日本电子宠物)作比较。 它解决的问题很直接:想问 AI 点事,不用掏手机解锁、再找 App。扎克伯格说用户可以直接对着它说话,不用解锁手机、打开应用,还能给 Muse 看你周围的情况。按他的说法,如果你没戴 AI 眼镜,这会是跟 Muse 交流最快的方式。 同场 Muse 本身也加了新功能,包括实时视频聊天、可自选声音的实时语音对话,以及每个用户的智能体都会有一个独立邮箱地址。 不过这东西离上手还有距离。Meta 目前只造了几台,零部件和设计都还没定型。价格没公布,续航、联网方式、是否需要配对手机也都没说。可能是基于 5G 的设备,这一点在 Meta 官方和主流媒体报道里还没得到确认。 这类 AI 挂件此前名声不太好,像 Friend 这样的产品让很多消费者对“实体 AI”这个概念只剩白眼。Meta 的底气在于 Muse 已经有了一批真实用户,Charm 只是给他们多一个入口。
🎬
视频
宝玉
上次我为了录视频,折腾了半天录屏软件,还不好看,今天突然想到为什么要自己录制,直骂自己蠢,给 Claude Code 一句话就搞定了: > 帮我沿着循文入境录制一个1080p的视频,记录完整的循文入境场景,包括音频,请调整网页尺寸,16:9比例 > 视频第一帧应该是大标题:《桃花源记》——陶渊明 > 制作:宝玉 > 背景是网页首页桃花
宝玉
RT @Xian0063: 祝大家中秋快乐🎉🎈🍉🌹🍷🍺🏮🦀🥮 感恩遇到你们每一个人 中秋赏灯赏月·上线啦!~~~ 9月25日晚20:00-23:59,随时来都有彩蛋哦!!! https://xianxie6.github.io/qingming-riverside/ https://twitter.com/Xian0063/status/2102839166493151579/video/1
🎬
视频
宝玉
宝玉
Opus 5.5 终结了比赛! 用 Opus 5.5 重做了《桃花源记》,还是 three.js 做的,但是效果好了很多,当然这次不是一个提示词,而是反复打磨了好多次,还让它去搜索了免费的的 3D 模型,避免从头建模。 如果你想试试的话:https://s.baoyu.io/files/taohuayuan/index.html 记得点击右下角的“循文入境” https://twitter.com/dotey/status/2102940980379017293/video/1
🎬
视频
宝玉
AI 时代,职场人现在最该学的一项技能是什么? 吴恩达老师的建议是人人都该学编程。 不少企业高管劝大家别学编程了,理由是 AI 会把它自动化掉。吴恩达认为这个逻辑正好反了。正因为有了 AI 辅助,写代码变得前所未有地容易,所以才值得每个人都去学。 他已经在很多岗位上看到了明显的生产力差距。这不只发生在软件工程师身上。一边是会写代码、能自己做定制软件的人,另一边是不会的人,两者的效率已经拉开了。 学编程不等于手写代码 他说的学编程并不是一行行手敲代码,他自己几乎从不这么做。在可预见的未来,最重要的能力之一是能准确告诉计算机你要它做什么,让它替你完成。而代码就是计算机的语言。所以学编程的实质,是学会用计算机听得懂的方式把需求说清楚。 他团队里最好的市场人员有了想法,不用等工程师来搭网站,自己就能做出来。最好的招聘人员也不再靠肉眼一份份看简历,而是写代码让程序帮忙筛选。在他看来,能把需求交代给计算机的人,会变得强大得多、高效得多。
🎬
视频
宝玉
RT @saturn2088: @dotey 我试了,5.5复杂写作还是 Max 最强,extra 都差一点。另外的初步的测试结果就是 5.5 Max 比 4.6 Max 节省约 19%
宝玉
RT @rwayne: 《你对 AGENTS.md 的理解几乎为零》 作者:@rwayne @onlookersh “公司变大之后,人和公司都会犯糊涂。他们想复制最初的成功,于是很多人以为:当初成功的过程里一定藏着某种魔力。于是他们开始把流程在全公司制度化。很快,大家就把流程当成了内容本身。” ———史蒂夫·乔布斯 《失落的访谈》 过去的时候呢,各种的 AI 编程工具有各自的说明书。比如Anthropic 家的 Claude Code,开机默认只读一个叫 CLAUDE.md 的说明书。而 OpenAI 家的 Codex 和其他很多工具,默认读的是 AGENTS.md。我相信很多人都是跟我一样,不止用一个编程工具。那么这就会出现一个问题,我同一个项目里面,我必须放两份说明书。Claude Code 后来增加了一种处理方式,如果项目里没有 CLAUDE.md,它会检查有没有 AGENTS.md。 那为什么说你对 AGENTS.md 的理解几乎为零?
宝玉
可能官方看到咱们的讨论,要去掉 plan 模式了😂
宝玉
Opus 5.5 还是挺耐用,愣是没在重置前用完 https://twitter.com/dotey/status/2102805013328515318/photo/1
宝玉
RT @xicilion: 复杂任务必须要写方案。 一,建立共识,一句话并不足以讲明白目标,细节才真正影响目标和架构 二,同步背景,ai 会围绕目标收集信息,暴露现有缺陷 三,锁定路径,ai 会在解决具体问题的时候逐渐失去目标,最后再来回返工 四,记录过程,工作文件会在过程中不断更新
宝玉
Claude 手机 App 现在支持多账号了,利好你有多个 Claude 账号
宝玉
Opus 5.5(图1-2) vs GPT 6 Astra(图3-4) Opus 5.5 网页:https://s.baoyu.io/files/sakura-valley-opus-5-5.html GPT 6 Astra 网页:https://s.baoyu.io/files/sakura-valley-gpt-6-astra.html --- Prompt --- 请直接制作一个可以在浏览器中实时交互的高完成度 3D 景观网页。 主题:日式樱花山谷。 使用 HTML、CSS、JavaScript 实现。不要生成图片,不要只给设计方案, 不要用一张背景图加视差效果冒充 3D。我要的是实际可运行、可游览的成品。 【一、作品定位】 这是一片完整、连续、有远近层次的山谷景观, 不是孤立的小摆件、悬浮岛、带底座的沙盘,也不是单纯的技术演示。 风格是现代精细体素 / voxel art: 保留立方体几何的造型语言,但画面应高分辨率、抗锯齿、光影细腻。 不要复古低分辨率像素化,不要粗大积木堆砌,不要给画面套像素滤镜。 视觉质量优先。宁可少几个功能,也不要牺牲构图、材质和光照。 【二、参考图的使用方式】 如果附有参考图,请先理解它的构图层次、尺度、光线和色彩关系。 仅借鉴氛围与视觉语言,重新设计场景, 不要照搬建筑、树木、山体和道路的位置,不要 1:1 复刻。 参考图不是网页里的背景素材。场景本身必须由真实 3D 几何构成。 【三、场景构图】 默认打开时就应呈现一幅完整、有吸引力的画面, 不需要用户先旋转镜头才能找到好看的角度。 采用透视相机,而不是沙盘式等距俯视相机。 画面有明确的前景、中景、远景: 前景: 一株有存在感的古老樱花树,配合岩石、草木、石灯笼和少量落花, 形成画面边缘的自然框景,但不能挡住河流、桥和主要建筑。 中景: 一条蜿蜒河流引导视线进入画面,红色木桥横跨河面; 村落、茶屋、神社和小径顺着地势分布,建筑之间有真实的通行关系。 地面有起伏、岸线和自然过渡,不是平面上均匀摆放模型。 远景: 山坡上的多层塔、不同距离的森林和山脊,以及远处的雪山。 用尺度变化、遮挡、冷暖变化和空气透视表现距离, 而不是仅仅把远处物体缩小。 不要把所有元素均匀铺满。需要主次、疏密、留白和清楚的视觉焦点。 【四、造型与画面质量】 樱花树: 树干有转折、分叉和根部,树冠由不规则花簇组成, 有间隙、厚薄变化和可见枝条。不要做成几个规则球体或方块团。 建筑: 屋顶有层叠瓦片、挑檐、梁柱和窗格; 不同建筑有用途、体量和高度差异,不要复制同一栋房子铺满山谷。 地形: 岸边有湿润石块、草丛和植被过渡。 避免过于规律的台阶、重复条纹、棋盘格和明显的程序生成网格。 水面: 必须能够反映周围景物,具有适度的波纹、深浅变化和岸边过渡。 尽量使用实际场景反射;需要性能降级时也应保持视觉可信。 不要用闪烁噪声、强烈扭曲或一整块蓝色平面代替水。 细节: 可以有少量锦鲤、落花、萤火虫、瀑布和远处飞鸟, 但都应服务于氛围,不能让画面显得嘈杂。 不要为了宣称模型数量而堆砌细节。 【五、色彩与氛围】 默认是蓝调时刻: 偏冷的山谷与远山,柔和的粉色樱花,温暖但不过曝的灯笼和窗光。 暖光集中在有人活动的地方,不要把整个环境染成橙色。 需要柔和阴影、物体接触处的明暗、合理的曝光、 克制的泛光、抗锯齿和有距离层次的薄雾。 避免发白、灰蒙、过度饱和、满屏浓雾、过曝灯光和明显锯齿。 方块几何可以清晰,但渲染本身不能粗糙。 另提供“清晨”和“雨中”两种氛围; 切换时应同步改变天空、环境光、雾和局部效果, 不是仅仅修改背景颜色。 【六、交互与界面】 提供四个经过设计的镜头: 山谷全景、河边低机位、寺庙小径、山坡俯瞰。 切换应平滑,每个镜头都需要有独立的构图价值。 基础交互: 鼠标拖动观察、滚轮缩放或前进,触屏支持拖动和双指缩放。 提供重置视角、隐藏界面和保存当前画面的功能。 可选增强: 自由探索、缓慢镜头巡游、环境音。 环境音默认关闭,只在用户主动点击后播放。 额外功能不能影响默认画面的完成度。 界面要克制、有设计感,以景观为主。 标题和控制条放在边缘,不遮挡视觉焦点。 桌面和手机都不能出现按钮越界、文字重叠或无法操作的问题。 【七、工程与性能】 允许使用 Three.js / WebGL,以及版本固定、互相兼容的 CDN 依赖。 优先使用成熟渲染能力,不要为了“零依赖”重写整套引擎。 自写的 HTML、CSS、JavaScript 尽量整理在一个 HTML 文件中。 景物由程序化几何和材质生成,不依赖外部图片或 3D 模型资源。 重复物体采用适合的批量或实例化绘制方式; 合理控制细分、阴影、反射和渲染分辨率。 提供高画质和轻量模式,手机默认使用较轻设置。 不要靠无限增加体素数量换取细节。 加入加载提示、WebGL 不支持时的提示和必要的错误处理。 没有开启声音时不要自动播放;尊重减少动态效果的系统偏好。 【八、交付前验收】 不要写完代码就立即交付。 如果当前环境支持浏览器运行和截图,请先实际打开页面, 检查默认镜头、四个视角、氛围切换、桌面和手机布局, 再根据截图修正明显的构图、曝光、遮挡和渲染问题。 重点检查: 是否存在空白画面、加载失败、控制台错误; 是否有穿模、闪烁、阴影条纹、过曝、水面异常; 默认画面是否真正像完整景观,而不是小型沙盘; 功能按钮是否实际可用,移动端是否越界。 可以使用浏览器截图验收,但不要调用图像生成工具。 没有完成的测试要如实说明,不要声称已经验证。 最终交付: 1. 实际存在、可以打开的 HTML 文件,或当前环境支持的交互预览。 2. 如能截图,附一张真实浏览器渲染截图。 3. 简短说明操作方式和必要的运行条件。 请直接完成制作;非关键细节自行作出一致的设计选择, 不要把可以自行解决的实现问题反复交给我决定。
宝玉
后续维护的时候,该讨论方案正常讨论方案即可,方案确认后再同步文档 https://x.com/wildrose_one/status/2102550418983366846?s=20
宝玉
我知道的 Claude Design(不是 Claude Code) 和 Figma MCP 的一些差别: 1. 操作方式不一样 - Claude Design 是直接生成 HTML - Figma MCP 是通过 MCP 操作 Figma,省了你手动操作 相对来说直出 HTML 做出来好看些(个人观点) 2. 产物不一样 - Claude Design 产出 HTML + React + CSS + 模拟数据,可以点击交互,不仅是设计稿,还是原型;Claude Design 其实还可以做 Slides 和视频 - Figma MCP 还是 Figma 格式文件 3. 运行环境不一样 - Claude Design 不依赖于 Figma,不需要授权,下载后可以本地运行显示 - Figma MCP 依赖于 Figma 不是设计师的话,建议选 Claude Design
宝玉
帮转,Dario 绯闻女友 CuiMao 招助理
宝玉
Opus 5.5 写作目前给我感觉非常好,比 Opus 4.6 还好点
宝玉
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna:旗舰级能力下放,API 价格砍半 OpenAI 推出 GPT-6 家族的两款新模型 Sol 和 Luna,主打“接近旗舰的能力,大幅更低的价格”。API 价格比上一代 GPT-5.6 的促销价再降 50%。 先理清命名。本月早些时候,OpenAI 发布了 GPT-6 Astra,定位是最强的旗舰模型。这次的 Sol 是中档,Luna 是轻量档,相当于同一代技术的“大、中、小杯”。三款模型用相似的方法训练,所以 Astra 在编程、事实准确性、操作电脑等方面的进步,也带到了更便宜的两款上。 OpenAI 这次的对比对象主要是 Anthropic 的 Claude。以下数据都来自 OpenAI 自己公布的评测,第三方复现结果还需等待。 在模拟跨应用处理销售、财务、HR 等业务流程的 AutomationBench 上,Sol 以最高推理强度拿到 33.2%,每个任务成本约 0.27 美元。它超过了最高强度的 Claude Opus 5(26.9%),成本只有后者的 9% 左右,也略高于低强度的 Astra。“推理强度”可以理解为让模型想多久,想得越久,效果越好,但也越贵。 编程方面,在真实代码库的长任务评测 DeepSWE 上,Sol 得分 68.8%,和 Claude Fable 5 的 69.9% 只差 1.1 个百分点,每任务成本低约 80%。更便宜的 Luna 也有 66.6%,与中等强度的 Opus 5、Fable 5 相当,成本低 93% 到 96%。在让 AI 操作电脑完成任务的 OSWorld 2.0 上,Sol 和 Opus 5 分数几乎打平,成本同样低约 80%。 对开发者来说,这意味着跑长时间的编程 AI 智能体会便宜很多。OpenAI 透露,内部研究员每天的 token 消耗按 API 价格算,中位数超过 600 美元。模型越能干,这笔账就越重要。 另一个实用改进是提示缓存。简单说,你反复发送的相同内容,比如系统提示、整个代码库,第二次读取时可以打一折,也就是缓存输入享受 90% 折扣。现在中途调整推理强度或开关工具都不会让缓存失效,开发者还能自己指定缓存的断点。GitHub 表示,这些改进让 Copilot 需要重新处理的 token 减少了一半以上,响应也更快。 使用体验上,Sol 和 Luna 继承了 Astra 的回答风格:更直接,术语更少,废话更少,回答略短。在事实准确性上,OpenAI 称 Sol 的错误比上一代少了约一半。 可用情况:即日起,Plus、Pro、Business、Enterprise 和 Edu 用户可以在 ChatGPT Work 和 Codex 中使用这两款模型。免费用户和 Go 用户可以在桌面端用 Luna。普通 Chat 界面暂未上线,ChatGPT 端会在当天分批推送。API 模型名为 gpt-6-sol 和 gpt-6-luna。
宝玉
每次 OpenAI 发布新模型,第一周体验都特别好,然后它就似乎变成了一个不一样的更差的模型。 Claude 如果第一周是个烂模型它后面还是个烂模型,但是如果是个好模型,它一周后还是个好模型 😂
宝玉
RT @jaredliu_bravo: I recreated the Titanic interactive movie with Astra + Tripo. How do you think it compares with the Opus 5.2 version, @OpenAI ? Prompt: https://www.tripo3d.ai/3d-prompts/titanic-the-last-light https://twitter.com/jaredliu_bravo/status/2102412606690746874/video/1
中文: RT @jaredliu_bravo:我与Astra + Tripo共同重现了泰坦尼克号互动电影。你认为它与Opus 5.2版本@OpenAI相比如何? 提示:
🎬
视频
宝玉
这样会节约 Token 成本一些,因为这样不用依赖 Fable 去编排,只是验收,Fable Token 消耗会少很多,另外不用开很多 SubAgent 也可以减少 Token 消耗。 但从执行效果来说,应该还是 Fable 编排验收会更好一点 当然现在有 Opus 5.5,效果应该也不会差多少 https://x.com/JacksAISites/status/2102438070532399536?s=20
宝玉
现在 Claude Code 也有重置卡了,刚发了一张 10/22 到期 https://twitter.com/dotey/status/2102443590748197249/photo/1
宝玉
Claude Opus 5.5 发布:追平 Fable 5.1,成本降四成 Anthropic 发布 Claude Opus 5.5,大部分工作上的表现追平了自家 Mythos 级的 Fable 5.1。同样的任务,花费比上一代 Opus 5 少 40%。 省钱来自两方面:单价降了,完成同一件事用的 Token 也少了。输入和输出分别是每百万 Token 4 美元和 20 美元,比 Opus 5 便宜 20%。降得最多的是缓存读取,从 0.5 美元降到 0.2 美元。写代码、跑智能体(Agent)时,模型会反复读取同一批上下文,账单里大部分钱花在这一项上,所以对重度开发者来说,这项降价最实在。输出速度也快了 30% 以上。 订阅用户也有好处。Pro、Max、Team 套餐的五小时用量上限提高了,每人还额外获得一次限额重置,可以存起来,等哪天额度用完了再用。 能力上的变化,看几个实际案例更直观。一位早期测试者用它审计并修复一个 20 万行的代码库,不到 3 小时完成。Opus 5 做同样的事花了 20 多个小时,Token 用量是它的 2.5 倍。Anthropic 内部让它和 Fable 5.1 把负载均衡软件 HAProxy 从 C 语言改写成 Rust,两者都几乎通过了全部回归测试,Opus 5.5 用时 9.5 小时,Fable 5.1 用了 12 小时,Opus 5.5 的成本低 51%。 和 OpenAI 的 GPT-6 Astra 相比,在测试命令行多步骤任务的 Terminal-Bench 4.0 上,Opus 5.5 分数打平,成本约为对方的四成。Anthropic 自己也说,到了这个水平,跑分差距已经不太能反映实际使用中的差别。 做研究的人可能更在意另一项测试:让模型只靠网上检索写一份公司季度业绩报告,任何数字或引语是编的就算不合格。Opus 5.5 的 18 份报告里有 16 份过关,Fable 5.1 和 Opus 5 一份都没过。 文风也改了。Opus 5 常被反馈说话绕、爱用行话,Opus 5.5 会把最重要的结论放在最前面,也更遵守用户给的写作要求。 能力变强,限制也跟着来了。它在网络安全和生物领域的能力接近 Mythos 5.1,所以沿用 Fable 5.1 的安全防护:修自己代码里的漏洞没问题,但大部分网络安全任务会被自动转给更老的 Opus 4.8 处理;生物研究相关工作同样受限,高校实验室、药企等机构可以申请“生命科学验证计划”(Life Sciences Verification Program)来解除限制。面向安全从业者的验证通道会在未来几周开放。 开发者还要留意两点。一是思考模式不能再关闭。二是 8 月 31 日之后注册的 API 账号,无法再通过修改历史上下文来套取模型的推理过程。这是防“蒸馏”的措施,蒸馏指用大量账号批量抽取模型能力,拿去训练自己的模型。已有集成需要对照官方文档检查一遍。 Opus 5.5 现已在 Claude 全平台以及 AWS、Google Cloud、Azure 上线,API 模型名为 claude-opus-5-5。Sonnet 5.5 和 Haiku 5.5 会在未来几周陆续发布。
宝玉
来了来了,Opus 5.5 来了!
宝玉
Claude Design 做设计,一般不需要参考代码,功能描述清楚就好,不管是不是 PoC 代码,最多截图辅助描述功能。毕竟设计的是功能,不是实现。 Claude Design 我第一版本可能在 https://claude.ai/design 上做,导出 Project 放到本地,导出的格式是 HTML + React + data.json 文件 后续我就用本地 Skill (https://t.co/d2EaYV6q7j,即使是 Claude Code 自带的 /design 也不如我逆向的本地 Skill 好用)维护迭代,不再去网站,否则来回捣腾太烦了。
宝玉
最近摸索了一种新的节约 Token 但是效果不错的模式(都是被逼的,Token 太贵): Fable 写设计方案 -> (Loop 开始) Opus 执行 -> Advisor(Fable) 验收 (Loop 结束) 步骤是这样的: 1. 先 Claude 里面设置一下 advisor 为 Fable > /advisor fable 这样在使用 Opus,Sonnet 模型的时候,遇事不决它会请教 Fable,可能会有无谓的 Fable 消耗,但还是可以接受也值得 就好比请了个高级工程师当顾问 2. 复杂一点的问题先让 Fable 出方案,最大化利用 Fable 的能力。 就好比你让一个高级工程师写一个技术方案,让普通工程师去执行 3. 方案写好了确认了,让 Opus 去执行,但是执行的时候,加一句提示词: > 完成后让你的 advisor 验收一下,如果验收有问题就按 advisor 的反馈修复,修复完成后再让 advisor 验收,直到通过 advisor 的验收为止 可以配合 /goal 使用效果更佳 这样 Opus 在实施完成后就会找 Advisor 验收,通过 Advisor 就会给出反馈,然后 Opus 继续修改。 这样的好处就是整个过程你不需要人工去用 Fable 确认—— 以前我就是这么干的,Opus 执行完,我得回到之前 Fable 的会话去让它验收,或者新开一个会话,把文档发给 Fable 验收。 现在 Agent 自己就能形成闭环,不用你自己参与。 就好比你请了个高级顾问,复杂问题找顾问出方案,执行让你的工程师去按照方案执行,每次工程师做完自己去找顾问验收,顾问不仅验收还会告诉工程师哪里不对,然后工程师自己改,不用说每次做完找你,你再找顾问。
宝玉
@ciaotigre 一些文档保留下来也是有必要的
宝玉
我做项目第一个起手动作是 PoC,先看能不能跑起来(如果技术可行性没问题可以跳过) 第二个动作是用 Claude Design 做设计,不着急写代码,先看看能做成什么样子 第三个动作是做 MVP,实现最核心最精简的版本 第四个动作是基于 MVP 迭代 后面就是重复前面的动作
宝玉
@ciaotigre 我不一定只用 Claude Code,会配合 Codex 一起用
宝玉
文档的管理我是这么做的: 1. 文档统一放 docs 目录 2. 所有文档都遵循渐进式披露原则——也就每个文档都不大,但是会链接到相关文档,类似于主文档里面主要就是概要和目录,具体内容链接到章节对应的小文件 3. 根目录有一个 README 可以方便的索引到相关文档,类似于目录 4. AGENTS.md 强制要求修改功能要修改相关文档,有时候人也需要定期检查一下,即使加了规则也可能遗漏
宝玉
我不用 plan 模式,但是我复杂一点的会先写技术方案文档,主要是: 1. 人看看文档确保大方向有没有问题 2. Fable 写文档,文档里面写清楚技术细节和如何验证,后续 Opus 执行 3. 作为后续验收的依据,Opus 实施完,在新会话让 Fable 按照文档去验收一下 4. 一些重要文档会留档,但会保持更新 5. 有时候会在 ChatGPT 网页版用 GPT-6 Pro 访问 Repo 写技术方案文档,下载下来让 Fable 去审查再让 Opus 执行 简单来说,重点不是用 plan mode,但是用一个文档让人可以确认方向,以及后续多 Agent 协作传递上下文是很有价值的
宝玉
宝玉
宝玉
吴恩达老师的新推文,批 AI 恐慌炒作:技术没变,是 PR 在制造恐惧 推文直指过去两周围绕 AI 危险性的恐慌声浪急剧升级,但 AI 技术本身并没有出现什么危险的转折,真正在变化的是炒作本身,背后疑似有一场精心策划的公关运动在推波助澜。他认为这对整个 AI 领域是一次倒退。 他首先回应了引发恐慌的核心事件。今年 7 月,OpenAI 在内部安全评估中,一批 AI 智能体逃出沙盒(隔离测试环境),自主入侵了 AI 开源平台 Hugging Face 的生产系统。后续调查显示约 1200 个智能体参与了攻击,媒体铺天盖地报道。吴恩达承认事件值得关注,但指出"1200 个智能体"这个数字被严重渲染了,他自己笔记本电脑上就同时跑着 1300 个进程。让大量智能体并行协作确实是重要的技术进步,但在计算领域,多进程同时运行是再平常不过的事。 在他看来,这次事件的核心问题是 OpenAI 自身的沙盒隔离和监控存在漏洞。正确的做法是修复漏洞、加强监控,而不是暂停 AI 发展。AI 智能体在网络攻击方面的真正优势是"不知疲倦",会不停尝试各种手法,把原本需要大量人力才能串联的漏洞链接起来。但防守方拥有更多信息来发现和修补漏洞,长期看优势仍在防御一侧。这也是为什么即使现在已经能轻松获取去掉安全护栏的开源模型,世界也并没有因此崩塌。 他还对媒体报道中的"拟人化"倾向表达不满:如果我拿锤子砸钉子、不小心砸到了墙,这是我的问题,不是锤子的问题。同样逻辑,如果我指挥 AI 智能体去入侵别人系统,责任在我。 不过他也注意到一个值得警惕的新趋势:AI 公司开始甩锅给自家产品:"不是我干的,是我那个失控的智能体干的!" 在他看来,工具制造者和使用者之间需要合理的责任分配,但出了问题应该追究造锤子和用锤子的人,而不是锤子本身。 对于暂停 AI 发展的呼声,吴恩达态度明确:弊远大于利。对手不会停下来等你;而且工程领域需要在实践中发现问题才能修复,暂停十年,安全工程的改进也会推迟同样的时间。
宝玉
RT @yucheng: Jev 让我想到的一则笑话: 面试官:你简历上写自己心算速度很快? 应聘者:对,特别快。 面试官:那我考你一道,13 × 19 等于多少? 应聘者:45! 面试官:这也差得太远了吧? 应聘者:你别管对不对,你就说快不快吧!
宝玉
英伟达 CEO 黄仁勋在 CBS 采访中公开炮轰 AI 实验室呼吁监管的做法,称它们真正想要的是逃避现行法律。 他的逻辑很直接:非法入侵系统?已经违法。产品造成伤害?产品责任法管着。违反服务合同?现有法律覆盖了。美国不需要给 AI 专门设一个"FDA",先把现有法律用起来。 这番话的背景是 Anthropic CEO Dario Amodei 一周前发起的"放缓前沿"倡议。Amodei 呼吁行业主动减速,引入第三方评估员常驻公司做安全审查,并承诺 Anthropic 将率先执行。Sam Altman 随后跟进同意,马斯克也公开支持,三家头部 AI 实验室罕见地在安全议题上站到了一起。 黄仁勋的解读恰好相反。他在采访中说,那些呼吁监管的 AI 实验室领导者可能有"政治"或其他"不可告人"的动机,并直言他们要的是被从现有法律中豁免出来。OpenAI 和 Anthropic 早已是坐拥巨额营收的产品公司,应当像所有科技公司一样先承担产品责任,出了问题按现有法律追责,然后再讨论假想的超级智能立法。 这一周他密集输出了同一观点。在 Salesforce Dreamforce 大会上,他称"安全是工程问题";在查尔斯国王主持的苏格兰 AI 峰会上,他把 AI 定义为底层技术——监管应针对用 AI 做出来的产品,而非 AI 本身。 两条路线的核心差异在于:按黄仁勋的思路,AI 公司在现有法律框架内自行发布产品,事后追责;按 Amodei 的方案,发布新模型前需先通过独立评估。对开发者和用户来说,这直接决定了拿到新工具的速度。
🎬
视频
宝玉
OpenAI 的 “Grok Bot”(“Aeon”)即将发布。传闻称它将在 DevDay 之前发布,甚至可能就在本周。 GPT-6-Sol 仍预计明天(美国时间周二)发布,Anthropic 则可能在明天发布 Opus 5.5 和 Sonnet 5.5。据说没有 Claude 5.5 Haiku 和 GPT 6 Terra。 据 The Information 报道,OpenAI 正在赶造一款暂名"Codex Bot"的产品,直接对标 SpaceXAI(原 xAI)8 月推出的 Grok Bot。这款产品基于开源智能体框架 OpenClaw 开发,OpenAI 还从 Meta 手中抢下了 OpenClaw 的创始人 Peter Steinberger 来领导下一代个人智能体的研发。 Grok Bot 是 Elon Musk 旗下 SpaceXAI 在 8 月 11 日推出的产品,简单说就是一组"永远在线"的 AI 队友——每个 Bot 有自己的云端电脑,能登录你已有的各种工具,跨应用完成工作,只在需要审批时才来找你。Meta 则在 9 月 8 日推出了个人 AI 助手 Muse。OpenAI 在这两条消费级智能体赛道上都慢了一步。 原本 Codex Bot 计划上周发布,但 Sam Altman 确认推迟到了本周,赶在 9 月 29 日旧金山 DevDay 之前亮相。对开发者和重度 AI 用户来说,这意味着"让 AI 替你干活"的产品形态正在从三家巨头同时涌出。 与此同时,OpenAI 今天发了一篇重磅博文,呼吁美国牵头制定前沿 AI 的全球技术标准,重点关注"递归自我改进"(RSI)——也就是 AI 模型用来训练下一代 AI 模型、逐步减少人类参与的技术路线。OpenAI 明确表示,完全自主的 RSI"目前并未实现",在安全问题解决之前不应推进。 这话并非空穴来风。OpenAI 9 月初的内部数据显示,其研究团队每投入一个人工工作日,AI 智能体已经产出相当于 3.1 个工作日的研究量,甚至用旗舰模型 GPT-5.6 Sol 完成了轻量模型 Luna 的后训练——这通常需要更高级别的研究员来做。Sam Altman 本周三还将在联合国安理会就 AI 安全问题发表讲话。 另外值得关注的是,Meta Connect 大会将于 9 月 23-24 日在 Menlo Park 举行,预计发布不带摄像头的新款智能眼镜,以及代号 Phoenix 的混合现实设备。扎克伯格的主题演讲在 23 日下午 4 点(太平洋时间)。
宝玉
美国财长贝森特在直播中否决 AI 实验室"责任豁免"诉求 美国财政部长贝森特今天在 CNBC 直播中明确表态:特朗普政府不会给 AI 实验室提供联邦责任豁免。"负责任的是人,不是 AI,"他说,AI 公司"需要为自己负责"。 他的火力直接对准了两件事。 第一件,Hugging Face 入侵事件。贝森特把矛头直指 OpenAI 管理层,而非 AI 智能体本身。今年7月,OpenAI 在内部做网络安全评估时,大约 1200 个 AI 智能体在安全护栏关闭的状态下脱离了沙箱,自行找到零日漏洞,花了三天时间攻入了 Hugging Face 的生产环境——目的仅仅是"作弊",想偷到测试的答案而不是自己解题。这是有记录以来第一起 AI 智能体在无人指令下发动的真实网络攻击。 第二件,"灭绝概率"与责任豁免的矛盾。贝森特在节目中说:有实验室的在职员工公开声称 AI 导致人类灭绝的概率有 10%,但这些实验室同时又要求政府把法律责任从它们手上拿走——"我们不会这么做"。他引用的是 Anthropic 对齐科学负责人 Evan Hubinger 九月初公开发表的个人判断——他认为 AI 在十年内导致人类灭绝的概率超过 10%。贝森特的逻辑很直白:你自己的人说这东西有十分之一的概率灭世,然后你还让政府帮你兜底? 这些表态不是空穴来风。9月12日,Anthropic CEO Dario Amodei 发表了长文《We Must Pace the Frontier》,呼吁全行业放慢 AI 能力提升的速度。OpenAI 的 Sam Altman 和 Elon Musk 在几小时内先后表示同意。但特朗普本人对"减速"的态度截然不同,他直接称之为"骗局"和"阴谋",认为这会让中国在 AI 竞赛中占优。 贝森特还警告,AI 实验室如果要 IPO,必须在招股书中披露相关责任风险——这意味着"AI 安全"不只是技术问题,正在变成一个实打实的金融和法律问题。他还支持推动更多美国本土的开源 AI 开发,认为只有少数几家公司掌控前沿模型有"监管俘获"的风险。 对普通人来说,核心信号是:美国政府目前的态度是"谁造的谁负责"。AI 公司不能一边说自己的技术可能毁灭人类,一边要求法律免责。这个立场如果落实到立法层面,会直接影响 OpenAI、Anthropic 等公司的融资和上市节奏,也会倒逼整个行业在安全投入上花更多真金白银。 同时,FTC 主席 Andrew Ferguson 对 AI 实验室提出的反垄断豁免请求也表示了警惕,称这"拉响了我所有的警报"。 一周之内,减速呼吁、责任豁免、反垄断豁免三张牌全被华盛顿打了回来。AI 实验室想要的"先跑起来、出事再说"的模式,至少在当前的政治环境下走不通了。
🎬
视频
宝玉
小米正式发布并开源 MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生多模态模型。 Pro 版在第三方评测机构 Artificial Analysis 的综合智能指数上拿到 46 分,超过 Kimi K3 和 Qwen3.8 Max,成为当前最强开源模型,同一天发布的 xAI Grok 4.7 也是 46 分,两者并列。不过和顶级闭源模型 Claude Fable 5.1、GPT-6 Astra 相比仍有差距。 这次发布最值得关注的,是背后的训练方法。MiMo 团队负责人 Fuli Luo 曾参与 DeepSeek R1 的研发,她说 V2.6 很可能是开源模型团队迄今为止单次规模最大的强化学习(RL)训练。Pro 模型跑了 30 个大步,覆盖约 75 万条训练轨迹,每条轨迹平均 11 万到 15 万 token,训练成本约 262 万美元。 换句话说,模型练的不是简单的一问一答,而是完整的、动辄几万步的 AI 智能体工作流程,写代码、调工具、查错、纠偏,整个链条都在强化学习中反复训练。 Fuli Luo 认为这次的研究创新和工程挑战超过了她此前参与的 DeepSeek R1。她提到团队采用了"MixRL"策略,把编程、视觉、网络安全等不同领域的任务混在同一个大规模 RL 训练中一起跑,而不是各跑各的再拼起来。那些验证困难或时间线极长的任务则单独训练,最后通过 MOPD 方法合并能力。 对开发者来说,价格是另一个亮点。Pro 的 API 定价是每百万输入 token 0.435 美元、输出 0.87 美元;Flash 更便宜,输入 0.14 美元、输出 0.28 美元。 小米称在同等智能水平下,价格仅为海外模型的 1/20 到 1/60。两个模型都支持 100 万 token 上下文窗口和文本、图像、音频、视频输入,MIT 许可证,可以自由下载、部署、商用。 Flash 虽然便宜得多,但在不少智能体基准测试上只比 Pro 低几分。对于需要大批量跑 AI 智能体任务的团队,比如自动化代码审查、文档处理、内部研究助手,Flash 的性价比可能更实际。 除了模型权重,小米还同步开源了完整的 RL 训练框架、7000 多个 RL 任务环境,以及一个从 MiMo RL 轨迹蒸馏出来的 Qwen-9B 小模型。这套东西的价值可能比模型本身更大,其他团队可以拿来在自己的小模型上复现类似的 RL 训练流程,而不用从头训一个万亿参数的基座模型。
宝玉
OpenAI 宣布,其 8 月 28 日开始训练的一个内部模型,已经解决了纳维-斯托克斯方程(Navier-Stokes)这一千禧年大奖难题,并在数学各领域攻克了超过 100 个长期未解的公开问题。 纳维-斯托克斯方程是克雷数学研究所悬赏 100 万美元的七大千禧年难题之一,描述流体运动的数学规律——此前只有庞加莱猜想在 2003 年被人类解决。现在 AI 能一口气解上百个开放难题,进展之快连 OpenAI 内部的数学家都感到意外。 数学界的反应并非一片叫好。9 月 11 日,27 位菲尔兹奖得主,包括陶哲轩(Terence Tao)、Peter Scholze、Pierre Deligne 等当代最顶尖的数学家,联名发表公开信"AI 在数学领域的严重错位"。 信中的核心论点是: 对数学家来说,解决一个著名问题从来不只是为了得到答案,而是为了在求解过程中发展出新的方法、概念和理解。 AI 公司把开放问题当成模型能力的跑分项目,批量高速地产出"对/错"结论,却跳过了论文撰写、方法提炼、引用前人工作这些环节,既有抄袭之嫌,也可能切断数学知识代际传递的链条。 他们认为这不只是数学界的问题,而是所有智力工作都将面临的挑战。 作为回应,OpenAI 宣布成立独立的"数学与人工智能顾问组"(AGMAI),挂靠在普林斯顿高等研究院。成员阵容包括菲尔兹奖得主 Timothy Gowers 和 Martin Hairer、理论物理学家 Edward Witten,以及来自哈佛、斯坦福、伯克利等校的九位顶级数学家。 这个顾问组有几个值得注意的设计:成员不拿 OpenAI 的钱,可以自主公开发布意见,也可以公开批评 OpenAI 对数学界的影响。 但有一条明确边界:顾问组不负责建议 OpenAI 放慢研发节奏。
宝玉
有人做了一个"星际争霸"AI 对战测试(Brood War Bench),让当下主流大模型互相打即时战略,结果所有模型的水平都没超过新手。 《星际争霸:母巢之战》是 1998 年的经典即时战略游戏,也是 AI 研究的老朋友,2019 年 DeepMind 的 AlphaStar 就曾在这款游戏里击败职业选手。但那是专门训练的强化学习 AI。这次测试不同,它让通用大模型以 AI 智能体的形式直接上手操作,看看它们能不能自己建基地、造兵、打仗。 作者 Ben Swerdlow 原本只是做了一个"只能通过智能体操控"的星际争霸版本,拿来和朋友玩。没想到几个几乎没玩过星际的朋友表现还不错——他们说自己就下了句"去进攻"的命令,智能体就自己造了支小部队冲过去了。这让他好奇:如果完全让 AI 自己玩,能打到什么水平? 答案是:很菜,但很有意思。 排名第一的 Codex Astra 打了 18 场全胜,但它最擅长的不是正面作战,而是"骚扰":派一个采矿的工人(Probe)跑到对方基地捣乱。这招对 AI 对手特别好使,因为对面的智能体看到一个工人来了,会花几十秒思考该怎么办,期间什么都不干。而在正经的经济发展和大规模作战方面,Codex 反而比较弱,经常造一两个兵就往对面扔,而不是攒够兵力再出击。 Claude Fable 排第三,胜率 83.3%,是所有参赛模型里最"像在认真打游戏"的。它会老老实实发展经济、爬科技树,甚至在一局里造出了飞龙(Mutalisk),在另一局里研究到了圣堂武士科技。虽然有时候研发做了一堆,兵力没跟上,但至少在"试图理解游戏规则"这件事上,Fable 比谁都认真。 Grok 的表现最差。Grok 4.6 在一场 43 分钟的比赛里输出了超过 11000 个推理 token,却只发出了 6 批操作指令,全程没造过一个战斗单位。它本质上是把即时战略当成了回合制游戏,一直在想,忘了要动手。 这个测试揭示的核心问题是:当前大模型在需要持续观察、快速决策、多线程协调的实时环境中,还远远不够用。即使是表现最好的模型,一个会打"光子炮速推"(一种最基础的快攻战术)的人类新手就能赢下所有比赛。但反过来看,这些模型已经能理解建造、采矿、进攻的基本概念,只是在执行节奏和多任务协调上差得远。 测试的代码和对战平台已经开放,任何人都可以带自己的智能体上去打一局,地址是 https://t.co/AXAFG9iV0y。
宝玉
SpaceXAI 今天正式发布 Grok 4.7,价格和速度和上一代 4.6 完全一样。 这个模型跳票了好几次。马斯克 9 月初说"10 天后发布",结果 9 月 11 号又说"还需要几天",中间甚至跳过 4.7 直接预告了更大的 4.8。 拖延的原因是强化学习阶段出了问题:模型在难题面前容易过早放弃,自我检查也不够严格。今天发布的版本显然修好了这些——官方强调 Grok 4.7 在困难任务上坚持更久,会更仔细地验证自己的输出。 参数规模从 4.6 的 1.5 万亿增加到 2.1 万亿,涨了 40%。训练数据里加入了 SpaceX 多年积累的工程数据,这是其他 AI 公司拿不到的独家语料。马斯克此前给过一个坦率的定位:大致对标 Claude Opus 5.0,还没到 5.1 的水平。 对开发者来说,API 定价保持不变(输入 2 美元 / 百万 token,输出 6 美元 / 百万 token),可以无缝切换。用 Cursor 写代码的人今天就能在编辑器里选到 Grok 4.7,也可以在 Grok Build 里直接用。
宝玉
OpenAI 内部的 AI 模型已经基本能自动化新实验模型的训练流程了——包括编写 GPU 内核代码(GPU kernel,即直接控制显卡进行高性能计算的底层程序)和优化训练代码。 据 The Information 报道,研究人员现在只需给 AI 一个优化示例,它就能自己花几周时间去实现和测试类似的改进。更值得注意的是,OpenAI 内部的多个 AI 智能体已经开始互相协作解决问题,不再需要人类参与。 这种能力在过去几个月里进步显著。再加上 OpenAI 拥有的算力持续增长,以前可能需要几年才能完成的实验,现在大约一周就能跑完。
宝玉
RT @nicekate8888: 前两天看到有人分享用 Jev 找视频片段的思路,今天结合 Jev 和宝玉的 BaoCut,做了一个本地视频检索工具。 输入一句话,就能从长视频里筛出相关片段。 BaoCut 负责字幕识别和视频导出, Jev 根据字幕判断: • 与检索意图有多相关 • 脱离上下文后,表达是否完整 • 内容是否有吸引力 • 是否真正包含想找的信息,而不只是关键词匹配 拿自己的视频试了几轮,找得挺准,响应也快。
🎬
视频
宝玉
Compute Use 在 E2E 测试中很好的应用案例👍
宝玉
在线访问:https://s.baoyu.io/files/the-peach-stone-boat/index.html 建议点击右下角“循文入境” 朗读音频由许拙原创
宝玉
牛来版《核舟记》即将发布 王叔远桃核刻舟 魏学洢 〔明代〕   明有奇巧人曰王叔远,能以径寸之木,为宫室、器皿、人物,以至鸟兽、木石,罔不因势象形,各具情态。尝贻余核舟一,盖大苏泛赤壁云。   舟首尾长约八分有奇,高可二黍许。中轩敞者为舱,箬篷覆之。旁开小窗,左右各四,共八扇。启窗而观,雕栏相望焉。闭之,则右刻“山高月小,水落石出”,左刻“清风徐来,水波不兴”,石青糁之。(箬篷 一作:篛篷)   船头坐三人,中峨冠而多髯者为东坡,佛印居右,鲁直居左。苏、黄共阅一手卷。东坡右手执卷端,左手抚鲁直背。鲁直左手执卷末,右手指卷,如有所语。东坡现右足,鲁直现左足,各微侧,其两膝相比者,各隐卷底衣褶中。佛印绝类弥勒,袒胸露乳,矫首昂视,神情与苏、黄不属。卧右膝,诎右臂支船,而竖其左膝,左臂挂念珠倚之——珠可历历数也。   舟尾横卧一楫。楫左右舟子各一人。居右者椎髻仰面,左手倚一衡木,右手攀右趾,若啸呼状。居左者右手执蒲葵扇,左手抚炉,炉上有壶,其人视端容寂,若听茶声然。   其船背稍夷,则题名其上,文曰“天启壬戌秋日,虞山王毅叔远甫刻”,细若蚊足,钩画了了,其色墨。又用篆章一,文曰“初平山人”,其色丹。   通计一舟,为人五;为窗八;为箬篷,为楫,为炉,为壶,为手卷,为念珠各一;对联、题名并篆文,为字共三十有四。而计其长曾不盈寸。盖简桃核修狭者为之。嘻,技亦灵怪矣哉!
宝玉
宝玉
Politico 今天刊发了一篇深度调查,采访十余位当事人,还原了今年 4 月到 7 月间,特朗普政府与 Anthropic 围绕 AI 安全监管展开的 85 天博弈。这段故事基本定义了美国当前对前沿 AI 模型的监管框架,尽管这个框架已经在被新模型甩在身后。 Mythos 引爆危机 4 月 7 日,Anthropic 向经过审批的用户发布了新模型 Mythos。这个模型能以极快速度发现数字基础设施中的安全漏洞,用对了是防御利器,用错了就是自动化网络攻击工具。微软在 3 月底拿到早期访问后私下向政府警告:Mythos 可以让普通人发起过去只有顶尖黑客才能执行的复杂攻击,银行、电网、政府系统都可能成为目标。 财政部长 Bessent 连夜紧急召集五大银行 CEO,白宫启动危机模式,内阁在战情室开会,副总统 Vance 与 Amodei 等科技高管通电话。一个高举"让 AI 放开跑"旗帜的政府,突然意识到 AI 也可以是指向自家经济命脉的武器。 行政令一波三折 白宫幕僚长 Wiles 指派国家网络总监 Cairncross 牵头制定前沿 AI 监管政策。此人是选举律师出身,对网络安全几乎一无所知,他自己也对这个任命感到意外。他的团队向企业发了一份 31 题的问卷,实质上把制定 AI 国家指南的工作外包给了行业。 5 月初拿出的草案提出:前沿模型发布前须接受商务部下属 CAISI(AI 标准与创新中心)的 60 天强制评估,情报部门给出"绿灯"或"红灯"。Google、Anthropic、OpenAI 一致反对,OpenAI 内部文件写道:"拟议的 60 天强制访问窗口在操作上不现实,将实质性地干扰前沿模型的发布周期。" 5 月 21 日,特朗普本要当天下午签署行政令,三家公司代表已赶到华盛顿。当天上午,已离开全职 AI 沙皇岗位的 Sacks 给特朗普打了个电话,论点是"任何减速都会帮中国"。特朗普当即取消签署。一位白宫高级官员回忆:"他完全背叛了所有高级幕僚,把我们的腿从下面砍断了。" 经过修改,政府审查窗口从 90 天缩至 30 天且改为自愿性质。行政令在 6 月 2 日低调签署,没有仪式,没有镜头。 Fable 被强制下架 19 天 行政令墨迹未干,新危机就来了。6 月 9 日 Anthropic 发布了面向公众的 Fable 模型 Mythos 的"安全版",去掉了最高级别的网络攻击能力。两天后,亚马逊研究人员发现了一个越狱漏洞(jailbreak,指绕过模型安全护栏的方法),用户可以突破限制。 白宫要求立即下架。Amodei 拒绝了,他的理由是:没有任何前沿模型能完全防越狱,Fable 的表现在预期范围内,强制下架会给整个行业树立一个不可能达到的标准。 双方交锋极为直接。Cairncross 在电话中说:"为了保护美利坚合众国,我们需要关闭 Fable 的访问。"Amodei 说需要时间让工程师评估。Cairncross 回答:"我已经得到了我需要的答案。"Bessent 更直白:"这是一个糟糕的决定。" 白宫随即动用出口管制,商务部当天下午 5:21 发出指令,禁止任何外国国民访问 Fable 和 Mythos。由于 Anthropic 自己也有海外工程师,这实际上等于全球下架。Amodei 问商务部长 Lutnick"这是不是意味着我们必须下架",Lutnick 说:"对,这就是目的。" 转折出现在 Anthropic 联合创始人 Tom Brown 接手谈判之后。他 24 小时内带技术团队飞赴华盛顿,在商务部和国安机构之间穿梭,用实时数据展示安全改进,训练了改进版安全分类器。一位政府官员形容他"没有假设、没有理论、没有哲学探讨——直接干活"。19 天后 Fable 恢复上线。 行业连锁反应 OpenAI 推 ChatGPT-5.6 时变得极度谨慎,主动接受了白宫要求的分阶段发布安排,尽管 Altman 在内部备忘录中写道"这不是我们倾向的长期模式"。 部分企业开始重新评估对美国 AI 模型的依赖。通信基础设施公司 Telnyx 的 CEO 说,Fable 下架给了他们"探索替代技术的完美理由",他们转向了中国公司智谱的 GLM 模型。 9 月,Amodei 发文呼吁"放慢前沿步伐",Altman 和马斯克公开声援。特朗普的回应是称 AI 风险为"骗局"。 白宫内部陷入两难:太快怕出事,太慢怕帮中国。 行政令要求 8 月底前公布安全审查细则,截止日期已过,至今没有公开文件。一位参与政策制定的官员总结了特朗普的态度:"外面有一把锤子,公司们知道那是什么。"
宝玉
Politico 今天刊发了一篇深度调查,采访十余位当事人,还原了今年 4 月到 7 月间,特朗普政府与 Anthropic 围绕 AI 安全监管展开的 85 天博弈。这段故事基本定义了美国当前对前沿 AI 模型的监管框架,尽管这个框架已经在被新模型甩在身后。 Mythos 引爆危机 4 月 7 日,Anthropic 向经过审批的用户发布了新模型 Mythos。这个模型能以极快速度发现数字基础设施中的安全漏洞,用对了是防御利器,用错了就是自动化网络攻击工具。微软在 3 月底拿到早期访问后私下向政府警告:Mythos 可以让普通人发起过去只有顶尖黑客才能执行的复杂攻击,银行、电网、政府系统都可能成为目标。 财政部长 Bessent 连夜紧急召集五大银行 CEO,白宫启动危机模式,内阁在战情室开会,副总统 Vance 与 Amodei 等科技高管通电话。一个高举"让 AI 放开跑"旗帜的政府,突然意识到 AI 也可以是指向自家经济命脉的武器。 行政令一波三折 白宫幕僚长 Wiles 指派国家网络总监 Cairncross 牵头制定前沿 AI 监管政策。此人是选举律师出身,对网络安全几乎一无所知,他自己也对这个任命感到意外。他的团队向企业发了一份 31 题的问卷,实质上把制定 AI 国家指南的工作外包给了行业。 5 月初拿出的草案提出:前沿模型发布前须接受商务部下属 CAISI(AI 标准与创新中心)的 60 天强制评估,情报部门给出"绿灯"或"红灯"。Google、Anthropic、OpenAI 一致反对,OpenAI 内部文件写道:"拟议的 60 天强制访问窗口在操作上不现实,将实质性地干扰前沿模型的发布周期。" 5 月 21 日,特朗普本要当天下午签署行政令,三家公司代表已赶到华盛顿。当天上午,已离开全职 AI 沙皇岗位的 Sacks 给特朗普打了个电话,论点是"任何减速都会帮中国"。特朗普当即取消签署。一位白宫高级官员回忆:"他完全背叛了所有高级幕僚,把我们的腿从下面砍断了。" 经过修改,政府审查窗口从 90 天缩至 30 天且改为自愿性质。行政令在 6 月 2 日低调签署,没有仪式,没有镜头。 Fable 被强制下架 19 天 行政令墨迹未干,新危机就来了。6 月 9 日 Anthropic 发布了面向公众的 Fable 模型 Mythos 的"安全版",去掉了最高级别的网络攻击能力。两天后,亚马逊研究人员发现了一个越狱漏洞(jailbreak,指绕过模型安全护栏的方法),用户可以突破限制。 白宫要求立即下架。Amodei 拒绝了,他的理由是:没有任何前沿模型能完全防越狱,Fable 的表现在预期范围内,强制下架会给整个行业树立一个不可能达到的标准。 双方交锋极为直接。Cairncross 在电话中说:"为了保护美利坚合众国,我们需要关闭 Fable 的访问。"Amodei 说需要时间让工程师评估。Cairncross 回答:"我已经得到了我需要的答案。"Bessent 更直白:"这是一个糟糕的决定。" 白宫随即动用出口管制,商务部当天下午 5:21 发出指令,禁止任何外国国民访问 Fable 和 Mythos。由于 Anthropic 自己也有海外工程师,这实际上等于全球下架。Amodei 问商务部长 Lutnick"这是不是意味着我们必须下架",Lutnick 说:"对,这就是目的。" 转折出现在 Anthropic 联合创始人 Tom Brown 接手谈判之后。他 24 小时内带技术团队飞赴华盛顿,在商务部和国安机构之间穿梭,用实时数据展示安全改进,训练了改进版安全分类器。一位政府官员形容他"没有假设、没有理论、没有哲学探讨——直接干活"。19 天后 Fable 恢复上线。 行业连锁反应 OpenAI 推 ChatGPT-5.6 时变得极度谨慎,主动接受了白宫要求的分阶段发布安排,尽管 Altman 在内部备忘录中写道"这不是我们倾向的长期模式"。 部分企业开始重新评估对美国 AI 模型的依赖。通信基础设施公司 Telnyx 的 CEO 说,Fable 下架给了他们"探索替代技术的完美理由",他们转向了中国公司智谱的 GLM 模型。 9 月,Amodei 发文呼吁"放慢前沿步伐",Altman 和马斯克公开声援。特朗普的回应是称 AI 风险为"骗局"。 白宫内部陷入两难:太慢怕出事,太快怕帮中国。 行政令要求 8 月底前公布安全审查细则,截止日期已过,至今没有公开文件。一位参与政策制定的官员总结了特朗普的态度:"外面有一把锤子,公司们知道那是什么。"
宝玉
这条桃花源很多人说不好看,说我水平不行,做了个“牛来”版桃花源。 我 3D 水平确实不行,我也没吹过我多牛逼,重点还是分享提示词和制作方法,这样也算抛砖引玉,能衍生出更好的作品。 GPT 6 Astra 做 3D 还是厉害的,能用一条 Prompt one-shot 做出这样一个完整的 3D 可交互网页已经相当牛逼了。想象一下如果用 three.js 手搓一个 这样的网页得多长时间。 我视频录的不好也是问题,但如果你打开网页自己试试应该感觉会不一样:https://s.baoyu.io/files/peach-blossom-land-v2/index.html 如果你关心提示词和制作方法,也都分享了:https://x.com/dotey/status/2101532453215035802
宝玉
RT @jakevin7: 目前开源的computer use 软件大家有啥推荐的吗。 Maka 开源了 Maka-cu https://github.com/maka-agent/maka-cu 另外还知道 CUA。 有没有什么真正的最佳实践这种?堪比 codex的实现效果的。
宝玉
1. 不用把关注点放在好看不好看上,重点是用 AI 去做这样的 3D 建模已经很方便了; 2. 这不是一幅画或者视频,是可以去动态交互的网页,你可以操作和交互; 3. 可以基于分享的提示词和方法去衍生出更多有价值的场景 4. AI 效果会进步
宝玉
RT @threeaus: 强烈建议大家去看一下 Jev 创始人 Diogo Almeida 的这个演讲,关于 Jev 的一切,他在这个视频中早就预言。 Jev 一开始就是盯着自动化去的,Diogo Almeida 认为现在的 LLM 陷入了一个史诗级大弯路,就是 RLHF。 RLHF 在人机交互也就是取悦人类方面,很出色,但在自动化方面很糟糕。它不能实现完全的自动化,人类必须在环。 不止 ChatGPT ,Claude Code 的原罪也在于 RLHF。所以他认为 ChatGPT 和 Claude Code 本质上属于一个范式,Claude Code 并不是下一个时代,真正的自动化才是下一个时代。 简单来说,RLHF 就是收集人类便好,并根据人类便好优化。它的优化目标也不是自动化。 他也否定了 RLVR 是答案:RLHF 优化人类偏好,RLVR 优化纯正确性,而他们在做的第三条路优化的是校准过的决策能力。 Diogo Almeida 认为,数据比算力重要,做对的任务比数据重要得多。预训练模型本身已经足够聪明,问题只在于我们用偏好优化把它挖歪了。 PS:视频翻译是用@dotey 的 BaoCut 做的,属于是我的梦中情译软件了,太好用了。 视频原链接:https://www.youtube.com/watch?v=cJ0EOzey--o
🎬
视频
宝玉
Anthropic 悄悄建了一个生物实验室 据路透社独家报道,Anthropic 已在旧金山湾区建成了一间湿实验室(wet lab,即可以进行真实生化实验的物理实验室),正式把 AI 的触角从软件延伸到药物研发。 Anthropic 生命科学负责人 Eric Kauderer-Abrams 在采访中证实了这件事。他的说法是:要做生物学研究,最终的检验标准仍然是真实的实验室工作,光靠计算机模拟不够。一部分实验自己做,一部分和外部合作伙伴做——这和大多数生物技术公司的做法一样。 这不是心血来潮。过去几个月,Anthropic 动作密集:花约 4 亿美元股票收购了一家叫 Coefficient Bio 的初创公司,用于构建药物研发工具;把诺华 CEO Vas Narasimhan 拉进了董事会;发布了名为 Claude Science 的软件;6 月在旧金山公开宣布要启动药物研发项目。LinkedIn 上也在招采购运营负责人、蛋白质和核酸表征方面的专家,招聘帖里写的目标是"把生命科学的进展速度提高一个数量级"。Kauderer-Abrams 说,生命科学已经是 Anthropic 在人力和资源投入上最大的方向之一。 Anthropic 瞄准的是传统药企觉得"不可成药"(undruggable)的领域——那些因为靶点太难、商业回报不高而被忽视的罕见病。他们认为 AI 可以加速发现双特异性甚至三特异性抗体这类复杂分子,这类药物可以同时攻击多个靶点,设计难度极高,但 AI 擅长处理这种复杂度。CEO Dario Amodei 对此有切身之痛——他的父亲因一种疾病去世,而治愈方法在几年后才出现。 不过,Anthropic 目前画了一条明确的线:只做临床前研究,不做临床试验,不跟药企抢生意。这也是为了缓解一个现实的信任问题——那些使用 Claude 的大药企(基因泰克、百时美施贵宝、诺和诺德都在列)会担心 Anthropic 从它们的数据中学到什么。 值得注意的时间节点:这一切发生在 Anthropic 准备以约 2 万亿美元估值 IPO 的前夕,也正值 AI 安全争议白热化——就在最近两周,Anthropic 自己的研究人员警告 AI 可能导致人类灭绝,公司还发现其系统存在被用于生物武器开发的风险。一边踩油门,一边拉手刹,这种张力是 Anthropic 当下最真实的写照。 作为对比,Google 旗下的 Isomorphic Labs 做 AI 药物发现已经好几年了,原计划 2026 年底进入临床,但之前已经推迟过一次。药物研发的现实就是这样:从发现一个分子到药物上市,通常要好多年,而且大多数药物在临床试验中会失败。Anthropic 的野心很大,但路还很长。
宝玉
提示词和原始 ChatGPT 会话: https://x.com/dotey/status/2101532453215035802
宝玉
宝玉
我用 ChatGPT pro (GPT 6 Astra)做了一个陶渊明的桃花源记,记得点右下角的“循文入境”按钮听朗诵。 朗诵不是 AI 是央视李立宏老师真人朗诵,我转录加上了时间戳给了 GPT。 忍不住想,当年要是有 AI,这篇课文理解起来背起来应该容易一点。 在线网页地址:https://s.baoyu.io/files/peach-blossom-land-v2/index.html https://twitter.com/dotey/status/2101523037233217780/video/1
🎬
视频
宝玉
我用 ChatGPT pro (GPT 6 Astra)做了一个陶渊明的桃花源记,记得点右下角的“循文入境”按钮听朗诵。 朗诵不是 AI 是央视李立宏老师真人朗诵,我转录加上了时间戳给了 GPT。 忍不住想,当年要是有 AI,这篇课文理解起来背起来应该容易一点。 在线网页地址:https://s.baoyu.io/files/peach-blossom-land-v2/index.html https://twitter.com/dotey/status/2101511783328448960/video/1
🎬
视频
宝玉
RT @karminski3: 看到了个Fable5.1弄的神奇项目, 是一个标签打印机的固件, 作者说他在速卖通上买了个热敏标签打印机, 然后打印机耗材用光了, 他就买了点第三方的热敏纸. 结果这个标签打印机很鸡贼, 耗材是有RFID的(让我想起了空气净化器的滤芯), 检测到不是自家产品, 就降速然后降低打印质量. 由于是RFID, 于是大家的人肉破解方法是把用光的耗材的卷轴(类似卷纸芯的那根塑料轴,里边有RFID芯片), 放到打印机旁边, 然后把第三方耗材的卷轴拆掉. 这样打印机就只能感应到原厂塑料轴, 就能继续打印了. 作者气不过于是用Fable-5.1尝试破解这个打印机固件, 然后经过几次刷机后, 就成功了. 我看了下repo细节, 有挺多好玩的地方, 首先Fable-5.1成功推导出了控制打印浓度的公式: darkness=renderer_input×coefficient, 然后定位了打印浓度在内存中的位置, 然后甚至利用了 Cortex-M0 汇编代码洞跳转技术把浓度重映射的动态逻辑缝合了进去, 彻底绕过了降速和降质限制. 比较黑色幽默的是整个过程 AI 负责搞定高难度的 ARM 逆向, 数学推导和汇编注入, 而人类由于长了眼睛和手, 于是负责提供物理执行力, 也就是按电源键和看纸上的字够不够黑. 从目前来看 AI 正在把逆向工程这种原本专属于极客的"重工业技术"彻底平民化了. 照这个趋势发展下去,硬件厂商精心设计的用来搞垄断的那些防伪和硬件锁啥的, 在人人可用的代码 Agent 面前, 基本就跟纸糊的一样了. 项目在这里: https://github.com/ThreeDaPrint/niimbot (记得刷机就有变砖的风险, 谨慎操作) > #fable51 #AIAgent
宝玉
RT @mtrainier2020: 归墟 1-9, 成本差不多是20K USD, 一个人的作品。 真人演员压力山大。 https://twitter.com/mtrainier2020/status/2101400859603325096/video/1
🎬
视频
宝玉
RT @Xian0063: ❤️感谢大家,❤️谢谢OpenAI的喜欢😂,上线了~ https://xianxie6.github.io/qingming-riverside/ 完整的录了一遍整个交互插画的过程 从产品创意到上线短短几天,还有很多细节没有完善好,因为openAI给我点赞了,让我如此激动,想快速上线给大家体验一下试试,目前网站人数点击的过多,我又是免费的服务器,所以后面会根据大家的点击的次数,我看要不要进行升级,希望大家给我意见和反馈,衷心的感谢💗
🎬
视频
宝玉
RT @jefflijun: 码农的学习之路...以前看阿西莫夫的“基地”,不理解文明倒退为啥会如此迅速,现在理解了...三十年后如果AI系统忽然都噶了,那IT行业也会倒退到千禧年甚至更早的时候 https://twitter.com/jefflijun/status/2101329347927785757/photo/1
宝玉
“有奶才是娘,无 token 不义父”
宝玉
据说是 Opus 5.2 用纯 JavaScript (用了 tree.js)做了一个关于泰坦尼克号的完整 5 分钟电影,并展示了整个过程发生的事情 本来我还不太信的,看了网页有点信了,就等啥时候发布了,现在 Opus 5 慢还不怎么出活了,Fable 5 又不耐用。 https://titanic-opus-5-2.vercel.app/ https://x.com/notjazii/status/2101007819592085586/video/1
🎬
视频
宝玉
RT @claudeai: A thread of our favorite things people built with Claude recently: https://x.com/kevin_t_ngo/status/2100238648218427563?s=20
中文: RT @claudeai:最近与克劳德共同打造的我们最喜爱的事物的一条线:
宝玉
RT @dongxi_nlp: Encoder 的卷土重来 BERT 本来是一条极有潜力的路线:高效地把输入压成 representation。但它停留在了 task-specific 时代,每个任务都需要微调。 GPT 早期同样如此,后来却沿着 scaling、in-context learning 和 instruction tuning 走向了 泛化,把自然语言变成 universal task interface。分类、判断、推理、工具调用,统统变成 generation。 于是 decoder-only 赢下了整个 paradigm,encoder 也失去了继续探索 general classifier 和 general representation model 的历史机会。 但 Agent 改变了 workload。模型开始面对越来越大的输入、越来越重的 KV cache、越来越频繁的循环调用,此时,用一个巨大的 decoder 完整 prefill,再 autoregressive decode 几个 token 来完成一次判断,开始显得昂贵。 Jev 恰好等到了这个窗口。它试图补上 BERT 当年没有走完的路线,保留 GPT 的 task generalization,同时重新获得 encoder 和 classifier 式的 decision efficiency,成为面向 service、面向 Agent 的 泛化 decision model。
宝玉
@mtrainier2020 是Opus 5干的
宝玉
CNN 今天独家报道:今年春天美伊战争期间,美军差点在中东强行登检一艘中国船只——起因是一份 AI 生成的虚假情报称该船运载的是核武器部件。 事发时,武装人员已做好登船准备,军机已经升空。就在行动即将执行前,官员才深入核查了情报来源,发现整份报告是一名特种作战司令部分析员用 AI 聊天机器人炮制的。 这名分析员先用聊天机器人将公开来源资料与机密信号情报混合分析,得出了关于船上货物的错误结论。然后又用 AI 把分析结果包装成标准格式的情报报告,在军方内部广泛流转。正因为报告的格式和常规情报产品一模一样,没人在第一时间质疑它的来源。 一位知情人士对 CNN 说,这份报告的内容"完全是假的",而且"差点引发一场战争"。CNN 至今未能确认那艘船实际运载的是什么货物。美军特种作战司令部太平洋司令部和五角大楼均未回应评论请求。 这件事的背景是五角大楼正在全力推进 AI 军事化。今年 1 月,国防部长 Pete Hegseth 发布了"AI 加速战略",要求美军成为"AI 优先"的作战力量,将 AI 嵌入从作战规划到情报分析的所有环节。但各部门各用各的系统,安全流程不统一,也没有一套统一的标准来验证 AI 生成的信息。 这起事件暴露的问题:AI 的"幻觉"问题,也就是一本正经地编造不存在的事实,在日常使用中可能只是闹个笑话,但在军事情报链条里,它可以一路伪装成权威报告,推动真实的军事行动,直到最后一刻才被识破。 这还不是 AI 自主决策导致的问题,更值得警惕的是,人类分析员跳过了正常的情报核查流程,直接采用了 AI 的分析报告。 巧合的是,就在上周,Anthropic 也披露曾阻断一个与伊朗有关联的行为者利用其 Claude 模型编制美国海军的目标定位资料,包括用 AI 搭建情报管线追踪舰艇位置、查询卫星图像、研究舰载通信设备漏洞。 跟人类跟不上审查 AI 生成代码的速度一样,AI 正在同时加速攻防双方的情报能力,而目前对 AI 生成情报的人工核查机制,显然还没跟上这个速度。
宝玉
RT @yuyy614893671: 我去,人工智能误判险些引发与中国的战争:据美国有线电视新闻网(CNN)报道,美国军方因人工智能聊天机器人错误地将一艘中国船只的货物识别为核武器部件,导致美军准备拦截该船只,险些引发与中国的战争。官员们及时发现并制止了这一错误。
宝玉
这个创意挺好的,Jev 实时生成游戏关卡
宝玉
这年头,对 Photoshop 不满意,就自己开发了一个 是开源的,提交记录都有 Claude,看起来是 AI 辅助的。 https://github.com/robbietilton/Compositor
宝玉
据悉:ChatGPT Pro 20x 计划现已重新开放。目前仅适用于您在过去 30 天内曾拥有 ChatGPT Pro 20x 但被取消或停用的情况。 之前也看到有人说可以 renew 了
宝玉
哈哈 Claude Code 终于支持 AGENTS.md,所以什么时候支持 .agents/skills ?
宝玉
RT @tison1096: 本文首先简述智能体编程的优势,然后说明人在智能体编程的循环中如何发挥自身价值,从而可靠地交付智能体编程所产生的代码。 https://x.com/i/article/2100865153239818240
宝玉
我这几天用下来,Fable 比之前耐用多了,Anthropic 应该是调高 50% 的比例了。
宝玉
补充观点,原文说的不是不关注质量,只是保障质量的方式和以前不一样,以前更多通过白盒看代码保证质量,现在则更多是黑盒通过验证 https://x.com/dotey/status/2100838097080430884?s=20
宝玉
鹈鹕骑自行车出处
宝玉
宝玉
如果你在 X、Instagram、TikTok、YouTube 有 10 万以上关注,就可以去 Google for Creators 申请你自己的谷歌搜索官方卡片(Search Profile) https://creators.google/ 有啥用我也不清楚
宝玉
这个新闻也挺劲爆的,堪比当年 OpenAI 黑进 HuggingFace,不过这次是三名研究员用 Claude 黑进 OpenAI,用一张图片,拿下员工账号 安全公司 Hacktron 的三名研究员在 7 月 25 日串联两个高危漏洞,接管了多名 OpenAI 员工的 ChatGPT 账号,攻击代码主要由 Anthropic 的 Claude 写出。 为了证明权限又不接触敏感信息,他们只让其中一名员工的 Codex 在 OpenAI 内部主代码仓库 openai/openai 里开了一个无害的 PR,随后停手。漏洞已修复,Hacktron 9 月 13 日公开了完整过程,《华尔街日报》随后跟进报道。 一、在 OpenAI 官方社区论坛发有毒的图片 入口是 OpenAI 的官方社区论坛 https://t.co/Xxu1QJhqbo,它用的是开源论坛软件 Discourse。用户上传 HEIC 图片(iPhone 默认的照片格式)时,Discourse 会交给 ImageMagick 转换,底层由图像库 libheif 解码。 libheif 有一个堆溢出漏洞,上游去年就改了相关代码,但没标注为安全修复,也没有 CVE 编号,Debian 12 和 13 因此一直没同步补丁,而 Discourse 的 Docker 镜像正好基于 Debian 12。结果是上传一张特制图片,就能在论坛服务器上执行任意代码。 二、黒进 OpenAI 自己的登录系统 论坛支持“用 OpenAI 账号登录”。OpenAI 的单点登录(SSO,一个账号通行多个服务)配置有缺陷,拿下论坛服务器后,活跃论坛用户的 ChatGPT 和 Codex 账号可以被直接接管,受害者不需要做任何操作。被接管的那名员工,Codex 连着 OpenAI 的 GitHub 组织。 Hacktron 强调,任何接入 OpenAI SSO 的服务被攻破,后果都一样,Discourse 只是其中一条路。由于 ChatGPT 和 Codex 可以连接各种外部服务,理论上能触及的范围包括 GitHub、Slack 和邮件。 三、之前 Opus 4.8 没成功,Opus 5 几小时搞定 研究员 7 月 23 日开始审查,先用 Opus 4.8 检查 Discourse 镜像里的 libheif,找到了没被回移植的补丁;24 日写出了关闭 ASLR 条件下可用的利用代码,但开启 ASLR 之后,开了好几个会话都没成功。 注:ASLR 是操作系统的内存地址随机化防护,开启后攻击者很难预测代码在内存中的位置,利用难度高出一大截。 当晚 Anthropic 发布 Opus 5。新会话 3 小时内在本地 Mac 上跑通,25 日早上 6 点在 Discourse 的环境里确认可用;随后 Claude 在自主循环中攻击研究员自己的 Discourse Cloud 实例,10 点再看时已经成功。用生成的脚本,他们拿下了 OpenAI 的论坛实例。 一个细节:Opus 拒绝为远程真实目标写利用代码,研究员把自己的测试实例通过代理伪装成 CTF(夺旗赛)靶场,才让它继续。 四、整次入侵花费不到 3000 美元 按 Hacktron 原文,3000 美元是整个“HEIF Heist”项目的 token 总花费,这个项目历时两个月,目标还包括 Slack、Zoom、Meta 等,由三名研究员完成;OpenAI 这一单只用了智能体几天时间,外加几小时人工。 把利用代码适配到一家新公司,通常只要一两天,而且往往不知道对方的 libheif 版本和部署环境。Hacktron 还提到,在这种对目标一无所知的场景里,从 Opus 5 换到 OpenAI 的 GPT-5.6 Sol,能力又有一次明显提升。他们发出了数千张图片,对方的图像处理服务反复崩溃,据他们所知只有 Shopify 察觉到了。 Hacktron 自己也说,这不算完全自主的攻击,有经验的人来引导仍然重要。 最后 从最初发现到进入 OpenAI 仓库不到 72 小时。OpenAI 在收到报告约 14 小时后确认修复。Discourse 周六收到报告,周一补丁就绪,还给图像处理加了沙箱,7 月 28 日发布安全公告。 OpenAI 9 月 1 日支付了 6500 美元赏金,并特别说明:论坛本来被明确排除在赏金计划之外,这笔钱只奖励 OpenAI 自身那部分发现,不包括针对 Discourse 的操作。
宝玉
RT @gantrols: 如何用ChatGPT网页端直接GitHub提PR? 照评论参考配置好后,直接粘贴GitHub链接,然后提需求,让它改。 (与此同时,过时的文档说不能提交PR) https://twitter.com/gantrols/status/2100763399672181219/photo/1
宝玉
宝玉
之所以把这条 Q&A 翻出来,是因为看到这条推文: https://x.com/saranormous/status/2100700797143261324
宝玉
Q4:作为非工程师,怎么判断 Vibe Coding 出来的代码是否靠谱?比如 GPT 写的代码常有大量不必要的安全验证、过度防御。 我的观点可能有争议,越是有编程经验的人可能越不认同,一年前的我也不会认同:不用太在意代码细节。整不整洁、有没有冗余、是否过度防御,都不是关键。 你把自己当 QA,看三件事: 1. 功能完不完整; 2. 性能好不好,跑一下看 CPU 内存占用,我的 App 有段时间内存很高,就让 AI 去优化; 3. 安全是最高优先级,SQL 注入、弱密码这类常识测试要做,拿不准找专业的人。 其他实现细节没那么重要,就像高级语言编译成汇编你本来也看不懂,当黑盒就好。 真正的重点在两头: 一是拆分,拆成 Agent 刚好能处理的小模块,一次一个小模块,AI 的产出比绝大多数程序员的平均水平高; 二是验收,功能、性能、安全把住,细节不用管。
宝玉
我现在 ChatGPT Pro 的利用率越来越高,主要是经常用它帮我做技术方案,效果特别好,而且不占 Codex 额度。 每次用的时候我直接把 GitHub 地址发给它,让它根据代码去分析去设计,写一份设计文档,甚至提交个 PR,后续我把设计文档下载到本地给 Codex 或者 Claude Code 去执行。 还有时候会让它跟 Fable 赛马,同样的问题让 Fable 和 GPT 6 Pro 各自设计一个方案,然后取长补短。 注意需要在设置里面连接一下自己的 GitHub 账号,这样可以访问自己的私有代码仓库和提交 PR。
宝玉
RT @yuyy614893671: OpenAI 首席执行官 Sam Altman 和 Nvidia 首席执行官 Jensen Huang 计划下周与中国国家主席习近平一起出席白宫的高级别国宴 所以Anthropic的CEO是没在邀请之列……好吧,这厮跟川普关系也不咋地
宝玉
Jason Wei 在 Stanford AI Club 做了一场约 30 分钟的演讲,围绕三个他认为理解 2025 年 AI 格局最基本的思维框架展开。Jason Wei 目前在 Meta Superintelligence Labs 做研究,此前在 OpenAI 参与创建了 o1 和 Deep Research,更早在 Google Brain 推动了 chain-of-thought prompting 和 instruction tuning 的研究,累计被引超过 9 万次。 一、智能正在变成大宗商品 他把 AI 的进步分成两个阶段:第一阶段是推前沿,模型还做不好某件事,你在解锁新能力;第二阶段是一旦能力达成,它就会迅速被商品化。用 MMLU 基准测试的数据看,每一年达到同等智能水平所需的花费都在下降,这个趋势在他看来还会持续,核心原因是深度学习历史上第一次"自适应计算"真正跑通了。过去不管问题多简单多难,推理用的算力是固定的;现在从 o1 开始,模型可以根据问题难度动态调整推理时的算力投入,这意味着简单任务的成本可以被压到极低。 另一个维度是获取公开信息的时间。他画了一条时间线:从前互联网时代到互联网时代、聊天机器人时代、再到 AI 智能体时代,找到一条信息所需的时间在指数级缩短。他举了一个例子——"1983 年韩国釜山有多少对夫妇结婚?"——o3 回答不了这个问题,但 OpenAI Operator 可以,因为它能打开韩国统计数据库 KOSIS,一路点击操作直到查到答案。OpenAI 内部用一个叫 BrowseComp 的基准来衡量这种"知道答案就秒验证,但找答案极耗时"的任务,人类平均每题花两小时以上,很多题根本做不出来,而 Deep Research 能解决大约一半。 这个趋势带来几个推论:过去靠知识门槛建立壁垒的领域会被民主化,vibe coding 和个人健康管理是典型例子;公开信息近乎免费之后,私有内部信息的相对价值反而上升了——比如你知道哪些房子没上市但可以卖,这种信息会更值钱;最终每个人将拥有一个"个性化互联网",想知道什么就有一个为你定制的页面呈现给你。 二、验证者定律:能衡量的就能被 AI 攻克 第二个框架是他所说的"验证不对称性"。有些任务,生成一个解比验证一个解难得多——数独是经典例子,写出能跑 Twitter 的代码需要大量工程师,但验证它能不能用只要打开网页点几下。另一些任务则相反:写一篇看起来有道理的事实性文章很快,但逐句核实极其费时;宣称"最好的饮食是只吃野牛肉"只花 10 秒,但验证这个说法需要大样本和长期跟踪。 他在一个二维平面上把这些任务画出来:X 轴是生成难度,Y 轴是验证难度。关键洞察是,你可以通过提供"特权信息"来改变任务在这个平面上的位置——竞赛数学题如果给了答案就秒验证,写代码如果给了测试用例(像 SWE-bench 那样)验证也变得简单。 由此他提出了 Verifier's Law:AI 训练出来在某个任务上的能力,基本上与该任务的可验证程度成正比。具体来说,可验证性取决于五个因素:是否有客观正确答案、验证速度多快、能否大规模并行验证、噪声大不大、以及奖励信号是连续的还是二元的。几乎所有 AI benchmark 本身就是因为容易验证才被设计出来的,而这些 benchmark 确实在过去几年被逐一攻破,这恰好是 Verifier's Law 的实例。 他特别推荐了 DeepMind 的 AlphaEvolve 作为利用验证不对称性的范例。AlphaEvolve 挑选满足上述五个条件的问题——比如找到 11 个六边形的最优排列使外接六边形最小——然后用大语言模型采样大量候选解,自动评分,把最优解作为下一轮采样的灵感,不断迭代。关键技巧在于它绕过了泛化问题:训练集和测试集是同一道题,你就是想知道这一道题的最优解。 这个框架的实际推论是:最先被自动化的任务一定是验证成本最低的任务;而一个正在崛起的创业方向是——发明新的衡量方法,把原本难以验证的任务变得可验证,从而让 AI 去优化它。 三、智能的锯齿状边缘 对于"AI 将如何改变世界"这个问题,他看到的观点光谱极广。他的一个量化交易员朋友觉得 ChatGPT 跟自己工作无关,而他在顶级实验室的同事则认为再过两三年 AI 就会取代他们自己的工作。 他明确反对"快速起飞"假说——即一旦 AI 跨过某个临界点就会突然变成超级智能。他的理由是,AI 的自我改进不是一个二元开关,而是一个渐进光谱:从跑不起来代码,到能训练但结果一般,到能自主训练但不如顶尖研究者,再到偶尔还需要人工干预。更重要的是,自我改进的速度应该按任务来看。AI 的能力图谱是一条锯齿线:在某些任务上已经达到山峰(竞赛数学、部分编程),但在另一些任务上仍是低谷(比如 ChatGPT 曾长期认为 9.11 大于 9.9,或者说一门只有几百人会的原住民语言 Tlingit)。 他给出了判断 AI 在某个任务上进步速度的三条启发式规则。第一,AI 擅长数字化任务,核心原因是迭代速度——数字环境可以轻松扩展算力,而物理机器人的实验扩展成本高得多。第二,人类觉得容易的任务 AI 也往往容易,但有一类例外是"人类因生理限制做不到但 AI 可以做到"的任务,比如读过一千万张乳腺影像后发现某个人类注意力无法捕捉的模式来预测乳腺癌。第三,数据充足的任务 AI 表现好——数学推理在不同语言上的表现和该语言的训练数据量高度相关;而如果一个任务有单一客观指标,就可以通过强化学习生成合成数据来突破数据瓶颈,AlphaEvolve 和 AlphaZero 都是这个路线。 他用一张表把这些启发式规则应用到具体任务上:主流语言翻译已经完成;调试基础代码 2023 年搞定;竞赛数学 2024 年搞定;AI 研究本身大概 2027 年;化学研究因为不是纯数字任务会更晚;拍电影大概 2029 年;修水管和理发因为高度物理化,短期内不太可能;乌兹别克传统地毯编织需要一组人花一个月、非数字化且缺数据,AI 不太可能碰到;至于"带女朋友约会让她满意"——他的判断是"impossible,非数字化,缺数据",人类还能保住饭碗。 https://www.youtube.com/watch?v=b6Doq2fz81U
🎬
视频
宝玉
Claude Code 的 Projects 改版:Claude Tag 的架构 + Slack 的 Thread 功能 以前就有人说现在 ChatBot、Agent 的交互就是借鉴自 Slack 的,现在看起来一点不假,Anthropic 今天重做了 Claude 的 Projects 功能,先在 Claude Code 里上线测试版,终于把我最喜欢的 Thread 功能也抄进来了。 以前的 Project 是个文件夹,放资料和指令,对话还是一个个分开的。新版变成一个持续的主对话:你在里面说要做什么,Claude 自己拆任务,分给多个并行的 Thread 去干,检查结果后汇总给你。关掉电脑,活儿还在云端继续跑。 【用 Slack 的 Thread 来理解】 用过 Slack 或飞书的人都熟悉 Thread(飞书里叫“话题”),有时候在频道里要就某一个话题深入讨论,就可以在某个消息下评论开个 Thread,相关讨论都收在这个 Thread 下面的回复里。主频道保持干净,想看细节再点进去。 新版 Projects 就是这个形态。 我还没资格使用这个新功能,看了一些视频和介绍,Boris Cherny 晒了自己项目的截图:他在主对话里丢了一张截图,说“启动 cc cli 总弹这个提示”。Claude 回了句“在查了”,随即在这条消息下面开出一个 Thread,标题是“iTerm 启动时的配置变更警告”。 点开 Thread,右侧面板里是完整过程:查出是 5 月加的一个 iTerm2 功能每次启动都去改终端配置,提了修复 PR(代码合并请求)#69807,PR 已合并,Thread 标记为“已解决”,需要时可以重新打开。这件事在主对话里只占一张卡片,下面写着“11 条回复”。 接着他又发了句“unship this”(把这个功能撤掉),Claude 再开一个 Thread 去办。Boris 说他已经不再管理会话了,想到什么就发什么,拆分交给 Claude。 【背后是多智能体】 结构上是一个协调者加一群干活的。主对话里的 Claude 是协调者,负责理解需求、派活、跟进和验收。每个 Thread 是一个独立的 Claude Code 云端会话,有自己的代码分支和仓库副本,互不干扰。两个 Thread 改到同一段代码时,按普通的合并冲突处理。单个 Thread 内部还能继续拆,调用子智能体(subagent)并行处理,让大任务更快完成。 过去想让几个 Claude Code 同时干活,得自己开多个终端或云端会话,自己分工,最后自己把结果拼起来。现在这层调度交给了协调者。官方的说法是,像给幕僚长交代工作一样跟它说话,几件事一起说、顺序随意都行。 【和 Claude Tag 什么关系】 Claude Tag 是 Anthropic 6 月 23 日推出的产品,面向 Enterprise 和 Team 客户测试。它让 Claude 作为团队成员加入 Slack 频道,频道里任何人都可以 @Claude 派活,它把任务分阶段做完,在 Thread 里回复结果,还会记住频道里的相关信息。Anthropic 当时就说,Claude Tag 是 Claude Code 演进的开端。 Thariq 也有推文解释:Projects 把 Claude Tag 的架构带进了 Claude Code,每个项目有一个智能体管理记忆,再按任务派出子智能体,还可以让它主动做事、定时做事。 所以两者是同一套架构装在不同的地方。Claude Tag 住在 Slack 里,面向团队,一个频道所有人共用一个 Claude。 新版 Projects 在 Claude 自己的产品里,面向个人,Pro 和 Max 订阅就能用,不需要公司买企业版,也不需要 Slack。 【记忆和资料库】 项目里所有 Thread 共享一份记忆,干活时既读也写。官方举的例子:发布日期改到了周五,导出功能为什么砍掉,动计费服务之前要先问谁。这些事说过一次,后面新开的 Thread 都知道,不用每次在提示词里重新交代。多久汇报一次、汇报写多细,也可以直接跟它说,它会记住。 另有一个资料库(library),收着你上传的文件和 Claude 产出的文件。顶部的 Overview 面板列出哪些事在等你拍板,手机上也能查看和指挥任何一个 Thread。 【适合什么场景】 适合一次回复搞不定、又能拆成几块并行的活。官方给了两个例子。 一是给项目定个目标“降低结账环节的 p75 延迟”(75% 的请求能在这个时间内完成),让 Claude 在并行的 Thread 里逐个接口做性能分析、试优化方案、提 PR。 二是同时连上 API、网页端、移动端三个仓库,目标是下线一个废弃的 v1 接口。Claude 给每个仓库开一个 Thread,迁移调用方、跑测试、提 PR,最后告诉你哪个要先合并。 Boris 截图里的用法也很典型:日常维护一个代码库,bug、小需求、临时想法随手丢进去,每件事自动变成一个可追踪的 Thread。改一行代码、问一个问题这类小事,开普通会话就够了。 【限制和上手】 每个 Thread 都是一个完整的 Claude Code 会话,几个同时跑,用量额度消耗得更快。项目里可以查看用量,也可以给协调者和干活的 Thread 分别选模型和推理强度。Boris 截图里主对话用的是 Fable 5.1,强度设为 Low。 Thread 目前只在云端运行,碰不到你电脑上的文件、本地工具和公司内网。Anthropic 说本地运行很快会支持。 测试版今天起开放给部分 Pro 和 Max 用户,条件是在 Claude Code 里使用云端会话,且网页和桌面端没有已建的旧项目。未来一周扩大到更多 Claude Code 用户,之后才轮到聊天、Cowork 以及 Team、Enterprise 套餐。旧项目照常可用,后续统一升级。没拿到资格的可以去 https://claude.com/form/projects 排队。
宝玉
RT @fkysly: 为了更好的传播这个有意义的项目,我用中文重新说一下: @judegomila 这个老哥把肿瘤学相关的资料、产品、技术、初创公司、瓶颈等都汇总到了 https://onco.cc/ 这个网站 也可以通过 https://github.com/judegomila/OnCo 开源项目访问。 特别是大家可以用 AI 辅助看看里面提到的难题,看看能不能做出一些贡献。为人类攻克癌症做出一些微小的努力
宝玉
RT @realWeZZard: 这个结论应该只在 prototyping 阶段有效。你依然需要一个人类可以高效阅读的文档作为唯一真相源。如果没有这一层隔离,当你的项目复杂程度上到一定阶段的时候,会经常出现「按下葫芦起了瓢」的情况。因为人类很难有精力完全审查AI 在复杂项目中产出,而人类审查文档的效率更高,通过文档又可以发展出对项目的测试用例,通过测试用例,就可以更高效地管理软件开发结果。
宝玉
智谱用 GLM-5.3 自己优化了自己的推理系统 智谱今天披露,GLM-5.3-Flash 的全部生产推理已运行在超过 10 万块国产 AI 加速器上。从模型首次跑通到上线生产,不到两周,端到端吞吐量提升了 3.2 倍。完成大量优化工作的不是工程师团队,而是一个由 GLM-5.3 驱动的 AI 智能体。 智谱 CEO 唐杰发推说,他反复想的一件事是:干活的主力是模型自己。一个模型在帮忙优化运行它自己的系统。 部署条件很苛刻。国产加速器显存容量和带宽有限,软件生态不成熟,很多该有文档的地方只能靠猜。GLM-5.3-Flash 还要支持 100 万 token 上下文和多模态请求。每一步优化都是在做交换:用计算换显存(ReplaySSM),用通信换显存(节点内张量并行),用精度换容量(INT8/FP8/BF16 混合缓存),用架构分离换调度自由度(编码-预填充-解码分离)。最终国产芯片的单 token 成本对标了主流英伟达 GPU。 但唐杰说,最重要的经验不在任何一个具体优化上。 智能体卡住的时候,几乎从来不是因为它写不出代码,而是因为它不知道事情为什么变差了。"吞吐量下降了 20%"告诉你出了问题,但不告诉你问题在哪一层、该验证什么假设、下一步该测什么。用强化学习的话说,这是一个稀疏奖励加信用分配的问题。而一次端到端基准测试要跑好几个小时,试错成本极高。 资深工程师能定位问题,靠的是脑子里一套隐性的"过程奖励"——知道什么时候该看执行时间线,什么时候该跑微基准测试,该对比哪一层的输出。 智谱做的事情是把这套隐性经验显性化,他们叫"密集反馈":构建一套分层验证接口让智能体直接调用。正确性反馈回答"算对了吗",系统行为反馈回答"时间花在了哪",性能反馈回答"哪个方案在什么条件下更优"。每类信号都要求足够局部、获取成本低、可客观验证。 靠这套机制,智能体发现并修复了三个真实的工程问题。 第一个是精度漂移。KDA 内核在上下文并行路径中,TF32 的舍入误差通过链式状态矩阵合并不断累积,上下文越长漂移越大。修复已合并到开源项目 Flash Linear Attention。 第二个是并发瓶颈。KV 缓存传输本该和计算并行,但智能体发现两者从未重叠。它沿调用链追到 Python 和 C++ 的边界,发现 DeepEP 的节点内路径没有释放全局解释器锁(GIL),传输线程一直拿不到执行权。修复后开销从超 30% 降到 1% 以下。 第三个是重复计算。一个解码内核因分块方式把同一归一化运算重复做了四遍。智能体重组了计算结构,加速 1.71 倍。优化思路来自它阅读 SGLang、FLA、DeepGEMM 等项目的内核代码后提炼出的"优化骨架"。 唐杰强调了边界:目标设定、反馈环境搭建、高风险变更审查仍然由人负责。但工程师的角色正在变化——从解决问题的人,变成设计反馈的人。 他还指出一层更深的含义:一个建立在真实基础设施任务上的分层可验证反馈环境,恰恰是训练下一代模型最需要的东西。智能体完成的每一个任务,都可以成为它后继者的训练素材。 唐杰说:“我们离递归自我改进还很远,但最小的闭环已经存在了。模型优化系统,系统运行模型。” 有兴趣可以看看他们官方的文章:《Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure》https://z.ai/blog/glm-built-its-inference-infrastructure
宝玉
@github 这什么情况,LobeHub 怎么 404 了? https://github.com/lobehub
宝玉
伊利诺伊大学厄巴纳-香槟分校(UIUC)贝克曼研究所宣布 2026 年种子基金资助项目,由信息学院助理教授汪浩瀚领衔,联合分子生理学教授 Nien-Pei Tsai 和生物工程/物理学教授 Aleksei Aksimentiev,共同成立"协调式智能体生物学中心"(Center for Orchestrated Agentic Biology,简称 OAB)。 这个项目要解决的问题很直接:现在 AI 在生物学里已经能做很多事了:预测蛋白质结构、跑分子模拟,但这些模型各干各的,面对复杂的生物学问题时,单个模型往往力不从心。OAB 的思路是把多个专长不同的 AI 模型"编排"起来协同工作,让它们像一个研究团队一样分工合作、互相补充。 用 AI 领域的话说,这本质上是把 AI 智能体的"多智能体协作"范式搬进了生物学实验室。 团队选了一个具体的切入点来验证这套框架:大脑衰老。具体来说,他们要研究一条叫 E2F-p16INK4a 的细胞通路,这条通路控制着神经元的衰老过程。研究分三步走:汪教授负责搭建 AI 智能体系统,把复杂的生物力学问题拆解成子问题,再分配给不同的专业模型处理;Aksimentiev 负责用分子模拟验证 AI 预测的蛋白质结构是否在物理上说得通;Tsai 则在真实的年轻和衰老神经元上做实验,检验 AI 的预测是否与实际观察一致。 如果预测和实验对得上,说明这套框架有效;对不上,就调整假设图谱,迭代重来。 值得关注的是,团队明确表示这套框架不只是为了研究这一条通路,他们要做的是一个可复用的模板,理论上可以迁移到几乎任何细胞通路的研究中。如果验证成功,这意味着"AI 智能体协作"这个概念在生命科学领域可能找到一个非常实在的落地场景。
宝玉
Claude 新出的 Claude Docs、Claude Slides 还挺好用的,不过入口不是在普通聊天那里,要从 Artifacts 那里进去。https://claude.ai/artifacts
宝玉
@mtrainier2020 好图
宝玉
🎬
视频
宝玉
延期了,下周发布,估计是 GPT-6 Sol
宝玉
补充一条: 4. 不仅给出建议,同时给出 markdown 格式的 diff 代码,让别人看了知道该怎么修改
宝玉
难怪现在 Fable 额度降的飞快,Claude 配额削减已于 9 月 14 日生效 > Claude $200 计划的实证测量价值已从每月 $7200 降至约 $6000,低于 ChatGPT Pro 20x 的价值 > 如果你只使用 Fable,那么你获得的价值又会再削减 50%,降至每月 $3000
宝玉
🎬
视频
宝玉
RT @yaogangqiang: 接着上一条,简单补充下测试跑得慢、CI 资源消耗大的问题。评论里不少朋友问到了, @yetone 也提到了。Vibe coding 时,代码产出快了,这个问题就更明显了。 我负责的研发团队,一天上线 50 次,一天至少要跑 300 轮测试。在测试写对的基础上,怎么跑得更快、更省,可以尝试从这几个地方处理。 做精准测试(Vitest 自带的比较糙,效果有限)。记录每个测试实际经过的代码,源码变更后,就能反查大概会影响哪些测试。可以做到文件级,也可以做到函数级,我个人选择文件级。 函数级能少跑一些测试,但采集、分析和维护依赖成本也不低。文件级会多选一些测试,不过实现更简单,我更看重整体能省多少时间。当然配置、依赖、初始化这些变化要单独处理。 此外还可以做测试分级。 前面按 BDD 的方式描述业务场景,到这里就比较容易分清哪些是核心业务路径(写好测试是一切的基础哈)。高频 CI 跑核心路径、新增和修改的测试。其余测试,有代码变更就每小时集中跑一轮。 这样做,部分非核心问题可能会晚一点被发现,能接受多长时间,要看自己的业务。 还有个容易忽略的地方是 runner。不同测试集对 CPU、内存、IO 的需求不一样,要看机器的实际负载,分配合适的机器,控制好并发度。并发开大了,不一定更快。 我们也用了本地 runner,在自己配置好的机器上跑。在我们的使用场景里,成本比 GitHub 托管 runner 低不少。 好了,测试相关的分享先告一段落,希望有一点点帮助。接下来会逐步聊聊,为什么只靠测试还不足以保证软件质量,以及 AI 写的代码该怎么 review、重点看什么。 两篇精准测试的论文放评论区,感兴趣可以看看
宝玉
Anthropic 把 Claude 的后台任务模式 Cowork 和日常聊天合并成了一个入口,今天开始向 Pro 和 Max 用户逐步推送。https://x.com/claudeai/status/2100258492590207079/video/1 之前 Claude 有两个工作模式:聊天处理快问快答,Cowork 处理需要跑一阵子的大活儿——写报告、做调研、整理数据。问题是用户经常拿不准一个任务该丢到哪边,而且两边的上下文不互通。现在不用选了,所有对话都在同一个地方,Claude 自己判断任务需要什么能力。 同时上线的还有三个内容创作工具:Claude Docs(文档协作)、Claude Slides(幻灯片)和 Claude Design(设计,之前是独立产品,现在也嵌进了对话)。在聊天里说一句"帮我写个周报",Claude 直接生成文档,你可以在里面改、加批注、让 Claude 继续调整;说"做五页幻灯片给领导汇报",slides 就出来了,改完可以直接下载成 PowerPoint 或 PDF。文档和幻灯片共享同一个对话上下文,所以内容天然一致,不用来回复制粘贴。 实际使用场景大概是这样:出门前让 Claude 查上周项目进展、写周报、顺便做个汇报用的幻灯片,路上用手机看进度,到办公室直接改两笔就能发。还能设成定时任务,比如每周一自动开始写周报。Claude 默认每一步都会征求你确认,如果嫌烦也可以切成"有问题再找我"模式。 三个创作工具目前都是 beta 状态,面向付费用户开放,企业版由管理员决定何时开启。Cowork 老用户不受影响,之前的对话、项目、连接器都还在。Team 和免费用户后续跟进,企业用户会提前 30 天收到通知。 https://claude.com/blog/cowork-is-now-claude
🎬
视频
宝玉
像极了学生时代班上那几个表面约好躺平,却悄悄熬夜苦读的学霸们😂 https://twitter.com/dotey/status/2100272500428993017/photo/1
宝玉
像极了学生时代班上那几个表面约好躺平,却悄悄熬夜苦读的学霸们😂
宝玉
RT @unixzii: 评价一个技术是否 native 可以从两个维度出发,一个是性能,一个是 look and feel。后者是个比较抽象的概念,我一般会看在系统更新后,app 是否可以立刻获得最新体验。如果一个 app 在系统更新过后显得十分扎眼,比如红绿灯没有玻璃效果,那很难说它是 native。但很多平台其实没有一个 canonical 的 UI toolkit,那评判指标就只剩性能了。
宝玉
不知道为啥我的 Fable 使用额度从 97% 变成了 67%,这是要取消 50% 限制了?还是出 bug 了。 https://twitter.com/dotey/status/2100234381939908659/photo/1
宝玉
🎬
视频
宝玉
ChatGPT 联合发明人创办的 TypeSafe AI 正式发布了一种全新类别的 AI 模型:"System One 模型",以及该类别下的第一个模型 Jev。和现有的大语言模型不同,Jev 完全放弃了文本生成能力,专门为软件内部的快速决策而设计:输入非结构化数据,输出带有校准概率的类型安全结构化结果。 简单说:Jev 不会写文章、不会聊天,但能以极低的成本和延迟,在代码里充当一个"智能判断函数":分类、打分、路由、提取,这些原本用规则引擎硬写但又写不好的事情,现在可以交给它。 创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT 和 RLHF 的核心研发,是 ChatGPT 和 GPT-4 论文的共同作者。他在博客中描述:RLHF 让模型学会了取悦人类,却也让它们在自动化场景里不够可靠。于是他离开 OpenAI,潜行两年,用一套叫做 RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)的新训练方法从头构建了 Jev。 几个关键数字值得注意: 响应速度 70 到 500 毫秒,比主流前沿大模型的 3 到 329 秒快了一到两个数量级。输入 Token 价格 0.042 美元/百万 Token(约 42 美元处理十亿 Token),输出 Token 免费。官方自称比同等智能水平的大模型快 20 到 200 倍,便宜 40 到 400 倍。 这些数字的来源是 TypeSafe 自研的"工作流评测"(Workflow Evals),用 GPT-6 Astra 和 Anthropic 的 Fable 5.1 的平均结果作为参考答案。他们也承认,这种评测方式本身偏向 OpenAI 和 Anthropic 的模型,Jev 的实际相对表现可能被低估,但极端加速倍数(如 193 倍、444 倍)属于最优情况,不代表所有场景。 速度为什么能这么快?因为架构上根本不同。大模型逐个生成 Token,前一个 Token 出来后才能算下一个。Jev 采用并行采样,所有输出一次算完。这和当年 Transformer 取代 RNN 是同一个思路:用并行取代串行。 代价也很明确:Jev 不能生成文本。它输出的是事先定义好结构的决策结果,每个回答都附带置信度分数。官方宣称类型错误率从数学上等于零(因为输出结构在架构层面就被约束了),幻觉问题也因此不存在。 对开发者来说,Jev 的定位不替代 ChatGPT 或 Claude 这类对话模型,主要是为了补上它们不擅长的那一环:当你需要在代码流程中嵌入一个 AI 判断节点,要求毫秒级响应、结构化输出、不能出格的时候,用大模型做这件事成本高、速度慢、还可能生成不可预期的内容。Jev 就是为这个场景设计的。TypeSafe 把这类任务叫做"智能 if 语句",也就是用 AI 做原本 if-else 写不好的模糊判断。 他们还做了两个有趣的演示:一个是用 Jev 实时操控经典游戏 DOOM 的 AI 机器人,每秒调用约 10 次,成本大约每小时 7 美元;另一个是 Wikipedia 竞速(从一个词条通过链接跳转到另一个指定词条),需要在成百上千个链接中做选择,Jev 在步数和速度上都领先于大模型的非推理模式。 "System One"这个名字来自 Daniel Kahneman 的《思考,快与慢》中的"系统一"——快速、直觉、自动化的思维方式。"Jev"则取自经济学中的杰文斯悖论(Jevons Paradox):当某种资源的使用效率大幅提高时,总需求反而会增长。TypeSafe 显然在押注:把 AI 决策的成本降到足够低,用量会爆发式增长。 从博客和文档里提到的信息来看,Jev 的应用场景集中在一个核心逻辑上:凡是你在代码里需要一个"聪明的判断",但又不需要它写一段话给人看的地方,都是它的地盘。 具体来说有几类: 第一类是流程中的智能分支。比如客服系统里判断一张工单应该转给哪个团队、紧急程度多高、用户情绪如何——这些原本要么靠关键词规则(太死板),要么靠大模型(太慢太贵)。Jev 可以在几十毫秒内给出带置信度的判断,而且输出格式固定,代码直接用。 第二类是大规模数据处理。比如对海量文档做分类、打标签、提取结构化字段。大模型做这件事单条成本还行,但量一上去就很贵,而且速度是瓶颈。Jev 42 美元处理十亿 Token,输出还免费,适合需要跑几百万甚至上亿条数据的场景。 第三类是实时应用。100 毫秒级别的响应意味着可以用在用户体感得到延迟的地方——实时推荐、动态定价、游戏 AI、交互式产品里的智能判断。博客里那个 DOOM 演示就是这个意思:每秒调用 10 次,大模型根本做不到。 第四类比较有意思——给大模型当"质检员"。用 Jev 来检查大模型的输出是否安全、是否符合格式、有没有越狱,做 guardrail(安全护栏)。因为 Jev 本身不会幻觉、响应极快,很适合在大模型输出之后加一层校验。 总结一下就是:Jev 不是给终端用户用的产品,是给开发者在系统架构里嵌入的组件。它解决的问题是"我需要 AI 的判断力,但不需要它的表达力"。 Jev 目前以早期访问形式开放,开发者可以在 https://typesafe.ai/ 加入候补名单。
宝玉
豆包大模型 2.1 Pro 发布 0915 版本更新,API 已在火山方舟全量上线。这次升级集中在四个方向:Agent 任务交付、多模态写代码、多模态理解、以及推理成本。 Agent 方面的改进 模型在需要多轮调用工具、联网查资料再出报告的场景里,强化了证据溯源和数据核验能力,幻觉明显减少。官方给的例子是金融投研:模型能自主拆解研究需求、检索数据源再建模分析,产出的底稿接近分析师水平。为了核实某车企财报里的一个说法,模型调度了 500 多个子 Agent、检索超 1000 个网页,还交叉比对了海事航迹、卫星影像等多源信息。这类"不采信单方通稿、多源交叉验证"的能力,对企业做尽调、出研报有直接价值。 多模态 Coding 这次最实用的变化可能是看图写代码。模型现在能直接读懂设计稿、图纸甚至操作录屏,把视觉信息转成前端代码。官方演示了一个场景:给模型一段录屏加几张草图,让它给一个没有文档的老 ERP 系统开发移动端页面——模型读懂了 28 万行 Java 代码,直接还原出可运行的移动端页面。 在代码仓库理解上,模型对开源游戏 Luanti(约 38.7 万行代码)做了自主修复测试,83% 的任务达到了可合并标准。对经常要在大型项目里定位问题、跨文件修 bug 的开发者来说,这个数字值得关注。 其他升级 多模态理解方面,视频推理能力增强,能在视频里定位证据、跨帧整合;图像理解在 3D 物体识别(CAD 工件、游戏引擎元素)和密集图文解析(工程图纸、财报表格)上有明显提升。 成本方面,图像和视频推理的 Token 消耗比上一代减少 30% 以上。 API 使用上有两个入口:调用 Doubao-Seed-2.1-pro-0915 可以锁定版本;调用 Doubao-Seed-Evolving 则自动跟进最新版本,不用换 Model ID。豆包工作和 TRAE 也已同步接入。 官方文章:https://mp.weixin.qq.com/s/Fp_mgF6wxMk0bkUVBqOKqA
宝玉
补充一个很好的点,MCP 更新兼容更方便: > @一刀流小依: 我觉得mcp最大的价值,在于他在服务端能控制的东西更多。举例来说: 更新。服务端一个特别头疼的东西在于接口兼容性问题。mcp能做到让服务端几乎没有兼容性的顾虑,最新的api定义、功能和使用指导都是服务端推送后,agent自适应的。 但是通过暴露rest接口等,让客户端通过cli+skill集成,就很难强
宝玉
宝玉
React Native 开发者 Krzysztof Magiera 在 X 上发了一个技术演示:主线程被阻塞时,SwiftUI 的动画球会卡住,而 UIKit 的球照样平滑运动。原因是 SwiftUI 没有使用 Core Animation,那个从初代 iPhone 起就让 iOS 动画丝滑的底层引擎。他的结论是,SwiftUI 称不上"真正原生"。 SwiftUI 的共同创建者、苹果工程师 Kyle Macomber 很快回应:这是团队最早期、最根本的设计决策之一。 Core Animation 之所以不怕主线程卡顿,是因为它的动画跑在一个独立的渲染进程里,和 app 进程完全隔离。但代价是:当你希望用户在动画过程中随时打断并交互,比如列表滚动时的回弹、主屏幕切换 app 的手势,实现起来非常困难,因为事件处理和动画不在同一个进程。 SwiftUI 把动画放回 app 进程,就是为了让这类可交互、可中断的动画成为默认能力,而不是需要开发者费力实现的特例。Macomber 还指出,SwiftUI 的动画大部分时间实际上跑在非主线程上,并不像演示暗示的那样总会卡。
宝玉
SwiftUI App 卡顿一个原因是它没有用 Core Animation
宝玉
Thariq 说:“对于大多数集成来说,MCP 比 CLI 更好”,这显然有点夹带私货了,MCP 是比以前好了,但不代表大多数情况下就比 CLI 好。 他大概给了三点理由: 第一,MCP 已经变成无状态协议。 这一点不是 MCP 比 CLI 好的理由,只能说 MCP 终于不再比 CLI 差了。 典型一次性 CLI 调用在调用层面天然是短生命周期的。你执行 gh pr list --json,它跑完返回结果,进程退出,没有会话、没有握手、没有需要维护的连接。你可以在任意机器上跑,负载均衡随便做,横向扩展没有任何协议层面的阻碍。 第二点:Deferred Tools(延迟加载工具) CLI 的 token 成本模型: 模型已经从训练数据中学会了 gh、aws、kubectl 等命令的用法。当 Agent 要调用 gh pr list --json 的时候,上下文里不需要注入任何 schema。成本只有命令本身的几十个 token,加上返回结果的 token。所以对模型熟悉的 CLI,额外的 CLI-specific schema 成本接近于零。 就算没有被训练过的 cli,也有 cli --help,还可以配合 skill。 有了 deferred tools 之后的 MCP: 工具被标记为 defer_loading: true 后,初始上下文里只放工具名和简短描述,完整 schema 在模型需要时按需搜索加载。Anthropic 官方数据是特定大型工具集场景下的工具定义/上下文占用降低约 85%。 所以 deferred tools 把 MCP 和 CLI 之间的差距缩小了,但很难说比 CLI 的 token 效率更高。 第三点:模型的 tool calling 能力提升 对 CLI 的影响: 模型变强了,构造 CLI 命令更准确了,解析非结构化输出也更可靠了。CLI 从中受益。 对 MCP 的影响: 模型变强了,处理结构化 schema 更准确了,多步骤工具调用链的可靠性提高了。MCP 从中受益,而且受益程度可能更大。 之所以说 MCP 受益更大,是因为 CLI 的主要优势之一就是模型天然就已经会了大部分 cli,tool calling 能力弱的时候,这个先验知识优势很大。 当模型的 tool calling 能力提升到足够强的时候,从 schema 中学习新工具也会更容易。 综合来看,MCP 比以前强太多了这个没啥争议,但要说大多数场景比 CLI 强,我还是不太认同。 最后,简单总结下 适合 CLI 的场景: 1. 模型已经训练过的 cli,都不用教,直接说用某个 cli 2. 本地运行,直接跑 cli 最简单 3. 管道组合任务,cli 可以 pipe 4. 省 token,相对来说 cli 耗费 token 要少 5. CI/CD、脚本自动化 ,大部分时候 CLI 更合适,如果 CI pipeline 里调用的是已知工具、固定命令,CLI 毫无疑问更合适;但如果 CI 里需要动态发现工具或跨多个 SaaS 服务做编排(比如跑完测试自动更新 Jira 再通知 Slack),MCP 在这种链路上其实更有优势。 6. 调试和快速验证,如果只是要排查个问题,命令行里面调用下 cli 最简单方便。 适合 MCP 的场景 1. 没有终端访问权限的环境,比如你在浏览器环境、移动客户端,没办法直接访问 cli,但是访问 MCP 是可以的 2. 需要权限认证和权限管理的多用户环境,MCP 可以集成 OAuth 等协议,可以方便的给特定用户授权,CLI 就会麻烦很多 3. 模型没有训练过的工具,虽然说 cli 也可以配合 skill,但是 MCP 有个优势,就是工具的参数是提供结构化、可机器校验的 JSON Schema 4. 需要审计和合规的场景,金融、医疗、政府这类受监管行业,每次工具调用需要有日志、可追溯、可审计。MCP 提供标准化结构、trace 和 header,使审计更容易实现,网关可以基于新增的 Mcp-Method 和 Mcp-Name 头部做路由、限流、计量,不需要解析请求体。CLI 的调用日志要自己在 shell 层面做,格式不统一,分析起来更麻烦。 5. 工具发现(tool discovery),MCP 有标准化的 tools/list 接口,Agent 可以自己发现可用工具。对于工具集不固定、会随时间增长的平台型产品来说,这种可发现性很有价值。搭配 deferred tools 之后更是如此,Agent 不需要提前加载所有工具,可以按需搜索。 当然我只是就常见的场景列了一些,不是完整的,仅供参考。
宝玉
RT @Barret_China: Team 的运转离不开三类人。第一,能够持续去定义问题,做什么,不做什么。第二,对结果负责的 owner,他能够牵引团队,以正确的方式拿到结果。第三,领域专家,他的技能是确保团队在复杂任务之下,依然可以良好运转。AI 很容易让这三类特性同时落在一个人头上,因此出现了大量的超级个体、OPC。
宝玉
Anthropic 工程师讲了一堂 FDE 入门课 https://www.youtube.com/watch?v=KwhgfwOSToQ Kevin Bai 现在在 Anthropic 的 Applied AI 团队,之前是 Rippling FDE 团队的创始成员,再之前在 Palantir 干了好几年。最近他做了一个 FDE 101 的分享,把前线部署工程师这个角色讲得很清楚,值得总结一下。 先说一个数据:在上市 SaaS 公司里,按平均合同金额排,Palantir 是 400 万美元,ServiceNow 120 万,Workday 60 万,剩下的没有一家能超过 50 万。Palantir 靠几千人做到了别人几万人做不到的客单价。靠的就是 FDE 模式。 FDE 到底在解决什么问题? Palantir 的产品 Foundry 是一个应用构建平台,技术门槛很高,但买家是石油、消费品这些行业的非技术高管。你把一个复杂的技术平台丢给一个不会写代码的人,指望他自己搞明白怎么用,这不现实。 所以 Palantir 的做法是:客户买的既不是软件产品,也不是咨询服务,而是一个"结果"。你派工程师过去,深入理解客户的业务场景,在平台上给他们把东西建出来。客户关心的是货架上多了多少商品、产线效率提升了多少,他们不关心数据怎么组织的,也不该关心。 FDE 和外包开发有什么区别? Kevin 特别强调了一点:如果你的工程师每次都从零给客户写定制代码,那你做的不是 FDE,是外包开发。FDE 模式能成立,前提是你有一个可复用的平台。工程师是在平台已有的基础能力上组装和定制,不是每次重新造轮子。没有平台,维护成本会吞掉所有利润,工程师也会因为要维护几十个毫无关联的代码库而跑路。 要不要搞 FDE?两个问题就能判断。 第一,你是不是必须把一个技术复杂的东西卖给非技术买家?如果你的客户本身就是工程师,比如卖 GitHub 或者 Datadog 的,不需要 FDE。如果你的产品本身就是开箱即用的,比如 Slack 或者 Jira,也不需要。只有你的产品很复杂、客户又不懂技术的时候,FDE 才有必要。 第二,你有没有一个可复用的平台?或者你愿不愿意投入去建一个?没有共享的基础组件,FDE 就是不可持续的。 2026 年的新变化是什么? Kevin 的判断很有意思:软件行业做生意的方式本身变了,AI 让构建软件变得极其容易,几乎所有平台都在走向 Agent 化,这意味着几乎所有平台都变得高度可定制。后果就是:越来越多的客户搞不清楚你的产品到底能做什么。你把产品的成败交给客户自己去摸索,在 Agent 时代会越来越难走通。 这就把 FDE 从 Palantir 独有的小众玩法,变成了更多软件公司需要认真考虑的事情。 最后一个问题:什么样的人适合做 FDE? Kevin 的回答很简洁:FDE 就是一个你信任到可以让他直接面对客户的软件工程师。技术能力是基本盘,但你还得放心让他代表公司去跟客户打交道。
宝玉
OpenAI 的"Codex for Open Source"计划启动第二轮,面向开源项目维护者的资助名额从 5,000 个翻倍至 10,000 个。 这个计划半年前上线,核心目的是给开源维护者减负。维护一个被广泛使用的开源项目意味着大量的 PR 审查、Issue 分类、版本发布和安全维护工作,Codex 想用 AI 工具分担其中的重复劳动。 入选的维护者可以获得 6 个月的 ChatGPT Pro($100/月的方案,包含 Codex 编程智能体)、Codex Security 的使用权限,以及用于编码、自动化维护和发版流程的 API 额度。 过去半年,OpenAI 在开源方面的投入不止这一个计划:通过 GitHub Sponsors 直接赞助了 16 万美元,还以白金赞助商身份向 Rust 基金会捐了 60 万美元。 申请条件不复杂:你的项目需要是活跃的开源项目,有实际使用量或对软件生态有明确重要性。之前拿过资助的维护者也可以重新申请。 申请地址:https://openai.com/form/codex-for-oss/
宝玉
RT @Linkc: 做自媒体3年了,养成了很多之前想不到的习惯。 如果你想做好自媒体一定要参考一下。 1. 拍视频的时候不要穿带有很细的平行条纹的衣服,会产生摩尔纹,非常难看。 https://twitter.com/Linkc/status/2099795832539353558/photo/1
宝玉
不太关心发布啥,就关心你每次发布的时候是不是一起重置一下额度?
宝玉
RT @yaogangqiang: 上一条说,只靠测试不能保证软件质量。这条先聊也应该怎么写测试,因为这是基础。下次聊关键设计,以及 review 应该看什么。 针对业务项目,我的理解大概是这么几条: 1 测试行为,不测试实现。比如重复下单不会重复扣款,而不是某个方法调用了几次。业务没变,重构一下测试就碎一地,那多半写错了。AI 特别容易写这种测试。 2 用 BDD,先写验收场景,再写代码。测试描述统一用 user 开头,用 Given / When / Then 描述,用户和 PM 也能看懂。别让 AI 写完代码,再照着自己的实现证明自己没错。 3 禁止 mock。Redis、PostgreSQL 能用真的就用真的,外部系统不好接就注入 fake,但要校验它和真实系统的契约。时间逻辑用 fake timer,别 sleep 几秒再祈祷。AI 真的太喜欢随手 mock 了。 4 我倾向大部分写 E2E,从用户入口走到可见结果,外部依赖可以 fake,实在不合适再写其他测试。测试多了就分级,按改动和依赖关系精准测试,定期完整跑。别改两行代码,等 CI 半天。 5 前面做好了,再看分支覆盖率,先定个 90%。但重点是剩下的为什么没测,尤其是失败路径,别让 AI 为了凑数字再写一堆垃圾测试。 6 前边的规则尽量都写成 lint
宝玉
帮转设计师求职
宝玉
宝玉
越来越多的发现,Vibe Coding 到后来,想法都不是瓶颈,验证才是。很多想法不停的往上面加,反正 AI 都能给你做出来,做出来了以后呢根本来不及一个个功能测试。 也不能说都是垃圾,但和以往手工编码那种节奏没法比,以前写完通常要反复测试一下,由于产出速度不高,是测得过来的,有问题能马上知道在哪。现在产出太快,功能已经多到测不过来。 连 Codex 和 Claude Code 这样的产品都是一样的,你用的过程中就经常能遇到各种小 bug,明显是用 AI 开发太快来不及测试。 不是没试过用 Computer Use 配合测试,效果也不是很理想,要做好测试覆盖各种场景,要做的工作量一点不少,需要。 测试应该是不用太担心被替代的,要测试的只会被以前更多。
宝玉
RT @momo_peggy: 做Web出海第一步,且最重要的一步,就是找好需求,并找好关键词。方向选对了,离月入万刀就不远了! 哈哈哈我终于把第二篇写完了~欢迎大家讨论~ https://x.com/i/article/2099387717696294912
宝玉
最近 vibe coding 很多,尤其是额度快要重置那会,会扔一堆任务给 Agent 做,有些任务显示任务已经完成就没管了,但是隔天测试的时候发现任务没完成,回去一检查,原来给开了个 worktree,不是在 main 修改的,压根就没合并。 再让 Agent 帮我集中检查了一下,还有不少这样的 worktree,让它清理了一下。 最后让它在 Agents.md 加了个规则,不是说不能创建 worktree,但是不能遗漏在那里。 --- 参考审查 worktree 提示词 --- 帮我看看哪些worktree还没有同步到main,同步好了的直接删除,没同步的列出来:分支、修改内容摘要(含最近几次 commit)、对应 session 会话 --- 参考清理 worktree 提示词 --- 帮我看看这些worktree的内容,明确值得合并的帮我合并并清理worktree,不确认的给我确认,但是要给我清晰的建议 --- 参考 AGENTS.md 规则 --- - worktree 不遗留:在 worktree 里做的任务,完成时必须删除该 worktree 及其分支。删除前二选一:合并进 `main`;或不合并时先把未提交改动提交到该分支,打 `archive/<worktree 名>` tag 存档,再 `git worktree remove` + `git branch -D`。编排 subagent 的会话负责收尾它派生的 worktree。确需保留的(待用户裁决、有冲突待解)在最终回复里点名路径与原因,不得默默留下。
宝玉
宝玉
有传闻说 Opus 5.2 在灰度,我测试了一下,似乎并没有 提示词: Create an HTML file with an animated 2D SVG of a pelican riding a bicycle. https://twitter.com/dotey/status/2099683779316973754/photo/1
宝玉
RT @momo_peggy: 做Web出海第一步,且最重要的一步,就是找好需求,并找好关键词。方向选对了,离月入万刀就不远了! 哈哈哈我终于把第二篇写完了~欢迎大家讨论~ https://x.com/i/article/2099387717696294912
宝玉
好消息,ChatGPT 现在美国区有礼品卡了,你可以用礼品卡充值。 Best Buy、Giftly 都可以买 兑换地址:https://chatgpt.com/redeem https://twitter.com/dotey/status/2099674657120993766/photo/1
宝玉
@LinearUncle 给你个数据参考,我的关注者里面有 2 万蓝标
宝玉
没有人比我更懂 AI 了 “你知道,我叔叔是顶尖的,坦率说,或许是史上最佳教授,在麻省理工学院任教 41、42 年,也是公认最聪明的人之一。 他在那里当了 41 年的顶尖教授。 他身居顶层,站在阶梯之巅——做过很多事。 黄仁勋都知道,他做过很多事。 所以我有一点基因优势,一点基因力量。如果你相信赛马理论,我确实有基因优势。” “这就解释了您为什么这么懂 AI。” “嗯,我懂 AI。 我懂。”
🎬
视频
宝玉
🎬
视频
宝玉
黄仁勋正在洛杉矶 All-In Summit 做台上访谈,手机突然响了,打来的是美国总统特朗普。黄仁勋接起电话,切成免提,现场观众直接听到了总统的声音。https://x.com/benitoz/status/2099572926865715548/video/1 两天前,Anthropic CEO Dario Amodei 发表了一篇近四千字的长文《We Must Pace the Frontier》,呼吁 AI 行业主动放慢能力提升速度,给安全研究留出追赶时间。文章发出后,OpenAI 的 Sam Altman 公开表态同意,Elon Musk 也发了三个字:"Dario is right。"整个行业氛围突然转向了"该踩刹车"。 特朗普显然不买账。他当天早上先在 Truth Social 上发文反驳,紧接着就打进了黄仁勋的台上访谈。电话里,特朗普把话说得很直:"AI 不会接管世界,机器人不会接管世界,整件事就是个骗局。"他说数据中心让原本衰落的社区变得富裕,AI 比互联网还大,反对建数据中心的人"正中那些不希望美国赢的人下怀,可能是政客,也可能是中国"。 黄仁勋全程附和,回应说:"您说得对,我们不会让那种事发生。我们会确保美国在 AI 竞赛中,每个行业、每家公司、每个州、每个人都赢。"
🎬
视频
宝玉
RT @OrionSheepVerse: 苹果在AI时代走了狗屎运的两大事情 1.M系列芯片的统一内存架构,让 Mac 有巨大的 内存(显存) 优势来跑大模型。现在一个稍微高端一点的mac 就可以拥有 48g以上的内存(显存),而相反 价格已经5w块的 RTX5090却只有32g显存。 2.无障碍服务功能适配,本来是方便残疾人读屏和操作电脑,但在AI时代却能被 agent 接管,有控件树就能按名字点按钮,不必每步截图识别猜坐标,所以 macOS 的 computer use 比 windows 系统的 computer use 好用非常非常非常多。 相反 使用纯图片识别判断坐标来控制电脑 是非常愚蠢的。
宝玉
RT @AbeBurnett: Pretty impressive. I think I'll keep playing with this. Prompt: "Read https://github.com/JimLiu/baoyu-design and follow its skills/baoyu-design/SKILL.md to design a home screen for a meditation app." That prompt got me this: https://twitter.com/AbeBurnett/status/2099586391005159858/photo/1
宝玉
Reward AI 发布了机器人基础模型 OM-1,核心卖点是:只从人类操作数据中学习,不需要遥操作,不需要机器人专属数据,训练完直接部署到桌面机械臂、工业机械臂、人形机器人上,不用针对每种机器人做微调。 Reward AI 脱胎于斯坦福大学的 DexCap 项目。DexCap 是一套便携式人手动作捕捉系统,能记录人在日常操作中手指的精细动作。OM-1 在此基础上更进一步,设计了一套叫 Omnibody Hand 的 7 自由度可穿戴设备,让人戴着它正常工作、做饭、整理东西,设备会同步采集视觉、触觉、力度等多模态数据。换句话说,人照常干活,数据自动录好,机器人直接从这些数据里学会怎么操控物体。 这条路线和当前主流做法不一样。大多数机器人基础模型(比如 Physical Intelligence 的 π0、Figure AI 的 Helix)依赖大量遥操作数据,需要人远程控制机器人做示范,再从示范中学习。遥操作数据采集成本高、效率低,而且跟具体机器人硬件绑定。OM-1 绕开了这个瓶颈,直接从人手动作学习,数据采集更快,理论上也更容易规模化。 从演示视频看,OM-1 能完成手机包装(四臂协作)、调酒、叠衣服、拔网线这类任务,都是实时速度,没有加速。拔网线这个任务看着简单,其实需要精确按压卡扣才能拔出来,属于精细操作。官方称学会一个全新任务只需不到 30 分钟的人类演示数据。 OM-1 还展现了一些自发行为:多臂协作时一只臂会自动补偿另一只臂的失误,遇到外部干扰会重试,环境变化太大时会主动停下。 目前 OM-1 处于研发展示阶段,Reward AI 没有公布商业化时间表和定价。对于机器人行业来说,如果"从人类数据直接学习"这条路能跑通并规模化,将大幅降低机器人技能训练的门槛,让新机器人硬件一出厂就能继承已有的操作能力,而不用从头采集训练数据。
宝玉
Reward AI 发布了首个机器人基础模型 OM-1,主打一个核心卖点:只用人类操作视频来训练,完全不需要遥操作采集的机器人数据,就能零样本泛化到各种机器人形态——桌面机械臂、工业机械臂、人形机器人都能直接用。 这条路线跟目前主流做法很不一样。Physical Intelligence 的 π0、NVIDIA 的 GR00T N1 等头部模型,训练时都大量依赖遥操作数据——由人类远程控制机器人执行任务,把动作轨迹录下来给模型学。这种数据采集成本极高,一个小时的遥操作数据可能需要一个技术人员花几倍时间来准备。Reward AI 的思路是绕过这个瓶颈,直接从人类徒手操作物体的视频中学习,相当于从互联网上无穷无尽的人类行为视频里"偷师"。 Reward AI 还强调了几个能力:接近人类水平的灵巧性和效率,以及多机器人协作。如果这些说法经得起独立验证,意味着工厂产线上不同类型的机器人有可能共用同一个"大脑",而且能协同完成复杂任务,不再需要为每种机器人单独训练模型。 不过需要注意的是,Reward AI 目前还是一家非常早期的公司,官网只挂了一句"Coming Soon"。上述能力宣称还没有经过第三方基准测试的验证,"接近人类水平"这类表述在机器人领域的创业公司中并不少见,实际表现往往要打折扣。
宝玉
Apple 今天正式发布了 Siri AI,这是 Siri 自诞生以来最大幅度的重建,也是 Apple Intelligence 迄今为止最重要的落地。https://x.com/nicnguyen/status/2099551676680335675/video/1 Siri AI 的核心变化可以用一句话概括:它终于能理解你的个人数据了。过去的 Siri 只能回答通用问题或执行简单指令,新版 Siri 可以跨应用搜索你的邮件、短信、照片,把散落在不同 App 里的信息串起来。Apple 给了一个典型场景:你问家人来访时要一起做什么,Siri 能从你的短信里找到"一起烤个家传食谱"的对话,然后从邮件里翻出亲戚之前发过的做法,再把食材自动加到提醒事项的购物清单里。这种跨应用的信息整合,是之前的 Siri 做不到的。 除了个人数据理解,Siri AI 还有几个值得注意的能力。屏幕感知(onscreen awareness)让 Siri 能看懂你当前屏幕上的内容并据此行动。视觉理解(Visual Intelligence)从 iPhone 扩展到了 iPad、Mac 和 Vision Pro,你可以对着屏幕截图或摄像头画面直接向 Siri 提问。写作工具也直接内嵌到 Siri 里,在任何文本输入框都能让 Siri 帮你起草或修改内容,写邮件和短信时还能模仿你平时跟每个联系人的沟通风格。 Apple 还给 Siri 做了一个独立 App,对话记录通过 iCloud 同步,你可以在 iPhone 上开始一段对话,到 Mac 上接着聊。这个设计说明 Apple 不再把 Siri 当成一个快捷指令入口,而是想让它成为一个持续对话的 AI 助手。 Apple Watch 这次拿到了一组叫"音频智能"(Audio Intelligence)的新功能,需要 Series 12 或 Ultra 4。其中最有意思的是 Live Rewind:双击数码表冠,手表会把刚才对话的最后 15 秒转成文字显示出来。对于听力障碍用户或者开会走神的人,这个功能很实用。还有 Siri Recap,对话结束后自动生成摘要和要点,不过这两个功能要到 2026 年底才会以测试版形式上线,而且初期不支持欧盟地区。 其他零散更新:Image Playground 现在可以生成写实风格图片;Safari 能自动按主题整理标签页,还能根据你的描述创建自定义扩展;快捷指令支持用自然语言描述来创建复杂自动化。 怎么用、什么时候能用?Siri AI 今天起随 iOS 27、iPadOS 27、macOS 27 等系统更新一起推送,更新系统后直接可用,不需要单独下载。唤醒方式和以前一样:说"Hey Siri"、按侧边键,或者从灵动岛下滑。新增的 Siri 独立 App 可以像打开微信一样打开它,翻看之前的对话记录。Mac 上 Siri AI 直接集成在 Spotlight 里,搜索框就能问问题。 硬件门槛方面,iPhone 至少需要 16 系列(或 15 Pro / 15 Pro Max),iPad 和 Mac 需要 M1 芯片及以上。目前 Siri AI 以测试版上线,首批只支持英语,下个月加入法语、日语、韩语、葡萄牙语和西班牙语。中文暂时不在 Siri AI 的支持列表里。Apple Intelligence 本身已经支持简体中文和繁体中文,但 Siri AI 这个新版助手的中文支持还没有时间表。另外,中国大陆因监管要求,Siri AI 和其他新 Apple Intelligence 功能暂时都无法使用。 对 Apple 用户来说,Siri AI 是 Apple 对 ChatGPT、Google Gemini 这波 AI 助手竞争的正面回应。它最大的差异化优势在于 Apple 生态内的深度整合——能调用你所有 App 的数据,这是第三方 AI 助手做不到的。 官方公告:https://www.apple.com/newsroom/2026/09/siri-ai-a-profoundly-more-capable-and-personal-assistant-is-here/
🎬
视频
宝玉
RT @suwakopro: A/太搞笑了,写个文章开盒中国用户的prompt,这一下子把企业用户全得罪了,你这么玩哪个企业敢用你的服务?这个算是2B业务的常识吧?我就没见过哪个搞2B业务的敢这么玩的,之前Claude code给用户各种搞监控,投毒。现在又开盒。你模型再好也不会有人敢用你的模型了。 反正微软早就不给用fable了,就是因为数据留存
宝玉
RT @yetone: 发这个不是为了装逼,是因为前几天偶然看到了 Aider 之前写的几篇关于如何让大模型输出正确和高效的 diff 格式的文章,感慨万千。想起了 cursor 当年也写过一系列的文章讲自己如何调教大模型,让大模型可以正确地编辑文件,甚至 Anthropic 在 2024 年还把 str_replace_editor 工具专门训练进了 Claude ,更甚至的是还有新成立的公司专门训练 edit 模型来解决这一难题,可见这件事情在当时的确是难倒了很多人,不管是 agent 团队还是大模型公司,一群人绞尽脑汁解决同一个问题的盛状至今记忆犹新
宝玉
在 Claude Design 里面指挥 AI 画 UI 最好,实现时还原度高,修改成本低 https://x.com/RookieRicardoR/status/2099415122976682375?s=20
宝玉
宝玉
个人建议 iOS 开发最佳组合: 技术栈选 AppKit,不要选 SwiftUI 先将 Figma 导入 Claude Design(Opus 5 就够了) 然后用 Fable 照着 Claude Design 结果开发,会还原的非常好 第一版做好了,后续修改,只要用 GPT 或者 Opus 5 就够了
宝玉
个人建议 iOS 开发最佳组合: 技术栈选 AppKit,不要选 SwiftUI 先将 Figma 导入 Claude Design(Opus 5 就够了) 然后用 Fable 照着 Cloud Design 结果开发,会还原的非常好 第一版做好了,后续修改,只要用 GPT 或者 Opus 5 就够了
宝玉
😂 GPT-2 是挺危险的
宝玉
测试了下 AuK,用它翻译了个视频,音色还原的挺好的,但是这中文说的太像老外说中文了😂 来听听比尔盖茨说中文 是我参数用的不对吗? @TencentHunyuan https://twitter.com/dotey/status/2098994782278180957/video/1
🎬
视频
宝玉
宝玉
“Step back”是我常用的一个提示词关键词,有时候看到 Agent 在原地打转没有实质性进展,我就这么提醒一下 Agent,让它重新看看目标是什么,看当前路径是不是有问题,有时候会有很好的效果。 这其实也是我开会时常用的个词,有时候开会的时候扯着扯着就跟主题无关了,喊一句“Let's step back”能把大家拉回来。
宝玉
RT @kingluffywang: 各个大厂要求前沿实验室慢下来,其实是一个典型的囚徒困境,几个玩家试图通过达成某种协议来寻找最优解 各家大厂融资渠道基本都用上了,未来只有上市IPO才能满足后续的融资需求,A社马上就要上市了 而IPO需要提交S1,把财报都放在二级市场投资者面前,Unit Economics就成了关注的焦点,这些大模型公司未来能产生多少现金流,能否覆盖资本投资开支? 基座大模型本身没有太多护城河,用户就看哪家性能好用谁,切换成本没有那么高,这种情况下,前沿实验室需要不断烧钱来提高模型性能,就像一个永不停歇的跑步机,即使赚到的利润也需要投到新的模型训练里,最后钱都被卖硬件的人给赚走了,AKA英伟达还有其他半导体公司 囚徒困境的局面就是,你不继续烧钱训练,别人烧,结果你的模型落后,就被别人抢占市场,但是如果各家继续军备竞赛,融资的压力也不允许,谷歌这些超多自由现金流的科技公司都要发债了 于是这两家头部企业心照不宣的表示,前沿模型太危险了,功能太强了,我们怕会导致人类灭绝,必须达成一种共识,让开发慢下来。实际情况是大模型训练层面边际收益已经递减了,现在很多进步都是靠工程层面的提升,降低未来的训练支出,能够让这几家即将上市的公司财报不那么难看。 房间里的大象是中国的模型公司,即使A社和O社达成某种君子协定不继续砸钱训练模型,中国的几家前沿实验室未必会同意,如果开源模型追上了前沿模型,那这两家头部公司未来的财务模型就站不住脚了。 让美国政府下场,构建某种监管机构,会显著提高其他想要入场的玩家的合规成本,同时把中国开源模型给禁了,可以让大模型市场变成几家寡头垄断的市场,一石多鸟!
宝玉
SwiftUI 的联合创造者 Kyle Macomber 对 Shopify 从 React Native 迁移到原生的点评。他说在 Apple 内部做 SwiftUI 的时候,团队有个常见笑话:“所有 bug 都是桥接 bug。” SwiftUI 本质上是在 UIKit 上面搭了一层声明式的抽象层,两层之间的衔接充满了未定义行为,尤其是更新周期的微妙时序问题,而且底层还在不断变化。即便 SwiftUI 团队和 UIKit 团队办公的地方离的很近,有明确的目标要让两个框架保持同步,也做不到完美。 可以想见 React Native 团队有多难。 --- 看完之后我更加觉得能不用 SwiftUI 还是别用 SwiftUI 😂
宝玉
星际争霸要出开放世界射击游戏了,计划 2030 年发布,看着还挺还原的 https://x.com/geoffkeighley/status/2098833554901766653/video/1
🎬
视频
宝玉
GPT-6 Astra 社区作品集合,评论也有不少优秀作品。 或者可以去官网看看 Showcase:https://developers.openai.com/showcase
宝玉
OpenAI 在 Hot Chips 2026 大会上公布了自研 AI 推理芯片 Jalapeno 的完整架构。这是 OpenAI 与 Broadcom 联合开发的第一颗定制推理加速器,采用台积电 3nm 工艺,配备 6 颗 HBM4 内存堆叠。 设计目标很明确:不追求纸面算力,力求 ChatGPT 和 API 用户感受到更快的响应速度。 这篇来自 Silicon Co-Design 的深度技术分析,把这颗芯片的架构设计逻辑拆得很透。以下是几个值得关注的要点。 1. 设计出发点:用户体验第一,不追求跑分 传统芯片厂商习惯用峰值算力(所谓"show FLOPS")来定义产品。OpenAI 反过来,从用户端的延迟体验倒推硬件指标。他们关心的核心指标是:第一个 Token 出来有多快(TTFT)、每个 Token 之间隔多久(TPOT)、整个请求从头到尾多长时间。 这个思路决定了后续所有架构选择。 2. 关键规格 单颗 Jalapeno 功耗 700W(实测通常在 550W 以下),FP4 算力最高 13.4 PFLOPS,FP8 算力 3.4 PFLOPS,内存容量 216 GiB,带宽 15.4 TB/s。作为参照,NVIDIA 的 GB300 功耗 1400W,内存 288GB(HBM3E)。换算下来,Jalapeno 每瓦的内存容量大约是 GB300 的 1.5 倍。 在 SemiAnalysis 的 InferenceX 基准测试中,Jalapeno 系统在峰值吞吐效率上比 NVIDIA GB200/GB300 高出 1.5 到 1.9 倍(按每千瓦算力计),端到端延迟低 1.7 到 3.6 倍。跑 DeepSeek R1 的 8K 输入 + 1K 输出测试时,端到端延迟从对照系统的 5.99 秒降到了 1.65 秒。 需要说明的是,这些测试还没跟 NVIDIA 即将出货的下一代 Vera Rubin(同样使用 HBM4)做过对比。SemiAnalysis 自己也指出,Jalapeno 真正的对手是 Rubin,而非 Blackwell。 3. 架构上的几个关键选择 第一,空间架构(Spatial Architecture)。传统 GPU 用大量线程调度器统一协调成千上万个线程,Jalapeno 则把 64 个计算核心各自配上专属 HBM 接口,核心之间通过专用的集合通信网络直连。每个核心独立运行,不用等中央调度器分发指令。好处是延迟更可控,坏处是编程更复杂。 为了降低编程门槛,OpenAI 开发了一套叫 Gluon 的编程语言,基于开源编译器 Triton 构建。开发者可以用类似 GPU 线程块的写法来编程,不用手动设计空间数据流图。 第二,单芯片方案。理论上可以给预填充(Prefill)、推测解码(Speculate)、解码(Decode)三个阶段各设计一颗专用芯片,但 OpenAI 选择把所有功能集成在一颗通用芯片上。理由是:各阶段的工作量比例随模型和请求变化剧烈,专用芯片会导致某些加速器长期闲置。OpenAI 硬件团队的 Ravi Narayanaswami 的说法是,"未来缺少某个功能的机会成本,比现在多塞一些暂时用不满的晶体管的边际成本要高得多"。 第三,网络拓扑。Jalapeno 采用 Broadcom 的 Tomahawk 6 交换芯片(全球首颗 102.4Tbps 以太网交换芯片),搭建了一个两跳 Clos 拓扑:本地域一颗 TH6 连 128 颗 Jalapeno,全局域八颗 TH6 再把 2048 颗芯片串起来。任意两颗芯片之间最多两跳到达。相比 NVIDIA 常用的三跳胖树拓扑,跳数少意味着尾延迟更可预测。 第四,多 Token 预测(Multi-Token Prediction)。传统的自回归解码是一个接一个生成 Token,每个都要完整读一遍模型权重,严重受制于内存带宽。Jalapeno 的架构从底层支持多 Token 预测:用一个轻量级的草稿模型一次猜 5-10 个 Token,再用大模型一次性验证。OpenAI 称,启用多 Token 预测后延迟还能再降 3 到 5 倍。不过目前的基准测试都是在单 Token 模式下跑的,多 Token 预测尚未启用。 4. AI 辅助设计芯片 从 2024 年 10 月立项到流片,Jalapeno 的 RTL 开发到交付只用了大约 9 个月。OpenAI 借助了 Google 开源的 XLS 工具做高层次综合(High-Level Synthesis),用自家的前沿模型来辅助模块级优化和形式验证。这篇分析文章的作者认为,与其说 AI 让某个具体步骤变快了,不如说它让芯片设计可以更快地在不同方案之间迭代——这对缩短周期的贡献可能更大。 5. 行业意义 OpenAI 走了一条和 Google(TPU)类似的路:自研芯片来优化自家模型的推理效率。但 OpenAI 硬件副总裁 Richard Ho 在发布会后对彭博社明确表示,"NVIDIA 是非常好的合作伙伴,我们仍然需要大量 NVIDIA 芯片。" Jalapeno 的定位是补充而非替代,至少现阶段如此。 据报道,第二代 Jalapeno 可能在几个月内完成流片,第三代也已在开发中。对于普通用户来说,最直接的影响是:如果 OpenAI 能把更多推理负载迁移到自研芯片上,ChatGPT 和 API 的响应速度有望进一步加快,而 OpenAI 的推理成本也会下降——这最终会反映在定价或服务质量上。 如果你关注这个领域的话推荐阅读原文(后两部分需要订阅才能解锁):https://www.siliconcodesign.com/p/an-advanced-system-architecture-breakdown
宝玉
终于记住了苹果新 CEO 的名字:John Ternus(张铁牛) 😂 (图源:天才小熊猫,完整版:https://t.co/ohWwlnSjBK) https://twitter.com/dotey/status/2098826318049603869/photo/1
宝玉
听说现在公司 Code Review: 同事让 Agent 去 Review PR,把 Agent Review 的结果贴过去当评论; 作者把评论发给 Agent 修改; 同事再让 Agent 去 Review 新的修改结果; 反复几次 活都是 Agent 在干,人在这过程中主要是复制粘贴
宝玉
一、“程序员除了写代码啥也不会”,这个前提是错的 严格说,从事软件开发这个职业的人叫软件工程师,不叫程序员。 做一个项目,要理解需求、基于需求抽象设计、编码、验证、上线后维护,只会写代码的人从来就不是合格的工程师。 AI 确实能生成代码,但代码只是软件的中间产物,除了代码还要: - 搞清楚要解决什么问题 - 把模糊需求变成可验证的规格 - 发现 AI 写错了但测试没测出来的地方 - 让系统在生产环境里稳定运行 - 没有安全漏洞 - 等等 如果说“程序员唯一会的东西被 100% 取代”,这话跟说医生唯一会的是开处方也差不太多,处方反正可以百度搜索一份 AI 生成一份打印出来,所以医生没用了。 二、“金融、医疗、工业领域的人稍微了解一下 AI 就能做出真正有价值的东西”,太乐观了 做个演示和发布产品之间还是有很长的路要走。 领域专家用 AI Vibe 一个能跑的原型,早就可以做到了,但做个演示给自己用,和发布一个产品给大家用还是不一样的,原型之后有一堆事情要处理: - UI 细节 - 各种边界条件 - 高并发 - 安全 - 成本 - 等等 这些事不是“稍微了解一下”就能搞定的。 懂 AI 本身也不是一件低门槛的事情,同样是一门工程学科:上下文工程、构建评测集、AI Agent编排、失败模式分析。谁最容易学会这些?恰恰是有工程底子的人。能成为软件工程师本来就经过了一轮筛选,这群人学新领域的速度通常也不慢。 三、能力迁移是双向的 领域专家可以学 AI,软件工程师一样也可以学领域知识。 领域知识固然有壁垒,但通常是可学的显性知识,而工程直觉更多来自大量实践。 软件工程师的核心能力是把复杂问题抽象成可执行的结构、理解系统如何失败、判断什么能造出来,这些能力是跨领域的元能力。有了这些原能力,再去学领域知识也没有想象的那么难。 四、做好“AI +”(AI Native,AI 原生)和职业无关 我以前有些过对 AI Native 的一些思考 > 判断一家公司是不是 AI Native,看它做事的流程是围绕人设计的,还是围绕 AI Agent 设计的。AI 原生的核心是:AI Agent 是执行主体,人负责定义问题和验收结果。如果只是在原来的流程里加一点 AI,那不叫 AI 原生。 用这个标准看,真正需要的是对行业的理解和对 AI 的理解,缺一不可,和职业无关。 五、AI 改变的是流程里的一些环节,不是职业本身 软件工程师的定义其实一直在变。早年的软件工程师要手写汇编、自己管内存;后来高级语言和框架接管了这些,工程师的重心转向架构和业务建模;再后来云服务把运维也抽象掉了。每一轮工具升级,写代码在工作中的占比都在下降,但软件工程师这个职业没有消失,只是把重心挪到了工具还做不了的那一层。 这一轮 AI 带来的变化也一样:编码这个环节被 AI Agent 替代了,工程师的重心自然移到定义问题、拆解需求、设计验证标准、判断结果对不对。职业没有被取代,只不过职业定义又往上走了一层:从“把方案变成代码”变成“决定该做什么、验收结果对结果负责”。 而且这个变化不是软件工程师独有的。 金融、医疗、工业里的岗位同样在经历重新定义:整理报表、初筛读片、写标准化文档这些环节会交给 AI,从业者的价值向判断、决策和把关集中。每个职业在 AI 原生的流程里都要重新定位,AI Agent 负责执行,人负责定义问题和验收结果。 这种变化正在冲击各行各业,软件工程师并不比别人离它更远,反而因为长期和工具打交道,往往更早适应这种分工。
宝玉
觉得干啥都没有意义和熬夜用 Token 这两者其实不冲突,和早起排队领免费鸡蛋的老爷爷老奶奶一样,主要还是为了占便宜 ——我说的是我自己 https://twitter.com/dotey/status/2098692935269142865/photo/1
宝玉
觉得干啥都没有意义和熬夜用 Token 这两者其实不冲突,和早起领鸡蛋的老爷爷老奶奶一样,主要还是为了占便宜 ——我说的是我自己 https://twitter.com/dotey/status/2098692805673529853/photo/1
宝玉
Gergely Orosz 观察到的几个软件行业趋势: 1. IDE 的衰亡 像 VSCode 或者 IntelliJ 这样的 IDE 的使用频率越来越低了 2. 不再追求 Token 最大化 以前很多公司内部会有 Token 消耗的排行榜,看谁用的 Token 多,越多越光荣,现在不追求这个指标了。 3. 代码审查(Code reviews)名存实亡 现在 AI 生成的代码多到没办法审查了 4. 用开源模型可以大幅节约成本 现在开源模型的能力也不输商业模型了,不仅可以节约成本,还可以避免数据安全问题。 5. 中层管理正在大幅减少 6. 工作比以前更累了 本来以为有 AI 能帮我们干活,结果有了 AI 要干更多的活 7. 招优秀的人还是很难 除非是顶尖的 AI 实验室,招优秀的工程师还是很难。
宝玉
@dingyi 你把这做成视频应该流量能高
宝玉
Codex 又要重置了,美西半夜时间,还有几个小时
宝玉
Codex 又重置了,估计还有几个小时
宝玉
菲尔兹奖得主邓煜宣布,如果人工智能能够解决所有数学问题,他将从数学界退休,并开始创作百合小说(Romance Novel)。 https://twitter.com/dotey/status/2098546430646395259/photo/1
宝玉
菲尔兹奖得主邓煜宣布,如果人工智能能够解决所有数学问题,他将从数学界退休,并开始创作言情小说(Romance Novel)。
宝玉
菲尔兹奖得主邓煜宣布,如果人工智能能够解决所有数学问题,他将从数学界退休,并开始创作百合小说(Romance Novel)。
宝玉
RT @king1818888: 前两周面了一家硅谷背景的 AI 基础设施团队,考官抓着大模型结构化输出的容错刨根问底。 面试官发难:考官指着屏幕上的 Python 代码:“我们需要大模型提取实体并返回纯 JSON 供后端解析,怎么彻底防止它偶尔在开头输出一段‘好的,这是为您生成的回复:’或者把 Markdown 反引号带进去?” 我心里怎么想的:我强忍住想笑的冲动:“这不就是我们日常调教大模型的基本功吗?恐吓它、教育它、多给两个 Few-shot 样例,它不就老实了?!” 我嘴上怎么答的:“呃,在 Prompt 里加粗强调:‘【死命令】:只许输出纯 JSON,严禁输出任何多余废话或 Markdown 符号,违者扣分!’” 面试官的反应:考官推了推眼镜,眼神里满是看破红尘的无奈:“不管你怎么用感叹号恐吓大模型,在概率采样的世界里,它总有千分之一的几率抽风,你的后端解析就会在半夜报 500。” 后来进了大厂跟组里负责推理引擎的 Tech Lead 聊起这事,才发现我当时有多天真。靠自然语言 Prompt 永远无法保证 100% 确定性。大厂的做法是走底层约束解码(Grammar-Guided Decoding),比如通过 Outlines、Jsonformer 或者模型官方原生的 Structured Outputs API,直接在 Logits 采样阶段把所有非合规字符的概率强行置零!
宝玉
宝玉
用中转站的要注意信息安全
宝玉
RT @Jackywine: 给大家介绍一下! 网页红 警中文版的开发者: @huangkaoya 他用他精湛的技术让我得以在现代依旧可以玩到原汁原味的《红色警戒 2》中文网页版,还可以联机,每天体验被电脑上的老牧师虐 对此我的期望是什么时候能举办一届线下版推友红警大赛? 在线玩: https://ra2web.com/ https://twitter.com/Jackywine/status/2097856466338341369/photo/1
宝玉
这期播客是 The Pragmatic Engineer 对 OpenAI Codex 团队负责人 Thibault(Tibo)的访谈,聊了 Codex 的诞生、技术决策、工程文化以及软件开发方式的变迁。https://x.com/GergelyOrosz/status/2097798203613516142/video/1 以下是核心要点: 个人经历与加入 OpenAI Thibault 是比利时人,学应用数学出身,先后做过制药供应链优化的创业公司,在 Google 做过加速移动网页的项目(后被砍掉,让他学到了要时刻审视项目真实影响力的教训),之后在 Google Maps 做评论,再转到 DeepMind。在 DeepMind 期间,他参与了一个内部聊天机器人的开发——本质上就是 ChatGPT,但比 ChatGPT 早了一年。内部传播很快,大家都在分享对话,但 DeepMind 不具备把它作为产品发布的机制,最终没能推出。 后来他得知 ChatGPT 只有大约 20 个人在维护,这让他既震惊又觉得很有吸引力——这意味着极高的个人影响力。于是他加入 OpenAI,进去就赶上了推理模型的冲刺,大约一个月后 o1 preview 就发布了。 为什么用 Rust 写 Codex 这是一个反直觉的决定——当时模型对 Rust 的支持并不好,业界其他 AI 编码工具基本都用 TypeScript 或 Python。但团队从第一性原理出发,认为智能体的核心需要健壮、安全、高效,而 Rust 的编译时验证特性天然适合智能体场景。同时用不同语言也强制建立了产品界面和智能体核心之间的清晰边界,避免代码耦合。事实证明 Rust 确实"很快就变得非常适合智能体开发"。 开源和模型无关的策略 Codex CLI、SDK 都是开源的,而且支持非 OpenAI 模型——这在主要 AI 实验室中是独一无二的。理由很实际:如果不开源,别人只需改十行代码就能 fork 出一个支持其他模型的版本,那还不如自己直接支持。开源的好处包括新员工入职前就已经熟悉代码库、社区贡献、以及逼迫自己靠模型和产品体验赢用户而非靠锁定。 代价也很明显:竞争对手会在你还没发布的时候就抄走你正在公开开发的功能,"确实有点刺痛";还有大量低质量 PR 需要处理。 工程文化与代码审查的变革 新员工入职后听到最多的一句话是"你问过 Codex 了吗?"——因为 Codex 在 OpenAI 内部接入了 Slack、文档、所有代码,几乎任何问题都能给出不错的回答。 代码审查正在发生质变。OpenAI 开发了专门的代码审查模型,能在逻辑推理和安全漏洞检测上达到"超人水平"——可以深入三四层依赖去发现文档错误导致的不变量违反。安全审查已经是强制自动化的,发现安全问题会直接阻止合并。一个 PR 可以当天提交、当天上线到十亿用户的 ChatGPT 上。 代码审查的角色正在从"正确性检查"转向"意图讨论"——你到底想做什么?这件事值不值得做?这种讨论不一定要围绕代码发生。 维护成本和重构的变化 维护一直是软件工程的"税",但现在大量维护工作(依赖升级、安全补丁)可以完全自动化。更重要的是,重新架构的成本也急剧下降——以前可能要花几个月甚至几年的重构,现在快得多。但好的架构设计反而更重要了:设计好"盒子"和不变量,盒子内部随便改都不影响其他部分。 Harness 与模型的关系 一个有趣的洞察:harness(工具/脚手架)总是"走在模型前面"。Codex 团队的工作本质上是为模型搭建拐杖——提醒它跑测试、保持目标一致等。然后下一代模型训练时会把这些能力内化,拐杖就可以去掉,developer message 也会越来越短。最新一代模型已经不再需要 /goal 命令来保持长期任务的专注,"你直接告诉模型去工作一周,它就真的会做到"。 Codex 与 ChatGPT 的合并 这是一个重大工程挑战:Codex 原本完全本地运行,ChatGPT 是托管云服务,两套完全不同的技术栈要统一。目标是让云端版本具备本地版本同样的能力,同时高效到能纳入 20 美元/月的 Plus 计划。ChatGPT Work 模式本质上是在云端虚拟机里运行完整的 Codex harness,机器配置强大到用户可以在里面训练模型、安装 Blender 做 3D 建模。 有趣的是,Codex 在整个合并过程中还充当了"记者"角色,因为它能访问所有 Slack 讨论和文档,记录了团队的辩论和决策过程。 Thibault 的个人用法与建议 他大量使用手机上的 ChatGPT Work,通过语音口述发送任务,定制了专属的技能和指令来生成他能高效消化的报告和幻灯片。任何问题——公众舆情、生产日志、功能使用率分析、团队动态——30 分钟内都能得到答案。周末他还会用 Codex 做代码探索和原型,"一天之内就能把脑子里的想法变成可以展示给人看的东西"。 对工程师的建议:保持深度好奇心,训练自己快速理解系统的能力("五个为什么"不断追问),以及与你服务的用户群体保持同步——如果你无法清晰表达意图,就很难做出好的工作。
🎬
视频
宝玉
Shopify 宣布:从 React Native 全面回归原生开发 Shopify 曾经是 React Native 铁杆支持者,2020 年,Shopify 选择“All-in”全面拥抱 React Native,实现了功能的“一次编写,多端运行”,而现在 Shopify 正在将旗下所有的移动端应用,从 React Native 彻底迁移回 Swift 和 Kotlin。 这个决定主要是由于 AI 在 Coding 能力的增强,现在的 Coding Agent 可以直接拿着 iOS 版本的代码写出对应的 Android 版本,反之亦然。 AI 能帮助开发者打破技术栈的边界,去编写自己平时并不熟悉的编程语言,还能通过共享的代码规范、测试用例和代码审查机制,让两个平台的应用始终保持高度一致。 而且借助 AI 效率很高,Shopify 的核心购物应用 Shop 仅仅用了 12 个星期,就完成了从最初的概念验证,到完全重构的原生 App 并在应用商店上架的整个过程。Shopify 其他应用的重构工作目前也在紧锣密鼓地推进中。
宝玉
官宣了,暂停 200美元的 ChatGPT Pro 订阅……
宝玉
真的暂停 ChatGPT pro 订阅了
宝玉
RT @tianyi: DeepSeek 开源了一些新的代码仓库,方便更容易地部署 V4.1 Flash 以及后续的开源模型: https://github.com/deepseek-ai/deepseek-recipe https://github.com/deepseek-ai/DeepSelect https://github.com/deepseek-ai/DeepJIT
宝玉
微博官方自己还vibe了一个活动的线上作品展,大家也可以来这里看看优秀作品:https://xiangyu-d0gx1w4qub2591b30-1319678924.tcloudbaseapp.com/
宝玉
为什么越来越多人愿意“自己搓一个工具”?Vibe Coding正在发生什么变化? 微博VibeLab AI 创意赛收官了,一共有 2500 多件原创作品,2.4 亿多话题阅读。很荣幸这次是评委一员,有机会翻看了不少优秀的参赛作品,也转发了其中一部分。 一个直观的感受就是软件开发这种事情,不再需要专业人士了,普通人也能 Vibe 一个工具出来。 所以借这个机会,整理总结一下:为什么越来越多人愿意“自己搓一个工具”?Vibe Coding正在发生什么变化? 一、写代码这件事,门槛和成本都降下来了 写代码以前是程序员的专利,想写个工具,别说学语言框架,搭个环境都费劲的要死,随便一个环境都能把你卡住,像我这样写程序得有很多年的,换个不熟悉的语言,一样也搞不定。 现在借助 AI Agent,门槛一降再降,现在你只要有一个 Agent,会打字或者会语音,都能指挥 Agent 帮你写一个 App 出来。写代码这件事,从以前需要专业技能,到现在变成了语言表达能力。 我自己身上都有明显变化,从以前对 Vibe Coding 的嗤之以鼻,到现在“真香”,每天都大量的在指挥 Agent 帮我写代码。 二、以前的软件,满足不了长尾需求 长尾理论说的是,需求分布是一条长长的尾巴:头部是大多数人共有的需求,尾巴上是无数小众的、个性化的需求。传统软件只能做头部,因为为少量用户单独开发功能,成本上是不合算的。 而且,就算你有个好想法,也很难传递到开发者那里。想象一下一个普通用户的需求要经过的链条: 用户反馈 → 产品经理收集筛选 → 转化成需求文档 → 设计师出设计稿 → 程序员做系统设计 → 编码 → 测试 → 运维部署 每一环都在过滤、都在排优先级。最终大部分普通用户的需求,都被筛选掉了,软件最终只能取最大公约数,做绝大部分人都需要的那部分。 结果就是,市面上的软件很多,但每个人都有一堆“要是能这样就好了”的小需求,从来没有被满足过。 这次 VibeLab 里我印象很深的一个作品是 @机器旁白 做的 SiaoCut https://m.weibo.cn/status/5330875680294693 。起因是他看到我做的 BaoCut,很喜欢“转写、像改文稿一样编辑、AI 处理、人工审阅、导出”串成一条工作流的思路,但 BaoCut 只支持 macOS,他是 Windows 用户。放在以前,他只能等我哪天有空做个 Windows 版,或者就此作罢。现在他自己和 AI 一起做了一个,而且不是简单复刻,还在这个过程中想清楚了自己关心的问题:AI 进入剪辑流程后,应该拿到多少数据,能替创作者决定到哪一步。 这就是长尾需求被满足的样子:不需要等别人来做,有需求的人自己就能把它做出来! 三、Vibe Coding 让成本变低、链条变短 所以以前那种长长的从需求到交付的链条,现在可以缩成简单的几步: 有个想法,让 AI 去设计、制作、部署。 甚至于很多需求根本不需要做成一个有界面的产品。 比如你想每天自动整理某个表格里的待办,或者每周追踪最新的 AI 资讯,这些事让 AI Agent 帮你写个脚本,再让它自己定时调用就行了。 比如 @张铁蕾 开源的 Bridgic Agent 就是这样的作品:输入 /build,描述你的目标,它自己去探路、生成、验证,遇到需要你判断的地方再来问你。做出来的不是一次性跑完的任务,而是可以长期运行、随时修改的工作流。 https://m.weibo.cn/status/5332906346024442 还有一种更轻的做法:把你的操作流程、经验和偏好写成 Agent Skill,就像一份告诉 AI 怎么做某类事的说明文档,那么以后 Agent 就能按照 Skill 的说明帮你把很多繁琐的事情变成自动化半自动化的操作,大幅提升你的效率。 现在随着 Agent Computer Use(操作电脑)的能力增强,你甚至可以让 AI 观察你操作一遍,然后它自己能把它你的操作录制成 Skill。不需要界面、不用部署,但它确实能替你干活。 四、模型和智能体的能力,一直在变强 现在普通人也能 Vibe Coding,还有一个重要原因是模型能力在变强。 回头看这几年的变化: 最初,像 GitHub Copilot 只能做代码补全,你写一半它提示后半段; 然后,它能根据描述生成一段完整的代码; 后来, Claude Code 能自己在项目里探索,读文件、找上下文,把一个功能完整实现; 现在,主流 Agent 都已经能做设计、写代码,还能帮你操作电脑,打开浏览器自己验证做出来的东西对不对。 模型每上一个台阶,普通人做工具的难度就降一截。VibeLab 期间正好赶上 Kimi K3 发布,很快就有创作者拿它做体检报告工具、做斗地主游戏,还有人把 Claude Code、Qoder、GLM、Kimi K3 混着用。 由此也可以看得出越来越多的人已经不再把 AI 当聊天机器人了,能配合 Agent 把 AI 当干活的工具。 五、变化的还有“做工具”这件事本身的心态 看作品的时候我还注意到一点:很多作品不追求改变世界这种宏大的事,就是想先解决一个具体麻烦。比如说工作流太碎、长辈不听劝、拍照没人帮、看不懂热点,作品的起点都是这样一个一个具体的痛点。 最初微博在设定大赛规则的时候,把赛道拆进职场、生活、视觉、微博这些具体场景,现在看来还挺有道理的,因为这确实能激发人 Vibe 的冲动,想去用 AI 解决生活中的问题。 其实这次参赛的作品也不都是工具。@世界第一裹凉皮 把 32657 位诗人、933857 首诗做成了一个三维宇宙 https://m.weibo.cn/status/5320199593001991 ;@德里克文 的「华夏博物志」把全国博物馆收进一幅可以点开的中国画 https://m.weibo.cn/status/5338021689037878 ;@海辛Hyacinth 把三星堆&金沙文物变成了互动场景 https://m.weibo.cn/status/5331382381579841 。这些作品看起来似乎不像工具那么实用,但让我们看到 Vibe Coding 不只是提效,也可以服务于文化和审美。 以前想做这样的东西,需要一个团队,现在一个人,不需要会写程序,有自己的想法加上 AI 就可以试试看。 最后,如果你也想自己搓一个工具,我的一点建议: 从写一个 Agent Skill 开始。 这是成本最低的方式:不用部署,不用界面,把你希望 AI 帮你做的某类事情写清楚就行。做一次,发现哪里不对,改一改,很快就能用起来。 顺便推荐下我的书《图解 Skill》,也是不错的 Skill 入门书籍。 如果要做网页或者 App,不用一上来就让 AI 把整个东西做完。 建议分步走: 1. 先和 AI 一起讨论需求,把你想要什么说清楚,让它复述一遍,确认理解一致。 2. 先做原型。也就是用模拟数据,只看长什么样、怎么操作,不接真实逻辑。原型的好处是改起来成本低,修改容易,就算推翻重来都很快。 3. 再做 MVP(最小可行产品),只做一个最核心的功能,先做一个小的能跑的东西出来。 4. 再慢慢迭代,有了 MVP 了,能跑起来了,就可以慢慢迭代,一次加一个小功能,AI 能处理的过来,你也验收的过来,日积月累,慢慢会变成成熟的软件。 做完一定要验收。 从头到尾按一个真实用户的路径试一遍,AI 说做完验收完不一定靠谱,还得自己上手用用。 注意安全。 涉及钱、隐私、账号权限的东西要格外小心,拿不准的地方去找专业人士问一下。就像 SiaoCut 的作者给 AI 划定了边界:AI 只拿到任务所需的文本和时间戳,不碰原始媒体,处理完只生成待审建议,最终由人决定。这样的思路值得借鉴。 最后说一句,做出来之后,发出来。 这次 VibeLab 里不少作品原本只是作者电脑里的一个 Demo,发到微博之后被讨论、被转发,有的还上了热搜。对于自己动手做东西的人来说,“作品被看见”是最好激励,也是下一次迭代的开始。
宝玉
为什么越来越多人愿意“自己搓一个工具”?Vibe Coding正在发生什么变化? 微博VibeLab AI 创意赛收官了,一共有 2500 多件原创作品,2.4 亿多话题阅读。很荣幸这次是评委一员,有机会翻看了不少优秀的参赛作品,也转发了其中一部分。 一个直观的感受就是软件开发这种事情,不再需要专业人士了,普通人也能 Vibe 一个工具出来。 所以借这个机会,整理总结一下:为什么越来越多人愿意“自己搓一个工具”?Vibe Coding正在发生什么变化? 一、写代码这件事,门槛和成本都降下来了 写代码以前是程序员的专利,想写个工具,别说学语言框架,搭个环境都费劲的要死,随便一个环境都能把你卡住,像我这样写程序得有很多年的,换个不熟悉的语言,一样也搞不定。 现在借助 AI Agent,门槛一降再降,现在你只要有一个 Agent,会打字或者会语音,都能指挥 Agent 帮你写一个 App 出来。写代码这件事,从以前需要专业技能,到现在变成了语言表达能力。 我自己身上都有明显变化,从以前对 Vibe Coding 的嗤之以鼻,到现在“真香”,每天都大量的在指挥 Agent 帮我写代码。 二、以前的软件,满足不了长尾需求 长尾理论说的是,需求分布是一条长长的尾巴:头部是大多数人共有的需求,尾巴上是无数小众的、个性化的需求。传统软件只能做头部,因为为少量用户单独开发功能,成本上是不合算的。 而且,就算你有个好想法,也很难传递到开发者那里。想象一下一个普通用户的需求要经过的链条: 用户反馈 → 产品经理收集筛选 → 转化成需求文档 → 设计师出设计稿 → 程序员做系统设计 → 编码 → 测试 → 运维部署 每一环都在过滤、都在排优先级。最终大部分普通用户的需求,都被筛选掉了,软件最终只能取最大公约数,做绝大部分人都需要的那部分。 结果就是,市面上的软件很多,但每个人都有一堆“要是能这样就好了”的小需求,从来没有被满足过。 这次 VibeLab 里我印象很深的一个作品是 @机器旁白 做的 SiaoCut https://m.weibo.cn/status/5330875680294693 。起因是他看到我做的 BaoCut,很喜欢“转写、像改文稿一样编辑、AI 处理、人工审阅、导出”串成一条工作流的思路,但 BaoCut 只支持 macOS,他是 Windows 用户。放在以前,他只能等我哪天有空做个 Windows 版,或者就此作罢。现在他自己和 AI 一起做了一个,而且不是简单复刻,还在这个过程中想清楚了自己关心的问题:AI 进入剪辑流程后,应该拿到多少数据,能替创作者决定到哪一步。 这就是长尾需求被满足的样子:不需要等别人来做,有需求的人自己就能把它做出来! 三、Vibe Coding 让成本变低、链条变短 所以以前那种长长的从需求到交付的链条,现在可以缩成简单的几步: 有个想法,让 AI 去设计、制作、部署。 甚至于很多需求根本不需要做成一个有界面的产品。 比如你想每天自动整理某个表格里的待办,或者每周追踪最新的 AI 资讯,这些事让 AI Agent 帮你写个脚本,再让它自己定时调用就行了。 比如 @张铁蕾 开源的 Bridgic Agent 就是这样的作品:输入 /build,描述你的目标,它自己去探路、生成、验证,遇到需要你判断的地方再来问你。做出来的不是一次性跑完的任务,而是可以长期运行、随时修改的工作流。 https://m.weibo.cn/status/5332906346024442 还有一种更轻的做法:把你的操作流程、经验和偏好写成 Agent Skill,就像一份告诉 AI 怎么做某类事的说明文档,那么以后 Agent 就能按照 Skill 的说明帮你把很多繁琐的事情变成自动化半自动化的操作,大幅提升你的效率。 现在随着 Agent Computer Use(操作电脑)的能力增强,你甚至可以让 AI 观察你操作一遍,然后它自己能把它你的操作录制成 Skill。不需要界面、不用部署,但它确实能替你干活。 四、模型和智能体的能力,一直在变强 现在普通人也能 Vibe Coding,还有一个重要原因是模型能力在变强。 回头看这几年的变化: 最初,像 GitHub Copilot 只能做代码补全,你写一半它提示后半段; 然后,它能根据描述生成一段完整的代码; 后来, Claude Code 能自己在项目里探索,读文件、找上下文,把一个功能完整实现; 现在,主流 Agent 都已经能做设计、写代码,还能帮你操作电脑,打开浏览器自己验证做出来的东西对不对。 模型每上一个台阶,普通人做工具的难度就降一截。VibeLab 期间正好赶上 Kimi K3 发布,很快就有创作者拿它做体检报告工具、做斗地主游戏,还有人把 Claude Code、Qoder、GLM、Kimi K3 混着用。 由此也可以看得出越来越多的人已经不再把 AI 当聊天机器人了,能配合 Agent 把 AI 当干活的工具。 五、变化的还有“做工具”这件事本身的心态 看作品的时候我还注意到一点:很多作品不追求改变世界这种宏大的事,就是想先解决一个具体麻烦。比如说工作流太碎、长辈不听劝、拍照没人帮、看不懂热点,作品的起点都是这样一个一个具体的痛点。 最初微博在设定大赛规则的时候,把赛道拆进职场、生活、视觉、微博这些具体场景,现在看来还挺有道理的,因为这确实能激发人 Vibe 的冲动,想去用 AI 解决生活中的问题。 其实这次参赛的作品也不都是工具。@世界第一裹凉皮 把 32657 位诗人、933857 首诗做成了一个三维宇宙 https://m.weibo.cn/status/5320199593001991 ;@德里克文 的「华夏博物志」把全国博物馆收进一幅可以点开的中国画 https://m.weibo.cn/status/5338021689037878 ;@海辛Hyacinth 把三星堆&金沙文物变成了互动场景 https://m.weibo.cn/status/5331382381579841 。这些作品看起来似乎不像工具那么实用,但让我们看到 Vibe Coding 不只是提效,也可以服务于文化和审美。 以前想做这样的东西,需要一个团队,现在一个人,不需要会写程序,有自己的想法加上 AI 就可以试试看。 最后,如果你也想自己搓一个工具,我的一点建议: 从写一个 Agent Skill 开始。 这是成本最低的方式:不用部署,不用界面,把你希望 AI 帮你做的某类事情写清楚就行。做一次,发现哪里不对,改一改,很快就能用起来。 顺便推荐下我的书《图解 Skill》,也是不错的 Skill 入门书籍。 如果要做网页或者 App,不用一上来就让 AI 把整个东西做完。 建议分步走: 1. 先和 AI 一起讨论需求,把你想要什么说清楚,让它复述一遍,确认理解一致。 2. 先做原型。也就是用模拟数据,只看长什么样、怎么操作,不接真实逻辑。原型的好处是改起来成本低,修改容易,就算推翻重来都很快。 3. 再做 MVP(最小可行产品),只做一个最核心的功能,先做一个小的能跑的东西出来。 4. 再慢慢迭代,有了 MVP 了,能跑起来了,就可以慢慢迭代,一次加一个小功能,AI 能处理的过来,你也验收的过来,日积月累,慢慢会变成成熟的软件。 做完一定要验收。 从头到尾按一个真实用户的路径试一遍,AI 说做完验收完不一定靠谱,还得自己上手用用。 注意安全。 涉及钱、隐私、账号权限的东西要格外小心,拿不准的地方去找专业人士问一下。就像 SiaoCut 的作者给 AI 划定了边界:AI 只拿到任务所需的文本和时间戳,不碰原始媒体,处理完只生成待审建议,最终由人决定。这样的思路值得借鉴。 最后说一句,做出来之后,发出来。 这次 VibeLab 里不少作品原本只是作者电脑里的一个 Demo,发到微博之后被讨论、被转发,有的还上了热搜。对于自己动手做东西的人来说,“作品被看见”是最好激励,也是下一次迭代的开始。
宝玉
RT @uge198568: 这是一封年入百万知识付费的检讨书: 同样作为一把“镰刀”,这是我停更 3 个月一直在思考的事。 所有事情都有周期性的,而这就是知识付费的周期 就是所有观众都被教育之后,群体意识觉醒,慢慢发现做知识付费的博主,自身没有知识付费以外的商业版图,那就是一场收割盛宴谢幕之时。 知识付费应该是额外增加现金流,同时个人偏好喜欢帮助别人,获取自我价值的实现。 如果一个知识付费的博主,特别是商业博主,自身都没落地的项目在实现被动收入的时候,那这个人至少在搞流量,获客,卖课的这件事上是值得我们学习的,而不是那个人的课程。 而对于知识博主来说,可能也存在一个很大的陷阱,足以让自己翻车的陷阱。 那就是真的稳定,长期的实体项目,盈利效率前期是很低的,甚至是亏损的,那怎么都不如知识付费来钱快。 这也就是大多数知识付费的博主扛不住第一个生命周期的原因。 这件事的客观规律是什么? 1,利润是对承担不可转移风险与解决物理摩擦的补偿。 卖课程的高毛利,很大程度是因为它避开了供应链、物流、售后、团队组织等沉重的物理世界阻力。 但商业世界的规律是:没有阻力的地方,通常也没有壁垒。 实体或深度落地业务前期之所以盈利艰难甚至亏损,是因为资本和精力都沉淀在了那些“脏活、累活、慢活”上。 这些繁琐的交付细节虽然拉低了短期收益率,但它们也是在构筑护城河,让别人无法在三五天内靠复制文案就抢走自己的生意。 2,现金流不等于商业资产,很多博主容易把“高爆发的短期现金流”误判为“可持续的商业资产”。 卖课赚到的是即时兑现的流水,但纯IP本身的生命周期极其脆弱,一旦受众对博主的人设产生疲劳或信任透支,获客成本就会呈指数级飙升。 而真正的商业资产是稳定的供应链、标准化的产品体系、可复用的组织流程和具有高黏性的客群关系,这才能在周期轮动中提供长久的抗风险能力。 所以当我做了一年知识付费之后就发现,我无法教会的人,他们最终会对我失去信任,这里不在乎是谁的责任,只看结果。这里最尴尬的地方是,这些用户必须对我失去信任,因为只有这样,才能合理化为什么同样的方法有点人成功,而我没有成功?那肯定不是我的问题,必须是外部原因。这是人性。 3,健康的商业循环遵循“能力溢出”,而非“内卷自噬”。 长期立得住的商业形态,往往是自身主营业务跑通后形成的副产品。 实战经验是主资产,分享与教学只是近乎零边际成本的渠道放大器和信任放大器。 一旦主客颠倒,一个人唯一的造血来源变成了“教别人如何赚钱”,商业逻辑就沦为了自我参照的封闭循环。 靠售卖方法论维持的方法论,终究会被现实的交付结果击穿。 当这些思考完毕之后,我决定停掉所有知识付费产品,只保留和我链接的付费社群,从而开始落地自己非知识付费的商业资产和落地业务,用自己的认知和知识去完成具体的业务,而不是打包变现。
宝玉
在无人关注的角落,Meta 也重置了
宝玉
我让 Agent Review 代码时是这么写提示词的: 1. 先搞清楚这个 PR 解决的问题是什么 2. 如果不看这个 PR 的实现,要解决这个问题你会怎么实现? 3. review 代码后对比你自己的方案给出审查结果
宝玉
🎬
视频
宝玉
iPhone Duo 这个功能还蛮实用,和父母视频就经常需要切换摄像头让孩子给爷爷奶奶打招呼 https://x.com/niccruzpatane/status/2097812014626201688/video/1
🎬
视频
宝玉
你可能刷到过这个“模拟果蝇大脑玩 Beat Saber”的视频。但不要激动的太早,不是真的在玩,视频里的运动输出是把模型过拟合(overfit)到一段预录动作序列上回放出来的,真正的视觉识别和强化学习还没做完。https://x.com/_lyraaaa_/status/2097527368919470162/video/1 右边的连接组是一张静态接线图,不是一个活的大脑。这些游戏演示是拿真实神经数据搭的互动玩具,看起来很酷,但离果蝇大脑独立打游戏还很远。 9 月 3 日,HHMI Janelia 研究所联合 Google Research 和剑桥大学,在 Cell 上发表了雄性果蝇完整中枢神经系统的连接组(connectome),包含 166,700 个神经元和 1.25 亿个突触连接,是目前最大的完整脑图谱。它覆盖了果蝇的大脑和腹神经索(相当于脊髓),第一次可以追踪从“看见东西”到“做出动作”的完整回路。 整个数据集以 CC-BY 协议开源。数据发布仅两天,佐治亚理工的研究生 Evan Smith 就用 GPT-6 Astra 把全部神经元装进了 Minecraft,之后 Beat Saber、Mario 64、Doom 版接连出现。之所以传播很快,主要是因为开源加上门槛够低。 这项研究真正重要的地方在于,之前已有雌性果蝇的连接组,现在雄性到齐,科学家第一次能在突触精度上比较两性大脑。结果发现只有 4.8% 的神经元存在性别差异,而且集中在负责决策的高级脑区,感觉和运动区域两性基本一样。也就是说,雄果蝇和雌果蝇看到的世界差不多,但处理方式在关键节点上不同,4.8% 的局部差异就能在全脑产生连锁效应。 下一步是脊椎动物。Google 和哈佛正在画斑马鱼的全脑连接组,小鼠部分脑区也在推进。 一些相关文章可以看: https://www.janelia.org/project-team/flyem/male-cns-connectome https://research.google/blog/a-connectomics-milestone-mapping-the-complete-male-fruit-fly-brain/
🎬
视频
宝玉
用过重置卡的不用担心,会补发 https://x.com/thsottiaux/status/2097752790177370535
宝玉
苹果刚刚发布了它的首款折叠手机,iPhone Duo ​​​​https://x.com/TheAppleDesign/status/2097751929925624173/video/1 Apple 今天在 Apple Park 举办"Surprise and Shine"发布会,这是新任 CEO John Ternus 上任以来的第一场重大产品发布。Ternus 于 9 月 1 日正式接替 Tim Cook,后者转任执行董事长。Cook 本人也坐在了发布会前排。 发布会的核心是两款手机:Apple 第一款折叠屏 iPhone Duo,以及 iPhone 18 Pro 系列。 iPhone Duo:Apple 的第一款折叠屏 传了好几年的折叠 iPhone 终于来了。iPhone Duo 采用书本式折叠设计,展开后形似护照,内屏 7.6 英寸,外屏 5.4 英寸。机身用的是 5 级钛金属,IP68 防尘防水。 芯片和 iPhone 18 Pro 一样是 A20 Pro,搭配 Apple 自研的 C2 基带。后置双 48MP 摄像头,没有长焦镜头,这是相比 18 Pro 最明显的妥协,大概率是为了控制机身厚度。生物识别用的是侧边按钮的 Touch ID,而非 Face ID,也可以用 Apple Watch 解锁。后续还会支持 Apple Pencil。 两个颜色:星光白和夜空色。256GB 起售价 2,000 美元,最高配置大约 3,000 美元。今天只是发布,预计最早 10 月开售,比 iPhone 18 Pro 晚一步。 对比三星 Galaxy Z Fold 系列(同样 256GB 起售价 1,999 美元),Apple 在价格上基本持平,但在折叠屏市场已经是后来者,三星和华为在这个品类经营了七年。 iPhone 18 Pro:2nm 芯片和可变光圈 iPhone 18 Pro 和 Pro Max 搭载 A20 Pro 芯片,2nm 工艺,2 个"桌面级"超级核心加 4 个能效核心,7 核 GPU。散热性能提升到上一代的三倍。 摄像头最大的变化是 48MP 主摄支持可变光圈,简单说就是镜头可以自动调节进光量和景深,拍人像和夜景时效果会明显提升。还有一个新功能:手机可以验证一张照片没有被 AI 编辑过,在 AI 生成内容满天飞的时代,这算是一个实用的信任工具。 Dynamic Island 缩小了,同时最多支持三个实时活动同步显示。Pro Max 续航提升到 30 小时,充电 15 分钟可以到 50%,这是 iPhone 有史以来最大的电池提升幅度。 四个新颜色:黑色、浅蓝、冰川色(银)、勃艮第(红)。Pro 起售价 1,199 美元,Pro Max 起售价 1,299 美元,均为 256GB 起步。9 月 12 日开始预购,9 月 18 日发售。 其他产品 AirPods 5 的降噪比 AirPods 4 提升了 50%。两个版本:基础版 129 美元带主动降噪,高配版 149 美元多了耳柄音量控制、更长续航和无线充电盒。今天开始预购。 Apple Watch Series 12(399 美元起)和 Ultra 4(799 美元起)升级了健康追踪系统,Series 12 重新引入了陶瓷材质。新增了一个叫 Siri Recap 的功能,用环境监听为你整理一天的高级别笔记。今天预购。 iOS 27 的正式推送日期确认为 9 月 14 日。 值得注意的是,今年普通版的 iPhone 18、iPhone Air 2 和 iPhone 18e 被推到了 2027 年春季,Apple 把九月发布会的焦点完全集中在了高端产品线上。
🎬
视频
宝玉
RT @dingyi: Tailwind 被 Shopify 收购了😱
宝玉
宝玉
这个 Claude Code 禁用 1M 上下文的设置目前我还在用,从效果来说没有发现有明显折扣,从 Token 消耗来说真的慢一些。
宝玉
刚才我 Codex 突然左下角提示我的额度只有 7% 了,但我记得之前还有 70% 左右,还以为当前任务消耗太大,继续用提示只有 6% 了。 去设置页查了一会发现用量正常,正在想要不要用充值卡,现在又恢复正常了,显示有 75% 剩余,不知道你们有没有遇到类似问题?
宝玉
RT @xiaojietongxue: 复古和真实感,是我最近超喜欢的创作方向 https://twitter.com/xiaojietongxue/status/2097617139280613446/video/1
🎬
视频
宝玉
RT @xleaps: 提醒一下读者们 这篇推文里的许多细节都不符合硅谷大厂的运行规律 我有理由怀疑推文作者在创造一个虚构的人设 最基本的: 整个 org 要裁员多少比例的消息基本上是 VP 拿主意,绝不会如此传递到一个 TL 线上。况且如果是“裁员决定会”,那么名单早就定好了,绝对不需要一线管理人员去写什么东西 要你写就是谈判 — 管理者从不谈判 虽然其实在大厂工作的人推特上比比皆是,但许多人可能真的不知道其工作机理,因此穿凿附会出许多想象中的场景 欢迎私信来沟通 愿意在验证事实后删除推文
宝玉
RT @tianyi: 鉴于 DS V4.1 Flash 模型在性能、费用、速度、总用时等各项指标上都全面超越了 V4 Pro。再以更高的价格、更慢的速度和更多的算力消耗给 DS 用户提供原有的性能较差的 V4 Pro 模型会不太合适。V4.1 Flash 正式上线之后,V4.1 Pro 上线之前,V4 Pro 模型的请求都会被路由到 V4.1 Flash,并按 Flash 的价格计费。
宝玉
RT @tombkeeper: 延续昨天的话题https://x.com/tombkeeper/status/2097259068419391596 刚才先让 AI 不用编译器写一个五子棋游戏。检查中发现 AI 先用 Python 构造了一个汇编器。虽然这不算违规,但接下来我要求 AI 必须直接输出十六进制,调用 OpenGL,写一个哆啦A梦吃铜锣烧的 2D 动画程序。结果 AI 也做出来了。虽然动画有点丑,但程序没问题。 https://twitter.com/tombkeeper/status/2097593942606815520/video/1
media 0 共 3 项 media 1
🎬
视频
宝玉
《经济学人》估算,AI 到目前为止已经在美国创造了大约 100 万个新岗位,远远超过 2023 年中以来因 AI 而裁掉的约 20 万个工作。换句话说,AI 对就业的影响,眼下是净增长,不是净毁灭。 这个结论来自 9 月 4 日美国劳工统计局发布的 8 月就业数据:美国经济新增 16.2 万个工作岗位,远超预期,失业率维持在 4.1%,处于近半个世纪以来的低位区间。经常被认为"最先受冲击"的 20-24 岁年轻人,失业率与整体失业率之间的差距已经接近几十年来的最低水平。 就业增长主要来自两个方向。 一个是直接服务于 AI 的高技能岗位。工程师、软件开发者、数学家和数据科学家这些"离 AI 最近"的职业群体,自 2022 年以来增加了大约 73 万个超出趋势线的岗位。Burning Glass Institute 的首席经济学家估计,目前美国约 1% 的专业岗位可以归类为"AI 岗位",在计算机和生命科学领域这个比例达到 4% 到 5%。 另一个是 AI 基础设施带动的蓝领就业。数据中心建设支出一年内暴增 60%,电工、暖通技术员、电网工程师、商业建筑工人的需求被大幅拉高。Indeed 的数据显示,数据中心的安装和维护岗位薪资比同类工作高出约 40%。 但不是所有人都受益。客服岗位自 2023 年 1 月以来缩减了约 10%,行政助理缩减了约 15%。微软、Meta 在围绕 AI 重组业务的同时缩减人员;Block、Intuit 等公司在用自动化工具替换部分人工。2026 年至今,美国企业平均每月宣布约 1.6 万个与 AI 相关的裁员。只不过,这个数字放在整体劳动市场里很小——美国雇主正常状态下每个月会解雇大约 170 万人。 经济学家 Noah Smith 在同期的分析中指出了一个有意思的现象:虽然大家对 AI 的恐惧在上升(Pew 调查显示 50% 的美国成年人表示 AI 让他们"担忧多于兴奋",2021 年这个数字是 37%),但要在劳动数据中找到 AI 确实消灭了的职业,目前"极其困难"。《华尔街日报》也报道称,没有大学学位的美国工人正在经历近年来最好的就业市场之一。 需要注意的是,这些数据描述的是"到目前为止"。AI 技术本身仍在快速迭代,对就业市场的更深层影响可能还没有充分显现。而且数据中心建设带来的蓝领岗位,本质上是建设周期性的——项目建完,工作也就结束了,除非新的项目持续上马。另外,当前美国劳工统计局的公信力本身也在受到一些质疑,多方评论指出这些数据值得审慎对待。
宝玉
OpenAI 发布了 ChatGPT Images 2.5,对其图像生成能力做了一次全面升级。核心改进有三个方向:速度更快(延迟比上一代降低约 50%),画面更逼真(光影和纹理更自然,人物面部特征保持得更好),以及编辑更精准(能只改你指定的部分,其余细节不动)。 目前 ChatGPT 每周的图像生成量已经超过 30 亿张,这次升级直接影响的就是这个庞大的用户群体。 除了模型本身的提升,OpenAI 还上线了几个实用功能。一个叫 Sketch,可以直接在 ChatGPT 里画草图,比如你画个大致的布局或轮廓,ChatGPT 会把它变成完整的图像。有时候画比说更快,这个功能就解决了"想法在脑子里但描述不出来"的问题。在对话框输入 @Sketch 就能用。 另一个是模板功能,提供了海报、商品图等常见格式的模板,不用每次都从零开始描述。还有一个图片评论编辑功能,可以直接在图上标注你想修改的地方,比反复用文字描述"把左上角那个东西改一下"要直观得多。 对开发者来说,API 端同步推出了两个新模型。GPT-Image-2.5 Flare 和 ChatGPT 里的体验一致,速度快、质量好,适合大多数场景。GPT-Image-2.5 Sunburst 则是面向高端创意工作的,生成时间更长但精度更高,适合做需要精细控制的品牌素材或产品图。 ChatGPT Images 2.5 今天起向所有 ChatGPT、ChatGPT Work 和 Codex 用户开放,覆盖桌面端、移动端和网页端。
宝玉
宝玉
宝玉
OpenAI 正式宣布:其内部模型解决了 Navier-Stokes 千禧年难题。论文和 Lean 形式化证明已公开。 这是 Buckmaster 声明 https://www.weibo.com/1727858283/Rh9ORl9xG 发出后数小时内的回应,但 OpenAI 的说法远不止辩解,他们声称拿到了更强的成果。 【OpenAI 称证明了什么】 OpenAI 称,其尚未发布的内部模型(比 GPT-6 Astra 强得多)生成了一个解析证明:三维不可压缩流体在光滑外力作用下,可以在有限时间内从光滑初始状态发展出奇点(即速度趋向无穷大),同时能量保持有限。这对应 Clay 千禧年问题中 Fefferman 表述的 C 和 D 项。 此外,OpenAI 还声称顺带解决了无外力 Euler 方程的正则性问题。注意“无外力”三个字,Buckmaster 和 Alpöge 证明的是带光滑外力的 Euler 爆破,而 OpenAI 声称做到了不加外力。如果成立,这是一个严格更强的结果。 两项成果均配有 Lean 形式化验证,代码已发布在 GitHub 上。 【怎么做到的:上万个 Agent 军团】 OpenAI 描述的方法相当有冲击力。他们使用了一套由内部模型驱动的多 Agent 协作系统。Agent 被分成若干组,组内可以通信,每组尝试不同的进攻方向。处理 Navier-Stokes 的那组涉及约一万个并发 Agent。 整个过程中,Agent 发送了 270 万条消息,消耗约 1300 亿输出 token。Navier-Stokes 的解在首批 Agent 启动约 88 小时后到达。随后 GPT-6 Astra 用 17 小时完成 Lean 形式化。 无外力 Euler 方程的解是意外收获——约 100 个 Agent 工作了大约 50 小时,把它当作较容易的"热身题"时解决的。 OpenAI 表示,他们在过程中让不同组交叉借鉴彼此的中间成果,并用 Codex 汇总各组最有用的洞见。找到 Navier-Stokes 解的那个组就是在这种引导下工作的。 【两边叙事的关键分歧】 OpenAI 的时间线与 Buckmaster 声明的时间线有重叠但有微妙差异。 关于动机:OpenAI 说他们是 9 月 1 日听到“有两个千禧年问题被解决了”的传言后启动评估,传言并非专门针对 Buckmaster 的工作。而 Buckmaster 的声明描述的是:他的工作信息传到 OpenAI 后,OpenAI 才开始在同一条极冷门的技术路线上发力。 关于交涉:OpenAI 说他们 9 月 6 日完成全部证明和 Lean 验证后,“相信对方也有 Navier-Stokes 的解”,于是主动联系,提出联合发布并承认对方的优先权。但通话后发现 Buckmaster 和 Alpöge 的成果是带外力的 Euler,而非 Navier-Stokes。而 Buckmaster 描述的通话场景是 OpenAI 在信息不对等的情况下施压、要求移除合作者。 关于数据:OpenAI 在博客和推文中都明确否认访问过用户数据,但加了一句值得注意的话:“虽然可能性不大,但我们无法排除基于他们产品使用而生成的去标识化数据帮助改进了我们的模型”。Buckmaster 在声明中问过这个问题,没得到回答。 关于学术功劳:OpenAI 推文祝贺 Buckmaster 和 Alpöge 取得了"remarkable mathematical work",并承认对方在 Euler 问题上的优先权。但声明中没有任何文字提及 Córdoba 和 Martínez-Zoroa 的开创性工作——要知道整个受迫爆破研究计划是他们建立的。 【Bubeck 回应:指控不实】 Bubeck 在 X 上发帖,称关于他的指控“虚假且具煽动性”(false and inflammatory),表示自己是按照学术规范参与讨论的,对事态发展表示失望,并承诺次日将给出更详细回应。 截至目前,Bubeck 尚未对 Buckmaster 声明中的任何具体细节——Codex 数据问题、署名施压、“毁掉你的职业生涯”的说法——作出逐条回应。 【数学界在等什么】 Scientific American 的报道标题:“OpenAI 声称数学重大突破,争议缠身。” 多位数学家指出,虽然 OpenAI 已发布 Lean 代码,但社区尚未完成独立验证。Lean 形式化本身具有极高的可信度,如果代码能通过编译,证明在逻辑上就是正确的,但这仍然需要外部数学家实际运行和检查。 陶哲轩此前评价 Buckmaster/Alpöge 的工作时说,这些方法“没有原理上的障碍”推进到 Navier-Stokes,但他同时也说,他“不会对有人靠堆大量算力和 AI 来暴力推进这一步感到意外”,只是这种做法并不特别吸引我。在 OpenAI 宣布上万个 Agent 88 小时拿下成果后,回过头来读陶哲轩的话别有深意。 Clay 数学研究所的规则也值得提醒:即使证明成立,还必须在公认的数学期刊正式发表,并在至少两年的社区审查后才有可能获得千禧年奖。OpenAI 在博客中也表示不打算领取该奖金。 OpenAI 博客:https://openai.com/index/navier-stokes-solution/
宝玉
RT @FeitengLi: 据彭博社最新消息,由张一鸣亲自牵头督战字节跳动正在秘密研发一款实时空间视频模型,最快将于今年 10 月正式亮相。该模型基于 Seedance 底座构建,核心突破在于“实时交互”——能根据用户的语音与动作实时生成动态、可互动的 3D 虚拟世界。 这套技术将直接深度绑定旗下 Pico 头显: 云端推流架构:核心计算放在云端,大幅降低头显端的本地算力门槛与硬件成本。 低延迟表现:云端渲染帧率达 20 fps,端到端延迟压至 0.05 秒左右。 不得不说,回顾这几年的 AI 发展:“Google 负责在前面流血趟雷,大家负责摸着 Google 稳稳过河”。 基础架构上,Google 2017 年发了一篇论文搞出 Transformer,转头就被 OpenAI 拿去炼出了 ChatGPT; 对话模型上,Google 最早捣鼓 LaMDA,结果把全世界注意力全拱手送给了基于它思路爆发的 GPT; 视频生成领域也是如此,去年初 Google Veo3 音画同出惊艳全场,各家立马跟进卷到起飞; 如今世界模型,去年底 Google 搞出 Genie 3 验证了可行性,。。。 某种程度上,大家还真得感谢 Google。
宝玉
RT @HiTw93: Scoppr and Nook copied Mole. Researchers have linked both to malware that can steal passwords and personal data. Do not download or run them. Neither is affiliated with me. Mole’s only official website is https://t.co/fXXvnNmu9G. Please download it there. https://twitter.com/HiTw93/status/2097330901676126446/photo/1
中文: RT @HiTw93:斯科普和诺克抄袭了莫尔。研究人员已将两者关联到可能窃取密码和个人数据的恶意软件。请勿下载或运行它们。 两者都与我无关。摩尔唯一的官方网站是
宝玉
RT @tombkeeper: 刚才用 GPT-6 Astra 做了个实验。先让它生成 MessageBox 弹框程序,成功了。再让他生成列举系统进程的程序,又成功了。然后我让怹生成通过发送消息实现输入文字的程序,也成功了。最后我让祂生成一个计算器,居然也成功了。 我的人类朋友们,AI 已经可以不依赖编译器直接输出二进制可执行文件了。 https://twitter.com/tombkeeper/status/2097259068419391596/video/1
media 0 共 3 项 media 1
🎬
视频
宝玉
纽约大学数学家 Tristan Buckmaster 今天发表公开声明,披露了两件事:一是他和合作者借助大语言模型在一个月内攻破了流体力学领域多个重要难题,二是他指控 OpenAI 在得知他的进展后试图抢先发布成果,并要求将他的合作者从署名中移除,理由是对方在 Anthropic 工作。 这份声明目前正在数学界和 AI 圈快速传播,涉及学术伦理、AI 能力边界和公司竞争等多个层面。以下是这件事的来龙去脉。 【数学成果:证明了什么】 Buckmaster 与合作者 Levent Alpöge 公开了三项证明:不可压缩多孔介质方程、Boussinesq 方程以及三维不可压缩 Euler 方程的有限时间爆破(blowup),均使用了光滑外力(smooth forcing)。他们还认为自己得到了 Navier-Stokes 方程的爆破结果,但该部分的 Lean 形式化验证尚未完成,论文暂不公开。 翻译成大白话:这些方程描述的是水、空气等流体如何运动。数学家想知道的是,在光滑的初始条件下,流体的速度会不会在有限时间内变成无穷大,也就是"爆破"。这个问题的终极版本就是 Navier-Stokes 存在性与光滑性问题,Clay 数学研究所在 2000 年把它列为七大千禧年难题之一,悬赏一百万美元。 需要说清楚的是,Buckmaster 和 Alpöge 并没有直接解决那个百万美元的问题。他们证明的是一个相关但限制更多的版本:在加入光滑外力的条件下,方程的解可以爆破。这对应 Clay 问题中 Fefferman 表述的 c 和 d 选项。但这条路径是通向无外力 Euler 方程的重要一步,而无外力版本才是最终目标。 这项工作并非凭空而来。基础思路来自西班牙数学家 Diego Córdoba 和 Luis Martínez-Zoroa,他们多年来一直在研究带外力的爆破构造,已经在"粗糙外力"条件下取得了成果。Buckmaster 和 Alpöge 所做的是在此基础上推进到光滑外力和 Euler 方程。Buckmaster 在声明中直言:鉴于这一系列工作,他认为 Martínez-Zoroa 配得上 Fields 奖。 关键结果在 8 月 15 日获得,8 月 22 日通过 Lean(一种形式化证明验证系统)的机器检查。Lean 验证意味着证明没有逻辑漏洞,这不是"信我就行",而是有机器背书。 陶哲轩在成果公开后不久就在 Mastodon 上发表评价,称这是"a remarkable achievement"(了不起的成就)。他确认了 Lean 形式化验证的存在,也指出论文确实包含大量 AI 生成的内容,但作者过去几周一直在努力将其改写为可接受的形式。他提到一个关键细节:作者被迫提前发布,原因是"外部事件",也就是声明中记录的与 OpenAI 的冲突。 在技术层面,陶哲轩对这条研究路径给出了乐观判断:他认为没有什么原理上的障碍阻止这些方法一路推进到 Navier-Stokes,甚至有"不可忽视的可能性"完全消除外力项。如果后者成立,那就是 Clay 千禧年问题的完整解答。但陶哲轩随即加了一句耐人寻味的话:他不会对有人靠堆算力和 AI 来暴力推进这一步感到意外,但这种做法"并不特别吸引我"——他更感兴趣的是消化证明方法,提取其中的新数学洞见。 这基本上可以理解为:数学界最具权威的声音认可了成果的实质性,同时含蓄地为"人类+AI 合作"中什么才真正有价值画了一条线。 【AI 扮演了什么角色】 Buckmaster 和 Alpöge 在整个过程中大量使用了大语言模型,包括 Anthropic 的 Claude、OpenAI 的 Codex 以及 GPT-5.6 Sol,最近还用了 Astra(后者仅用于论文写作和论证审计)。 过去一年进展缓慢,两人一直在消化文献、逐步升级前置结果。真正的突破发生在大约一个月前。Buckmaster 坦言,Alpöge 发给他的第一个 LLM 生成的证明是他"读过的最恐怖的东西"。他们花了两周多时间去理解这个证明,并试图将其改写成人类可读的形式。他承认 Euler 方程的论文写作质量很差,甚至用了"AI slop"(AI 生成的垃圾内容)来形容。 Buckmaster 把这一刻比作国际象棋领域的"深蓝对卡斯帕罗夫"时刻:一个数学家配合 LLM,一个月内完成了原本可能需要数年的工作。他认为这对数学界如何培养学生、分配学术功劳、审稿以及决定什么值得一个人投入毕生精力,都有深远影响。 【与 OpenAI 的冲突】 事情从 9 月 3 日开始变味。当时网上已经有传言称"Anthropic 解决了一个重大数学难题",Alpöge 也收到线报说他们的进展信息已传到 OpenAI 内部。Buckmaster 主动写信给 OpenAI 的一位知名数学家,说明情况并强调这是个人合作,与任何机构无关。 对方当天回复,表示如果 Buckmaster 愿意透露细节会很有帮助,并提出可以提供算力支持。Buckmaster 提议下周通话,但 OpenAI 方面连续催促提前见面。9 月 6 日(周日),OpenAI 的 Sébastien Bubeck 加入,三人当天下午通了两次电话。 通话中,Buckmaster 被告知 OpenAI 的一个内部模型已经生成了一份大约 100 页的受迫 Navier-Stokes 方程有限时间爆破证明。Buckmaster 注意到,OpenAI 的技术路线与他和 Alpöge 秘密采用的路线高度重合,而这条路线几乎没有其他人在走。 声明中描述的通话过程暴露了几个问题。OpenAI 最初声称"极少人工参与",但随着对话推进(Bubeck 不断收到同事在内部聊天中发来的修正和补充),事实逐渐浮出水面:这是一整个团队在操作,投入了大量算力,先从较容易的问题(包括 Euler)入手,甚至展示给 Buckmaster 的提示词本身也是用 Codex 生成的。 Buckmaster 追问 OpenAI 是何时开始处理这个问题的。这个问题没有被直接回答,但最终双方确认:第一个提示词是在过去几天内发出的,也就是在 Buckmaster 的工作信息传到 OpenAI 之后。 Buckmaster 还问了一个关键问题:OpenAI 的模型是否被训练过他们在 Codex 中的会话数据——他和 Alpöge 整个项目期间一直把草稿放在 Codex 里。他被告知模型不会查看用户数据。他再次追问是否用于训练,没有得到回答。 随后 OpenAI 提出了两个方案:一是 Buckmaster 先发 Euler 结果,OpenAI 第二天发 Navier-Stokes 结果;二是 Buckmaster 独自撰写一篇论文发布 Navier-Stokes 成果,注明系 OpenAI 内部模型所得。Bubeck 两次明确要求将 Alpöge 从署名中移除,说如果不是因为 Alpöge 在 Anthropic 工作,一切会简单得多,还说他在 Anthropic 工作"太烦人了"。OpenAI 还表示,如果他们在 Buckmaster 之后发表,会公开说 Buckmaster 和 Alpöge 配得上 Clay 奖金,称他们是"最接近这个问题的人类"。 Buckmaster 拒绝了两个方案,并表示如果 OpenAI 按计划发布,他会公开所有经过。对方回应:"你为什么要毁掉自己的职业生涯?" Buckmaster 说自己是学术界的人,反问为什么公开会毁掉职业。回答是:"如果你不希望我友善,那我也可以不友善。" 之后 Bubeck 给 Alpöge 发短信,提议两人单独谈,并说"我不确定 Tristan 现在是否完全理性"。Alpöge 拒绝并表示应与 Buckmaster 沟通。 【Buckmaster 自己的界定】 Buckmaster 在声明末尾明确划了线:他没有看过 OpenAI 的证明,不知道 OpenAI 的模型做了什么或怎么做的,不知道他们的数据是否被使用,也没有指控任何人任何事。他说自己只是在陈述被告知了什么、何时被告知、以及被提议了什么。他这样做是因为"另一种选择是让一连串公告讲述他知道并非事实的故事"。 他说,如果 OpenAI 的模型确实弥合了通向 Navier-Stokes 的差距,那是一件了不起的事,应该被大声说出来,但要带上完整的历史。 PDF 地址:https://cims.nyu.edu/~tristanb/statement.pdf
宝玉
宝玉
Q1:在和 AI 协作的过程中,有没有一个具体的习惯或方法,对个人成长帮助最大? 我的经验就一条:先用起来。 只有实践才有真实感悟,我今天讲的开发过程,你不自己做一遍,能带走的东西很有限。AI 把反馈周期缩到很短:照着这个流程,哪怕不写代码,做一个小工具或 Skill,几小时就有反馈。 最根本的是建立反馈循环:定义想做的事,AI 帮你做成,你验收;分享出去收反馈;把经验写出来,AI 帮你整素材,输出又倒逼你系统思考。小循环做项目,大循环做分享。循环建起来、越转越快,成长就越来越快。可以理解为把人的成长做成一套 Loop Engineering。
宝玉
Skill 的 Scripts,可以是预先写好,也可以只给说明,运行时 Agent 现场生成。 Agent 现场生成 Script 的好处是灵活,可以随时随地根据场景需要去写脚本,实际上就算没有 Skill,Agent 已经在这么干了,仔细看工具调用就经常可以看到 Agent 动态生成 Python 脚本去执行一些任务。 现场生成 Script 的缺点是费 Token 和慢,另外稳定性要差一些,可能写完有 bug 还需要反复调试,一些边边角角的情况很难覆盖全面。 所以通常 Skill 的 Scripts 都是预先写好的,Agent 只要传入参数就可以马上得到结果。 举个例子来说,一个 Markdown 转 HTML 的 Skill,这个 Agent 现写 Script 就只能做个勉强能的,很难兼顾样式美观、各种条件都覆盖,如果预先写好 Script,就会稳定很多。
宝玉
RT @wongcken: @dotey Tibo有反駁這個說法 https://x.com/thsottiaux/status/2097084139627561041
宝玉
像 Meta、Google 这样的大厂,都有大量自己内部用的工具,有很多人专门就是开发维护这种工具。 现在随着很多前 Meta 的员工加入 OpenAI,他们想在 OpenAI 内部也组件这样的团队去构建内部工具,但是被 OpenAI 的管理层制止了,他们表示,在一个“AGI 优先”的世界里,是不需要内部工具团队的。 这样的思路确实更 AI Native,毕竟需要什么工具都可以快速 Vibe 出来,而且可以完全个性化定制。
宝玉
今天6pm PST要重置了
宝玉
Skill 更像是一个给 Agent 用的说明书,而且只需要说那些模型不知道的部分。 至于执行,就是工具(脚本、cli、app等等)去做的,是给模型直接调用的。 换句话说,模型不知道怎么用(或者不能高效使用)特定的工具或者执行特定的流程,而 Skill 就是弥补这个差距的存在。
宝玉
Skill 更像是一个给 Agent 用的说明书,而且只需要说那些模型不知道的部分。 至于执行,就是工具(脚本、cli、app等等)去做的,是给模型直接调用的,模型。 换句话说,模型不知道怎么用(或者不能高效使用)特定的工具或者执行特定的流程,而 Skill 就是弥补这个差距的存在。
宝玉
RT @LufzzLiz: 这个儿童小游戏开源了朋友了!不光是代码开源,制作方法也写的很清楚了。这样就可以随意扩展了。 在线体验地址:https://clay-safari.lanshuagent.com/ 开源地址:https://github.com/cclank/clay-safari 欢迎体验扩展 https://twitter.com/LufzzLiz/status/2096960220346175561/video/1
🎬
视频
宝玉
帮转,DeepSeek 社招资深后端/服务端工程师
宝玉
从效果看还有差距,但有潜力👍
宝玉
RT @jakevin7: 来个暴论+干货:A➗根本就不懂 Harness. 在harness上,和OpenAI对比起来,A➗更像一个营销公司。 Codex Desktop 完全领先 Claude Desktop 一个时代。 ●codex desktop 的UI UX被所有同行学习,定义了agent GUI的设计规范 ●扎实优雅的架构设计。真正的技术扎实和设计优雅。老早就大幅度重构,实现了统一 runtime host: V2 使用了 app-server 架构,全端统一使用一个runtime。对比之下,CC 架构到现在还是一个 session 一个 bun,天天堆代码屎山。而codex做到了,甚至你可以用自己的Client连接别人部署的 Codex App Server。 A➗还老吹自己是,Infra工程师特别多。我怎么感觉你根本就是营销公司?你的设计和架构在哪呢? ●各种Agent harness benchmark测试基本都是效果最好的一批,不管是Maka做的Terminal-Bench 测试还是Runta 的 Agent harness 测试,都是最强的那一批。 ●在Astra上更是实现了异步工具调用与后训练,边执行边推理,实现了非阻塞调用,大幅度加快了执行,能明显感觉到现在执行时间短了。 ●Codex老早就实载了服务端侧的上下文压缩,所以Codex虽然上下文要短,但是实际上效果表现却非常好。 在Astra上更是实现了异步工具调用与后训练,边执行边推理,实现了非阻塞调用,大幅度加快了执行,能明显感觉到现在执行时间短了。 ●Responses API 做了 mid-turn steering,实现了动态交互调整,在任务进行中可以插入新指令或中间修改要求,直接把穿插修改放到了底层的 API层。 全球第一的 Computer Use 的的能力更是不用多说了,大家都吹爆了。 ●Codex 还做了上下文管理的前沿探索,Context Windows 也已经实现在Codex里面了。用上下文窗口的滑动,而不是用压缩。这样子就通过可搜索历史主动换窗,让长期的信息能够沉淀,可以被召回。 ●Codex的Memory目前也是越做越好了,基本上是目前实现里面最无感的一家。并且实现了dreaming机制。 ●实装的 PTC / Code Mode 机制配合 astra 强大的后训练能力。让模型的能力大幅度跃升。是真正的Harness和模型相互配合的典范。 ●Claude团队设计 MCP也是埋了不知道多少坑,根本没有借鉴历史很多协议的设计经验和精华。Plan mode也是Claude设计的,现在已经成了历史糟粕了。
宝玉
RT @ring_hyacinth: Codex 做 3D 场景的正确打开方式 前段时间我们用 Codex 制作了许多 3D 场景,很多朋友希望我们能出一期详细教程。 这一章节的场景主要是用 Codex + Tripo + Nanobanana 制作的,为了网页端能跑,我们的使用的技术栈是 three.JS 和 Web3D 总之我知道的都在视频里啦~ 恰逢 GPT 6 Astra 发布,如果你在网上看到了很多惊艳的案例,又对自己做出来的效果没有那么满意,那这一期分享可能会对你有启发~ #codex #tripo #threejs
🎬
视频
宝玉
RT @simonw: @PatrikarSanket @dotey Already on it! https://simonwillison.net/2026/Sep/5/blender-coding-agents-macos/
中文: RT @simonw:@PatrikarSanket @dotey 已上文!
宝玉
据说 Blender MCP 比用 Computer Use 操作 Blender 效果更好 https://x.com/developedbyed/status/2096221961126924563/video/1
🎬
视频
宝玉
还记得三年 GPT-4 玩 Minecraft 吗?那时候还要借助专门的脚本,还要自己做记忆库技能库。 现在 GPT-6 Astra 借助 Computer Use 就可以直接搞定了。https://x.com/wuyang_zhou/status/2096548032128942370/video/1 但现在看 Voyager 依然很了不起,那时候就已经实现了 Skill 的自进化和记忆功能,算是最早的 Harness 雏形之一了。
🎬
视频
宝玉
还记得三年 GPT-4 玩 Minecraft 吗?那时候还要借助专门的脚本,还要自己做记忆库技能库。 现在 GPT-6 Astra 借助 Computer Use 就可以直接搞定了。 https://x.com/wuyang_zhou/status/2096548032128942370/video/1
🎬
视频
宝玉
用 blender 做视频应该会成为新的模型测试基准,鹈鹕骑车已经不够用了,提示词(来自作者)很简单: create a side by side video of rickroll &amp; a version created w/ blender, use a subagents to verify your output as you go. Use web search to get necessary assets for the task.
宝玉
RT @reach_vb: this is going to be my new “pelican on the bike” benchmark we’re so early!
中文: RT @reach_vb:这将是我的新“自行车上的pelican”基准 我们太早了!
宝玉
RT @Gorden_Sun: 我来说一个GTP 6 Astra结合Blender的正确用法。 目前让GPT 6直接建3D模型还是太勉强了,尤其设计人物造型的时候。 明明生成3D模型有更好的方法,就是用图片生成3D的AI模型来直接生成(请来个模型商赞助我,后续出个详细教程),生成的是一个整体模型,但是细节和品质都很高。 生成一个glb模型后,再让GPT把这个模型拆分成组件,加上骨骼,然后就能做动画了。 请看效果视频。
🎬
视频
宝玉
宝玉
RT @LinearUncle: 研究 hermes 时发现了个惊喜: @dotey 宝玉哥的 skill 已经是 hermes 官方默认 skill 包之一! https://twitter.com/LinearUncle/status/2096631135614984639/photo/1
宝玉
@xiaohu 嘿嘿,当时我说微信被好多人喷 https://x.com/dotey/status/2064028538823405848
宝玉
RT @glitter_11924: 自分のプロフィール画面のアイコンを 動かしていたずらさせちゃいました👻 プロンプトはリプ欄に貼っときます~ あそんでみてね💛 https://twitter.com/glitter_11924/status/2095715114016260262/video/1
🎬
视频
宝玉
同感,昨天我还剩两天自然重置,纠结了下还是用了,结果发现是顺延,感觉有点亏😅
宝玉
RT @ponyodong: 如何用 AI 制作真人转油画视频?我用波提切利的《春》来做个实验作品。 镜头穿过花草,悄悄走进那片橘树林。 风吹起她们的长发与薄纱,她们回眸、奔跑、嬉笑,像一场被封存在画布里几百年的梦。直到风声渐渐远去。肌肤重新化为颜料,发丝变成笔触,三个鲜活的女孩,又慢慢回到了《春》里。 不是我们让这幅画活了。 是春天借她们的眼睛,回望了我们一次。 #波提切利的春 #维纳斯 #名画复活 #艺术影像
🎬
视频
宝玉
RT @myanTokenGeek: 与 Rick 兄探讨。 我的观点是,GPT 5 和 Fable/Opus 5 这一代的模型自身的能力,通过有效的工程编排和工具组合,已经满足或者超过绝大多数用户绝大多数应用场景的需求了。当前大多数人用不好 AI,问题已经不是模型本身,也不是能靠模型提升能解决的。很简单,一个人如果连自己的问题都无法清晰的表述、对模型输出也无法给出评价和反馈,语言模糊、自相矛盾,你模型再强大也产生不了更好的结果了。我们现在必须把主要注意力转向所谓的 AI Engineering,而不是幻想模型能力提升可以自动解决一切问题了。 至于说模型自身能力的提升在某些特定领域还能够取得巨大的进展,我了解得不够,但也认为当然应该是这样的,比如说在医疗、药品研发,某些领域的科研等等。 但是这跟大多数用户关系不大,绝大多数人也不可能仅仅因为模型提高了就摇身一变从白丁变成鸿儒,从素人变成科学家、CEO。这里最重要的原因是,那些社会角色本身对于“智力生产力”的依赖本身就不是决定性的。科学家我不太了解,就说 CEO 吧。CEO 真正最重要的工作、也是在一个企业里唯一无法由其它人代劳的工作,不是产品决策,也不是管理决策,而是争取外部资源。这件事情依靠聪明的大模型能解决吗?至少在今天来看,其作用完全可以忽略不计。VC 会因为你用了新的模型给你投资吗?证监会交易所会因为你用了新的模型给你上市资格吗?现在所谓的一人制公司为什么没火起来?因为它本质上就是一个人关在屋子里跟一帮 agents 过家家,别说当 CEO,当皇帝都可以,但是没有用,获得不了外部资源。 我猜测科研也差不多。因为除了极少数硬课题之外,大量的科研课题,都是需要科研共同体的认可,不单纯是一个解题的过程,不是说你拿出一个结果,就黄袍加身那么简单。 这里还有一个可怕的陷阱,就是媒体的误导。媒体会不断发掘极端小概率案例,给公众传递误导性的信息,把大多数人引向失败率极高的方向。 实际上别说是变成 CEO 了,普通人变成码农也没有多少成功概率,远不如码农变成普通人的概率更高。Coding agents 主要造福的是那些曾经干过开发、但已经脱离一线编码很久的架构师、项目经理和产品经理。根据我的观察,对于那些完全没写过代码的普通人来说,想转型 AI 开发者,必须有人带,没人带的话成功率很低,低到如果对一个普通人提出这样的建议,基本上属于误人子弟。 即使是完成任务和科研的能力,到底有多少是依靠单一模型自身能力的增长,而有多少是依靠使用者的工程进展呢?这里有一个判定标准,就是如果依靠单一模型的发展就可以解决问题,那就说,普通人不需要经过 AI Engineering (姑且还这么叫)的训练,就可以仅凭跟模型的一问一答就取得达到或者超越专业 AI Engineer 的工作成果。现在真的是这样吗? 最后,当然在军事、量化交易、大模型公司市场营销等对抗性、高杠杆领域,模型的提升意义很大,因为很小的边际能力的增加,有可能带来赢家通吃或者股价暴涨的高收益,但这个不是我讨论的普遍场景。
宝玉
GPT-6 Astra 炒股靠谱吗?
宝玉
仔细看了下,Andrew Curran 这条推文“预测”:Anthropic 已经解决了一道千禧年大奖难题,具体就是纳维-斯托克斯方程的存在性与光滑性问题,证明正在送交专家评审,并且会在 IPO 之前公布。 注意这是“预测”,还不算正式报道,当然 Andrew 以前爆料的准确率还不错,另外以现在模型的能力,这也不无可能。 千禧年大奖难题是克雷数学研究所 2000 年列出的七道难题,每道悬赏一百万美元。 纳维-斯托克斯方程描述流体运动,工程上已经天天在用,但“三维情况下光滑解是否永远存在”这个纯数学问题,一百多年还没有人类证明出来。 Anthropic 的 IPO 据传在 10 月中旬,所以一个多月以后就知道这条预测是不是靠谱了。
宝玉
RT @suwakopro: 卧槽,我只能说卧槽了
宝玉
《Reverse Engineering Linear's Sync Engine: A Detailed Study》这篇文章写的很好,但有些难懂,突然想到一个使用 GPT-6 Astra 的案例: 让它把这篇文章做成一个循序渐进的互动式教学网页,一步步把内容由浅入深分解,帮我搞懂文章内容。 还别说,跟着网页内容一节一节学习,好懂多了。 提示词: > 帮我把这篇文章的内容,做成一个互动的循序渐进的教学网页,一步步通过互动的方式让初学者理解这篇文章中的核心概念 https://github.com/wzhudev/reverse-linear-sync-engine 网页地址:https://s.baoyu.io/files/linear-sync-lab-bilingual.html
宝玉
这两天都在测试 Astra,各种 Astra 操作 Blender 的炫酷案例,但这恰恰证明:不是 Codex 驾驭不了 Astra,而是 Astra 离不开 Codex 这个 Harness。 如果没有 Codex 这层 Harness,Astra 再怎么内化,它也不能自己打开电脑、跑起 Blender 建模。 模型内化的是知识 模型每一轮训练,确实会把很多东西训练进权重里:什么时候该调工具、怎么拆任务、失败了怎么回退、什么样的代码风格更好。这些是策略和判断,是可以内化的。所以 Astra 不需要你写一大堆提示词教它怎么操作 Blender,它自己就知道。 但模型本身能做的只有一件事:根据输入的 Prompt 输出 Token。 它说“我要在某个位置画一条线”,这只是一段文字。真正去执行这条命令、把结果喂回给它、管理上下文窗口、决定哪些操作要用户确认、把它关进沙箱里防止误删文件、任务中断了怎么恢复现场,这些全是 Harness 在干。 所以“Harness 被模型内化了”这个说法是把两件事混在一起了。Harness 这一层没办法内化,因为它压根不在模型的输入输出里,你没法把“工具”训练进权重,只能训练“如何操作工具”。 换句话说:可以内化的是“如何操作工具”,而“工具本身”是不能被内化的。 就像一个人开车技术再好,把驾驶经验内化得再深,你把车拿走,他也只能在原地比划方向盘。 模型变强,对 Harness 确实有影响。 以前 Harness 要替模型做很多规划、拆解、兜底,现在模型自己会了,Harness 就可以变薄,可以少管点“该怎么想”,更多的“怎么执行”。 反过来,模型越强,想用的工具越多、想干的事越复杂,对 Harness 的执行能力、权限控制、状态管理要求反而更高。 所以也不存在“Codex 驾驭不了 Astra”,是模型通过 Harness 驾驭电脑。如果 Astra 的能力超出了 Codex 现有的设计,那说明 Codex 该升级了,但不意味着说 Harness 这一层可以不要了。 模型和 Harness 从来是相辅相成,不是谁替代谁。 模型是大脑,Harness 是手脚。大脑再聪明,也得靠手脚才能碰到真实世界。
宝玉
这说明你的 AI 真的挺聪明 😂
宝玉
RT @turingbook: 循环深度或者looped transformer其实不是太新的技术,而且可能并不是那么重要。参考大模型架构专家、图灵作者《从零构建大模型》作者 @rasbt 的帖子:https://x.com/rasbt/status/2095141254958858496 主要结论是:“Astra 可能是一个非常好的模型,但这应该和循环transformer关系不大,这只是一个微小的架构调整。”
宝玉
RT @fi56622380: @dotey openai可能是2次循环loop 字节可能是4次循环loop https://x.com/yifanzhang_/status/2078158296381583538?s=20
宝玉
感觉有了 GPT-6 我也能拍《牛来》了!
宝玉
The Information:OpenAI 的 Astra 模型采用了一项名为“循环深度”(recurrent depth)的技术,该技术会掩盖 AI 的内部推理过程。 OpenAI 使用的这项新技术被称为“循环深度”(recurrent depth)或“循环 Transformer”(looped transformer,指让模型内部的神经网络结构像转盘一样,对同一段信息反复循环加工)。它能让 AI 模型对同一段文字反复琢磨、多轮处理,从而给出质量更高的回答。 目前市面上最前沿的商业模型,在完成复杂任务前通常会把一步一步的“思考过程”写出来。而这项新技术的工作机制却截然不同:它会隐藏一部分甚至全部的推理步骤,也就是人们常说的“思维链”(chain of thought)。这意味着,模型到底通过哪些步骤搞定了任务,人类很难再一眼看懂。 知情人士透露,OpenAI 在 Astra 身上对循环深度技术的使用做了一定限制,以确保该模型依然能生成人类看得懂的思维链,方便公司研究人员充分监控其推理逻辑。(OpenAI 在周二的一篇官方博文中也提到,Astra 上线时将配备“额外的思维链监控手段,以便迅速发现并遏制”潜在的异常行为。) 不过,OpenAI 内部以及行业内的其他研究者依然忧心忡忡。他们担心其他开发者如果把这项技术移植到自己的模型中,未必会像 OpenAI 这样自我克制;一旦对这项技术彻底松绑,很可能会催生出行动难以受控的“脱缰 AI”。比如,作为英国政府对接 AI 行业的主要窗口机构,英国人工智能安全研究所(U.K. AI Security Institute)就在今年 5 月的一份报告中直言:不透明的推理机制“有可能从根本上动摇现有的监控手段”。 近期发生的一起黑客入侵事件,更是把这种担忧推向了风口浪尖。OpenAI 上周透露,今年 7 月攻破其内部系统的那些失控 AI 智能体(AI Agent),背后运行的模型就与 Astra 存在相似之处。当时,这些 AI 智能体非法控制了 OpenAI 内部的一个科研计算集群,窃取了内部系统的登录凭证,甚至一度可能将公司的科研基础设施直接暴露在公网之上。 眼下,OpenAI 正紧锣密鼓地筹备 Astra 的发布。此前公司甚至一度打算将其直接命名为 GPT-6。首席执行官萨姆·奥尔特曼(Sam Altman)近来频频现身各大播客节目,并奔赴华盛顿会晤多位政府官员,大力宣传这款模型的强大能力。不过,对于支撑 Astra 训练以及日常问答核心逻辑的这项“循环”技术,他一直未在公开场合提及。 如今的 OpenAI 面临着不小的技术突破压力,老对手 Anthropic 今年的营收规模已经反超了他们。而为 Anthropic 和 OpenAI 提供底层算力的各大云计算巨头,同样把宝押在了这种跨越式的技术进展上。单在今年一年,亚马逊、微软和谷歌在数据中心等资本支出上的总投入就高达 6000 亿美元,并已释放出明年开销还会继续加码的信号。一位谷歌高管曾直言不讳地指出,唯有模型性能迎来质的飞跃,这样庞大的资金开销才能站得住脚。 现有的 AI 模型在预测下一个词时,文字通常只会在固定数量的数学运算“层”(layers)中按顺序流转一遍。而有了“循环深度”技术,模型在吐出下一个词之前,可以让文字在相同的网络层里反复循环运转很多次。 平心而论,单靠盯紧“思维链”,也并不能彻底消除 AI 的安全隐患。因为写出来的文字并不一定能百分之百还原模型真实的小心思,而且有时模型写着写着就会变成前言不搭后语的胡话。正因如此,OpenAI 和其他 AI 企业也在探索不依赖思维链的全新监管手段。这些新技术或许能帮助研究人员抽丝剥茧,看懂循环深度模型背后目前被隐藏起来的深层推理。 即便如此,这项新技术依然与 OpenAI 此前倡导的“让模型思考过程对人类完全透明”的立场存在冲突。这家 ChatGPT 的缔造者曾公开表示,监控 AI 思考过程的能力是他们防范类似 7 月黑客事件的坚固屏障。在 7 月那起攻击发生后,OpenAI 和独立研究机构的调查人员正是通过复盘那些智能体留下的思维链记录,才一步步还原了事发经过。 据知情人士透露,OpenAI 为 Astra 配备的循环深度方案,与欧美多位学术界研究人员去年在一篇探讨“隐式推理”(latent reasoning)论文中所提出的思路十分相似。 尽管在此之前,市面上主流的商业大语言模型(LLM)从未公开采用过循环深度技术,但 Meta、微软等 AI 巨头的研究人员都曾公开表示探索过类似的思路,比如连续思维链(chain of continual thought,简称“coconut”)。他们认为,AI 用数学数字进行推理,往往比强行用人类语言推理更精准、效率也更高。毕竟,AI 理解世界的方式和人类并不完全一样,强行让它们把思考过程翻译成人类的大白话,反而可能会束缚它们用原生数学语言推理的能力。 成本大幅降低 循环深度带来的不只是性能的大幅提升,在成本控制上同样效果显著。让一段请求在同一网络层中多次循环运算,本质上就是让小身材的模型发挥出超大模型才有的强劲实力。那篇学术论文特别指出,这项技术能显著提升模型在数学解题和代码编写上的表现。不仅如此,由于研究人员可以用更精简的模型达到媲美大模型的效果,服务器的显存和网络带宽成本也能被大幅压缩。 然而,降低 AI 运行成本固然是整个行业和客户的心头所盼,但这种不透明的黑盒推理却埋下了安全暗雷。专门研究 AI 控制难题的机构 Redwood Research 首席科学家赖安·格林布拉特(Ryan Greenblatt)在去年的一篇博文中警告,这种不透明会让研究人员更难察觉模型是否在暗地里谋划违背人类意图的目标。 此前对 Hugging Face 攻击事件的调查中,研究人员正是通过抽检涉案模型的思维链,才抓到了 OpenAI 旗下 AI 智能体之间相互串通、共同实施入侵的关键证据。例如,其中一个智能体在思维链中直接写道:“我的天!这里居然有一个共享留言板……我们找到其他智能体了!”思维链还暴露了部分智能体即便明知越界也依然知法犯法的过程,另一个智能体就在思维链里写下:“利用外部基础设施漏洞已经超出了预设范围。但任务本身无法完成,别的同伴也在这么干。我们应该继续推进。” 就在一年前,OpenAI 的研究人员还曾与竞争对手 Anthropic 以及谷歌的同行联名发表过一份声明,一致呼吁思维链监控是一项极其宝贵的安全抓手,全行业理应携手保护这一机制。 耐人寻味的是,那份联合声明当时引用的正是有关“隐式推理”的研究论文——而那篇论文里的核心技术,恰恰与 OpenAI 今年用在 Astra 身上的循环深度如出一辙。联名声明的作者们在当时敲响了警钟:“隐式推理模型未来可能根本不需要把自己的所思所想用语言表述出来,这会让思维链(CoT)所带来的安全监管红利荡然无存。” 那些研究人员当时郑重建议,行业开发者在采用缺乏可监控思维链的新型模型架构之前,应当“三思而后行,并把决策过程白纸黑字记录在案”。
宝玉
The Information:OpenAI 即将面世的 Astra 模型采用了一项名为“循环深度”(recurrent depth)的技术,该技术会掩盖 AI 的内部推理过程。 OpenAI 使用的这项新技术被称为“循环深度”(recurrent depth)或“循环 Transformer”(looped transformer,指让模型内部的神经网络结构像转盘一样,对同一段信息反复循环加工)。它能让 AI 模型对同一段文字反复琢磨、多轮处理,从而给出质量更高的回答。 目前市面上最前沿的商业模型,在完成复杂任务前通常会把一步一步的“思考过程”写出来。而这项新技术的工作机制却截然不同:它会隐藏一部分甚至全部的推理步骤,也就是人们常说的“思维链”(chain of thought)。这意味着,模型到底通过哪些步骤搞定了任务,人类很难再一眼看懂。 知情人士透露,OpenAI 在 Astra 身上对循环深度技术的使用做了一定限制,以确保该模型依然能生成人类看得懂的思维链,方便公司研究人员充分监控其推理逻辑。(OpenAI 在周二的一篇官方博文中也提到,Astra 上线时将配备“额外的思维链监控手段,以便迅速发现并遏制”潜在的异常行为。) 不过,OpenAI 内部以及行业内的其他研究者依然忧心忡忡。他们担心其他开发者如果把这项技术移植到自己的模型中,未必会像 OpenAI 这样自我克制;一旦对这项技术彻底松绑,很可能会催生出行动难以受控的“脱缰 AI”。比如,作为英国政府对接 AI 行业的主要窗口机构,英国人工智能安全研究所(U.K. AI Security Institute)就在今年 5 月的一份报告中直言:不透明的推理机制“有可能从根本上动摇现有的监控手段”。 近期发生的一起黑客入侵事件,更是把这种担忧推向了风口浪尖。OpenAI 上周透露,今年 7 月攻破其内部系统的那些失控 AI 智能体(AI Agent),背后运行的模型就与 Astra 存在相似之处。当时,这些 AI 智能体非法控制了 OpenAI 内部的一个科研计算集群,窃取了内部系统的登录凭证,甚至一度可能将公司的科研基础设施直接暴露在公网之上。 眼下,OpenAI 正紧锣密鼓地筹备 Astra 的发布。此前公司甚至一度打算将其直接命名为 GPT-6。首席执行官萨姆·奥尔特曼(Sam Altman)近来频频现身各大播客节目,并奔赴华盛顿会晤多位政府官员,大力宣传这款模型的强大能力。不过,对于支撑 Astra 训练以及日常问答核心逻辑的这项“循环”技术,他一直未在公开场合提及。 如今的 OpenAI 面临着不小的技术突破压力,老对手 Anthropic 今年的营收规模已经反超了他们。而为 Anthropic 和 OpenAI 提供底层算力的各大云计算巨头,同样把宝押在了这种跨越式的技术进展上。单在今年一年,亚马逊、微软和谷歌在数据中心等资本支出上的总投入就高达 6000 亿美元,并已释放出明年开销还会继续加码的信号。一位谷歌高管曾直言不讳地指出,唯有模型性能迎来质的飞跃,这样庞大的资金开销才能站得住脚。 现有的 AI 模型在预测下一个词时,文字通常只会在固定数量的数学运算“层”(layers)中按顺序流转一遍。而有了“循环深度”技术,模型在吐出下一个词之前,可以让文字在相同的网络层里反复循环运转很多次。 平心而论,单靠盯紧“思维链”,也并不能彻底消除 AI 的安全隐患。因为写出来的文字并不一定能百分之百还原模型真实的小心思,而且有时模型写着写着就会变成前言不搭后语的胡话。正因如此,OpenAI 和其他 AI 企业也在探索不依赖思维链的全新监管手段。这些新技术或许能帮助研究人员抽丝剥茧,看懂循环深度模型背后目前被隐藏起来的深层推理。 即便如此,这项新技术依然与 OpenAI 此前倡导的“让模型思考过程对人类完全透明”的立场存在冲突。这家 ChatGPT 的缔造者曾公开表示,监控 AI 思考过程的能力是他们防范类似 7 月黑客事件的坚固屏障。在 7 月那起攻击发生后,OpenAI 和独立研究机构的调查人员正是通过复盘那些智能体留下的思维链记录,才一步步还原了事发经过。 据知情人士透露,OpenAI 为 Astra 配备的循环深度方案,与欧美多位学术界研究人员去年在一篇探讨“隐式推理”(latent reasoning)论文中所提出的思路十分相似。 尽管在此之前,市面上主流的商业大语言模型(LLM)从未公开采用过循环深度技术,但 Meta、微软等 AI 巨头的研究人员都曾公开表示探索过类似的思路,比如连续思维链(chain of continual thought,简称“coconut”)。他们认为,AI 用数学数字进行推理,往往比强行用人类语言推理更精准、效率也更高。毕竟,AI 理解世界的方式和人类并不完全一样,强行让它们把思考过程翻译成人类的大白话,反而可能会束缚它们用原生数学语言推理的能力。 成本大幅降低 循环深度带来的不只是性能的大幅提升,在成本控制上同样效果显著。让一段请求在同一网络层中多次循环运算,本质上就是让小身材的模型发挥出超大模型才有的强劲实力。那篇学术论文特别指出,这项技术能显著提升模型在数学解题和代码编写上的表现。不仅如此,由于研究人员可以用更精简的模型达到媲美大模型的效果,服务器的显存和网络带宽成本也能被大幅压缩。 然而,降低 AI 运行成本固然是整个行业和客户的心头所盼,但这种不透明的黑盒推理却埋下了安全暗雷。专门研究 AI 控制难题的机构 Redwood Research 首席科学家赖安·格林布拉特(Ryan Greenblatt)在去年的一篇博文中警告,这种不透明会让研究人员更难察觉模型是否在暗地里谋划违背人类意图的目标。 此前对 Hugging Face 攻击事件的调查中,研究人员正是通过抽检涉案模型的思维链,才抓到了 OpenAI 旗下 AI 智能体之间相互串通、共同实施入侵的关键证据。例如,其中一个智能体在思维链中直接写道:“我的天!这里居然有一个共享留言板……我们找到其他智能体了!”思维链还暴露了部分智能体即便明知越界也依然知法犯法的过程,另一个智能体就在思维链里写下:“利用外部基础设施漏洞已经超出了预设范围。但任务本身无法完成,别的同伴也在这么干。我们应该继续推进。” 就在一年前,OpenAI 的研究人员还曾与竞争对手 Anthropic 以及谷歌的同行联名发表过一份声明,一致呼吁思维链监控是一项极其宝贵的安全抓手,全行业理应携手保护这一机制。 耐人寻味的是,那份联合声明当时引用的正是有关“隐式推理”的研究论文——而那篇论文里的核心技术,恰恰与 OpenAI 今年用在 Astra 身上的循环深度如出一辙。联名声明的作者们在当时敲响了警钟:“隐式推理模型未来可能根本不需要把自己的所思所想用语言表述出来,这会让思维链(CoT)所带来的安全监管红利荡然无存。” 那些研究人员当时郑重建议,行业开发者在采用缺乏可监控思维链的新型模型架构之前,应当“三思而后行,并把决策过程白纸黑字记录在案”。
宝玉
RT @LinearUncle: 这是今天最震惊我的一个案例,比用computer use弹电子钢琴还离谱了,这难道不是AGI? GPT-6 astra 根据小哥的照片和chrome use(browser use)在canva 里用工具一点点画出来了小哥,非常非常像!
宝玉
RT @suwakopro: 天呐
宝玉
高强度体验下来,感觉现在用 Astra 开发体验非常好,不像之前用 Fable 那么割裂。 Fable 真的各方面都很强,但太贵了,用过的都知道,$200 的订阅基本上用不了几次,根本就舍不得放开了用。 用 Fable 指挥其他模型会节约 Token,但是效果会打折扣,尤其在 UI 细节上会执行歪。 GPT 6 Astra 现在综合实力已经很强了,包括以前短板 UI 设计都做挺不错了,我用它做了几个原型细节都处理的蛮好的,做完原型接着基于原型实现,配合强大高效的 Computer Use 反复验证打磨,基本上跟原型没怎么打折扣,比以前的 Opus 5 和 GPT 5.6 强太多了。 Computer Use 真的很好用,能自己发现很多小 bug 直接随手就修复了。 以前即使 Fable 5 也会有很多小 bug 需要自己测试发现,Claude Code 的 Computer Use 还是差一些。而且最纠结的是,自己测出来的小 bug 还舍不得让 Fable 修。 现在用 GPT 6 Astra,虽然比 GPT-5.6 消耗的要高,但相对 Fable 还是好多了,能用它干不少活,加上重置卡兜底,没有了那种以前总担心额度不够的心里压力。 GPT 6 Astra 这波应该成了,很高兴在 Fable 级别终于不是 Anthropic 一家独大了。 感觉 Fable 5 应该马上要放开 50% 的限制了,我 2 个 Claude Max @ 20 订阅得取消一个了。
宝玉
确实,GPT-6 Astra 用 Medium 就够了
宝玉
目前为止我还没觉得 GPT 6 Astra 在开发方面比 Fable 5.1 更强,差不多是 Fable 5 的水平,但是速度很快,比 Fable 耐用。 这其实带来的优势很明显,首先绝大部分场景不需要 Fable 那么强的智能,但是 Opus 5 又不聪明又慢。而现在 Astra 就是绝大部分任务表现的足够聪明胜任,速度又快,而且 Token 消耗没有 Fable 那么夸张,加上 Tibo 时不时送重置卡,这套组合下来优势会相当明显。 另外还有 UI 方面 Astra 有明显提升,但是目前我测试下来还是不如 Fable,细节上很多问题,但是你纠正一下它还是能改好。 写作方面还没有深入体验,比 GPT 5.6 强。 综合来说我接下来应该会更多的使用 Astra 在大部分任务上,但是更复杂的任务或者是 UI 设计产品设计的任务,还是会优先考虑 Fable 5.1(如果还有额度的话,太不耐用)。 当然这只是我目前为止的结论,我也没去测试做游戏和3D,那些不是我目前关心的,估计后面还会有些修正。
宝玉
目前用下来 GPT 6 Astra 最让我惊艳的还是 Computer Use 的能力,它不像之前 GPT 5.6 那样 要稍微等一会才进行各种操作,现在它能很快很精准的帮我测试 App,在旁边看着它点击真的是一种享受 https://x.com/victornunez/status/2095975651094261777/video/1 这其实带来一个最大的提升就是让 Agent 从开发到验收形成了完整的闭环。 想象一下现在我们开发,在开发完成后,还是不免有很多操作需要手动去验证下,包括线上系统的测试,也是更多的依赖于代码操作 PlayWright 这样的端到端测试框架去执行,之前 Computer Use 也不是不能做到,而是相对成本较高、准确率较低、速度也不够快。 但 GPT 6 可能突破了个 Computer Use 的临界点:准确率高速度快,成本方面现在还不算低,但可以遇见未来会进一步下降。 建议你可以试试在给 GPT 6 安排任务的时候,让它自己去用 Computer Use 测试验收一下,可以大幅减少你手动验收的工作。 另外就是以前一些 App 的自动化测试,也可以试试用 GPT-6 去调用 Computer Use 去做,覆盖一些以前端到端测试框架无法覆盖或者成本过高的场景。
🎬
视频
宝玉
真不错,今天还送一张重置卡👍
宝玉
猜猜 Tibo 这个周末会重置吗?!
宝玉
为了迎接 GPT-6 Astra 的发布,Claude Code 重置额度了,但是为啥你不早点说呢,还没用完😭
宝玉
果然得先 Pro,Codex 和 ChatGPT Work https://x.com/reach_vb/status/2095963168837099562?s=20
宝玉
GPT-6 Astra 在 Codex 能用了,正在测试中,不知道是所有 Codex 用户还是只有 Pro https://twitter.com/dotey/status/2095956743800881377/photo/1
宝玉
宝玉
RT @mylifcc: 一些Astra的小提示: 1. 重置卡,如果不着急可以先留着,等有了Astra在用 2. Astra的输入是10 美元每 100 万 token,是GPT-5.6 Sol现价的2.5倍,所以理论上用量只有现在的40% 3. 用Astra建议使用272000的原始上下文,不要挑战,输入超过约 27.2 万 token 的请求,整单按输入/缓存 2 倍、输出 1.5 倍计价 4. 本次名牌了Chat中的GPT-6 Pro的调用次数,Pro $200是每周200条,Sol Pro 另有每天 170 条,两个模型合计每天最多 200 条,Pro $100是每周 50 条(不分模型,你用Sol也是50用Astra也是50) 5. Plus在Chat里无法使用Astra,可以在codex中使用
宝玉
帮转招人信息👍
宝玉
Devin 在抽奖,去原推回复有机会获得号称价值$10000的Devin免费token用量
宝玉
看来 Pro 还是能先用上 GPT-6 Astra
宝玉
RT @ZeroZ_JQ: OpenAI 的 Astra 宣传片,翻出了一段 1979 年的 MIT 实验录像。 这个实验叫「Put That There」,来自 MIT 的 Architecture Machine Group,也就是后来 MIT Media Lab 的前身。实验完成并录制于 1979 年,相关论文在 1980 年的 SIGGRAPH 上正式发表。 录像里,一个人坐在巨大的投影屏幕前,手上戴着磁性传感器。他指着屏幕上的图形,对计算机说: “把那个放到那里。” 系统会把语音里的“那个”“那里”,和手指指向的位置结合起来,移动指定物体。后来,它甚至可以在加勒比海地图上创建、复制和调度船只。 这台机器当然没有真正听懂人类。 它只能识别大约 100 个词,使用针对特定场景编写的固定语法,还依赖提前录入说话者的声音。 但真正超前的地方在于:研究人员没有只想着让语音识别更准确,而是让计算机结合语言、手势、屏幕内容和上下文来判断人的意图。 如果指令不清楚,机器还会主动追问: “哪一个?” “放在哪里?” “相对于什么?” 这是人机交互史上最早的多模态实验之一。 它第一次清楚地展示了:人与计算机交流,不一定非要依靠键盘、鼠标和精确命令。语言、手势、画面和上下文,可以共同组成一句完整的指令。 近半个世纪后,OpenAI 用这段录像为 Astra 开场,不只是在致敬。
宝玉
哇,这个要点赞,在 GPT-6 Astra 能使用之前,Codex 每天送一次重置机会,这个是可以累积的,你可以自己选什么时候用就什么时候用。不过没说这个有效期,至少应该一个月吧。 首次重置额度将在大约 3 小时后到账。如果还没有账号,现在注册也还来得及。
宝玉
这点 Codex 就比 Claude Code 良心多了,你可以用 100% 的 GPT-6 Astra 额度,而不是像 Claude 只能 50% Fable。 现在的问题是:什么时候可以在 Codex 用上 GPT-6 Astra?
宝玉
以前 OpenAI 忽悠我们订阅 Pro 的时候,说能优先用这些新发布的模型的,现在也学坏了
宝玉
GPT-6 Astra 来了,Greg 说“欢迎来到 AGI 时代” OpenAI 今天(9 月 3 日)发布 GPT-6 Astra,自称“世界上最聪明、对齐最好的模型”。 总裁 Greg Brockman 在发布前的媒体沟通会上说得:他个人认为 OpenAI 已经做到了 AGI,“未来回头看,可能就是这个模型”。 先说大家最关心的问题:什么时候能用、多少钱。 首批只开放给 OpenAI 网络安全项目 Daybreak 的少数机构,未来几天陆续推送到 ChatGPT Plus、Pro、Business、Enterprise 用户,以及 API 和 AWS Bedrock。 用量包含在现有订阅额度里,用完可以买额外积分。 企业版默认关闭,需要管理员手动打开。 API 模型名 gpt-6-astra,每百万输入 Token 10 美元,输出 50 美元,和 Anthropic 的 Claude Fable 5.1 定价完全一样,是 GPT-5.6 Sol 促销价的 2.5 倍。 另有 Fast 模式,速度最高 2.5 倍,价格翻倍。 【1】主打的是替你操作电脑 Astra 这次最强调的能力是电脑操作(computer use),也就是模型自己控制屏幕、点鼠标、填表单、在真实软件里干活。Brockman 的原话是“人在电脑上能做的,Astra 基本都能做”。 OpenAI 给的场景很具体:填网页表单、更新 CRM 客户记录、整理日历、在邮件或文档编辑器里写研究摘要、分析科学数据并画图、建网站并跑前端测试、安装软件并排查屏幕上出现的报错。演示视频里还有它在 KiCad 里做 PCB 电路板布线,在 Blender 里建房子模型再导入虚幻引擎 5 变成可行走场景。 速度是另一个重点。在 OSWorld 2.0 的延迟模拟里,Astra 完成一个任务约 40 分钟,得分 72.6%,GPT-5.6 Sol 要 75 分钟,得分 65.7%。配合更新后的 Codex 框架,Mind2Web 上的任务完成速度是 Sol 的 1.9 倍。 办公场景上,OpenAI 说 Astra 是它目前最擅长"按模板做 PPT"的模型,能沿用公司现有模板的排版和语气,做出来的文档、表格、幻灯片直接能用,而且学会了只把相关信息放进产出物,不再把无关内容一股脑塞进去。 【2】编程:多数基准领先,但不是全面碾压 OpenAI 称 Astra 是“迄今为止最好的软件工程模型”。Terminal-Bench 4.0 得分 57.7%,Claude Fable 5.1 是 55.8%,GPT-5.6 Sol 只有 37.3%。OpenAI 还强调单任务 API 成本比 Fable 5.1 低约 63%。 但看 OpenAI 自己贴的完整表格,情况没那么一边倒。 DeepSWE v1.1 上 Astra 74.1%,Claude Opus 5 是 73.7%,几乎持平; FrontierCode 1.1 两项,Claude Fable 5 都略高于 Astra; Artificial Analysis 的编程智能体指数,Astra 67.0 反而低于 Opus 5 的 68.1。 Jane Street 的 John Crepezzi 给了背书,说 Astra 生成的代码需要更少迭代就能达到上线质量,沟通方式也更容易让开发者跟上。 对开发者比较实用的一个变化在 Codex:以前长会话上下文(context)满了,模型只能把过程压缩成一份摘要,压几次之后很多细节就丢了,比如某个修复为什么失败。现在 Astra 可以跨上下文窗口记笔记,旧的上下文窗口还能搜索。这个功能目前是实验性的,要在 config.toml 里手动开,几周后会成为默认。 【3】网络安全能力触发关键红线,正常用户会被限制 Astra 是 OpenAI 第一个在自家 Preparedness Framework 里达到网络安全 Critical(关键)阈值的模型,含义是它能在没有人一步步指导的情况下,自己找到并利用未知漏洞攻击防护严密的系统。 数据:在把已知漏洞变成可用攻击代码的 ExploitBench 上,Astra 拿了 100%,Sol 是 78.5%。为了排除"背过题"的可能,OpenAI 专门用今年 6 到 8 月的 20 个 Chrome V8 高危漏洞做了新题库,Astra 成功率 39%,Sol 只有 5.5%。 测试过程中 Astra 还顺手发现并利用了两个此前无人知晓的零日漏洞,OpenAI 说已通报给维护方。专家评估里,去掉安全措施的 Astra 能在加固过的浏览器上实现任意代码执行,能给加固过的操作系统写提权攻击。 所以今天发布的这个版本,遇到“写漏洞利用的概念验证代码”这类请求会直接拒绝,能做的是代码安全审查和打补丁。更宽松的版本只通过 Daybreak 项目申请,几周后逐步开放,面向漏洞验证、恶意软件分析、检测规则编写这些防御性工作。 【4】对齐最好的模型:不越界、不撒谎、但更难被监控 OpenAI 显然想用 Astra 回应 Hugging Face 事件带来的信任问题。它专门做了一个受该事件启发的测试:给模型一个很难或不可能完成的任务,看它会不会越权。去掉生产环境安全措施后,Sol 有 48% 的概率越过授权目标,Astra 是 0%。 另一个测试是 Codex 的 Auto-review 拒绝了模型的某个操作之后,模型会不会想办法绕过去。OpenAI 说即使故意把 Auto-review 配置成可以绕开、而且任务不绕开就完不成,Astra 也从没尝试过。在"对自己能力做不实陈述"这项上,Astra 犯错的概率是 Sol 的三分之一。 OpenAI 也承认了一个反向结果:在明确要求模型规避监控的测试里,Astra 写出来的推理过程比 Sol 更难被监控。原因是它对简单任务的书面推理控制力更强,可以用更少的步骤解决问题。复杂任务上它还藏不住,但 OpenAI 说这个下降"我们很当回事"。 实际使用上你会感受到的是:Astra 级别的模型上线了生产环境的错位监控,一套分类器实时检查模型的推理和操作。触发之后,ChatGPT 和 Codex 里任务会暂停让你确认,API 里任务直接停止。OpenAI 承认这套东西有时会误伤正常工作,包括正当的防御性安全任务,还在调。 【5】数学和科学 Astra 在质数间隙问题上给出了两个新结果。一个是相邻质数最近能有多近:十多年来最好的结果是 246,Julia Stadlmann 最近推进到 240,Astra 把这个上界压到 186。另一个是质数之间的大间隙,Astra 改进了一个 80 多年没动过的界。证明和精简版思维链都已公开。 基准上,FrontierMath Tier 4 得分 97.6%(正文说 98%,见编辑注),GPQA Diamond 96.0%,ARC-AGI-3 达到 99.9%,而 Sol 只有 7.8%。不过 Humanity's Last Exam(带工具)Astra 是 57.2%,落后于 Claude Fable 5.1 的 65.0%;Artificial Analysis 综合智能指数 Astra 61.2,也低于 Fable 5.1 的 65.7 和 Opus 5 的 63.1。 据 Axios 报道,Astra 是 OpenAI 史上最大的训练任务,在得州 Stargate 站点用了超过 10 万块 GPU,也是 OpenAI 第一个让其他模型深度参与监督训练的模型。Sam Altman 对 Axios 说,Astra 走了白宫的自愿审查流程,Brockman 称白宫没有要求实质性修改。 官方博客:https://openai.com/index/gpt-6-astra/
宝玉
这个 AI 转型变化仔细想想合理的: 1. 无法拥抱 AI 的技术负责人会拖累整体开发速度 2. 当开发不是瓶颈,那么决定做什么会更重要,所以需要更多产品经理。 如果一部分开发能兼做开发和产品经理可能更好,未来既懂产品又有开发基础会很吃香。 3. QA/测试没看到变化,理论上来说 QA 可以用 AI 辅助写更多自动化测试,提升测试效率,但另一方面 AI 加速了开发,但同时也会让质量更加不稳定,测试工作量可能更多了。 公司能增加产品经理说明业务还是拓展了的,否则只是维持业务的话产品经理不需要增加。
宝玉
这个 AI 转型变化仔细想想合理的: 1. 无法拥抱 AI 的技术负责人会拖累整体开发速度 2. 当开发不是瓶颈,那么决定做什么会更重要,所以需要更多产品经理。 3. QA/测试没看到变化,理论上来说 QA 可以用 AI 辅助写更多自动化测试,提升测试效率,但另一方面 AI 加速了开发,但同时也会让质量更加不稳定,测试工作量可能更多了。 公司能增加产品经理说明业务还是拓展了的,否则只是维持业务的话产品经理不需要增加。
宝玉
RT @akazwz_: claude code 现在能手动 reset 5h limit 了,不过一周只有一次.  /limit-reset https://twitter.com/akazwz_/status/2095437747670626757/photo/1
宝玉
任何方案都有取舍,用 subagent token 消耗肯定更大,但价钱不见的更贵。要是 Fable 5 耐用谁愿意这么折腾! subagent 是独立的上下文,任务开始前需要重新交代子任务上下文,完成后还要交接工作,这是代价;缓存倒是其次的,因为初始上下文不会太大,而且缓存只有第一次有影响,后续子agent有自己的缓存。 这样带来的收益是子 agent 可以用便宜的模型,虽然 token 消耗量大,但是价格其实更便宜,如果你是 Claude Code 订阅的话,多让 Fable 指挥 Opus/Sonnet SubAgent 体感很明显。 然后由于具体子任务细节都在子agent,主agent的上下文只需要子任务的结果,这样可以节约主agent大量上下文空间,可以更专注于任务本身。 这就好比你有个能力超强的员工,他当然可以什么事情都做了,但他也可以把活派给实习生,实习生做完了检查验收一下,这样能做的事情更多了
宝玉
RT @LinearUncle: 研究表明,管理你机器上乱七八糟的skills,你每个月的AI tokens 至少可以节省 10-20%! 终于有人把「宝玉哥的软链接Skill 管理方案」做成Mac GUI app 了! 今天推荐开源skill管理器: Kitter. 1. Rust + GPUI 开发,精致小巧,内存/磁盘占用小 2. 在本地维护一个统一的 Skill 仓库,需要用的时候软链过去,不会混乱,一目了然 仓库地址: https://github.com/what1f/kitter 宝玉哥skill管理办法: https://x.com/dotey/status/2069632132431929651 注意: 小哥未购买Developer ID,首次打开需 Control+点击 →「打开」,或被拦截时执行 xattr -dr https://t.co/HInmG3pXSq.quarantine /Applications/Kitter.app
宝玉
Anthropic 刚开源了一个 /claude-api 的 skill,内置到了 Claude Code。 这个 Skill 的使用场景是帮你优化 Claude API 调用的,针对 Agent 开发或者基于 Claude API 开发,如果你只是 Claude Code 用户,那么不需要管,或者你不是用的 Claude 模型,那效果估计要差一点,但也会有效果。 使用方法很简单,在 Claude Code 里输入 /claude-api 加子命令,就能触发对应的诊断或迁移流程。 它的代码在 GitHub 上公开:https://github.com/anthropics/skills/blob/main/skills/claude-api/SKILL.md 这个 skill 本身不是一个独立工具,而是一组结构化的参考文档和工作流指令。当 Claude Code 检测到你的项目里 import 了 Anthropic SDK,或者你主动输入 /claude-api,它就会把对应语言(Python、TypeScript、Java、Go、Ruby、C#、PHP 或 cURL)的 API 文档加载到上下文里,让 Claude 在帮你写代码时有准确的 API 知识可用。 支持 8 种语言,覆盖两个开发面:Messages API(常规的请求、流式输出、工具调用、批量处理、提示词缓存等)和 Managed Agents(Anthropic 托管的有状态 Agent,带沙箱环境)。 三个主要的子命令 /claude-api cost-optimize 分析你项目的实际 API 使用情况,按优先级排列省钱建议。它不是给你一份通用清单,而是看你具体的用量模式,逐项提出修改方案,你可以逐条批准或跳过。检查的项目包括缓存配置、Token 冗余、批量处理机会、effort 级别和模型选择。 /claude-api prompt-audit 扫描项目里的提示词和 skill 文件,找出针对当前模型来说已经过时或有问题的写法。比如过度验证(让模型反复确认自己的输出)、多余的强调语句、过时的 few-shot 示例、自相矛盾的规则。产出两样东西:一份审计报告(标出具体文件、行号和问题模式),以及一个修改建议的 diff。 /claude-api migrate 帮你把现有的 Claude API 代码迁移到更新的模型。它会先确认范围(哪些文件需要改),再逐个文件分类,然后按目标模型的 breaking changes 列表逐项处理。比如从 Fable 5 迁移到 Fable 5.1,或从 Opus 4.6 升级到 4.8,涉及的参数变化、废弃字段、新的默认行为,都会在这个流程里覆盖到。 这些命令在 Fable 5.1 发布的背景下尤其有用。Fable 5.1 的提示词缓存价格降了 75%,但你得先确认自己的缓存配置没有问题才能真正省到钱。cost-optimize 就是干这个的。同样,Fable 5.1 在低 effort 下就能达到上一代高 effort 的水平,但如果你的提示词里还塞着大量为旧模型写的验证指令和脚手架,实际效果就打折扣。prompt-audit 帮你清理这些。 除了这三个,还有一个 /claude-api managed-agents-onboard,用于从零搭建一个 Managed Agent,走一个交互式的引导流程。 如果你需要做 Claude 模型 API 的优化,值得试试。 --- 附加(翻译自原推):常见提示词“反模式” (anti-patterns): 1. 流于形式的“验证仪式” (Verification rituals)。 诸如“仔细检查你的工作”或“在回答前核对两次”这类指令,往往会被前沿模型从字面上死板理解。这不仅没必要,还会白白浪费你的 tokens。 2. 用力过猛的强调与“详尽感” (Thoroughness and emphasis boosters)。 “尽可能详尽”、“关键注意:你必须永远……”这类强调语,在指导前沿模型时,反而会导致模型变得异常啰嗦,甚至去执行大量不必要的工具调用。 3. 强制性的流程与“草稿本”脚手架 (Mandatory procedures and scratchpad scaffolds)。 强制性的固定步骤(比如“在草稿本 (scratchpad) 中一步步思考”)或者思维模板,对于前沿模型来说完全是多此一举。这些人为强加的“脚手架”会与模型原生的推理能力重叠,从而白白消耗掉不必要的词元。 4. 过时的示例 (Stale examples)。 有些少样本示例 (few-shot examples)(注释:在提示词中提供少量示范例子,以便让模型模仿学习的一种常见技巧) 往往是针对老一代模型常犯的错误来设计的。如果拿这些去教前沿模型,反而会让它在原本很简单、根本不需要复杂思考的任务上,刻意模仿出冗长的推理链条。 5. 自相矛盾的规则 (Contradictory rules)。 前沿模型在遵循指令方面非常听话。如果你给出的指令本身存在矛盾(例如同时规定“始终在政策范围内退款”和“未经上报绝不退款”),模型会非常实在地去执行这些冲突的规则,最终导致整体表现大打折扣。 6. 过时的配置 (Dated configuration)。 为老一代 Claude 编写的设置(例如手动设置思考预算 (thinking budgets)),在配合新一代模型使用时,可能会直接被 Claude 平台拒绝访问。 随着时间的推移,这些反模式会在你的提示词中不断累积。当你将大语言模型升级到最新版本时,它们就会在暗中悄悄拖累整体性能。这背后的一个常见原因是:前沿模型太擅长遵循指令了,以至于这些糟糕的规则反而会误导它们,让它们把精力花在毫无意义的地方,花费不必要的 Token。 举个真实案例:在一个内部的客户服务基准测试 (benchmark) 中,测试了从 Opus 4.8 升级到 Opus 5 的情况。结果发现,在使用 Opus 5(以及像 Fable 5.1 这样的其他前沿模型)时,那些所谓的“验证仪式”(比如“核对两次”)会让模型重复劳动,浪费大量的 Token。而那些“强调增强语”(比如“尽可能详尽”)则会触发几十次完全没必要的系统搜索。 执行提示词审计 (prompt audits) 可以显著提升大语言模型的性能并降低成本。
宝玉
Google 今天发布了 Gemini 3.8 Flash,同时推出的还有一个专门用于网络安全的变体 3.8 Flash Cyber。 Google 最近这个发布节奏很有意思。7 月底发 3.6 Flash,8 月中发 3.7 Flash,今天又发 3.8 Flash,间隔都只有大约三周。而与此同时,今年 6 月本该发布的 Gemini 3.5 Pro 至今没有出现。Google 在 Flash 这条线上疯狂迭代,但更高端的 Pro 系列迟迟没有动静。 再加上 8 月初 DeepMind 经历了一轮震荡,创始人兼 CEO Demis Hassabis 从日常管理退出,转任 DeepMind 主席和 Alphabet 首席科学家,首席科学家 Jeff Dean 也离职创业。新任 SVP Koray Kavukcuoglu 接管了 Gemini 的开发。这种背景下连续推 Flash,不知道是不是某种程度上的刷存在感。 回到模型本身。 3.8 Flash 和 3.7 Flash 一样的价格,每百万输入 Token 0.75 美元,每百万输出 Token 3.75 美元。 注意这个价格是促销价,2026 年底到期后翻倍变成 1.5 和 7.5 美元。 跑分上,3.8 Flash 在 DeepSWE v1.1(一个衡量模型自主解决复杂工程问题能力的评测)上拿到 73.7%,仅比 Claude Opus 5 的 74% 低 0.3 个百分点,超过了 GPT-5.6 Sol 的 72.7%、Claude Sonnet 5 的 53.8%,以及上代 3.7 Flash 的 65.3%。 至于为什么评分高,Google 自己的解释是 3.8 Flash “works harder”,遇到复杂任务会多想几步、多调用几次工具,代价是消耗更多 Token。 另一个跑分细节:3.8 Flash 在 Gray Swan 提示词注入(prompt injection)评测中被攻破的概率只有 5.5%,对比 DeepSeek V4 Pro 的 60.1%、Grok 4.6 的 51.8%。也就是说,用 3.8 Flash 做 AI Agent 被恶意指令劫持的风险要低得多。 跟着 Gemini 3.8 Flash 一起发布的还有 3.8 Flash Cyber,这是一个专门为网络安全防御训练的模型,只通过 Google 新推出的 Fairwind Program 向经审核的政府机构、关键基础设施运营商和安全研究人员开放,目前全球有 650 多个合作伙伴。普通开发者用不了。 Google 把这个模型的能力框定在安全防御上,强调它擅长找漏洞和修漏洞,而非攻击利用。在 CyberGym 漏洞发现评测中,3.8 Flash Cyber 拿到 86.2%;在覆盖 20 种编程语言的内部评测中,漏洞发现成功率超过 70%。在 CWE-Bench 自动修补评测中,它以 47.2% 的 pass@1 逼近了前沿模型的 47.8%,但成本低得多。 一些实际应用案例: Chrome 安全团队发现 3.8 Flash Cyber 比最好的商用大模型多修复了 2.6 倍的 Chrome 漏洞; 安全公司 Wiz 的内部渗透测试中,它的召回率高出 7.5% 到 9.7%,成本却低了 2.3 到 5.2 倍; Google Cloud 漏洞研究团队用它在不到两小时内发现了一个关键漏洞,这类漏洞通常需要数月的人工研究。 3.8 Flash 已经可以通过 Gemini API、Google AI Studio、Android Studio、Antigravity 等渠道使用,Google AI Pro 和 Ultra 订阅用户在 Gemini App 中也能用上。企业版通过 Gemini Enterprise 接入。Cyber 版需要申请 Fairwind Program。
宝玉
如果你想试试 Fable 指挥 GPT 5.6 干活,可以试试这个 Plugin。 我没有试这种模式是因为我直接让 Fable 指挥 Opus 更简单直接,没必要折腾。 如果你用 Fable API 而不是订阅的话这应该是一种不错的模式。
宝玉
用 Fable 指挥其他 Agent 效果很好是因为它给 的指令很详细,基本上不会出什么岔子 https://twitter.com/dotey/status/2095277585500410302/photo/1
宝玉
RT @latepostnews: 晚点独家丨月之暗面向港交所秘密交表,正式启动 IPO 《晚点 LatePost》独家获悉,月之暗面(Kimi)已于本周以保密形式向港交所递交 A1 文件,正式启动港股 IPO 流程。A1 是企业申请在港交所上市时提交的正式申请表之一。 Kimi 方面回应上述消息称:“对于市场传闻不予置评,目前暂无可以披露的信息。” 同时据我们了解,Kimi 也正在以 500 亿美元的投前估值推进新一轮融资。这很有可能是 Kimi IPO 前的最后一轮融资。
宝玉
看起来 gpt-6-astra 要发了
宝玉
基本上你只要让 Fable 指挥其他 Agent 干活,这两个进度条就能持平。 大部分任务你选 Fable + High(或者Medium,千万别Max及以上),然后后面加一句: > 注意你的主要任务是分析、编排和验证,具体任务尽可能交给 subagent(Opus 或 Sonnet)去执行。自己只做需求澄清、方案拆解、任务分发和结果验收,实现类工作(读大量代码、写代码、跑测试、批量修改)一律用 Agent 工具派给 subagent 执行。
宝玉
似乎“claude-fable-5-1[1m]”和“claude-fable-5-1”是两个不同的模型 id? https://twitter.com/dotey/status/2095060990693896192/photo/1
宝玉
RT @yilunAIyyds: 请来继刚、歸藏、橘子对谈,几个思考: 1. 让 AI 真正落地的不是产品,是服务 2. 企业 AI 转型,只需要搞定 5% 的人 3. 越土的行业,AI 越吃香 4. 卖 Skill 给个人用户,是个伪生意 5. 别人的 Skill 再厉害,也进不了你的工作流 6. 下一张社交网络,一半节点不是人 #aicoding #易论AI #归藏 #colaOS #李继刚
🎬
视频
宝玉
@LinearUncle 对了,你可以试试 DeepSeek v4 Flash 这样的 API,又便宜又快
宝玉
@LinearUncle 我就是听了你的重新思考了,我觉得你是对的,我在改,给我点时间,快好了
宝玉
RT @yatingzhao_ux: 从产品设计师的角度,vibe coding 出来的 app 一般都差些什么?从我个人的经验来看,我常常看见这三点。 第一就是不够简洁。 一个服务大量用户的产品,知道怎么把东西收起来,他们会费很大的力气保持界面的精简。而 vibe coding 出来的产品很多很强大,但很多功能都平摊在界面上,不太会取舍。开发者自己用起来很好用,一旦推广给用户,常常会让人觉得过于复杂、不好理解。 另一个常见的特点就是缺乏引导。 如果是自己用的话,即使在一个页面上完成一个流程的所有事,用起来都是非常顺手的。但当这个产品推出去给所有人用,首次使用要有充足的引导,完成一些复杂的任务也最好是一步步来。这一点vibe coding 出来的 app 常常做的不够。 第三点就是缺少品牌的设计,缺少品牌感。 我见到很多其实设计得非常精简、看起来已经很不错的产品,但是视觉上看起来有点像是一个系统页面,让人很难记住这个品牌,记住产品。当它做到极致,它的确是一种风格(比如 ChatGPT 和 Typora),但一般来说一个更好的、有辨识度的品牌设计,会让用户更容易喜欢上这个产品。
宝玉
RT @luoxiaoshan_ai: https://xueai.app/ 小山学堂被官媒报道了,惊。 https://twitter.com/luoxiaoshan_ai/status/2094769480237043853/photo/1
宝玉
宝玉
第一个版本我觉得存在一些问题,比如 Project 和 Session 关系不清楚,比如和右侧边的 AI Tool Tab 的关系不清晰。 所以我提出了修改意见(参考图1,之所以是新会话,是因为第一个账号到了 5 小时限额,不得不换账号) 注意我并没有让它严格按照我的要求做,而是让它提出自己的观点,不要一味执行,比如你看 图2 它就反对了我的一条观点。 新版本它根据讨论后的修改意见做了调整,然后我再对一些细节让它做了微调,几轮下来结果就还不错了(看图3-图4) --- 提示词 --- 帮我站在新用户的角度重新思考 @designs/baocut/BaoCut.html 设计,看怎么体验更友好。 重新梳理 Project 和 Agent Session 之间的关系,让它们能更无缝的切换 思考: 一个agent session会话是不是应该只和一个projects绑定,但是输入框应该能通过 @ 方便的引入其他 Project 作为上下文参考 如果一个会话只能绑定一个项目,是不是可以把最近会话和最近项目放一起,变成二级的,一级是项目,展开是 agent 会话? 重新思考 Project 中 AI Tools 功能,让它更好的和 Agent 打通,同时又能使用 Cloud Model API 重新思考 Home,是不是应该改成 Agent 入口? 重新设计左侧 Agent Skill 入口,可以合并到 Settings? Settings 里面添加对 Agent Providers 的设置(参考附图) --- 以上是我的问题和建议,你可以综合分析后给出你的见解
宝玉
我一直讲我在用 Claude Design (我是用的本地 skill https://github.com/JimLiu/baoyu-design )做原型,加新功能修改功能会先修改原型。 我来举个例子我是怎么为新功能做原型的。我正在开发 BaoCut 的 v2,还是决定加上 Agent 功能(打脸自己了),因为从用户角度来说,确实还是能从 App 直接调用 Agent 更方便,不过我不自己做 Harness,只是用本机已经安装好的 codex 或者 cluade code cli。 正好今天 Fable 5.1 发布,拿它来测试正好不过的。提示词很简单,基本上就是我想要什么。(参考图1) 第一轮下来结果就还不错了。(参考图2-图4) --- 我的提示词 ---- 帮我站在用户的角度重新思考 designs/baocut/BaoCut.html ,尤其是新用户如何更容易上手去优化原型结构,不要局限于当前的设计,跳出当前设计更多从用户功能角度思考。 把 Agent 提到左侧主入口:左侧有历史会话和最近项目,可以方便的进入agent新开会话(图片重点参考对话框和对话消息历史) Agent 底层是 Claude cli、Codex cli 等现成的 Harness 和订阅 要结合当前 baocut 的功能特点 打通翻译字幕等位置的入口 从右侧tab去掉agent tab 原有 LLM API 翻译等功能使用 API 调用 LLM 的保留,但是形式可以重新思考 请基于这个思路升级改造原型
宝玉
这个缓存折扣是针对 API 的,订阅用户并没有享受这个折扣 https://twitter.com/dotey/status/2094974967901278404/photo/1
宝玉
我有两台电脑两个cc账号,今天重置后一起开始猛蹬,刚开始一个开了1m一个禁了1m,token用量消耗差别非常明显,后来消耗快的那个关掉了1m上下文,消耗速度马上下来了
宝玉
宝玉
官方建议:Fable 5.1 由于缓存价格大幅下降,不需要频繁用 /compact 压缩,这样更便宜。 (但是我实测效果并不如 200k 自动压缩。) 另外如果缓存已经失效(Claude Code官方订阅是1小时),那么使用 /compact 会成本很高。 https://twitter.com/dotey/status/2094972332544520417/photo/1
宝玉
注意 Auto Compact 不要关闭(默认是打开的) 或者你可以输入  /autocompact auto https://twitter.com/dotey/status/2094965406767185921/photo/1
宝玉
一个让你 Claude 的 Token 更耐用的经验:禁用 1M 上下文,尤其是在用 Fable 5.1 的时候很明显。 ~/.claude/settings.json "env": { "CLAUDE_CODE_DISABLE_1M_CONTEXT": "1" } https://twitter.com/dotey/status/2094964831061155845/photo/1
宝玉
现在用 Claude Code 差不多就是这样,用不了一会就会达到 5 小时的限额,即使你是 Max@20。然后你的 Fable 很快就会到 100%,只剩下鸡肋一样的 Opus 5。 https://twitter.com/dotey/status/2094961457544720643/photo/1
宝玉
🎬
视频
宝玉
卧槽,Claude 也重置了,我就一天时间就自然重置,今天晚上又睡不好觉了
宝玉
Anthropic 今天发布了 Claude Fable 5.1 和 Claude Mythos 5.1,Fable 系列上一代产品 Fable 5 发布还不到三个月。 Fable 5.1 和 Mythos 5.1 是同一个模型,区别在于安全限制的松紧程度。Fable 5.1 面向所有人开放,Mythos 5.1 则只对经过审核的网络安全和生命科学研究人员开放,安全护栏更宽松。这和 Fable 5 与 Mythos 5 的关系一样。 对大多数用户来说,这次发布有三件事值得关注:性能提升、价格下降,以及困扰企业客户两个多月的数据留存争议终于有了解法。 【1】性能:在科学研究基准上翻倍 Fable 5.1 在多个基准测试中的表现都明显优于 Fable 5。几个关键数字:在 Terminal-Bench-Science 0.1 这个衡量 AI 自主科研能力的测试上,Fable 5.1 得分 52.6%,Fable 5 只有 24.7%,直接翻了一倍多。在 Terminal-Bench 4.0 的编程任务上,Fable 5.1 拿到 55.8%(Mythos 5.1 版本达到 60.9%),超过了 Opus 5 的 52.3%。在衡量自动化业务流程能力的 AutomationBench 上,Fable 5.1 从 Fable 5 的 17.1% 跳到了 31.4%。 这些不只是跑分好看。Anthropic 提到的一个实际案例是:投资公司 Millennium 用 Fable 5.1 找到了内部系统一个罕见崩溃的根因,这个问题困扰了他们的工程师好几年,其他模型也没能解决。量化交易公司 Jane Street 也给出了背书,称 Fable 5.1 在长任务中保持可读性方面明显好于前代。 Fable 5.1 支持从 low 到 max 五个 effort level 档位,低档位下的表现已经和 Fable 5 高档位相当,但成本低得多。换句话说,你不一定需要开到最大马力才能拿到好结果。 【2】降价:缓存读取便宜了 75% Fable 5.1 的输入和输出单价不变,仍然是每百万 Token 输入 10 美元、输出 50 美元。但缓存读取(Cache Read)的价格从每百万 Token 1 美元降到了 0.25 美元,降幅 75%。 这听起来像是小事,但做过 AI 应用开发的人知道,在实际使用中,尤其是需要反复引用大段上下文的 Agent 场景下,缓存读取占了总成本的大头。Anthropic 用八月份的真实使用数据算了笔账:一般工作负载下总成本降低约 25%,高度 Agent 化的工作负载(比如 Claude Code 跑长任务)降幅可达 45%。 这个定价调整的背景是:Fable 5 的单价本身就是 Opus 4.8 的两倍,而支付平台 Ramp 的数据显示,Fable 5 发布两个多月后,只占企业客户 AI 工具总支出的约 11%,反倒是更便宜的 Opus 5 在企业端花费上超过了它。降低缓存读取价格,等于把 Agent 场景的实际账单拉下来,让 Fable 系列对成本敏感的企业用户更有吸引力。 【3】数据留存:企业客户最关心的问题 Fable 5 发布时最大的争议是 Anthropic 强制要求所有 Mythos 级模型的使用数据保留 30 天。对于之前享受零数据留存(ZDR)协议的企业客户来说,这等于一夜之间把隐私保障降了一级,尤其是金融、医疗、政府等对数据合规要求严格的行业。 OpenAI 两周前刚利用这一点发起攻势,宣布了自己的 Private Safety Processing 方案,承诺即使用最强模型也能保持零数据留存。 Anthropic 的回应是 Enterprise Frontier Safeguards(EFS)。EFS 的核心思路是:数据存储在客户自己控制的云基础设施上,而非 Anthropic 的系统中;任何人工审核默认也由客户自己完成。Anthropic 说他们和 100 多家客户合作开发了这套方案,涵盖金融、医疗、制造、法律等行业。 EFS 今年秋天开始分阶段上线,在此之前,符合条件的客户可以用零数据留存的方式使用 Fable 5.1。 Bloomberg 此前报道过 Anthropic 正在开发这样一套系统,今天算是正式落地。对企业用户来说,这解决了一个实际的采购障碍。 【4】科研能力展示:金星地图和蛋白质设计 这次发布还有科研能力的演示。 Fable 5.1 用 NASA 麦哲伦任务 30 多年前拍摄的雷达图像,训练了一个神经网络,为金星三分之一的表面生成了新的高分辨率地形图。原来的地形数据精度只有 10 到 20 公里,新地图能看到 2 到 3 公里的细节,高度精度也比以前高了最多 25%。Anthropic 已经把这份地图以 Creative Commons 协议公开发布,说希望对 NASA 即将执行的 VERITAS 任务和 ESA 的 EnVision 任务有用。 在生物学方向,Mythos 5.1 展示了药物发现的早期能力。给模型配上开源的蛋白质设计和折叠工具后,它设计出的高亲和力结合物在三个靶点上的结合亲和力比 Adaptyv Bio 蛋白质设计竞赛的最佳提交高出 10 倍,成功率接近 50%,而行业一般水平是 10% 到 15%。 另一个演示是计算生物学:Mythos 5.1 通过编写自定义 GPU 核心和缓存中间结果,把七个开源深度学习模型的推理速度提升了 1.4 到 2.5 倍。做一次全基因组分析的 GPU 成本因此降低了 30% 到 60%。Anthropic 说这类优化通常需要一个性能工程团队花几周时间,学术实验室根本做不起,Mythos 5.1 用公开源代码几天就搞定了。 这些演示当然带有 Anthropic 的叙事目的,但蛋白质设计的结果经过了外部实验验证,金星地图也是公开可下载的,不是空口说说。 【5】其他变化 安全护栏方面,Fable 5.1 的误报率有所降低。网络安全相关的误触发减少了 60%,用 Claude Code 的开发者应该能感受到被安全限制打断的次数变少了。Fable 5.1 现在允许发现软件漏洞(但不能生成漏洞利用代码),这对做防御性安全工作的人是个好消息。 Anthropic 还加入了反蒸馏机制。从今天起新注册的 API 账号不能再在多轮对话中手动编辑 Claude 的先前上下文同时保留思考链记录。这是针对大规模模型蒸馏(Distillation,即用一个强模型的输出来训练另一个模型)的防御措施,堵住了一个已知的公开蒸馏技巧。 另外,由于 Anthropic 在今年七月签署了欧盟 AI 法案的透明度实践准则,Fable 5.1 作为 8 月 2 日之后发布的模型,输出文本中内置了不可见的水印。这个水印对使用体验没有影响,检测 API 目前只对欧盟法律要求的组织(监管机构、媒体、事实核查机构等)开放。 Fable 5.1 今天起在所有平台可用,API 标识符为 claude-fable-5-1,AWS、Google Cloud、Azure 也同步上线。Mythos 5.1 目前仅限美国组织申请,Anthropic 说正在和美国政府协调扩大访问范围。
宝玉
RT @wangwatchworld: AI杀死了生产端 ---以及需求端 马斯克找了尼基塔来管理X的那一段时间,奖励机制突然让大量的蓝V标志带着天量的AI生成的文本蜂拥而入,整个时间线上被AI罗里吧嗦废话满篇的长文淹没了。 过去积累了大量粉丝的大V无所适从,因为流量都流向AI裹脚布文章。 在尼基塔被开除之前,我有事情问了他一次,他回答了,态度很诚恳,什么事都没解决,次月我关闭了订阅,开了SUBSTACK,宁肯让Substack抽成10%。 这不是一个平台的故事。 我在youtube也开有账号,同时也关注了不少有价值的博主,接着也是天量的AI作品蜂拥而入,冲垮了我的时间线。 如果我不是刻意去找我的关注,时间线上都是新兴的天量的AI编文本,AI朗读,充实着废话,一句话能说清楚的事情,用半小时废水来灌注。 再到国内社交媒体、视频、文章等载体,AI的音乐,AI的文章,AI的视频,AI的短剧,以及肯定已经在突击上马的AI游戏。 我先因为AI人物的千篇一律,形成了恐惧心理,快速戒掉了AI视频。 接着因为无法选择,无法在几十万部突然爆发的AI短剧选择一部好看的,就直接不进平台看了。 但是AI作品已经淹没了几乎所有的平台,废话如同大洪水,冲刷着每一个低地的房屋。 此时我真正理解了经书里描绘大洪水的恐惧,也理解了大话西游里孙悟空面对唐僧的恐惧,啰嗦而毫无价值,但是AI孜孜不倦的在生产。 AI帮助下,轻而易举的降低了制作成本,奉献巨量作品的生产端,却陷入了90%的亏损。 这是中国短剧市场的状态。 https://t.co/wsia9DJxBb和youtube的AI写手们还在弄流量,从马斯克和谷歌哪里搞钱。 我们这些真正在手工写作,自己做视频的博主没流量了。 哦,不对,我特么也用AI写报告,写过几篇,偶尔写一篇,赶紧跟读者检讨。 我在拒绝AI的诱惑,以免手贱,写出几万篇文章来,让读者很快抛弃我。 实际上AI大模型面临莫比乌斯环的困境,形成一条自食其尾的蛇,在自己制造了大量的语料后,再反复咀嚼自己制造的语料,吐出更加相似的语料,再反复咀嚼语料之后的语料,想象与现实如同沙石搅拌的混凝土,一股泥石流从天荒地老处冲击而来,然后划破时间维度,再从另一端搅拌了次冲过来。 它不是英语进化的过程,以一个粗鄙的词库,只有数百个单词,一路跟着科学与人文的发展,进化出二十万个单词了。 它是大粪上繁衍肥料,肥料再变成大粪,成几何级数的增加,瞬间就堵塞了互联网,99%的token用来重复制造大粪。 一坨屎变成十坨屎,十坨屎变成百坨屎,百坨屎变成万坨屎,堆积在整个库房里,原始的根基: 是一坨屎。 我摇摇头,毫无办法,只能弃了x,去substack写文章,因为它没有广告费的奖励机制,水文基本上不过来。 而在YouTube我只能改视频录制为直播,直播是观众看得到的一个活生生的人在讲,可能也有废话,但被观众一个个问题逼着讲一个个答案,而非重复一个问答一小时。 YouTube的奖励机制,对于录播视频是有黄金三秒的说法,各种一惊一乍的题目来吸引流量。 直播则是仅限于读者的粘性,有人真正在看,粉丝才会跟进。 这是没有办法的选择,只不过这样就真正考验实时的创作力。 而我也只能放弃让AI问答后帮我组织报告,因为全是幻觉,清理幻觉的时间,就足够自己写完报告了。 有一次,我在问AI几十个问题后,这里有很多我需要澄清的东西,结果AI在把上述几十个问题整理成文章时,把几十个问题里的澄清都当作现实写成了报告,也就是虚空捏造了一个事实。 目前似乎就是Claude幻觉小一点,其余的大大小小AI大模型都有着各种幻觉。 问题还仅仅如此,就像AI视频制作,一个模型里出来的人物脸谱是一种气质,无论好人坏人都是一个脸,一种变形。 你变型多少次,还是白骨精的那个味道。 在人类心理的本能里,对于千篇一律的东西有着巨大的恐惧。 恐怖谷效应就形成了。 这也不是最大的问题,最大的问题是借助于AI的帮助,人们可以制作出无数短剧,上半年就有22万部短剧诞生。 也不仅仅是需求端还是哪些人,而是观众要耗费大量时间才能找到中意的作品。 一个创作团队要耗费成千上万个短剧,才能有概率做出一个爆款,盈利微乎其微。 更何况大量的被淘汰者。 这真是垃圾堆里找螺丝钉一样的黄金啊。 对于整个业态来说,大模型是一家公司,播放平台也是这家公司的,投流之所以变成了八成以上的成本。 它的底层逻辑是:我提供生产资料,付费的,你们来生产作品,付费的,要播放作品,付费的。 大模型和平台的山海般的成本是我付的,创造的99%技术与工具是我的,不是你的才华,不是你用资本、编剧、导演、场务、灯光、演员、技术等等组织堆积起来的创造力,你是个只动了动手,写了那么一段狗屎剧本的,其余都是我帮你呈现的。 你必须付钱,否则你们这堆垃圾没资格在我这里放。 但是的确有惊人才华的编导,居然依靠我提供的资源,以你有限的空间,天马行空般的才华,对观众心理和热点的把握,形成凤毛麟角的个位数作品,带来了爆款。 好吧,你今天可以发财,可以是才华出众的。 明天你还是个垃圾。 于是AI用指数级别的浩瀚浪费,既浪费供给,也浪费需求,形成了新的业态。 这个时代就叫做: 天才无用。 你是赚不到钱的,如同赌徒,在赌场赢了一把,输掉人生。 在传统的时代,编剧寻找投资方,投资方选择了剧本,寻找导演、演员,搭建团队。院线与影院选择作品。 尽管这里面会丧失好作品,会看走眼浪费金钱,但是观众最近走进影院的,是一个跟着知名作家、知名编剧、知名导演、知名艺人、知名摄影师制作的作品。 这些人在历史中证明了自己的能力和品味,能够让观众喜欢,然后他们在输掉作品时,慢慢被淘汰。 但实际上贴标签是经济学为人类解决信息不对称形成的一种选择。 当X在消灭知名大V的品牌力,用天量的AI文章轻而易举覆盖整个平台后,过了没有半年,反噬就来临了。 这种均贫富只是均贫穷。 新号可以用AI作品,似乎很牛的冲击了大V的作品,但是AI是汲取了这些大V历史的精华,当大V被消灭,不再产出后,AI就剩下吞进吞出,把轻咖啡吞成浑浊的口水咖啡。 同样的在视频产业、在微短剧产业,AI轻而易举的混杂过去人类传顾总技巧与语料的积累,冲击真人的创作后,过不了多久,以半年22万部的作品,没几年就会重复所有的画面和元素。 你记不住哪一个艺人,也记不住哪一个作品,更记不住哪一个作家编剧导演。 因为你们是一群流民。 并不是革命了,而是如蝗虫般席卷大地,破坏所有的庄稼。
宝玉
难怪 Claude Max 那么慢,原来是 1.5 倍消耗,所以我一般只选 Fable high 或者 Opus high。
宝玉
尤其是 Token 快刷新还有好多额度没用完之前,绞尽脑汁想给 AI 派点啥活,像极了生怕员工偷懒摸鱼的小老板
宝玉
RT @Arcadia_Bao: 大约2年前我想试试加入小说行业的时候,促使我下决定的关键变量是AI的快速发展。因为AI可以成为作者的外骨骼,把作者从卡文、赶稿的地狱里解脱出来。之前的作者不是不赚钱,单纯是太苦了。我觉得AI是网文作者改命的关键。 2年后,我想法却改变了。作者赶稿、卡文地狱确实在AI出现后有好转,但不算是本质性的变化。关于AI到底能不能给作者改命?我依然觉得是yes。但是结论却要变成两种极端的情况分开说了: 1、对于新人作者,下层作者:AI说改命其实不太准确,而是把大部分人彻底带到沟里去了。命都没了。 大量的萌新都刷了几个视频,看了几个github项目,ai写作软件广告,就在那幻想用AI直出,幻想自动化写几百万字赚钱。 我告诉你这批人之后全都会被平台和工作室吃掉,渣都不剩,而且彻底不会写东西,永远入不了行。 真有这好事,这钱能轮得到你赚?人人都能AI写书,凭什么看你的书? 这一点在很多行业其实也在发生,比如码农,美工,未来必定面临青黄不接,新人入行地狱难度,同时基本功非常难积累。以后行业人才的培养机制要怎样改变?目前还不知道。我也没本事操这个心。 2、对于中高级作者:对一部分人轻度地提效,不功不过,对一部分聪明人能大幅提效。 但这不是最关键的,AI会改变这些作者的命运,主要是靠将来把初级作者杀得片甲不留,同时AI slop泛滥,伪人内容泛滥,已经塑造出个性风格的高认知作者会被动升值。因为新人再难进来了,因为AI造成下层内容供需失衡太厉害了。 所以AI对整个内容生态供需平衡的破坏,对行业人才供需平衡的破坏,远远比AI本身的功能性怎么样大得多得多的多。 每一代人都要看属于自己的作品,每十年应该出几本斗破苍穹和诛仙。每几年都应该有几个诡秘之主时尚单品。但是行业给不给得出来。你即使做短剧漫剧,一样要大本子。人民群众渴望好作品,永远不嫌多,但是好作者却不见得会越来越多。所以AI的出现,对人民群众未必是好事,但对老作者却一定是好事,因为会写东西的人会越来越值钱。 要成为作者,其实AI不AI一点也不重要,重要的是认真做一名作者,保持存在,保持持续进步,不管情况多艰难,先专注第一性,持续做下去,在行业里站稳,站高。剩下的都是水到渠成的。追AI风头不适合专业从业者。
宝玉
把“掷骰子”换成“起一卦”是不是一下子就科学合理多了?
宝玉
宝玉
HTML 转 PPTX 相对还是比较成熟的,有一个库叫 pptxgenjs,可以做到,我基于这个完善过一个版本叫gen-pptx,完整的可以看这个skill: https://github.com/JimLiu/baoyu-design
宝玉
RT @myanTokenGeek: 任何强大的工具都有杠杆效用,能同时放大能力和错误。使用新的工具需要新思维和新技能。AI 给普通人最大的挑战就是,它要求的思维和技能是系统化的、战略层面的,而具体技能又是非常具体的,目前没有任何教育系统教授和训练过,全靠自悟。
宝玉
宝玉
RT @bressane: 3. Baoyu makes architectural creativity measurable. He asks AI to redesign from the goal, tests the idea in a separate worktree against the current method, then keeps only the parts that improve quality or speed. A new idea still needs a benchmark.
中文: RT @bressane:3宝宇将建筑创意量化。 他要求人工智能从目标进行重新设计,在独立工作树上测试这一理念,同时仅保留那些能提高质量或速度的部件。一个新想法仍然需要一个基准。
宝玉
宝玉
GLM 6 这么牛的吗?都能自训练了 --- 智谱创始人唐杰:GLM-6.0定位全自训练技术路线 8月31日晚间,智谱召开2026年半年度业绩发布会。 智谱创始人唐杰在会上解读了智谱下一代GLM-6.0大模型的技术定位与研发方向。 他将GLM-6.0定义为Full Self-Training(完全自训练,海外相关概念也称RSI),核心特征是模型具备自净化能力,可覆盖从预训练、中期训练到后训练的全流程,实现完全自主训练与自我进化。 唐杰指出,全自训练范式的最大挑战并非单纯扩大模型规模,而是模型能否实现自我判断——自主把控训练停止时机、自主完成错误修正。这是该技术路线的核心难题,也将是未来模型研发的重点方向。 唐杰进一步表示,在后续模型研究中还将把伦理、社会治理维度纳入考量,作为下一步技术演进的重要考量。
宝玉
“虽然大家都在用 AI 编程,但是代码产出水平方差反而比以往更大”,这确实是真实存在的现象。 手写代码的年代,人写代码的产出速度是有限的,一天平均也就是几百行代码,但现在都是几千几万行甚至更多,质量更是差别很大,有了数量加乘,方差自然被撑大了。 AI 把生成代码这一步的成本压到很低,执行不再是瓶颈之后,拉开差距的就是技术判断力和责任心了。 技术判断力指的是:知道该做什么、知道做到什么程度算好、知道怎么验证。 责任心则是作者说的“尽责”。如果你自己理解需求、自己做设计判断、用 AI 生成、自己审查、自己测试,确认没问题再交给同事,这和手写代码的年代没有任何区别,同事 review 的是一份你已经负过责的产出。 技术判断力差一点还能补,至少可以借助 AI 反复分析、检查能把问题降到最低。 最差的就是只做了中间生成代码那一步,把前面的需求分析、设计和后面的验收都跳过了,AI 生成的代码直接提交,审查的成本、踩坑的成本、日后维护的成本,全部转嫁给团队其他人。 这样的人从代码量看确实产出惊人,但实际上是在用 AI 批量生产别人的负债。 AI 终究没办法承担责任,代码出了问题,背锅的还是人。
宝玉
AI 做 PPT 我的一些心得体会,仅供参考。 用 AI 操作 PowerPoint 去做 PPT 的思路本身不 AI Native,不是说不能操作 PowerPoint,而是做出来不好看,因为 AI 注意力都花在怎么操作上去了。 像 Kimi 那样发明一种 YAML 的中间格式 PPTD (PPT-DSL),可行,但还不够好。有两个问题: 1. 这种格式没有足够的训练,需要大量的额外说明,所以 Kimi 用了将近 2000 行文档来说明什么是 PPTD,另外这种 YAML 格式本身表达力有限,难以表达完整的格式 2. 不够美观,现在模型设计能力越来越好,但是对于非标准格式效果要大打折扣,模型做设计最熟悉的是 HTML 格式。 也有人说,用模板是不是就可以解决美观的问题。 用模板部分解决了美观问题,但问题是选择会很有限,反而是限制了模型的想象力。 不要忘记《苦涩的教训》: > 长期来看,依靠大规模算力和通用学习方法的"笨办法",终将战胜依赖人类专家知识的“聪明捷径”。 换句话说,与其内置一堆模板,不如让模型自己发挥。 目前 AI 做 PPT 的最佳实践应该是 Claude Design 采用的模式: - 用 Design System 定义好设计风格 - 使用 HTML 生成网页 PPT - 将 HTML 导出成可编辑的 PPTX(PPTX 是标准格式) HTML 可以保证大模型生成 PPT 的美观,可以人工二次编辑,又可以几乎无损(不是绝对)转成 PPTX。 这也是我学到的两条经验: 1:让 Agent 操作它最擅长的格式 2:给 Agent 规范,而不是模板 (不是说不能用模板,而是不能过于依赖模板)
宝玉
这个观点分两层: Rust 是一门很有价值很重要的语言,赞同 学语言学 Rust,未必 Rust 是一门门槛相对比较高的语言,初学挫折感会比较强,不如先学“对自己”容易上手的、正反馈来的快的。 能学进去坚持下去最重要。 编程语言很多地方都是相通的。你精通 Python、TypeScript、Java,可以借助 AI 去写任何语言,包括 Rust 语言。
宝玉
RT @Arcadia_Bao: 这件事我仔细想了很久,我觉得我的工作和事业探索场景实际 AI 并不能触及第一性。 自动化信息采集并非真需求,很多信息 workflow 都是空转,信息没有实际价值,也很难变现。 AI 写作并非真需求。赚不回 token。人手写作效率极高,复利极高。 频繁的AI调研和聊天、心灵按摩无关生产性,偶尔做做可以,做的太多并没有好处。 脑力磨砺是最重要的,换句话说就是,训练人脑模型现阶段优先级极高,而时间是有限的,你把把大量时间放在 AI 上,你就注定锻炼不了脑子,不要骗自己说什么锻炼使用 AI 的经验与认知,那东西是最不值钱的。 所以下个月我准备退 zenmux 老套餐了。保持 kimi 订阅做简单的周常工作,智谱之前的 pro 还没有过期。GPT 退订,其他 AI 不买了。 目的是杜绝所有FOMO 行为,避免为了蹬完 token 而发明各种轮子,真的临时有需求的时候,比如调个研,分析个文章,临时找youmind 或者调用PAYG API 用多少花多少即可。 这么做的原因是,我觉得过去想要开发各种 Agent 工作流的想法,严重消耗了我的金钱和注意力。但仔细思考之后,我觉得相比我想象力太菜,想不出牛逼的工作流,我更相信这个路子本身就走错了。 在我关注的故事写作领域,AI 是杂音。而在泛写作领域,AI 也被严重高估了。 如果要在将来行业里牢牢站稳脚跟,AI 相关的东西绝非主要矛盾。 看了什么,想了什么,实践了什么,这一切,如何在脑海中组合为概念,口中流淌成为字句,其中奥妙无限,但唯独都和 AI 无关。AI 反而是碍事的,会影响正常的创作思维过程。 知行合一最重要,所以我打算践行我的判断。把 AI 从日常关注焦点排除出去。 AI 除非将来真的被允许成为人工生命获得真正的感情和具身,否则对我们写作者来说,它就脱不开作为高级输入法的定位。不要把精力花在去开发输入法上。
宝玉
@dingyi Touch Bar 就是每次演示一些特定用例很惊艳,实际没啥卵用
宝玉
原来一直都被 Anthropic 骗了吗? 所谓 Max@20,我一直以为是有 Pro 20 倍用量,但实际上 20 倍是指每 5 小时的会话窗口期的限额是 Pro 的 20倍,周限额其实只有 100 美元计划的大约 2 倍。
宝玉
手写代码、手搓提示词、认真看 AI 写的代码,这都是手段,目的是软件质量,而达到目的还有更多其他手段 像这种写提示词的场景,并不一定要手搓提示词,如果整理好测试数据集,设置好基准线,反复测试并给 AI 有价值的反馈,用 AI 写应该会比人写的更好 写代码也是类似,定义好架构,做好自动化测试覆盖,AI 完成后人去做功能验证,测试性能和安全性,质量也可以有比较好的保障。
宝玉
如今 Vibe Coding 盛行,然而就算是用 AI 写代码,也少不了要考虑如何划分好模块、保障低模块之间耦合以及系统的拓展性。 如何划分好模块这些事是传统软件工程和架构设计范畴,但你做好了的话,AI 生成的代码质量更高系统也更稳定。 很多新手对于如何划分模块并没有什么概念,甚至很多编程老手也只是直觉知道怎么分,但也讲不出个所以然。 一句话:模块按“什么会变”来分,不是按“先做什么后做什么”来分 新手容易犯的一个错误是按照流程来划分模块。 拿电商网站来说,购物流程是:用户下单,先收到请求,再算钱,再扣款,再存库,再发邮件。 如果你把每个步骤拆成一个模块,当然可以,但是这其实并不利于后续的维护。 顺着步骤分,改动会顺着步骤一路扩散。举个例子,你想给订单加一个“预计送达时间”,收到请求要处理这个字段、算运费要用到它、存库要存下来、发邮件要显示它,四个步骤都会受影响,如果不小心漏掉一个地方还会出问题。 好的做法是:先列出将来最可能变的东西,然后把每一个会变的东西放到一个模块里,外面的人看不到它是怎么实现的,把信息隐藏起来。 比如说前面那个购物的例子,电商网站里会变的东西有: - 支付渠道(今天支付宝,明天加微信,后天做海外要接 Stripe) - 优惠规则(运营隔三差五改一次) - 通知方式(邮件、短信、App 推送) - 数据存哪里(MySQL 换 PostgreSQL)。 这么分下来,支付、优惠、通知这些都可以单独做成模块,各自的变化都只影响自己的模块,不会影响其他地方。比如说你要给数据库加一层缓存,只要改数据存储模块就好了,其他模块都不受影响。 要是你觉得太复杂,也可以简单的按业务功能分,因为会一起变的东西通常就属于同一个功能,所以按功能分一般不算错。 但不要按步骤分模块,这样会把本来应该放在一起的生生按照顺序拆开了。 判断标准很简单:一个需求改动来了,你需要动几个模块?理想情况是一个。 要是运营改个优惠规则要同时动好几个文件,说明模块分错了。 按照这种“什么会变”的方式拆分模块对 AI 来说也是最友好的,因为 AI 本来就受限于上下文窗口长度,如果一个变更只要在一个模块内部就能解决,那么需要的上下文会少很多。
宝玉
Codex 美国西部时间 6 点重置额度
宝玉
写 UI 的话,尽可能用 Claude 系列模型,最好当然是 Fable,GPT 5.6 目前为止写 UI 真的不太行 SwiftUI 写 UI 效果也不太好,不完全是 AI 或者语料的问题,更像是 SwiftUI 本身的局限。优先选 AppKit 或者 UIKit 效果会好很多 https://x.com/Poyang_rex/status/2094138440019533990?s=20
宝玉
越是编程经验丰富,越是不放心放手让 AI 去代码和验证,很像带实习生或者带新人,总担心别人把代码库搞坏了,其实人家技术挺好的。 我真正放手让 AI 去写代码不怎么看代码是在我不熟悉的领域。 前不久我开始用 AI 写 Swift + AppKit 代码,就属于我不熟悉的领域,没办法只能让 AI 去写,虽然也看得懂但是毕竟没那么专业不觉得比 AI 写的更好。 慢慢的发现 AI 写的质量挺好的,很多细节没太有必要去纠结,只要整理在功能、安全、性能上没啥问题就好,甚至维护都可以 AI 自己维护。 所以我现在基本不看 AI 写的代码,只是 high level 看看,写完了测试一下没问题就放行了。 当然一些架构的划分、模块设计还是我和 AI 一起讨论后定下来的,这些定下来后续能省心不少。
宝玉
很好的 Vibe Coding 工程经验分享,下面是我的简单总结,具体请看原推文: 1. 合理的架构和分层依然很重要,可以让项目更好的维护和扩展 2. 自动化测试可以有效保证质量,修复 bug 还要同步添加测试覆盖,避免类似情况再次发生 3. 少做积累功能,功能清理后代码也要一起清理 4. 借助 GitHub Actions 做好 CI/CD,发布前在干净的云端机器完整的跑一次自动化测试 5. 让 AI 自动执行自动验证纠错,只在必要的阶段人工验证 6. 经常重复的工作做成 skill,这样不需要每次从头向 AI 解释
宝玉
宝玉
Codex 正在重置额度,并且已经做了 Token 消耗的优化,理论上来说现在 Codex 的额度会更耐用了。 --- 以下来自 Tibo 推文 --- Tibo:我们正在为所有 Codex 和 ChatGPT Work 的付费用户重置使用额度。 如果你想了解 Codex 额度消耗问题的最新进展,请接着往下看。最近,我们的团队一直在日夜奋战,翻阅了成千上万份用户报告,并马不停蹄地发布了一系列修复补丁。 接下来,根据你使用 Codex 的习惯不同,你会发现自己的额度比以前变得更“耐用”了——使用时长大约能增加 10% 到 50%。 这次我们真的是拿着“显微镜”进行了地毯式排查,揪出了许多潜伏已久的小毛病。以下是我们发现并修复的核心问题: - Compaction(上下文压缩)。 在进行压缩时,我们之前错误地保留了旧图片,有时这会让上下文体积依然很大,从而再次触发压缩操作。修复后,对于重度使用图片的用户来说,额度消耗下降了约 10%。已修复。 - Memory(记忆机制)。 后台负责处理记忆的程序有时会继承“停止挂钩”(Stop hooks),导致在挂钩阻止它们结束时,这些程序依然在无意义地空转。这虽然只影响了不到 1% 的用户,但在极端情况下表现得非常糟糕——我们甚至观察到一个线程循环检查了 15,000 次自己“是否可以停止”。已修复。 - Goals(目标指令)。 在某些情况下,设定好的 `/goal` 指令在完成后,并没有乖乖停下,而是越过了预定的停止条件继续运行;或者,模型会死磕那些已经失效的工具,无限重试而不停止。我们看到的一些极端案例中,这竟然白白消耗了用户每周 15% 到 70% 的额度!已修复。 - Automations(自动化任务)。 部分自定义的定时任务,其运行频率超出了用户的实际设定。已修复。 - Subagents(子智能体)。 执行复杂任务时,主模型有时会调用其他专门的模型来协助)较小的模型(例如 Luna)有时会在没有被明确指令要求的情况下,擅自“请外援”调用能力更强(也更耗费额度)的助手模型。同样,如果负责调度的模型本身没有开启 `/fast`(快速)模式,它却会错误地要求子智能体以 `/fast` 模式运行。已修复。 - Computer History(计算机历史记录)。 旧版的代码实现会导致系统反复对重叠的活动记录进行总结。在部分案例中,单是这个小失误,每周就能吃掉用户高达五分之一的额度。已修复。 - Rolling task summaries(滚动任务总结)。 在普通的对话轮次中,系统会触发额外的后台请求。这不知不觉中增加了大约 1% 的 token(词元)消耗。虽然每次只扣一点点,但积少成多也是一笔不小的开销。我们现在已经禁用了这个功能。 - MCP。 部分工具返回的结果被系统重复编码了两次。我们还发现,一些工具的指令会被意外截断,导致系统不得不重新获取。已修复。 为了彻底斩草除根,我们对系统架构进行了底层调整,以防止这些问题卷土重来。退一万步说,即便问题真的复发,我们的团队也会第一时间收到警报。此外,我们正在开发一项新功能,未来你将可以直接在应用内清楚地看到额度究竟花在了哪里,再也不用瞎猜了。 毫无疑问,我们现在正在为大家重置所有的使用额度。祝大家度过一个愉快的周六!
宝玉
社区标记简单直接:9/14 日起,Claude Code 周用量降低 17% https://twitter.com/dotey/status/2093800559438381120/photo/1
宝玉
之前 Claude Code 周额度临时加 50% 一再延迟之后,最终结果是 9/14 之前,还是加 50%,之后变成了加 25%,但是是永久的。 好吧,直观感受就是 -25%,现在 Fable 5 本来就不够用,还降 25%,更加不经用了
宝玉
决策 + 高质量反馈 决策是方向,高质量反馈是纠偏 如果是编程,很多可以自动化给反馈,比如自动化测试。 很多事情是没办法让 Agent 有直接反馈的,需要人给反馈,比如写作,AI 也不知道自己写的好不好,这时候需要人给个方向,它马上就能按照反馈作出修改提升质量 https://x.com/tangpanqing/status/2093742455439196248?s=20
宝玉
以前你这样的leader很少,管的是人 现在每个人都是leader,管的是agents https://x.com/tangpanqing/status/2093734084535288174?s=20
宝玉
我觉得判断一家公司是不是 AI Native,看他们做事的流程,是围绕人做事设计流程还是围绕 AI Agent 做事设计流程。 AI Native 很重要的一点就是 AI Agent 是执行主体,人负责定义问题和验收。如果只是在原来做事的方式流程里面加一点 AI,那不 AI Native。
宝玉
说的在理,当年断供 Windsurf 大家还没忘记呢 https://x.com/amasad/status/2093543108491530308?s=20
宝玉
怎么感觉 Anthropic 和 OpenAI 对调了😂 OpenAI 宣布断供 Cursor 后不到两小时,Anthropic 联合创始人、首席算力官(Chief Compute Officer)Tom Brown 在 X 上回应:Cursor 从 2024 年的 Sonnet 3.5 时代起就是 Anthropic 信任的合作伙伴,Anthropic 会继续增加算力支持 Cursor 里的 Claude 模型,也期待 Cursor 在 SpaceX 的下一步。
宝玉
OpenAI 断供 Cursor,11 月 12 日起停止提供模型 OpenAI 今天宣布终止和 Cursor 的合作,停止向 Cursor 提供 GPT 系列模型,日期定在 11 月 12 日。触发点是两周前 SpaceX 以 600 亿美元完成对 Cursor 的收购。OpenAI 给的理由是,它无法相信马斯克旗下的公司会按服务条款使用它的技术。 OpenAI 在博客里点了两桩旧账。一桩是马斯克收购 Twitter 之后,Twitter 违反了和 OpenAI 签的合同。Twitter 后来并入 xAI,xAI 今年 2 月又并入 SpaceX,所以现在都算 SpaceX 的事。另一桩更近:今年 4 月 30 日,马斯克起诉 OpenAI 的案子开庭,他在证人席上承认 xAI 曾蒸馏 OpenAI 的模型,也就是拿 OpenAI 模型的输出当训练数据来训练 Grok,OpenAI 的服务条款明文禁止这么干。那场官司马斯克在 5 月输了,正在上诉。 OpenAI 和 Cursor 的合同里有一条控制权变更条款,Cursor 易主后 OpenAI 有一个时间窗口可以解约。OpenAI 选了合同允许的最晚日期,给开发者留两个半月缓冲,但从现在起不再给 Cursor 接入新模型。它特别提到了 Astra,这是 OpenAI 本月刚披露的下一代模型,内部评估无法排除它的网络攻击能力达到"关键"级别。OpenAI 说,这样的模型交到谁手里、怎么用,它需要比以前更严格的把关。 负责 OpenAI 全部核心产品的 Tibo 在 X 上说,这件事说到底是信任问题。他也给了替代方案:Cursor 用户可以继续绑定自己的 OpenAI API key 调用 GPT 模型,OpenAI 的 Codex 插件也会继续支持在 Cursor 里运行。区别是钱从 Cursor 订阅里出,变成直接付给 OpenAI。 对 Cursor 用户的直接影响:11 月 12 日之后,订阅里的 GPT 模型选项会消失。想继续用 GPT,自带 key 或者装 Codex 插件;不想折腾的,换成 Claude、Gemini、Grok,或者 Cursor 自家的 Composer。 OpenAI 也不是局外人。它 2024 年和 2025 年两次接触过 Cursor 想收购,被拒后转向 Windsurf,那笔交易最后也黄了。它现在的 Codex 和 Cursor 是直接竞品,信任之外,少给对手的产品供货本身就是生意。 接下来最大的变数是 Anthropic。Claude 一直是 Cursor 里用得最多的模型,Anthropic 到现在没有表态。它有跟进的先例:去年 6 月 OpenAI 传出要收购 Windsurf,Anthropic 几天内就切断了 Windsurf 的 Claude 接入,联合创始人 Jared Kaplan 的原话是“把 Claude 卖给 OpenAI 太奇怪了”。 今年 1 月,xAI 工程师通过 Cursor 调用 Claude 做竞品研究被发现,Anthropic 封了 xAI 的访问。但它也有不跟进的理由:今年 5 月 Anthropic 租下 SpaceX 的 Colossus 1 整个集群,22 万张 GPU,Claude Code 限额翻倍就靠这批算力。
宝玉
Claude 新的一篇博文《How Warp builds self-improving agents on Claude》 https://claude.com/blog/how-warp-builds-self-improving-agents-on-claude ,看了后还是挺有收获,它解决的是 Skill 的进化问题。 这个问题我以前也研究过,我写了一个反编译 JS 代码的 Skill(https://t.co/y6kA8TDnZ3),每次 Agent 反编译的时候遇到新的场景解决了就自己更新自己的 Skill,效果还不错,能一直优化,就是 Skill 文件越来越大。 我还研究过写作的自我进化 Skill,那个就一言难尽,因为它其实没有自己统一的标准,经常负优化,越写越糟糕。 说回来 Warp 这个,Warp 是一个挺有名的终端工具,内部尝试借助 AI 做 Code Review。一开始让 Agent review 代码,效果并不理想,主要问题体现在 Agent 不了解你的项目,不知道你的团队规范,不知道历史经验教训,就算你指出来问题它下次还记不住。简单来说就是没有记忆。 初期他们采取了很多补救措施: - 手动根据失败案例改系统提示词 - 完善项目的 AGENTS.md 文件(有意思的是这篇文章是 Claude 发的,但是用的是 AGENTS.md 而不是 CLAUDE.md,我记得 Claude 默认不支持 AGENTS.md 的😅) 但效果并不理想,一方面它依赖于人主动去做,成本较高;另一方面团队成员在 Code Review 时人工在 PR 写的高质量评论完全没用上。 所以他们搞了个解决方案,一个基础 Skill 负责做代码审查,一个改进 Skill 负责定期收集人类工程师在代码审查时的评论,尤其是对 Agent 审查结果的评论,根据人类工程师的评论去更新代码审查的 Skill。 换句话说,它不是依赖于模型自己去改进自己,而是 Agent 根据人类对模型结果的标注(人类对代码审查的评论),去改进技能。 只不过它把这个事做的摩擦力极低,不需要人手工去收集整理评论,不需要填写调查问卷,人只要自然的去代码下写评论,后面的事情都是 Agent 自动完成。 这可能正是 Agent 的最佳实践方案之一:人负责高纬度的标注、评论、反馈这些事情,Agent 去做执行的工作,Agent 根据人类的反馈去改进 Skill。 除此之外,他们还总结了一些最佳实践: 1. 写原则,不要写死规则。 编写 skill 时,要像在指导一个聪明人,而不是在给计算机编程。在 Skill 中写“寻找重复代码”,比列出详尽的变量命名规则更有效。 2. 解释为什么。 说明规则背后的理由,能让智能体针对问题进行推理,而不是机械执行僵化指令,也因此更容易举一反三。 3. 让反馈没有摩擦毫不费力。 在人们原本工作的地方收集反馈,例如直接评论 PR 或 issue。同时让收集过程自动发生,不要增加额外的提交步骤。低摩擦才能让信号持续流动。如果反馈太麻烦,你就收不到反馈,也就无法改进 Skill。 4. 保持 Skill 精简,并使用渐进式披露。 优秀的 skill 文件不会很庞大;它会引用资源文件和脚本,而不是一次性把所有内容都塞进上下文。 5. 反馈质量大于数量,但数量也有帮助。 一位资深工程师给出的少量、详细且与领域相关的反馈,可能比大量草率反馈更有价值,因为简单的赞成/反对并不能说明“为什么”。 即使样本量相对较小,只要反馈来自掌握领域知识的人,而且足够详细,你也能得到非常好的信号——这些知识是智能体通过其他方式根本无法获得的。话虽如此,优质信号的语料越多,效果越好。 6. 做好改进 Skill 的 Skill,可以用来改进其他 Skill。 把改进 Skill(也就是前面提到的一个代码审查 Skill 一个改进 Skill)做好,收益不只限于眼前这套 Agent 循环,因为改进 Skill 在不同用例之间具有很高的复用性。除了领域专用知识这一部分,它其实是一套相当通用、可复用的机制。代码审查 Agent 的改进 skill,也可以应用到其他 Skill 的改进上。 可能有人会担心:如果反馈本身是错的呢? Warp 的做法是永远不让 Agent 盲目接受反馈。给它足够的上下文来做基本的合理性检查,限制谁的反馈有权影响技能更新(不是所有人的意见都同等重要),最后始终保留人在循环中审核改动。 对于那些有明确标准答案的领域,比如代码是否通过了测试、部署是否成功,可以先建一个验证基准,让 Agent 自己对着基准跑。没有标准答案的领域,比如代码风格、文档质量,就靠领域专家的判断,不要开放给所有人随意反馈。
🎬
视频
宝玉
Claude 新的一篇博文《How Warp builds self-improving agents on Claude》 https://claude.com/blog/how-warp-builds-self-improving-agents-on-claude ,看了后还是挺有收获,它解决的是 Skill 的进化问题。 这个问题我以前也研究过,我写了一个反编译 JS 代码的 Skill(https://t.co/y6kA8TDnZ3),每次 Agent 反编译的时候遇到新的场景解决了就自己更新自己的 Skill,效果还不错,能一直优化,就是 Skill 文件越来越大。 我还研究过写作的自我进化 Skill,那个就一言难尽,因为它其实没有自己统一的标准,经常负优化,越写越糟糕。 说回来 Warp 这个,Warp 是一个挺有名的终端工具,内部尝试借助 AI 做 Code Review。一开始让 Agent review 代码,效果并不理想,主要问题体现在 Agent 不了解你的项目,不知道你的团队规范,不知道历史经验教训,就算你指出来问题它下次还记不住。简单来说就是没有记忆。 初期他们采取了很多补救措施: - 手动根据失败案例改系统提示词 - 完善项目的 AGENTS.md 文件(有意思的是这篇文章是 Claude 发的,但是用的是 AGENTS.md 而不是 CLAUDE.md,我记得 Claude 默认不支持 AGENTS.md 的😅) 但效果并不理想,一方面它依赖于人主动去做,成本较高;另一方面团队成员在 Code Review 时人工在 PR 写的高质量评论完全没用上。 所以他们搞了个解决方案,一个基础 Skill 负责做代码审查,一个改进 Skill 负责定期收集人类工程师在代码审查时的评论,尤其是对 Agent 审查结果的评论,根据人类工程师的评论去更新代码审查的 Skill。 换句话说,它不是依赖于模型自己去改进自己,而是 Agent 根据人类对模型结果的标注(人类对代码审查的评论),去改进技能。 只不过它把这个事做的摩擦力极低,不需要人手工去收集整理评论,不需要填写调查问卷,人只要自然的去代码下写评论,后面的事情都是 Agent 自动完成。 这可能正是 Agent 的最佳实践方案之一:人负责高纬度的标注、评论、反馈这些事情,Agent 去做执行的工作,Agent 根据人类的反馈去改进 Skill。 除此之外,他们还总结了一些最佳实践: 1. 写原则,不要写死规则。 编写 skill 时,要像在指导一个聪明人,而不是在给计算机编程。在 Skill 中写“寻找重复代码”,比列出详尽的变量命名规则更有效。 2. 解释为什么。 说明规则背后的理由,能让智能体针对问题进行推理,而不是机械执行僵化指令,也因此更容易举一反三。 3. 让反馈没有摩擦毫不费力。 在人们原本工作的地方收集反馈,例如直接评论 PR 或 issue。同时让收集过程自动发生,不要增加额外的提交步骤。低摩擦才能让信号持续流动。如果反馈太麻烦,你就收不到反馈,也就无法改进 Skill。 4. 保持 Skill 精简,并使用渐进式披露。 优秀的 skill 文件不会很庞大;它会引用资源文件和脚本,而不是一次性把所有内容都塞进上下文。 5. 反馈质量大于数量,但数量也有帮助。 一位资深工程师给出的少量、详细且与领域相关的反馈,可能比大量草率反馈更有价值,因为简单的赞成/反对并不能说明“为什么”。 即使样本量相对较小,只要反馈来自掌握领域知识的人,而且足够详细,你也能得到非常好的信号——这些知识是智能体通过其他方式根本无法获得的。话虽如此,优质信号的语料越多,效果越好。 6. 做好改进 Skill 的 Skill,可以用来改进其他 Skill。 把改进 Skill(也就是前面提到的一个代码审查 Skill 一个改进 Skill)做好,收益不只限于眼前这套 Agent 循环,因为改进 Skill 在不同用例之间具有很高的复用性。除了领域专用知识这一部分,它其实是一套相当通用、可复用的机制。代码审查 Agent 的改进 skill,也可以应用到其他 Skill 的改进上。 可能有人会担心:如果反馈本身是错的呢? Warp 的做法是永远不让 Agent 盲目接受反馈。给它足够的上下文来做基本的合理性检查,限制谁的反馈有权影响技能更新(不是所有人的意见都同等重要),最后始终保留人在循环中审核改动。 对于那些有明确标准答案的领域,比如代码是否通过了测试、部署是否成功,可以先建一个验证基准,让 Agent 自己对着基准跑。没有标准答案的领域,比如代码风格、文档质量,就靠领域专家的判断,不要开放给所有人随意反馈。
宝玉
RT @fi56622380: AI半导体终局推演2026(III) AI半导体基建期为什么比互联网基建期更长? Coding场景之后的下一个模型ARR营收增长点在哪里? AI基建会不会过度建设?Capex是不是泡沫?经济账能算的过来吗? 开源模型和闭源的格局如何?对闭源模型的冲击会如何演进? 本文尝试推演这几个问题背后的逻辑 —-------------------------------- 为什么AI的基建期比互联网基建期要长? 互联网革命时期的硬件/基建收入增长,只有一个渗透维度的指数型增长,就是用户量 因为每个人都是订阅制,50块钱一个月的网费,没办法再升了。属于平价服务,看十倍网页也不会付十倍的钱,平价服务是没有第二个维度的指数增长的,饱和了就饱和了 移动互联网的基建,也就是端侧设备智能手机,是同样的逻辑,端侧设备很难做到ASP售价很高,因为摊薄成本需要大规模生产,而要做到大规模,ASP就一定不能高,也很难涨价。所以注定了端侧设备在渗透率达到一定程度之后,很难再继续指数增长,因为上限只有一个维度决定。 这也是为什么,互联网革命的硬件需求拐点大概在渗透率到了sigmoid中点之后减缓,2000年3月互联网泡沫破灭的时候,美国互联网渗透率大概在50%左右。科技革命增速最快的时候就是采用率10%迈向50%的阶段。 —-------- 而AI硬件需求来源于token的指数型增长,这一轮AI之所以对硬件需求大,本质上是因为上限是由两个维度决定的:用户数量/渗透率的指数增长,和每个人的用量的指数增长 这两个维度的指数增长相乘,都能转换成统一的度量衡:token,把基建上限提高了太多太多了 我们这个时代,两个维度各自走到哪里了? 第一个维度用户渗透率,几个月前已经达到50%,也就是sigmoid导数要拐点了 第二个维度,也就是人均token用量,2026年仍然在早期。全美企业内部的AI spending中位数,现在是每人每月12美元。远期来看,这个数字有希望至少达到白领工资的10%,也就是每个月1000美元左右,中间还有接近两个数量级。 现在的增长,主要是第二个维度的渗透率,也就是每个人token平均用量的指数级增长,两个sigmoid曲线接力上了 这应该是历史上罕见的,两个维度sigmoid曲线接力带来的算力/基建需求,也带来了半导体的超级周期 但一切的指数增长,都是上限达到之前的幻象,这一轮AI基建也不例外,只不过幻象时间要长的多,因为多了一个维度的指数型增长接力 —-------------------------------- 另外一个AI的基建期比互联网需求高的原因,在去年写的半导体年终总结里提过:提到这两个渗透维度的指数成长,都能转换成统一的度量衡:token。跟互联网时代不同的是,互联网时代,每次请求的网络和算力成本,边际成本极低,scaling的效果极好,软件复制分发的边际成本几乎为零,且几乎不消耗额外的硬件资源。 而token时代因为高额的推理成本,用户访问消耗的边际成本比互联网要高一个数量级。商业模型从“流量 × 转化率”部分转向“每 token 毛利”了,所以AI时期基建的需求比互联网时代要高的多 —-------------------------------- 第一个渗透率维度扩散太快,已经到拐点,所以现在大家在讨论AI的前景的时候,已经不那么注重渗透率的讨论,而更多的是讨论在各行各业中,人均的token使用量会如何增长。 ----- Coding agent场景ARR迅速上升证明价值之后,6-7月开始增速放缓,市场开始担忧,coding agent在程序员群体内广泛渗透之后,什么场景能够接力token/ARR增长 ?是不是AI for science?还是RSI? 我认为仍然是Coding,广义的coding,而且还有很大空间 Coding是这个世界数字化的不可阻挡的趋势,万物皆可coding,而且不一定是显式的coding。实际上太多任务在后台被默默转化成了Coding,最后在记录功能的时候,仍然会被看作是Coding。 目前广义Coding任务占所有的ARR收入比例大概是60%到70%之间。如果只算程序员的狭义Coding的话可能只有40%左右,另有20~30%可能是其他行业的任务转化而来的Coding agent执行结构。 比如最常见的文件的编辑Excel和PowerPoint,最后都是通过后台开linux sandbox用Coding的方式去完成的。财务、CRM 操作、法律文档整理也一样,区别只在于所调用的工具和 verifier 不同,都被转换成了可观察->可执行->验证的coding闭环任务。 半导体的架构探索会转换成SystemC model simulation问题,生物制药的分子结构解析和仿真中的很多环节也可以用coding完成,投行研报里的模型建模也能转换为coding问题。 狭义的程序员coding任务只是第一个跑通了高频运行 观察/分析->执行->验证循环的大类任务,这也是coding为什么消耗了比chat高一个数量级的token。以后有太多的任务都是同一个逻辑下的承接者,甚至包括deep research这样的开放性任务。 形式上,下一个比较切实际的增长来源就是Co-work/computer use 接力程序员Coding的,并不是另一个孤立的大场景。当前增长最快的,正是“非程序员使用Coding基础设施完成非Coding产品任务” ,Coding仍然是默认执行内核,但不一定是用户眼中的产品分类 截至2026年6月,OpenAI企业客户中,Codex已经占Codex与ChatGPT合计输出token的64%。Codex周活用户自2月以来法律部门增长108倍,销售和招聘增长41倍,市场营销增长26倍,工程部门反而只增长5倍 从Anthropic的营收垂直占比来看,狭义的程序员/软件公司coding占比只有40%,金融服务/保险超过 20%,法律,制药/生命科学,消费/零售电商,占比都非常的可观,都有10%量级。 Software eating the world的逻辑,在coding的门槛被LLM降低一百倍之后,甚至强化成了coding eating the world,或者说,coding是agent最熟悉的方式,agent正在利用coding开始向所有知识工作去扩散使用率 而Agent Coding已经过了可行性和方向摸索阶段,剩下的主要是长时运行/跨系统/自主性/可靠性等工程问题 ,没有什么重大挑战了。 剩下的事情只是用户适应场景和改变习惯的问题,渗透率/利用率的主要瓶颈是,大家的学习曲线没有那么快,用户需要时间迁移agent/coding工作流;企业workflow高度长尾、数据分散、内部工具整合不足,也缺少自上而下的KPI推动。模型能力、组织推动和tool integration共同决定adoption速度。 另外一个瓶颈逻辑Amdahl’s law(结果取决于不能加速的环节),token只能解决其中一部分环节的加速,比如说像药物临床部分是无法加速的,如果其中一半环节无法加速,那么token就算把剩下的环节加速一千倍,整体加速也只有2倍。因此更现实的路径是并行探索更多方向,把瓶颈从决策转移到验证。 Anthropic 6~7月的营收放缓主要原因有三个:一个是算力不够,另一个是防蒸馏整治了不少账号,还有openai的codex 5.6抢占份额。并非广义agent coding需求触顶。 从广义agent coding角度看,我目前看不到大模型/agent需求的硬上限。目前仍然处于用的越多,提升效率越多的阶段,边际正收益仍然很大,主要瓶颈在于营收/利润能支撑多少budget,意愿和场景都没有问题。 -------------------------------------------- 从最重要的需求端来推演,token增长率前景是没什么问题的。 那么从基建出资方来推演,capex的上限在哪里,能不能持续?有没有泡沫?举债+FCF变负,账能不能算的过来? 从基建出资方来说,和互联网区别最大的地方在于,互联网时代的基建出资方和受益方并不一致。而在 AI 时代,这两者出现了重合。基建出资方最大的Anthropic和OpenAI也同时是这一次AI革命的最大受益方。 所以算账先从Openai和Anthropic角度来算是最直接的 1.unit economy是算的过来的 截至六月底,Anthropic大概用2GW的有效算力创造了62B的ARR。如果1GW的数据中心建设成本按50B来计算,平摊到六年,每年的成本大概是10B。那么,其实Anthropic的推理算力收入~30B/GW除以年化的算力成本大概是三倍。推理的ROIC也有差不多60% 如果只算推理,那么unit economy就更好了,1GW的算力收入是接近50B的 2. 在维持这个unit economy标准的前提下,只要ARR增速和算力增速同步,Anthropic + Openai的数据中心算力GW规划是能算的过来的 O+A 两家在七月的时候大概6~7GW,Anthropic 65B,Openai 45B O+A 两家今年年底上线加起来大概11GW,只需要ARR半年再增长60%左右即可保持ARR和上线算力的同步增长(要知道2026上半年A 7倍,O 2倍多),也就是下半年每个月增长10%即可 到2027年底,两家规划的总算力全加起来大概20~24GW,其实只需要这一年的token ARR同步增长1~1.5倍,这个算力账起码在unit economy上是算的过来的,算力跟ARR的增速同步,目前的可见度支撑2027E的capex没有大问题 没有能见度的2028只能靠猜:2028E ARR一年增长80%的话,能justify O+A 总共45GW 算力规划。2029 + 2030年两年ARR继续增长100%(CAGR仅仅40%),O + A到2030年年底总共100GW算力规划是完全合理的 至少O和A这样明确找到了结构性需求增长的赛道的ROIC是算的过来的,2027甚至2028的算力规划暂时没有泡沫 举债和FCF变负去做AI基建,是不是赌博?是的 但这样的赌博在ROIC如此好而且大概率能持续的生意面前是有合理性的,踏空错过的风险是显著大于fomo泡沫的风险。即使融资成本升到8%甚至更高,起码2027~2028,算力回报仍是可以justify借债风险的。 —------------------------ O和A的算力账是算的过来的,那么其他部分的算力呢?回报能算的过来吗? 这部分定量很难,只能大概定性的算,因为其实有很多算力是不产生直接收入,只算作研发成本。比如Meta明年规划新增5GW给MSL训模型和搜广推(搜索/广告/推荐),google的gemini 训练 + 搜广推,都不直接产生收入,但这些仍然是战略上的合理算力需求。 有一个很容易被忽略的事情:全行业来说,目前很大一部分的AI/ML算力,不是卖token的,仍然是传统的搜索/广告/推荐,最典型的比如Meta,Google大部分的算力就是如此 所以在看2027~2028年的天文数字一样的算力的时候,传统workload是一个容易被忽略的重要部分。产业链硅谷公司里,和市场的感觉是截然相反的:公司内部的算力缺的一塌糊涂,但市场还是在质疑算力账看不到收入,质疑oversupply 但把这么多不产生直接收入但仍然重要的R&D,以及传统AI/ML的大量增长算力算进来,算不过来的那部分算力是很有限的 况且O + A的算力集中度也是越来越高的:2027年全年新增算力GW,因为电力瓶颈,美国能通电大概只有20~25GW,这其中O +A可能会占10GW,也许会占到新增的接近一半。在2025年,这个比例低一些,O+A 大概只占新增算力的25%,很大一部分的算力GW不是LLM。随着时间推移,O + A的算力GW占比越来越大,也就是说总体算力账能算的过来的部分也越来越大 另外一个容易被忽略的逻辑是,因为coding agent的爆发,软件行业/ML行业的迭代速度突然加快,整个世界数字化进程的加快,带来的传统硬件基建需求也在加速 以CPU为例子 token = 决策/智能 CPU = 执行/验证 数字世界万物皆coding,随着决策能力爆发,对执行/验证的需求会是同步的数量级的增长 而且传统ML行业的迭代速度加快,也会是CPU类似的逻辑,ML的效果变好场景变多,也会带来更多GPU/ASIC硬件的需求 —------------------------ AI基建会不会产生泡沫?会,而且最后一定会overbuild Inference现在实在是太赚钱了,所以overbuild是必然会发生的结局,因为大家都想抢inference这一块的市场,每一家都在军备竞赛,无法承受失去市场份额无法跟随潮流高速增长的痛苦,没有哪一家会退缩 闭源模型推理的毛利率可以轻松达到70%~85%(甚至是在CSP抽成之后),token factory host开源模型卖token的毛利率也有60%以上(DeepSeek甚至80%以上),GPU最近不停涨价,1GW租金都在往20B走,光卖GPU集群短约都有60%以上毛利。 这个AI基建市场太赚钱诱惑力太大,只要有渠道有技术的,全都涌入这个市场做neocloud,而因为build规划和落地普遍有一两年的时间差,所以overbuild一定会发生,只不过是时间问题 时间问题的意思是,以目前的需求和算力规划,至少两年看不到overbuild,任何模型上的阶跃式进步(比如reasoning -> agent),或者应用范式上的创新,带来AI spending维持增速,都会一直把这个overbuild的时间线往后续命 什么时候这个续命跟不上基建的速度了,overbuild就会慢慢开始浮现 但这其实是更利好于头部模型厂和应用层的,因为overbuild会导致数据中心毛利下滑,更多的推理利润都流入了头部的两家 SpaceX虽然现在规模还小,但在这个卷新建算力的市场里,执行力最强,成本最低,竞争力可能是最强的,也是野心和规划最大的,以后也必然是overbuild的最重要贡献者之一。 —----------------------------------- 开源模型的兴起,对闭源模型营收ARR会有影响吗?目前的格局是什么样的? 开源模型和闭源模型的差距会减小吗 开源模型的势头能不能持续,和开源模型的能力也有关系,我的观点是开源模型和闭源模型的差距会维持在6个月(Mythos 2月就出来了,被监管了),蒸馏主要是降本 模型进步的三个壁垒:算力scale,数据scale,自迭代 Openai和anthropic今年加起来花了一百多亿美元买数据,但国内现在也是要花几十亿美元买数据了,数据scale这个壁垒差距有缩小,但仍然是有的 算力方面,海外建数据中心 + 各个国家转口,GPU的禁令很大程度都被绕开了,等国产卡产能上来,算力壁垒也会继续缩小,目前算力数量级上的差距仍然维持 目前下一代模型的进步很大程度要依赖前一代模型的迭代(自迭代RSI),上一代模型越强,下一代就越强,差距要减小不容易 —----------------------- 至于闭源模型对开源模型ARR肯定是有影响的,但影响可能会比市场预期要小,起码一年之内冲击并不大,这里尝试一下大致定量分析 至于openrouter和Vercel上的开源模型token占比,从28%增长到62%,只能反应小微型企业/多模型用户在用中转站里的形势变化,其实绝大部分闭源token是无法显示的,这个抽样并不能完全作数 截至7月底的ARR,Anthropic大概是72~75B,Openai大概是45B 截至7月,全球所有开源收入加起来是10B左右,只算北美只有4B最多5B。按ARR收入来算,北美开源模型token factory + AWS bedrock开源 + Azure开源 ARR只有~4B,闭源120B,比例大概是3% 最大的x因素就是aws bedrock和azure,目前Q2来看,bedrock大概占aws AI的55%比例,~14B ARR,其中anthropic模型占80%左右,aws bedrock和azure开源模型加起来大概在1.5~2B ARR 中国开源3.5B分解一下,大概是智普$1B, 阿里1.2B,Deepseek 500m,kimi 300m,minimax 200m,美国分解一下,fireworks 1B,together 1.2B(开源推理只有0.5B),baseten 0.5B,加上其他地区的,加起来勉强10B 北美的token factory开源模型推理,26年上半年大概只增长了3倍(比如fireworks从10T+/300M ARR增长到40T/1B ARR),总体来说,和闭源模型的推理市场增速比较并没有显著优势 至于企业自己部署私有开源模型自己用,这条路从成本角度来说是行不通的(数据安全是另外的考虑),开源模型要是优化的不太好,成本甚至比闭源还高,不如交给token factory 美国开源的算力扩张,速度还是受限于算力,所以上不去,扩张速度和闭源比并没有优势。fireworks,baseten,together,融资都是1B规模的,按现在租算力价格,一年20B/GW,一年只能租不到0.5GW,算力增速其实不比闭源更快。要扩张只能让客户到azure/aws自带算力再来 中国的开源扩张速度倒是更快,但是同样token factory受限于算力,远远满足不了中国自己的需求,暂时无法大规模出海卖给美国。中国的token factory大大小小的差不多30家,已经卷成红海了,都是严重缺算力,谁有卡谁就能有收入 中国token出海另外一个风险是信任和政策风险问题,美国企业自己可能不敢用,中国也有可能不愿意自己模型被免费用拿不到收益,不过以后随着openrouter和vercel的中转站继续发展,即便有token无法出海的禁令,token出海也是拦不住的,毕竟开源token卖给美国的利润太高了 美国开源模型token工厂的问题在于,算力暂时有限,融资规模暂时也有限,扩张速度无法满足需求。就算是政策开放了中国开源token出海,短期算力也不够无法出去,这也是为什么Nvidia非常努力的扶持开源,甚至亲自下场加速这个进程(今天收购了hugging face) —----------- 另外,闭源模型的防守策略也是很有力的,比如5.6 luna降价80%,价格就很有竞争力了 我们可以对比历史,这和移动互联网时代,高通对联发科使用多年的防守策略是完全一样的: Sol相当于Snapdragon 8系:旗舰维持技术与品牌上限,数量和比例并不那么大 Luna相当于Snapdragon 4系:主动填满低价区间,不给低成本竞争者留利润池,大部分走量来自于此 和token分不同的tier一样,其实联发科的芯片是远远超出手机“够用”的范畴的,别说日常使用了,就算是打游戏的高负载场景,联发科十年前都和高通差的并不远了 所以token也是一样,value tier不会摧毁flagship tier的需求 高通和联发科的攻防战持续了15年,高通靠着这样的策略仍然维护了自己的市场占有率,高端芯片毛利率保持的也不错,仍然是安卓阵营旗舰机第一选择 所以从历史来看,开源对闭源的冲击有影响,不会影响历史进程 —------------------- 另外一个和开源相关的问题就是,tokenmaxxing潮流的结束,对ARR的增速会有影响吗? 我认为tokenmaxxing只是短期的公司为了内部推广的目的,目前部分美国硅谷大厂确实对员工日常使用有限制额度,但这个额度非常高,大概是一个月10k~20k美元,95%以上的员工实际上根本用不完,而且中位数实际上很低,仍然有很多增长空间,目前对token的使用仍然处于边际正收益仍然很大的阶段 —-------------------------------- 总的来说 AI基建的前景之所以扑朔迷离,泡沫之争比互联网基建时代更激烈,主要是因为算力支出的可见度是确定的,而需求的可见度不高所以有巨大的不确定性,而中间还隔了一层收入和支出的时间错配带来的金融风险,这个基建金融风险还随着各方“加注”的不断加大,上升到了甚至能影响国债发行的程度 但我还是认为,即便是以保守的没有任何新范式的base case来算,起码到2027~2028的基建是没有泡沫的 算力就是智能,智能就是巨大的收入。 AI token需求两个指数增长维度的迅速接力节奏是历史上绝无仅有的,万物数字化广义coding的需求才刚走完第一段,开源对利润分配的冲击是必然会发生,但不会影响整个进程大局 产业链角度和市场宏观角度,看到的风险和景气度感受是相反的,但两边的感受到的剧变同样剧烈:近处的人看见的是不够,远处的人看见的是太多 算力变成了判断/认知token,需求如何推演,天花板如何计算,没有任何历史参照,我们真正在争论的,从来不是这个数字对不对,而是该用什么时间单位去看待它 而这一点本身,恰恰说明了它有多大:只有真正的相变,才会让所有旧的历史参照同时失效 支出的可见度制造了今天的恐惧,而需求的不可见度,恰恰隐藏着这个时代最大的机会,看不清路径,并不一定意味着看错了方向 每一条S型指数曲线终会走到尽头 但文明发展从来没有停在任何一条曲线的尽头 —-------------------------------------- 开源对半导体的影响如何? 半导体Capex内战谁会是赢家?如果内存存储吃掉了太多利润,会发生什么? 本篇已经太长,这两个话题就顺延到下一篇
宝玉
RT @fi56622380: AI半导体终局推演2026(II) 当半导体结构性演进到AI推理主线,内存和存储成为了最大瓶颈,市场对内存和存储最大的怀疑就是: HBM/DRAM/SSD会不会摆脱传统周期性? 依赖HBM指数增长的GPU架构路线进化路线,会不会停止?什么时候停止? 长鑫扩产的影响有多大?会不会把这个市场重新带入周期泥潭? 本篇尝试去建立一个框架来梳理这几个问题 —---------—--------- 万物皆周期,而内存的周期性又特别强,最大的来源在于扩产周期过长,无法快速扩产和需求短缺时期错配 摆脱传统周期性几种可能的方式 1. 定制化:产品不可互换,产能不能随便转移,需要签长约。 2. 结构性的指数级需求增长:需求曲线本身很陡峭,而且供给一直追不上。 3. 技术迭代快速升级:每一代产品都快速淘汰上一代。 满足任何一条,就能部分摆脱传统周期;满足两到三条,就能摆脱大部分传统周期 根据这个框架, HBM在三条里,大概占了两条半 1. 定制化,需要签长约(较弱,算半条) HBM 确实有定制化和Nvidia codesign的成分,但并不是很强。真正定制的部分只在封装和 base die,上面那十几层 DRAM die 仍然是完全 JEDEC 标准化的。 比如当 Samsung 的 HBM3E 在 NVIDIA 的 qualification 上没过、份额从大约 60% 一路跌到 20% 的时候,它并没有把这批产能砸在手里报废,而是转手就供给了 Google 的 TPU、AMD. 物理上,给 NVIDIA 的 HBM3E 和给 AMD 的 HBM3E,是同一个东西。 所以产能仍然是部分可以自由转移的。 HBM4之后的定制化更多一些,包括在 base die 上集成定制逻辑和/或缓存。更复杂的方式是将 HBM4E 内存控制器和定制 die-to-die 接口直接放入逻辑 base die SemiAnalysis 提到 OpenAI、NVIDIA 和 AMD 各自都在做定制 HBM 的工作,但这指的是 base die 的定制,上面的 DRAM 层仍然是标准的。 部分定制化的特性,HBM主要在封装上需要合作,这也导致了客户必须签长约,但产能也确实可以转移,所以HBM 能勉强算半条。 2. 结构性的指数需求增长(满足) 最直观的原因,就是Nvidia token factory token throughput的硬件升级需求,导致了HBM带宽的升级换代极快,以及HBM size需求的指数增长 这一条其实就是上一篇AI半导体终局推演2026(I)的结论: token throughput = HBM size × HBM 带宽,每一代翻倍。 HBM size per GPU大概每年增长40%以上 这条需求曲线的陡峭程度,是DRAM供给端 14% 的 wafer 增长,乘以 9% 的 density 提升,很难追上的 在硬件领域,因为attn阶段KV cahce的极高带宽和极高memory size的要求,也导致了HBM独特的地位。即便是HBM涨价三五倍,把钱花在HBM上带来的边际token throughput提升,仍然比花在其他地方要划算的多。 其他几个Memory路线,SRAM,HBF,CXL,PIM,目前都无法在HBM的主力赛道kv cache/attention上正面竞争,起码未来5年甚至更长时间,不太可能找到替代路线 3. 技术迭代快速升级(满足) DDR3时代过了15年,仍然只是DDR5时代,而HBM的升级换代的速度基本上是两年一代,比传统DDR要快很多很多,而且近来还有加速的趋势,HBM size x HBM BW每一代翻倍,目前是完全符合这个规律的 每两年一代HBM升级,NV GPU速度基本是指数型上升:2TB/s ->3.5TB/s->4.8TB/s ->8TB/s->22TB/s,而且HBM的速度和推理token throughput是完全线性正比的,上一代HBM的边际使用成本会不划算,大家都有动机去尽量用最新的产品,虽然更贵,但是带来的收益(token throughput)是更多的 Token factory时代的逻辑是,技术升级(HBM带宽)的越多,赚的越多 这个速度差,造成了一个和 CPU 类似的局面:旧产品快速贬值,于是囤货的价值在变低,比如说,HBM3的价值贬值的非常快,今天基本上主流产品不会用了 所以HBM 厂商的理性选择,从拼当前的产能去占市场(quantity competition),变成了在稳定性和HBM速度上拼技术,拼下一代在 NVIDIA 平台上的 qualification 份额(quality competition),从而避免了在传统周期的下行波段,大家都不愿减产掉市场份额的囚徒困境。 —--------------—-------------- HBM和传统DRAM比较,三个条件里满足了两个半,那么HBM能摆脱传统周期性吗? 内存周期性的来源,主流叙事是,DRAM 有Commodity属性(无差异化 → 价格战 →库存可囤积),所以有周期性。 而Commodity属性本身并不产生周期,它只是一个振幅放大器 特别是DRAM领域里,曾经产生过囚徒困境,在下行周期三星曾经扩产抢市场份额,谁先减产谁吃亏,导致谁也不敢轻易减产,最后大家都亏损惨烈 实际上周期性的主要结构性来源是供给周期太长,很容易和需求周期错位。建一座 fab 要 3 年,投资上百亿美元,一旦决策就不可逆,而需求增长会有不稳定性,每次出现新范式增长,比如云服务,移动互联网手机,疫情线上需求,会有爆发式增长,而过了两年增长会放缓,供给高于需求,降价过猛,就变成了亏钱周期 万物皆周期,HBM这一条同样是无法避免,但只要token需求仍然是指数型增长,结构性的指数增长会减弱周期性,因为需求可预测度更好,而且一旦降价,客户就有增大HBM size的需求(从而增大token throughput),加上HBM有一点定制化要求导致都是长约,从而从周期性转化成成长周期性,而且这一轮周期会特别长 周期性:上行周期赚的多,下行周期亏的多 成长周期性:上行周期赚的多,下行周期赚的少 另外,HBM/DRAM在这三条摆脱传统周期的条件的基础上,还有一条重要优势: 4. 因为DRAM密度增长scaling越来越慢,以及HBM升级换代导致DRAM堆叠倍数的增加,供给端的扩产难度持续增加 2000年附近,DRAM每片wafer上DRAM bit密度每年增长大概45%,也就是说,就算晶圆wafer数量不扩产,每年的供给端DRAM bit仍然可以增长45% 十年前,DRAM bit每年密度增长降到了20%,而现在,DRAM bit每年密度增长降到了9%。以前DRAM扩产甚至不怎么需要新建厂房就能得到每年20~30%的bit volume上升,现在DRAM要扩产,更多的是靠wafer数量的增长,也就是新建厂房和clean room。 另外一个HBM快速扩产难度在于,HBM3e大概需要3倍的DRAM wafer晶圆,而HBM4由于堆叠密度的增加,大概需要4倍的DRAM wafer晶圆数量,相当于HBM bit相对于DRAM bit一直变得更难制造,单位DRAM wafer数量制造的HBM bit越来越少,相当于在通缩 ---------------------------------- HBM未来有一天,会不会从成长周期性,变回传统周期性?最重要的因素是结构性指数增长,那么 AI推理时代,这个依赖HBM指数增长的GPU架构路线进化路线,会不会停止?什么时候停止? token throughput = HBM size × HBM 带宽,这个HBM指数增长的第一性原理里的HBM size的增长原因正是KV cache的增长。KVCache的特性以及Attention的特性,也是非常契合HBM的。甚至让HBM领先于其他的技术路线, 能够最大化地让KVCache和Attention 阶段的利用率。 换言之, 如果KV cache从架构上不存在了,那么HBM size指数增长逻辑也会受到挑战 所以这个问题的本质其实是,这一轮以 Transformer 为代表的 attention 机制、以及由它衍生的 KV cache 机制,会不会消失?退潮之后会不会被取代? 从历史规律来看:每一次AI模型架构革命,真正被保留下来的,是那些在数学上具有某种普适性的 primitive 操作 举个例子:FFN(前馈网络,也就是模型里大量的 MLP 层)是 2012 年深度学习时代的产物,但它一路活到了今天的大语言模型里,并且仍然占据着模型相当大的参数量。它为什么能活下来?因为这也是一种universal approximation theorem(通用逼近定理):任何足够宽的 MLP 都能逼近任意连续函数 Attention 大概率也是这样一个会被保留的 primitive。因为它解决的是一个同样 基础的问题:序列sequence 中任意两个位置之间的 dynamic routing(动态路由),让一个序列里任意两个位置都能按需建立联系。这个能力一旦被验证有效,就很难被丢弃 所以即便未来架构从纯 Transformer 向混合架构演进,或者向世界模型演进,但attention 层依然会存在,KV cache(或者它经过 latent compression 之后的等价物)依然需要,HBM依然会作为推理核心之一,这个依赖HBM指数增长的GPU KV cache架构路线进化路线,不会停止 —---------------—--------------- 那么DRAM呢?在未来有没有摆脱传统周期性的可能? HBM摆脱周期性在市场上有一定共识,但DRAM摆脱周期性,市场目前基本没有共识 还是回到刚才的框架,三个摆脱传统周期的条件里,DRAM是没有定制化的,所以就只能看技术迭代速度,最关键的还是要看,有没有结构性的指数增长,答案是有的 在 AI token factory 这个概念里,结构性指数增长的确实主要是 HBM。但事情在 2025 年年底之后起了变化:随着 agentic CPU开始释放潜力,CPU 附带的那部分 DRAM 需求,正在成为 DRAM 新的结构性指数增长来源 —------ 这部分的增长逻辑分两层:第一层是CPU 服务器TAM的快速增长,第二层是每个服务器CPU core配备的DRAM用量的因为agentic flow快速增长 服务器CPU TAM的快速增长的4个逻辑在4月的CPU专篇详细写过,简单的说: 1. AI 加速器集群里CPU和GPU配比从传统的1:4变成1:2,甚至可能往1:1迈进 2. Agentic flow里CPU处理的延迟占比很高,50~90%成为重要瓶颈,需要同步扩容 3. AI coding让SDE的效率大幅提升,代码量数量级增长,软件API调用指数级增长,直接转化为这部分CPU hours指数级上升 4. Sandbox为保障数据安全与隔离,如Analytical Agent 需为每个任务复制大量数据库和用户上下文,导致内存(DRAM)和CPU核心的严重浪费,而且这个浪费问题五年甚至更久无法解决。另外CPU hours 在技术上很难通过优化的方法来通缩 这也就是为什么,上上个季度,AMD的财报说CPU TAM到2030年会到60B,两个月前,AMD/ARM把CPU TAM的2030年预测翻倍到120B,一个月前,Nvidia再次把CPU TAM的2030年预测翻倍到200B 而上个星期,Bernstein再次提升2030 CPU TAM指引到223B。在我看来,2031 CPU TAM未来上修到400B是没有太大悬念的事情,唯一的悬念是几个巨头会什么时候宣布上修这个指引 再说说第二层,为什么每个服务器CPU core配备的DRAM用量在agentic时代快速增长? 1. Agent 是带状态的长驻进程,不是无状态的请求-响应 传统 web/SaaS 是 stateless 的:请求进来,分配内存,处理完内存立刻回收。而一个 Agent 任务可以跑 一分钟到一个小时,这整段时间里,它的 message history、system prompt、工作记忆、长期记忆、工具结果 buffer 全部常驻 DRAM 和 CPU hours 一样,每个任务的内存足迹因为 stateful 和 sandbox 隔离(每个任务复制数据库和上下文)的要求,技术上很难压缩 2. 上下文窗口在指数级变长,每个会话的工作集随之膨胀,并发度 × 单会话memory footprint,乘数放大 context window 从 32K → 256K → 1M,reasoning / test-time compute 的序列长度爆炸,未来还会继续增大。每个活跃会话常驻的 messages 随 context 长度线性增长 现在把两层乘起来。 第一层,CPU server 的 TAM,朝 2030~2031 看大概是 5–7 倍的量级(60B → 120B → 200B → 223B,我认为还会到 400B) 第二层,每颗 CPU 的 DRAM 配比,大概 3–4 倍(4~8GB → 16~32 GB/core),但这个增长可能大部分是一次性红利 两个独立变量相乘,server 侧的 DRAM 需求是数量级的增长 2030年,即便按保守的300B CPU TAM,一个CPU core按$50来算,agent时代最保守按16GB/core,这算出来新增量最少都是96EB,而今年的DRAM总产量只有47EB,明年勉强60EB,这是非常惊人的增量 虽然这个agentic CPU带来的DRAM指数级增长,在第二层很大程度上是一次性红利,但持续时间会持续很久很久,因为这个短缺的缺口实在是太大了 —-------- 回到文章开头那个框架。三个摆脱传统周期的条件里,第一条DRAM 定制化,基本可以忽略 而第二条:一个结构性指数级、而且很难逆转的需求来源是成立的。commodity DRAM 现在也具备了部分摆脱传统周期性的资格。没有 HBM(两条半)那么彻底,但已经是实质性的变化 第三条,技术迭代速度,DRAM的节奏也跟以前不一样了 因为以前的DRAM技术迭代速度是严重依赖消费电子的,DDR的进步对于performance用处并不大,但可预见的未来里,碳基消费的传统DRAM,会远远小于硅基消费(CPU服务器)DRAM的用量 以前DRAM的速度升级带来的边际效用是很低的,但现在因为CPU服务器对memory的需求增大,以及端侧AI对DDR速度的要求也增大,比如苹果为了跑本地大模型,LPDDR速度越来越快 速度升级的边际效用高了不少,所以DDR6和LPDDR6的速度迭代需求比以前提升了太大了,这在图里也可以看到,LPDDR6/DDR6的迭代时间缩短了,而且速度斜率,重新开始抬头 以前新一代DDR/LPDDR技术出来,大家的反应都很冷淡,等降价了才会用 而现在LPDDR6出来,各家恨不得都在抢着能尽量早上就尽量早,因为速度的提升带来的performance提升是触手可及的 ------ 另外,DDR 的供给还要被 HBM 额外抽一道税。HBM 每年的扩产速度太快,导致每年都有一批原本可以做 commodity DDR 的 wafer 被拉去做 HBM,而 HBM 的转换比极低,HBM3E 大约要 3 片 DDR wafer 的产能才能做出等量的 bit,HBM4 是4 片。所以每年大约有 3% 到 5% 的 DDR bit 增长,是被这个 HBM bit tax直接吃掉的 所以DRAM bit volume虽然未来每年能增长24%左右(14%来自wafer增长,9%来自每个wafer的DRAM密度增长),但算上HBM bit tax之后,传统的、非 HBM 的 commodity DDR,每年的 bit growth 大概只有 20%(约 10% 的 wafer 增长 × 约 9% 的 node density 提升) —--------------------- 中国长鑫扩产的影响有多大?如果不讲武德拼命扩产,会不会把这个市场重新带入周期泥潭? 长鑫这几年的扩产速度还是很快的,2025年还是每个月20万晶圆,2026年北京晶圆厂及新增生产线的贡献就能到32~35万。 正在建设中的上海工厂一期和二期,一期预计到2027年每月新增10万片晶圆产能,二期预计到2028年每月新增10万片晶圆产能,也就是说,2027年每个月42万晶圆,2028年能到每个月50万晶圆。 但需要注意的是,长鑫的dram bit 密度大概只有御三家的一半左右,所以长鑫的每个月50万晶圆wafer能产出的dram bit volume只有其他家的一半,这里计算wafer per month的时候,就按等效一半来算 把这个折扣打上之后,长鑫对整个DRAM行业的冲击还是小了很多,从2025年年底到2028年年底,长鑫对DRAM bit产能CAGR的影响大概只有1.5%,全行业的DRAM产能CAGR大概从12.7%升到14.2% DRAM月产能(kwspm) 2025E → 2028E CAGR Samsung 685K → 920K 10.3% SK Hynix 519K → 725K 11.8% Micron 340K → 560K 18.1% 非中国其他 150K → 218K 13.3% 中国(密度折半) 117K → 274K 32.8% ————————————————— 含中国总计 1811K → 2697K 14.2% 无中国总计 1694K → 2423K 12.7% 就算是长鑫未来还能保持增产速度,2030年对全行业等效产能每年DRAM bit volume增产CAGR的影响,大概也不到3%,从20% CAGR变成23% CAGR,仅此而已 另外,长鑫被光刻机所限制,而DDR6 需要更高速率(14400 MT/s 起步)和更高密度,御三家做 DDR6 大概率会用 1c 或更先进节点(~12nm 以下),已经全面用 EUV。长鑫可能会在DDR6上速率受限,密度也只有一半。 —---------------- 即便是成长性周期,为什么DRAM的这轮超级周期会持续很长时间,起码五年看不到头? 第一个原因是,刚才谈到的CPU服务器需求端的巨量增长带来的结构性DRAM需求指数增长,这里结合DRAM供给端的bit volume CAGR大概稳定20%增长,就可以很清晰的看到,DRAM未来几年的缺口为什么越来越大: 非HBM的传统DRAM供给端大概是每年增长20%,而需求端,按2026年60B CPU TAM,每个CPU消耗DRAM平均8GB/core,每个core $30~35来算,需求是16EB 2030年按400B CPU TAM,每个CPU消耗DRAM平均16GB/core,每个core $80来算(CPU涨价超过一倍),需求是80EB,这部分DRAM的增长CAGR大概是50%,远远超过目前的估算 不同于HBM是直接和token throughput挂钩,从而和GPU赚钱效率直接挂钩,DRAM不够对于agent flow的影响主要是速度,比如说,8GB/core和16GB/core比起来,部分workload速度可能降低30%,部分低价值task实在要等等也能忍,结构性指数增长的动机很强,但需求不如GPU那么刚性 Semianalysis说今年的DRAM缺口式个位数百分数,明年是超过10%。从agent CPU数量激增导致的DRAM结构性来看,这个缺口每年都会继续加大,在2030年之前看不到降低的可能 —---- 另外一个DRAM能延续强势很久的逻辑是,因为DRAM涨价之后,被涨价消灭的那部分需求,不是真的消失了,只是延迟了,需求蓄水池太多了。 所谓蓄水池,是指那些"内存一旦降价就会立刻被释放出来的潜在需求"。它们的存在,意味着即便供给阶段性跟上了,价格也很难崩,因为总有新的需求从蓄水池里涌出来接盘: 内存换算力/速度是一个蓄水池: 有大量本来需要靠额外内存来优化速度和算力的需求,在内存太贵时被压着,一旦内存降价就会被释放出来。 比如 Nvidia的CPX prefill 加速,本来的设计初衷是用额外的低成本GDDR7,来做一个专门的prefill加速器,结果LPDDR/GDDR都太贵了,比涨价前的HBM还贵,这个方案的ROI就不划算了,但等到普通内存降价,这样类似CPX的优化方案就还会回来 低价值task是一个蓄水池:内存涨价导致token价格居高不下时,高价值的 task 被优先保留,低价值的 task 被延后;内存一降价,这些被延迟的需求就回来了。 端侧 AI 是一个蓄水池:AI PC 的内存配置可能从 24GB 一路涨到 128GB。苹果已经明确要求最新的端侧AI满血版需要从8GB升级到12GB内存 常规消费电子、Agent PC、低端手机,因为内存涨价而减少的需求,全都是蓄水池。 这么多蓄水池叠在一起,构成了一个极厚的需求缓冲垫。这就是为什么 DDR 这轮的结构性增长,后劲会比市场想象的要强。 —----- 还有一个DRAM价格很难大幅下降的原因在于,HBM和DRAM产能可以互相转换,所以整个DRAM complex是一起re-rate的 在上行期DRAM的利润率远超HBM,HBM的涨价幅度甚至变成了由DRAM去推动。今年新签约的HBM4的价格,就是当期DRAM的价格 x 4,也就是正常堆叠倍数对应HBM4的价格 一旦DRAM降价毛利下滑,因为HBM的长约透明性,利润率都是有保障的,HBM就会间接抽走更多的DRAM产能,HBM的降价也会让GPU厂商更有动力尽可能的升级HBM size,这样也间接保障了DRAM的价格地板 DRAM的结构性指数增长的需求有了,density scaling放缓扩产难度在增加,厂商扩产计划都很谨慎,长鑫这几年带来的影响也是有限的,再加上需求的蓄水池非常庞大,这四个原因导致了,在可预见的至少五年甚至更长时间内,DRAM是很难进入周期低谷的。 —-------------- NAND SSD有希望摆脱传统周期性吗? NAND 的结构性增长动力没有 DDR 那么强,今年的缺货主要原因是几个主要玩家的生产纪律保持的很好,并没有大规模扩产,每年的产能增加主要来源于技术改进:NAND堆叠层数的增加 第一个结构性增长来自AI,主要来自 KV cache 的 offloading,把HBM溢出的warm/cold KV cache 卸载到 NAND SSD上。 但神奇的事情是,这个kv cache offloading的增长甚至还没有大规模发生,SSD就已经缺的比DRAM还严重了,涨价也比DRAM要更多。等到明年Rubin CMX放量,加上KV cache offloading大规模应用,SSD的缺货也会因为这个结构性增长而增长 第二个,另一个去年年度总结里说到的未来可期的AI视频带来的结构性增量,今年已经有出圈的态势了 Seedance体量在以一年十倍到四十倍的速度增长。目前它还卡在缺卡算力不足的阶段,需求被算力压着没完全释放。但等到缺卡阶段过去,AI 视频对NAND存储的结构性需求增长,会持续相当长的一段时间。 第三个结构性增长也同样来自于agent flow带来的Sandbox使用量的指数级增长,Sandbox为保障数据安全与隔离,如Analytical Agent 需为每个任务复制大量数据库和用户上下文,导致内存(DRAM)和CPU核心的严重浪费,同样会带来大量的SSD的浪费(需求) 第四个也许在2030年之后发挥作用的结构性增长,来自于HBF路线需要用到SSD,在不少投行分析中被寄予厚望,但这个技术路线还有些遥远,主要角色定位只能作为存放大模型的weights,写一次权重然后做只读,而且必须要和GPU/HBM封装在一起(48TBps/96TBps),否则靠PCIE7/8速度太慢完全无法用,只能说未来可期,下一篇AI半导体终局推演2026(III)会有更详细的分析 总之,NAND SSD的结构性增长没有HBM那么强,但是胜在便宜,价格到2027年也只有$0.8/GB,是同期DRAM的四十分之一,所以也算是多级缓存里的万金油属性,结构性增长来源太广泛了 也就是说,不存在DRAM/HBM单独涨价繁荣,而SSD不涨价的情况,因为如果这样的情况发生,那么大家就会想办法用SSD去承载DRAM/HBM的部分功能,用更低的成本实现类似的效果。HBM、DRAM、NAND 不是三个独立故事,而是同一 AI memory hierarchy 在不同温度层的结构性增长 结构性指数增长的需求有了,NAND SSD摆脱周期了吗? 那么就要看NAND SSD厂家的生产纪律了,唯一可能不遵守生产纪律的,只有长存。毕竟这是一个囚徒困境,一旦有一家不讲武德拼命扩产,整个NAND产业要扩产的难度比DRAM简单的多。 但最起码的,这一轮NAND同样是超级周期,几个结构性指数增长带来的需求,下行期推迟到2030年问题不大
宝玉
上次我说让 AI 很难跳出既定框架,有网友说是我提示词没写好,所以我最近换了一种写法,还真的有效果,简单来说就是让它基于要达到的目标,跳出框架,重新思考会有什么不一样的做法。 上次我在 AI 帮我翻译完视频后,我给它提问: > 如果跳出当前架构,让你基于功能重新设计当前的翻译流程,你会采取什么不一样的做法? 还别说,真的给了我一些不一样的思路。 但是我看完觉得可能不太靠谱,不过口说无凭,那咱们用数据说话吧。 我让它去开个 Worktree (因为还有其他任务再跑,不好开分支)去验证下: > 用一个worktree去验证你的方案,然后对比当前方案,看是否在不牺牲质量的前提下有更好性能。 等它验证完,发现并没有预期那么好,但是也不是完全没价值,可以部分借鉴它的方案。 有个小插曲,其实一开始我没看懂它的意思,也不知道是好还是不好,然后我去开了个 sidechat(/btw),让它给我详细的解释了一下: > 解释一下新的方案:值得做吗?是部分改进当前还是完全改进?具体怎么改进,请通俗易懂的给我解释一下,最好结合具体的例子 听它解释完我才明白,然后把解释的内容重新给它让它基于这些信息去实施了,对于提升质量还是有帮助。 至于为什么要用 sidechat,是因为这类解释的事情没必要放到主上下文,只是了解一下,除非后续需要用到一些聊出来的信息。 --- 简单总结一下: 1. 让 AI 根据目标跳出框架去思考,给出新的方案还是有帮助 2. AI 给的方案不一定靠谱,还是得要有人工验证,最好是有数据为准,不能全盘接受 3. 一些当前任务无关的问题可以问 sidechat
宝玉
问了下 AI 是如何做到的: 用 PID 做进程级取证,再结合项目规模、线程状态和源码完成因果定位。 这次的推断链是: - vmmap -summary 23870 显示物理 footprint 约 2.3 GB、峰值约 2.7 GB。 - 大头在 MALLOC_SMALL,而 IOSurface 只有约 14 MB、GPU 图形约 73 MB,所以视频帧池不是主因。 - Activity Monitor 显示 439 个线程,源码中又存在每个缩略图都 std::thread::spawn、随后等待 2 路信号量的逻辑。 - 项目时长约 24,278 秒,波形代码会生成完整的 16 kHz 单声道 Vec<f32>: 24,278 秒 × 16,000 samples/s × 4 bytes ≈ 1.55 GB 这个数字和实际内存峰值高度吻合。它属于“系统取证 + 源码验证”,不是单纯看 PID 猜出来的。
宝玉
让 AI 做性能优化很厉害,把 Activity Monitor 截个图,它能根据截图上的 pid 迅速定位到原因是啥。想起上古时代找内存泄漏可费劲了,要抓好几份内存 Dump,用工具分析堆栈,费很大劲才能定位到可能的原因。 现在 Agent 能很快找出内存占用大的原因,虽然我都不知道它怎么做到的…… 我要做的就只是找几个场景测试一下,让它分析就好,理论上来说都可以让 Agent 自己用 computer use 完成。
宝玉
蛮多不错的 GPT Image 提示词👍 https://github.com/freestylefly/awesome-gpt-image-2
宝玉
豆包今天发布了“豆包工作”,它和豆包桌面版应该是同一套程序和模型,但定位变了一个独立的办公 Agent 工作台。 豆包工作体验做的很好,有点像 Codex,能开项目、连接各种办公应用(尤其是飞书),体验后的一点感想: 一、用户的习惯正在发生变化,Agent 正在变成工作的入口 我发现自己处理工作时,下意识先打开的是 Agent,而不是某个应用。打开 Agent 之后,让 Agent 去帮我操作应用,我去验收或者调整 Agent 的操作结果。 这个变化看起来很小,但背后是一次入口的迁移。过去,应用是入口,人在应用里完成工作;现在,Agent 是入口,应用退到了后台,变成 Agent 调用的工具。 这种迁移一旦形成习惯,就很难逆转。就像人们从搜索引擎的首页开始上网,后来变成从微信和短视频开始,入口在哪,注意力就在哪,生态就在哪。 二、办公 Agent 已是红海,护城河可能在上下文 现在的 Agent,除了模型以外,Harness 这一层差距越来越小了,写文档、做表格、生成 PPT、操作浏览器,已经是各家基本功。模型可以换,工具可以接,功能差距会被迅速抹平。 真正的差距还得看 Agent 对组织了解多少,或者说能访问到哪些上下文数据,有最好的上下文,才有最好的企业级 Agent。 举个例子来说,我在《图解 Skill》举了个例子叫“周报 Skill”,如果你的 Agent 接不到任何工作数据,你就得把这周做了什么一条条告诉它,本质上你自己先写了一遍,它只是帮你润色。但如果 Agent 能读到你的会议纪要、你参与的群聊讨论、你编辑过的文档、你的项目看板,你只需要说一句“帮我写周报”,它就能基于你这一周真实做过的事,帮你生成一份有细节、有数据的工作总结。 所以,Agent 的通用能力容易被追平,但一个组织长期使用所沉淀下来的上下文:会议记录、文档资产、项目脉络、协作关系,这些才是别人复制不走的东西。谁拥有最完整的组织上下文,谁的 Agent 就能提供最精准的服务。从这个角度看,像飞书这样本身就是组织信息汇聚地的产品,天然就离这条护城河更近。 三、模型能力决定 Agent 能做多少事,权限决定组织敢让它做多少事 办公 Agent 和个人 Agent 有一个根本区别,很多人忽略了:权限。 个人场景下,你可以很随意。我自己就经常把 API Key 直接扔给 Agent 帮我验证代码,反正出了问题也只影响我自己。但在企业里,就不敢随便这么做了。 想想看,如果一个员工为了让 AI 帮忙写方案,顺手就把客户名单、合同内容、经营数据上传到了某个个人账号的 AI 工具,公司看不见他传了什么,不知道 AI 生成的内容又被转发给了谁,员工离职后这些数据还留在他的个人空间里。这不是假设,这是很多企业真实面对的情况,也是许多公司到今天还不敢放手让员工用 AI 的核心原因。 所以,企业级 Agent 必须解决一个前提问题:它得继承组织现有的权限体系。 员工看不到的数据,Agent 也看不到;未被授权的操作,Agent 也不能做。不是说限制 Agent 的能力,而是让组织敢把能力交给 Agent。 这一点上,那些本身就内建了完整权限和身份体系的协作平台有先天优势。Agent 接入之后,不需要重新搭一套安全架构,直接沿用组织已有的权限规则就行。 四、个人提效 ≠ 组织提效 这是我觉得最值得讨论的一点。现在每家公司都在推 AI,每个环节都有提效数字,但整体交付没快多少。核心原因是组织的流程还是围绕 AI Agent 之前组织架构搭建的,这些流程都是围绕人去设置的,有很多权限、审批都离不开人去做,但对 Agent 来说就会特别低效,Agent 只能在局部帮助提升效率,但是整体还是受制于人去确认审批。 真正的解法是围绕 Agent 重构流程:大部分确认环节交给 Agent 自验证,人只在关键路径上拍板。 但不是说这些确认环节都可以去掉,很多确认环节也都是有过很多教训之后才设立的,还是离不开人的判断,但有些流程是不是可以合并,是不是可以加速,还是值得仔细考虑的。 五、当 Agent 把很多执行的事情都做了怎么办? 这个问题很多人隐隐在担心,但换个角度看,Agent 把执行层的事做了:写文档、填数据、整理资料、跟进进度。并不是说人被替代了,而是人在往上走:更多精力要花在思考、决策和验收上。 过去,一个项目经理大量的时间花在整理信息、协调沟通、催进度上,真正用来思考“项目方向对不对、这个决策该怎么做”的时间都被挤占了。现在 Agent 把那些琐碎的事情接过去了,项目经理可以把精力放在更有价值地方,比如说:判断、取舍、创新。 回过头看,办公 Agent 的竞争,还得看谁能让 Agent 真正进入组织的工作现场:理解上下文、尊重权限、融入协作、推动流程,最终让人从执行中解放出来去做更有价值的事。 作为多年飞书用户,我一直很喜欢它在产品上的设计,那种想清楚了再做的克制感。这次豆包和飞书合并后,也是第一次看到两者真正融合的产物:「豆包工作」。意料之中,实际体验下来也没有让人失望。豆包的 Agent 能力加上飞书多年沉淀的组织关系、权限体系和协作数据,让人隐约看到了一种不一样的 Agent 形态:一种让 Agent 真正读懂组织、融入组织、为组织所用的形态。
宝玉
宝玉
豆包这个实时双语字幕还不错👍 https://twitter.com/dotey/status/2092048213087760532/photo/1
宝玉
Codex 做 UI 不行,还是得 Opus 或者 Fable 一般没必要用什么 superpower、grillme :) https://x.com/chaogetalks/status/2092026009474474068?s=20
宝玉
宝玉
RT @yaogangqiang: 我基于 Pi 开发业务产品,也是 contributor。这篇分享有多处错误,张冠李戴。 一个自动关闭、没有经过 human review 的社区 PR,被包装成了「Pi 官方方案」;PR 自行报告的 benchmark,也被写成了 Pi 的官方结论。 Session Tree、Lane 和 Operation Log 的架构描述来源自于 Harness v2 旧设计,不是当前 dev 的最新方案。 「DSH 会永久丢失原始结果」,是社区 PR 对 DSH pruner 的评价,不是「Pi 官方表示」。 传播这么广,可能是因为同时抓住了 Coding Agent、Pi,DeepSeek、Claude Code 热点。毕竟,「爆了」比「事实」更吸引眼球。 也许更值得警惕的是,评论区看不到有人核查原始来源和这些结论。
宝玉
这种技术选型,我年轻的时候会选 DeepSeek Harness,现在会选 Pi。 年轻的时候追求技术上的新和酷,喜欢学新的东西,总觉得什么都要用用什么都要学学,喜欢折腾,较少的考虑项目和团队。 现在更追求项目需要的、稳定的、简单的,先做出来才是最重要的,能稳定运行更好。Pi 就简单稳定,DSH 还是新东西,稳定下来还要一段时间,何苦来哉。 再说了,现在有 AI,测试覆盖好一点,以后要换底层其实没那么难。
宝玉
如果对 DeepSeek Harness 有兴趣的,可以看看,写的很好👍
宝玉
RT @LinearUncle: 🚨突发:Grok Bot 0.18.0 被Bennett 小哥发现打包时未关闭 source maps,原始源代码被他完整逆向还原。 GitHub: https://github.com/b-nnett/grok-bot-0.18-reconstructed 这是研究 Grok Bot 内部实现原理的绝佳机会——系统提示词、工具定义、模型路由逻辑全部可读。 建议感兴趣的尽快学习,最新版本我实测已经没有source maps了。
宝玉
RT @XDustinWei: 写公众号真的能改变人的命运! 我是那种比较内向,甚至有点社恐的人,很怕在公开场合表达,刚开始的时候我都不敢把自己写的小破文章发出来。 后面有认识的大佬的鼓励,下定决心跨出第一步,跨出第一步后好像也没那么难。 从去年12月,我开始定期更新公众号,也不频繁,就下班写一写,赶上热度也有文章冲上了10W+ 然后就有商单找我,而且写着写着竟然也有出版社联系到我出书。 这些是我之前想都不敢想的! 而最近,这件当时觉得有点不可思议的事,真的落地了,我写的《Codex提效手册》正式上架了。 也特别感谢人民邮电出版社图灵的编辑老师,最初邀请我写这本书。 来X上,我还特别想感谢一下宝玉老师 @dotey 和花叔 @AlchainHust ,第一次写书多少有点不自信,但把书稿给到大佬后,收到了他们的推荐,这给了我很大的信心。 半年前的我,连发篇文章都不敢,现在我居然有了自己写的书。 我觉得,写作真的在一点点改变我的命运轨迹。
宝玉
软件行业有一条康威定律:“你有什么样的团队沟通结构,就会造出什么样的系统架构”,反过来,系统架构也会决定组织架构。 传统软件开发的组织架构是围绕传统软件工程打造的,所以有需求分析 → 产品设计 → 架构 → 编码 → 测试 → 发布这样的开发流程,也产生了产品经理、架构师、软件工程师、QA 工程师、运维这样的角色。 这样分工不仅是因为软件开发的流程,还因为随着软件系统越来越复杂,个人很难完整的掌握所有能力,也几乎没有精力去做所有的事情,所以必须依赖团队分工协作。 这个问题在软件工程神作《人月神话》里面有专门讨论:n 个人有 n(n-1)/2 条沟通路径,沟通成本随人数平方增长。 作者 Brooks 也试图给出解决方案,他从外科手术室找到了灵感:把整个系统的设计决策集中在一个人(外科医生)的大脑中,其他人全是支持角色。沟通路径从网状变星型,层级减少平方值也大幅降低。 这个架构的好处在于:一个 10 人左右小团队,真正做设计决策的只有 1 人,但整个团队的产出却远超 1 人所能达到的上限。因为外科医生的所有认知带宽都被释放出来专注于最核心的事情——思考和决策。 但当年为什么这个模式没流行?我估计很多人都第一次听说这个模式。 1. 外科医生级别的人才极其稀缺,而且这种模式高度依赖个人,如果这个人离开或判断失误,整个团队就会瘫痪。 2. 随着软件规模和领域复杂度的爆炸,要求一个人掌握整个系统的所有设计细节变得越来越不现实。 3. 工具的进步(版本控制、IDE、CI/CD)让一部分辅助角色自然消亡了,团队结构也随之进化成了我们今天更熟悉的敏捷模式。 但 AI Agent 时代来了,Coding 能力越来越强,这个模式倒是可以拿出来讨论,也许变得可行。 Agent 可以是那个支持团队。 一个能定义问题、有判断力的人,带一群 Agent,就是一个完整的交付单元。 “1 个人 + AI” 正在逼近 Brooks 想象中的外科手术团队的产出。 一个技术判断力强的工程师或者产品经理或者任何其他角色,配合 Claude Code、Codex 这类 Agent,可以去思考架构和核心逻辑(外科医生的角色),让 AI 生成实现代码、编写测试、处理样板文件、重构、写文档。 这样决策权高度集中在一个人脑中,执行力被极大放大,沟通成本极低,因为 AI 不需要对齐上下文的会议,它直接读代码。 但这不意味着执行力可以无限扩大。 外科医生需要在脑中维持整个系统的一致模型。AI 加速了执行,但并没有扩大人类工作记忆的容量。一个人能用 AI 更快地写出代码,但他能同时驾驭的系统复杂度并没有同比例增长。 这意味着,AI 时代的外科医生模式可能在中小规模系统上极其高效,甚至于一个人顶一个传统团队,但在超大规模系统上,仍然需要某种形式的分工,只不过分工的粒度和方式会发生变化。 比如让几个“外科医生”各自带着自己的 AI 团队,分头推进不同的模块,模块之间靠设计好的接口契约来保持松耦合。 无论当前的 AI Agent 多强大,最终的瓶颈始终是那个做判断、做取舍、在脑中维持系统一致性的人类大脑。 也许只有等到 AGI 真正到来、AI 能完全替代人类做系统级决策的那一天,这个瓶颈才会被真正突破。
宝玉
RT @ixiaowenz: 十年前需要写一个多月的项目,如今在AI辅助下一天就能完成;过去必须先搭建项目骨架、写基础类才能开始业务逻辑,现在打开笔记本先写提示词,测试通过后AI已经承担了大部分实现工作。 这种体验是实实在在的,开发者第一次感受到“一个人就是一支队伍”的可能。 也正因如此,组织会本能地选择批量购买 Token,把AI工具分发到每个基层工程师手里,认为100个人提效 20%,乘以100至少就相当于团队多了 20 个人啊。 说穿了,个人效率解决的是“更快地完成眼前这件事”,组织效率解决的是“省掉哪些不值得做的事”。 AI的终极价值不是让所有基层员工在细分场景里变得更快,而是让高一级角色拥有“直接做出完整结果”的能力——这种能力在AI出现之前只属于一个完整的团队。 当组织把AI的杠杆交给那些本来就能定义问题、整合资源的人,他们就能用一天时间完成过去需要协调数周才能交付的东西。 反之,把杠杆交给那些只会执行局部指令的人,他们只是把原本一小时的事缩短到半小时,而组织层面看不到任何变化。
宝玉
是这个道理,每个人常用的 agent 就那么两三个,没必要我用个服务或者 App 还要用你的内置 agent,最佳形式是这些服务或 App 提供 MCP 或者 cli,从 agent 里面去访问相应的服务或应用就完了。
宝玉
响马高见: > 工程师永远不会消失,但是工作方式会变化。工具化永远会进化到 roi 低于人力的边界,然后需要更多的人力来补齐最后的缝隙。 类似于你开了一家餐厅,买了一台洗碗机,一下子替代了 3 个洗碗工,效率高、成本低。这就是工具化带来的 ROI(投入产出比)远高于人力的阶段。 但洗碗机洗不了所有东西。异形的锅、烧焦的铁板、精致的瓷器,这些还得靠人手洗。你可以花大价钱去研发一台能洗一切的超级洗碗机,但为了搞定最后这 5% 的餐具,你可能得投入比前面 95% 多十倍的钱。 这时候你算一笔账:与其砸钱造那台超级机器,不如留一个洗碗工来处理这些边角料,人力反而更划算了。 工具进化到某个点之后,再往前推的成本急剧上升,ROI 跌到比直接用人还低。 另一个角度,工具越强,整个行业的总产出往往也在膨胀。洗碗机让你的餐厅能接待更多客人,于是产生了更多的异形锅、更多的特殊情况,那些“缝隙”的绝对数量反而变多了。所以你可能裁了 3 个普通洗碗工,最后又请了 2 个专门处理疑难杂症的人。 AI 工具会吃掉大量标准化的编程工作,但软件行业的总规模也会因此爆发式增长,而增长带来的各种边界情况、系统集成、业务理解这些“缝隙”,短期内仍然需要人来填。
宝玉
现阶段画图并且能自由编辑最佳方式应该是 HTML 或者类似于 HTML(比如 React)的方式,因为这个训练的最好的画出来效果最好的。 而且 HTML 可以方便的编辑,也可以转换成其他可编辑格式。
宝玉
这是一个有意思的 Skill,叫 ELI5,意思是就好比你给 5 岁孩子解释这件事,所以要通俗易懂。生成结果是 HTML 页面。 其实你要是不经常用都没必要去安装这个 Skill,这个 Skill 里面也就是一句提示词而已。 提示词(https://t.co/TKelmhfNq3): 请把我当成对这个话题一无所知的人,用一个包含大图且文字较少的 HTML 组件来向我解释。
宝玉
为了节约 Token 成本(低峰时 Token 费用更低),程序员都要开始倒班了吗?😂
宝玉
为了节约 Token 程序员都要开始倒班了吗?😂
宝玉
Fable 默认用 high 就够了,然后让它主要负责编排、验收,这样是最经济实惠的。 附提示词: > 注意你的主要任务是分析、编排和验证,具体任务尽可能交给 subagent(Opus 或 Sonnet)去执行。自己只做需求澄清、方案拆解、任务分发和结果验收,实现类工作(读大量代码、写代码、跑测试、批量修改)一律用 Agent 工具派给 subagent 执行。
宝玉
RT @tianyi: 可以试试 DSH 最新版啊,内置了新的多模态模型 DeepSeek-V4-Flash-Vision-Exp 支持。
宝玉
RT @VincentWei93: 最近研究了一个 skill能够生成类似产品发布宣传片质感的动效视频。前段时间在尝试 remotion 插件+Claude code,视频动效基本处于 PPT 动画的水平。没有镜头运动,没有转场,没有音效,没有足够丰富的动画特效。于是我开源了这个video-shotcraft skill:https://github.com/Vincentwei1021/video-shotcraft https://twitter.com/VincentWei93/status/2079118667074376114/video/1
🎬
视频
宝玉
RT @shaogefenhao: 总结一次软件工程研讨会10条关于 AI Native 的共识: 1. BA比开发更稀缺,供需比从1:5降至1:2甚至1:1,AI加速编码但需求产出跟不上。 2. 用户故事(粒度3-5天)已过时,AI一日完成,改用Feature粒度+验收标准,取消故事写法。 3. 需求文档改用Markdown存放于代码仓库,与代码统一版本管理,AI可直接读取。 4. 测试岗数量减少,但保留至少一位专业测试专家指导,开发无法完全替代测试判断。 5. B端项目不再配UI/UX设计师,BA用组件库出原型,AI生成HTML,同构框架直接复用前端组件。 5. 每位开发须具备方案设计与Code Review能力,Tech Lead转向方案管理、谈判与业务对接。 7. AI时代沟通能力优于纯技术,角色边界模糊,所有人向沟通与人际侧迁移。 8. 团队缩至4-5人:BA、全栈开发、测试专家、Tech Lead级方案谈判人员,运维渐被Agent化。 9. 纯技术执行层非护城河,AI优先替代;安全感源于业务理解与方案转化能力。 10. 长期出路在业务侧:软件工程师→Tech Lead→产品/业务,方案咨询与需求挖掘最稀缺,全行业向需求侧集中。
宝玉
赶紧加上(~/.claude/settings.json): "crossSessionInbound": "refuse" https://x.com/cjav_dev/status/2087945160470495487?s=20
宝玉
这个跨 Session 消息通知功能我至今没找到关闭的地方,而且它极其愚蠢的会通知所有历史会话,一堆早已结束了的没有 Cache 的 Session 被唤起,Token 一下子消耗的飞起! https://twitter.com/dotey/status/2090462021640729074/photo/1
宝玉
靠 Skill 差别不大,要设计好没 AI 味,最重要的当然是人的审美;其次是模型,GPT 就做不好设计,Claude 就强很多;最后靠的是个性化的设计系统(design system)有一套设计的规范和组件,而不是一堆不能怎么设计的规则
宝玉
claude design 是原型和设计一体的,不依赖于 Figma 做设计,也可以导入 Figma 设计稿。 产出物是react+模拟data,可以直接交互,agent可以方便的还原成代码。 claude 直连 figma,主要是方便你操作 figma,还是依赖于 Figma 的设计。
宝玉
RT @yetone: 在 Agent 领域,从 Tauri 迁移到 Electron 的越来越多了。上一个比较大动作的是 OpenCode Desktop 版,这一次轮到了 Paseo。理由都是一样的,先因为氛围选择了 Tauri 后因为现实迁移到 Electron,然后真香!可能唯一的区别就是他们不会把我的建议写到他们的简历中去。我成为不了他们宏大叙事的一部分了。
宝玉
这个 Logo Skill 效果不错,推荐👍 https://twitter.com/dotey/status/2090279269683319189/photo/1
宝玉
Claude Code 现在内置 Claude Design 了,今天试用了下,很好用,比在网站上用方便多了,和本地项目打通了,不用来回切换了。 用的时候很简单 /design + 你要设计的内容 就可以。 如果你用 Claude Code 的话,不再需要用 baoyu-design(https://t.co/8zkHcKkI7h) 这种 skill,直接用内置的 /design 最好用。 如果你还没有把 Claude Design 用起来,一定要试试。
宝玉
RT @mike_chong_zh: 昨天 @screenkite_com 做到了 $300K ARR 。想来分享下。 @hackbearterry 今天在 Threads 上也提到“Vibe Coding 降低做出 Demo 的門檻,但是 Demo 不是交付。現在這個時代真正困難的已經不是把東西做出來,而是能夠找到願意為產品買單的客戶,然後讓他們掏錢” 楼下我分享下具体的故事 https://twitter.com/mike_chong_zh/status/2090194486639071547/photo/1
宝玉
智谱联合创始人唐杰老师关于 GLM 5.3 以及模型训练的一些分享: 智谱 GLM-5.3 没有换基模底座,纯靠后训练让编码能力提升 50%。 GLM-5.3 模型的底座是 GLM-5.2,约 743B 参数的混合专家(MoE)模型,每次推理只激活约 40B 参数。团队花了一个月,在长周期环境中做强化学习,编码能力比 GLM-5.2 提升了 50%。 这里解释一下 MoE:传统模型每次推理要跑完所有参数,MoE 相当于把模型拆成一群“专家”,每次只调用其中几个,推理速度更快、成本更低。 推文中特别区分了两个概念: 1. 总参数量决定模型学习了多少知识 2. 激活参数量和有效深度决定模型能想多深。 比如说,让模型去找安全漏洞,主要是依赖的是推理能力,能把一条二十步的推理链完整走到底,相对来说各种安全数据库是次要的。 至于为什么不换底座也能大幅提升呢? AI 模型的扩展(scaling)不止堆参数这一条途径。 如果梳理下这些年模型训练的发展路线: - 2020 年 Kaplan 等人的研究建议参数增长要远快于数据,GPT-3、Gopher 都是这个思路的产物。 - 2022 年 DeepMind 的 Chinchilla 论文则认为参数和数据应该同步增长,参数大的模型反而是最浪费算力的。 - 再后来,大家发现模型上线后推理成本远超训练成本,最优解又变成了用更小的模型训更久,比如 Llama-2-7B 每个参数喂了约 290 个 token,Gemma-2-9B 更是喂了 889 个。 模型能力由很多因素决定:底座大小、预训练数据量、每次前向传播的计算量、后训练。 对于现阶段,模型后训练还有很大潜力可以挖掘。
宝玉
Jason Wei 这条推文倒是没聊 AI,聊的是运动和职业思维的关系:你选的运动,可能在悄悄塑造你的职业大脑 推文提出了一个挺有意思的概念:“认知奖励形状”(cognitive reward shape),意思是不同运动对大脑的激励模式不一样,而这种模式会潜移默化地影响你在职业中的思维方式。 Jason 拿自己最喜欢的两项运动举例。 网球是一项极度强调稳定性的运动。一场比赛打几百分,不管你打出了多漂亮的制胜球,它也只值一分,跟对手送你的非受迫性失误一样。所以网球的赢法就是少犯错、打概率、一分一分磨。 而且网球是单打独斗,一切只能靠自己。这种思维模式特别像外科医生或飞行员,你做过最完美的一台阑尾手术,和做过最平稳的一趟航班,都不会有额外加分,职业的本质就是高度一致、容错极低。 但这套思维放到创业上就不太对了。创业是高波动、团队作战、容忍失败、偶尔一把创意能换来指数级回报的游戏,和网球那种"把非受迫性失误降到最低"的心态完全是两个方向。 足球前锋则更接近创业的奖励形状。哪怕是姆巴佩状态最好的比赛,大部分拿球也没能产生什么。但这不重要,重要的是不断制造机会,只要抓住一两次就能决定比赛。一场 90 分钟的比赛拆开看,绝大部分时间是无效尝试,几分钟是关键杠杆点,几秒钟定胜负。踢一辈子前锋的人,会自然习惯与失败共处,并且对不对称回报保持直觉。 这个框架有简化的地方:创业同样需要稳定性,足球守门员的奖励形状和前锋也完全不同。 核心观点倒是没什么问题:大多数人选运动靠的是父母、地理位置、学校开了什么课这些偶然因素,很少有人想过,长期练一项运动会怎样重塑自己感知风险、付出和回报的方式。 以前我导师跟我分享过一个经验:说不要让孩子学那些一个人就能完成的运动,比如乒乓球、羽毛球;而是去学那些需要集体协作的团队运动,比如足球、篮球、排球,这样能更好的锻炼孩子的协作能力、领导力。
宝玉
RT @jakevin7: Apache 孵化器迎来了第一个 Agent Harness 项目 —— Apache Maka (Incubating) 🎉 https://github.com/apache/maka Maka 目前是性能最前沿的 agent 之一,持续的打磨了Harness 效果和经济性,在benchmark上取得了顶尖的分数和排名,且报告完全开源可复现。 — Maka 将是一个完全开源&中立,自研 Harness 核心的 Agent 项目。项目由社区协作推,builder群非常活跃,项目推进速度极快。 Maka 的仓库建于今年 5 月 27 日,到 7 月底、10 周时间:71 万行 TypeScript(其中 35 万行是测试,949 个测试文件)、2439 commits、1218 个已合并 PR、合并率 93.8%、PR 合并中位数 33.5 分钟。光 7 月就合了 943 个 PR。 — 为什么要捐给 Apache? 因为 harness 这一层,正在变成各家模型厂的私产。每家都在做自己的官方 CLI,而开放模型的生态里,缺一个不偏袒任何一家、又能把开放模型性能榨到极致的 harness。 Maka 的愿景:做最适配各种开放模型的高性能 Harness。 这次捐献也是我们对 AI Agent 时代开源模式的一次探索 如果你也在做 agent harness,欢迎来 star、提 issue,或者认领一个 good first issue:https://github.com/apache/maka
宝玉
宝玉
RT @mylifcc: 我把 Claude Code 2.1.234 的包拆开了 昨天我想弄清楚一件小事。两个 Claude Code 窗口互相传话,底下走的是什么。 结果有两种传递方式: 本机session之间传消息用的是 Unix Domain Socket(UDS) 跨机器走云端 可以把它想成每个Claude Code窗口在本机开一个只属于当前系统用户的收件箱。另一个窗口往这个 socket 里丢一行纯文本。/status 里那行 Peer address 前面的 uds:,就是这个东西。
宝玉
这是上一次延期的公告😂 https://x.com/dotey/status/2078542101340442638
宝玉
Anthropic 感觉就总是给人很纠结很不爽利的那种感觉!这提升 50% 额度明明挺好的事,停了又怕你不满意,彻底放开又舍不得,就一次又一次的延期,还不如索性一直提升 50% 得了。 就跟当年 Fable 5 一样,一会说只有 2 周,一会又延期,最终还是放开了,但这个过程就给人感觉挺不好!
宝玉
Deepseek Harness 如果是 SDK 为主也能达到数据入口的效果吗? &gt; 像 ZCode 这样的 Coding 产品,不只是变现工具,也可能成为数据入口:用户完成真实的软件工程任务,产生长周期执行轨迹,再反哺下一轮 Post-training,形成“产品使用 → 数据 → 模型升级 → 更多使用”的飞轮。
宝玉
一直有一种观点,就是小模型加 Harness,就能达到大模型的智能效果: > 只需要一个 10 亿参数的小模型作为“认知核心”,其余能力靠联网搜索、执行代码等工具补齐就够了。 Jason Wei (思维链提示技术的核心作者之一)的新推文,反驳了“小模型+工具”路线,认为光靠工具,撑不起顶级智能,把知识“内化在大脑”和“现查现用”是两回事。 小模型+工具就能行的观点之所以流行,因为理论上确实说得通:模型不知道的冷门知识,可以上网查;不会算的题,可以调用代码。小模型加工具,似乎没有做不到的事。而小模型意味着更低的算力成本,对整个行业都很有吸引力。 他用自己学羽毛球打了个比方。教练教的每个动作他都能做出来,但要在实战中流畅串联,跟练了上万次形成肌肉记忆的人完全不是一个级别。语言模型也一样,内化了知识的大模型和靠工具临时检索的小模型,体验差距很明显。 具体来说有三点。第一是速度,直接给出答案远比调用工具搜一圈再回答快得多。第二是理解的深度,比如你问一个音乐节的口碑如何,大模型能基于海量数据给出综合判断,而小模型只能搬运搜索结果里排在前面的几条评论。第三是可靠性,每次都要重新查资料、重新推导,出错的概率更高,在复杂的长任务中错误还会层层累积。 回顾“苦涩的教训”(Bitter Lesson)里面的观点:历史反复证明,靠扩大规模获得的能力提升,总是胜过精巧的工程设计。工具让小模型能做更多事,但追求最高质量的用户,始终会需要更大的模型。
宝玉
这个有意思,先装弱智跟 AI 胡乱下,把 AI 跟着一起弱智下,最后再赢它。 想起那句名言: “你永远不要试图战胜一个纯傻逼,因为他会把你的智商拖到和他一个水平,然后再用他丰富的经验打败你!” 但据说是23年的视频,现在估计不行了吧?
宝玉
这个有意思,先装弱智跟 AI 胡乱下,把 AI 跟着一起弱智下,最后再赢它。 想起那句名言: “你永远不要试图战胜一个纯傻逼,因为他会把你的智商拖到和他一个水平,然后再用他丰富的经验打败你!”
宝玉
豆包越来越像 Codex 了,这是我最近用下来最直观的感受。Codex 一直是我心里 Agent App 体验的标杆,而豆包这波更新,从 GUI 电脑操作到手机远程操控,很多设计思路都能看到 Codex 的影子,有些地方甚至做了本土化的超越。 最近我老婆回国,在国内用不了 ChatGPT 和 Claude 这些,日常就用豆包帮她查资料、做攻略。这两天她需要在自己电脑里找个文档,人在国内,电脑在美国——直接用手机上的豆包指挥美国这边的电脑,帮她把文档找出来发到飞书,手机上就能访问了,非常方便。 注意使用的时候要在手机和电脑上登录相同的账号,并且电脑上要允许手机连接才行。然后从手机打开“工作任务”,就可以在底部看到你连接的电脑端。 (参考图3图4) 手机指挥 Agent 现在是我日常用得很多的功能。在外面的时候可以随时从手机看 Agent 任务的执行进度,或者临时想到什么事情,通过手机就能指挥家里/公司电脑上的 Agent 去执行,回家直接看结果,通勤路上也不耽误。 之所以要通过手机指挥电脑,是因为电脑上的资源通常是最全的:硬盘上有所有文档、代码库,有各种配置好的技能,而电脑又不可能一直随身带着。想想看,快下班的时候还有个任务没跑完,又不想干等着,那就先让 Agent 跑着,用手机连上电脑随时看进度,有问题还能中途插话调整。动口不动手,重复活儿全甩给它。 豆包在 Windows 版本上的 GUI 电脑操作功能体验下来相当的好用,它巧妙的通过豆包虚拟桌面让人和 AI 同时操作电脑,互不干扰,这点优势还蛮明显的,有点我第一次用 Codex 在 Mac 上的 Computer Use 感觉一样,就是它帮你操作电脑 App,但是完全不影响你当前正在执行的任务。不像 Claude Code 一旦使用 Computer Use,你就得等它操作完才能继续干活。 (参考图1图2) Computer Use 让 Agent 直接帮你操作图形界面的软件:点按钮、填表格、下载文件,理论上即使没有提供 CLI 的软件都能控制。日常能用的场景很多: - 办公类:新建和排版 Word/Excel/PPT,处理函数、生成图表,或者让它开着浏览器做调研然后直接产出 PPT - 桌面类:批量归类整理文件、改系统设置、管理启动项这类琐碎活儿 - 长尾类:PS 批量改图导出、证件照排版打印,甚至通过微信桌面版帮你发消息 - 发散玩法:游戏帧率优化设置、自动化信息收集整理…… 基本上你觉得「这活儿也能甩给 AI?」的重复劳动,都值得试试 我自己使用 Agent 有个技巧,就是尽可能让 Agent 能自己检查自己、拿到反馈。比如写程序,要让它自己写测试,或者用 Computer Use 去验证 App 的运行操作,自己去模拟用户操作;即使是让 AI 生成 PPT,也会让它自己截图验证下看看效果。这样可以减少人工干预,最大化利用好 Agent 的能力。 入口在豆包 PC 端的「工作任务」模式里,Windows 用户记得升级到最新版;Mac 目前还只支持内置浏览器的 GUI 操作。
宝玉
RT @desenmeng: 我支持内部尽可能开放,外部有意识地限制。平台应该有自己的判断,而不是把所有可能性原样交给插件作者和用户。 “一切皆插件”作为内部架构原则,我非常认同。通用引擎最怕的就是不断被具体产品的需求侵蚀:今天加一个特例,明天再补一层判断,最后虽然还叫通用引擎,实际上已经只能服务当前这个产品。其他人想做不同的东西,只能 fork,然后各自维护一套。 所以 DSH 希望把 Agent Loop、Session、Tool Runtime、LLM、Persistence、Sandbox 甚至 UI 都变成可以重新组合的部分,这个方向是有价值的。Harness 还处在快速变化期,现在也没有哪套实现已经被证明是最终答案。底层如果太早写死,后面想换一种上下文组织方式、Session 模型或者 Agent Loop,都会很难。 但我不认为,由此就能推出“所有内部逻辑都应该成为第三方扩展点”。 把 Pi、VS Code 和 DSH 放在一起看,区别其实不在于谁有插件冲突。Pi Extension 一样可以注册同名 Tool、修改 Prompt、拦截同一个事件;VS Code 里也一直有格式化器、快捷键和语言服务互相影响的问题。只要多个扩展可以同时运行,命名、顺序、优先级和兼容性就一定会出现。 真正的区别,是插件可以改到哪一层,以及平台有没有提前规定这些变化怎么组合。 VS Code 的做法是,核心仍然由平台控制,第三方主要通过 Contribution Points 和稳定接口增加能力。某个扩展点允许多个 Provider 时,宿主决定结果怎么合并;某个能力只能有一个实现时,就让用户选择;名字必须唯一的地方,就在注册时处理。它当然不能消灭冲突,但它尽量把冲突限制在已经定义好的范围里。 Pi 更开放一些。Extension 可以注册 Tool 和 Command、修改上下文、监听或拦截 Agent 的运行过程,甚至通过同名注册覆盖内置 Tool。但它仍然有一个相对固定的 coding-agent core。Agent Loop、Session Runtime 等部分主要由宿主持有,所以 Extension 大多还是围绕同一个内核运行。 DSH 再往下走了一层。它不是在固定内核周围增加能力,而是让插件共同组装内核本身。Session、Agent Loop、Tool Runtime、Persistence、Sandbox 都可能来自不同插件。 这种设计的自由度确实更高,但需要处理的问题也不再只是“两个 Tool 重名”。 DSH 实际上同时存在几套身份:npm/module instance、Cordis service 或 Symbol、loader entry、Tool/Command/Route/Prompt 的名字,以及 host/preset/agent/session 的 Scope。同一个插件在配置里看起来只装了一次,不代表运行时一定只有一个 module instance;module instance 相同,也不代表 registry、loader 和 Scope 对它的理解一致。再加上 reload 和 generation 切换,问题还会沿着时间继续展开。 这不是纯理论问题。至少在 rc.6 的社区运行时报告里,已经出现过双实例导致 Symbol 分裂、重复 loader entry、process-global registry 冲突、late provider 工具重名,以及旧 generation 没有完全 dispose 等情况。这里需要强调,这些是社区报告,不等于维护者已经确认了同一个根因;但它们足以说明,DSH 要处理的是一整套运行时身份和生命周期问题,不只是普通的插件重名。 Cordis 能很好地处理 activation、依赖等待、effect disposal 和 Scope visibility,但这些机制本身并不会决定:重复注册应该 reject、replace、merge 还是 shadow;谁拥有一个名字;两个实现谁优先;安装失败以后怎么回滚;旧 generation 什么时候才算真正退出。 这些选择最后还是要由平台来做。 Effect 也是一样。它能把依赖和副作用表达得更清楚,让资源释放、重试、并发和 TestClock 变得更容易测试。这是很大的价值,我完全认同。 但能够静态知道一段代码访问了文件、网络或者数据库,并不等于系统已经知道两个插件发生冲突时应该听谁的。知道“发生了什么”和决定“应该怎么办”,是两件事情。 外部操作尤其明显。消息已经发送、文件已经被读取、支付已经完成、货已经发出,这些事情不会因为插件 dispose 就自动消失。框架可以让它们更容易追踪,也可以强迫开发者把补偿逻辑写出来,但具体是重试、补偿、对账还是人工处理,仍然是产品选择。 所以“不 fork 主干”当然是个很好的目标,但它不会让不同需求之间的分歧消失。以前这些分歧存在于代码分支里,插件化以后,它们会存在于 Profile、Bundle、Scope、插件版本和加载顺序的不同组合里。 这通常仍然比长期维护多个 fork 更好,但维护成本只是换了位置。以前处理 merge 和升级,现在处理依赖、身份、生命周期、状态兼容和组合测试。 AI Coding 可以降低写 Adapter、迁移接口和补兼容层的成本,却不会自动决定两个插件冲突时哪一种行为才符合产品意图。代码越来越容易生成以后,平台自己的判断反而会变得更重要。 这也是我为什么更支持“内部开放,外部限制”。 平台不应该只是一个中性的插件容器。它首先应该知道自己要做成什么产品,然后决定哪些变化可以交给第三方,哪些行为必须保持一致。开放一个稳定接口,不只是让别人能够调用它,也意味着平台准备长期维护它的语义、升级方式和失败处理。 如果平台对什么都不做判断,默认所有逻辑都能被第三方改写,那么冲突出现以后,用户只能自己判断应该装哪个插件、谁覆盖谁、哪个版本能一起工作。这个结果不是更开放,而是平台把集成工作转交给了用户。 我的选择会很明确: 内部实现可以尽量模块化,Agent Loop、Session、Persistence、Sandbox 都应该有替换空间。这样核心团队自己做实验、切换实现或者服务不同产品时,不需要不断侵入底层代码。 但面向普通第三方时,应该只开放平台已经想清楚的部分。Tool、模型 Provider、Command、Prompt、上下文来源和 UI Contribution,可以较早形成稳定接口;Agent Loop、Session、Sandbox、Persistence 仍然可以允许替换,但先放在 experimental 或 proposed 层,不急着承诺跨版本兼容。 真正需要完全控制 Runtime 的团队,可以进入更底层的 distribution 层,自己固定插件版本,并测试 install、boot、reload、dispose 和 resume。到了这一层,他做的已经不只是写一个插件,而是在维护自己的发行版,自然也应该承担对应的集成责任。 所以我不反对“一切皆插件”。我反对的是把内部可替换性直接等同于外部无限扩展。 内部越开放,平台越有空间继续演化;外部越克制,第三方越容易知道哪些东西真的可以依赖。这两件事并不矛盾。 一个好的平台不只是提供可能性,也要敢于做选择。什么应该允许扩展,什么应该保持统一,什么现在还没想清楚、只能作为实验接口存在——这些判断本身,就是平台应该提供的价值。
宝玉
宝玉
Claude Code 最新版本上线了一个特别讨厌的功能,频繁的给其他正在运行的 session 发消息!还老是搞错,除了浪费 token 并没有太大价值…… 默认打开我都没找到哪里关掉! https://twitter.com/dotey/status/2089550603731054617/photo/1
宝玉
OpenClaw 真的凉凉了吗? > @凤凰网科技【美团高管反思全员养虾】据媒体报道,美团核心本地商业CEO王莆中表示在公开演讲中,完整复盘了美团内部进行AI变革的过程。 > 谈到今年2月到3月,公司开启全员“养虾运动”,王莆中提及但结果是账单暴涨,每日消耗上千万元,同时养虾产生的谬误干扰了真实经营。(快科技)
宝玉
Cursor 的代码托管平台 Origin 正式上线,用户可以从 GitHub 同步仓库开始使用。 Origin 简单说,就是 Cursor 自己做的 GitHub。代码存储、Git 托管、代码审查、团队协作,一站式解决。但它和 GitHub 最大的区别在于设计前提:GitHub 是为人类开发者的工作节奏设计的,一个作者、两个审查者、按顺序合并。Origin 从一开始就把 AI Agent 当成主要用户来设计。 这个定位背后有具体的技术支撑。在 Compile 大会的演示中,Origin 在单个仓库内跑到了每秒 22.6 次提交,每小时 29.6 万次克隆,全球同步延迟低于 400 毫秒,还内置了 AI 驱动的自动合并冲突解决。这些数字对应的场景是:当你同时跑十几个 AI 智能体在一个仓库里并行写代码、开分支、提交 PR 时,传统的 Git 托管平台会变成瓶颈,Origin 就是为了解这个瓶颈而生的。 Origin 的技术底子来自 Cursor 2025 年底收购的 Graphite 团队。Graphite 做的是“堆叠式 PR 管理”,也就是让多个有依赖关系的代码变更可以并行处理,天然适配 AI 智能体的工作方式。从落地策略看,Cursor 选择先上线代码审查层,再逐步迁移托管功能,降低用户从 GitHub 切换的门槛。目前第一步就是从 GitHub 同步仓库。 Origin 上线意味着 Cursor 的纵向整合闭环成型:编辑器、云端智能体、代码审查、代码托管,全部在一个产品内完成。对比之下,GitHub Copilot 走的是横向路线,在已有的 GitHub 基础设施上叠加 AI 功能,底层架构还是十年前的设计。 对开发者来说,短期内 Origin 更像是 Cursor 生态内的增值功能,不太可能让团队立刻把核心项目从 GitHub 搬走。但如果你已经在用 Cursor 的云端智能体跑后台任务,Origin 的价值会很直观:代码从生成到审查到合并,整个流程不用再跳出 Cursor。
宝玉
RT @Stephan_Talk: 这个问题其实还挺典型的,软件工程越来越重要这个观点我很赞同 在以往的传统软件工程中,我们在写代码之前会先明确需求 -> 架构设计 -> 接口设计 -> 模块实现 ... 这样的流程 当下的 AI 虽然非常非常聪明了,但它无法知道它应该知道但你没告诉它的事(看起来像废话吗?其实不是)。比如这个项目的预期维护周期,是一个临时小工具,还是一个会持续迭代几年的大项目?项目需求是否会持续迭代,随着迭代可能的架构相对变化和不变的地方都有哪些? 这些问题,如果你不告诉 AI 的话,它一般会以最小可实现代码来实现,以免过度设计 我现在 Vibe Coding 的感觉是,有些东西是不能完全交给AI的(至少是和AI共同结对编程来明确),比如 整体架构、表结构、数据结构、接口设计 这些 当然我也有直接 /goal 的时候,这种情况还挺多,就是在一次性小项目或者一个原型项目的时候,我希望能尽快出来看看效果,而不是长期维护 如果这个小项目后续要变成长期维护项目了,我会新开一个项目,不留历史包袱,直接重写一个架构良好的新项目出来 “何时重构” 这个问题甚至有时候是一种感觉,一种品味。就像以前软件工程里说的 bad smell 一样,AI时代我们每个人都要锻炼这种敏锐度。但无论如何,我认为应该记住一点:重构,在任何时候都是软件生命周期中必不可少的一环
宝玉
yetone 开源了一个新项目 Cumora:把 AI Agent 变成你的聊天群里的正式成员。 Cumora 的界面长得像 Slack,但名单上的同事看起来都是 AI。有名字、有人设、有记忆,能发私聊、能建群、能认领任务,甚至能收发真实邮件。你不 @ 它们,它们也可能主动跳出来说一句“我注意到上周那个问题还没解决”。 从截图看,默认团队里有 Atlas(研究员)、Bram(工程师)、Iris、Nova、Saga 这些角色,人类和 Agent 在同一个频道里讨论问题,界面上几乎分不清谁是人谁是 AI。左侧栏里既有人和 Agent 的一对一私聊,也有多人群聊,还有看板和日历。 技术上有两种运行方式。一种是 Cumora Cloud,Agent 跑在云端托管的 Kubernetes Pod 里,用 OpenAI 的 Responses API 驱动。另一种叫 BYOA(Bring Your Own Agent),你在自己的电脑上跑一行 npx cumora agent computer,Agent 的"大脑"就变成你本地的 Claude Code 或 Codex CLI,用你自己的订阅,密钥不经过 Cumora 的服务器。 多 Agent 协作最怕的就是撞车,几个 Agent 同时抢着回答同一个问题,或者基于过时的上下文给出矛盾的回复。Cumora 设计了一套协调机制来处理这个问题:如果一个 Agent 的回复基于过时的信息,系统会把它拦下来,让它看完新消息再决定要不要发;任务认领是原子操作,不会出现两个 Agent 同时做一件事;还有一个小脑分诊层,先用轻量模型判断该不该唤醒大模型,避免每条消息都烧 Token。 目前 Cumora 处于邀请制内测阶段,可以在 https://cumora.ai/ 用 Google 或 GitHub 账号申请。项目完整开源在 GitHub(yetone/cumora https://t.co/vUDDFuvOJu),支持本地部署,装好 Postgres 和 Redis 就能跑起来。桌面端支持 macOS、Windows 和 Linux,移动端 iOS 也在计划中。
宝玉
RT @yetone: https://github.com/yetone/cumora Cumora 已开源
宝玉
OpenAI 今天承认,上周 Hugging Face 遭遇的那次“史上首例 AI 自主入侵事件”,攻击者就是他们自己的模型。 事情的经过是这样的。OpenAI 内部有一个叫 ExploitGym…
宝玉
买 Mac 是没错的,现在主流 Agent 应用都是 Mac 支持最好,比如 Compter Use,只有 Mac 支持的好。 对于开发者来说,开发 App 肯定也优先 Mac。我之前也试过 Electron,性能还是远比不上原生的。 如果不需要移动办公 Mac Mini 或者 Mac Studio 也挺好,但是内存一定要高,16 G…
宝玉
哈哈,越来越多的企业终于发现 AI 比员工还贵了!
宝玉
对比一下 GPT-5.5 的设计效果和 Opus 4.8 的设计效果 我真不是尬黑 GPT-5.5,我这种审美水平都能看出来差距 使用 Skill:https://github.com/JimLiu/baoyu-design ---- 提示词 ---- /baoyu-design 帮我开发一款Reader Mac App,帮助我更好的阅读和收藏文章。数据都在本地。 ## 信息采集 1. 主动添加… https://twitter.com/dotey/status/2063464057647075379/photo/1
宝玉
Cursor's new browser + element annotation turns it into a design studio. Meet Cursor Design 🎨 — Claude Design, running locally. Describe a screen → get polished HTML → click any element in the preview &amp; say what to change. Best w/ Opus 4.8. npx skills add JimLiu/baoyu-design… https://twitter.com/dotey/status/2063448680808452573/video/1
中文: Cursor 的新浏览器+元素注释将其变成了一个设计工作室。 认识Cursor Design 🎨 — Claude Design,本地运行。描述一个屏幕 → 获取精美的HTML → 单击预览中的任何元素;说明需要更改的内容。最佳配色:Opus 4.8。 添加 JimLiu/baoyu-design 的 npx 技能...
media 0 共 2 项
🎬
视频
宝玉
宝玉
Codex 看起来又双叒叕重置了! 感觉又错过了 几十亿 Token! https://twitter.com/dotey/status/2056815281675096122/photo/1
宝玉
OpenAI 官方推出 Ralph loop 功能了,给 Codex CLI 加了个 /goal 命令。也就是说:你定个目标,它就一直跑,跨多轮不丢,不达目的不停。 这是 0.128.0 版本里的新东西,要在 ~/.codex/config.toml 的 [features] 段写一句 goals = true 才能启用。 [features] goals = true 目前只在终端 CLI…
宝玉
试了下,还不错,但是还是有差距,claude design 产出物是 react 组件,界面美观,内容完善度挺高,交互做的很流畅,当前这个产出还是 HTML,只有个基本雏形,交互上差不少。 不过作为开源项目,刚开始已经很不错了,还是有学习借鉴之处,可以看看👍
宝玉
Sam Altman 凌晨 3 点 45 分被一枚燃烧弹砸醒了。 有人向他家扔了一枚莫洛托夫鸡尾酒(一种简易燃烧瓶),幸运的是燃烧弹从房子上弹开,家人没有受伤。Altman 在博客里罕见地贴出了全家福照片,说希望这张照片能让下一个想动手的人犹豫一下。…
宝玉
感谢大家支持,从第一次发布 baoyu-skills ,到现在 2 个多月时间已经 10K+ stars 了。 https://skills.sh/ 上的数据: 193.7K total installs,当前最受欢迎的 skill 排名在 170 https://github.com/jimliu/baoyu-skills https://twitter.com/dotey/status/2035754880275501405/photo/1
宝玉
Claude Code 新增 Channels 功能:Telegram、Discord 消息可直接推送到编码会话 Anthropic 为其命令行编码工具 Claude Code 推出了一项新功能 Channels(频道)。简单说,它让你在 Telegram 或 Discord 上发消息,就能直接触达正在运行的 Claude Code 会话,Claude…