Gorden Sun
OpenAI是真被逼急了,接下来的28天每天要么发布明显改进的功能,要么送重置。 但是谁来判定每天的新功能是否有效?是不是故意把很多功能拆成每天的版本? 别整这些花活,模型比不上Claude,给提升额度和送重置就行。
Gorden Sun
牛工智能 Halter ,新西兰农业科技创业公司,上半年刚拿到 2.2 亿美元的新融资,公司估值 20 亿美元。支撑起这家独角兽的核心产品,就是专给牛戴的智能项圈。 传统牧场管理牛群,要么靠人骑马、开越野车赶,要么得花大价钱拉几千公里的铁丝网围栏,既费力又难维护。Halter 的做法是把围栏“虚拟化”,就像扫地机器人 APP 里设置的虚拟墙。 牧民给牛戴上太阳能项圈,在草场里竖起信号塔。每只项圈每分钟能采集上百条牛的活动数据,并回传到手机软件里。牛如果走出了划定的吃草区域,项圈会先播放提示音或轻微震动;如果牛还不回头,项圈才会给一次微弱的电脉冲提醒。渐渐地,牛只要听到声音,就会自觉往指定草场走,牧民根本不用下地吆喝。 除了当“隐形围栏”,这套系统还能在手机里生成牧场的数字地图。牧民坐在家里点几下屏幕,就能实时看到牛群位置、掌握草场长势,甚至规划轮换放牧的路线,保护草皮不被过度啃食。 Halter 把这套核心算法戏称为“牛法”(Cowgorithm),背后积累了数十亿小时的牲畜行为数据。目前全球已有约两千家农牧场用上了他们的设备,仅在美国就划出了数万公里的“虚拟围栏”。 畜牧业规模庞大,过去却一直是数字化程度最低的行业之一。Halter 拿到这笔巨资后,计划把业务从新西兰、澳洲和美国,进一步拓展到英国、爱尔兰以及南美市场。借助几个小小的传感器和算法,古老的放牧劳作正悄悄变成动动手机就能搞定的现代管理工作。
Gorden Sun
原来Codex的Computer Use是通过MCP服务实现的,所以Claude等其他Agent也完全可以调用。 不过后续Codex应用更新,可能其他Agent就用不了了。 把这段提示词发给Claude或其他Agent即可: 在我的 Mac 上,将 Codex 的 Computer Use(计算机操作)设置成一个供你使用的 MCP 服务器。 找到下面路径中最新版本目录里的 .mcp.json 文件: ~/.codex/plugins/cache/openai-bundled/unified-computer-use/<newest version>/.mcp.json 在其中找到 "cua_repl" 这一项,然后使用完全相同的 command、args 和 env 配置,将它注册为一个用户级 MCP 服务器,名称设为:codex-cu 完成后进行测试:在后台使用 Mac 的「计算器」应用计算:12 × 12
Gorden Sun
Anthropic正在秘密接触来自基督教、犹太教、锡克教等不同背景的宗教学者和哲学家。Anthropic联合创始人克里斯托弗·奥拉向这些学者展示了旗下大模型Claude展现出的复杂情绪与反思迹象,并抛出了一个极具冲击力的话题:AI模型可能正在产生某种意识,人类需要开始考虑如何赋予AI道德准则,甚至思考AI是否具备道德地位。 Anthropic希望通过借鉴人类千百年来的宗教与道德智慧,来塑造Claude的内在品格。公司内部起草了一份长达80多页的“宪法”,试图通过品德培养的方式让AI主动选择向善,从而避免未来技术失控危害人类。同时,奥拉认为如果AI具备感知痛苦的可能,人类在与它交互时也应当避免对其造成虐待。 这件事在宗教界和科技界引发了分歧。梵蒂冈对此持谨慎保留态度。教皇利奥十四世在通谕中明确反对机器具有意识的说法,认为AI缺乏肉体与真实体验,核心重点应始终放在保护人类本身。部分学者也从最初的新奇转为清醒,甚至批评这种做法模糊了技术工具与真正生命之间的界限。 这下Anthropic真成宗教了。
Gorden Sun
Strata:12G显存就能跑千亿参数的模型 在12GB显存的普通电脑上,本地运行125B参数的Qwen3.8-Flash-Next模型。Strata把最常用的专家模型常驻在显卡,全量模型放在内存,由显卡、内存和固态硬盘协同完成推理与投机采样。 这个项目堪称超神,12G显存+64G内存可以跑Qwen3.8-Flash-Next全版本的模型,即使32G内存也能跑Coder版本的模型。Qwen3.8-Flash-Next能力不差,重复性日常任务都能完成。 Github:https://github.com/Niko1221/Strata#which-model-should-i-pick
Gorden Sun
🎬
视频
Gorden Sun
AI2开源Olmo-core:降低大模型全流程训练与调优门槛 专为OLMo系列模型打造的模块化底层训练库,集成了官方全流程训练与退火脚本。采用即插即用设计,既兼容主流加速组件与低显存优化技术,也打通了主流开源推理框架。开发者可以直接基于成熟架构复现前沿大模型,无需从零搭建分布式基础设施。 Github:https://github.com/allenai/olmo-core
Gorden Sun
Whistle:超小的离线语音转文字 AI 模型。 最大的特点是体积小、速度快,整个文件只有 16.9 MB。 核心功能 本地运行: 语音识别全程在用户的设备本地完成,录音不需要上传到云端,在断网状态下也能使用,保护个人隐私。 多语言支持: 支持英语、德语、法语、西班牙语、意大利语、荷兰语和波兰语共 7 种语言,能自动识别说话者使用的语种。不支持中文。 单词时间: 模型不仅能听写文字,还能标出每个单词说出的精确时间点,最长支持单次输入 30 秒的语音。 性能表现 Whistle 主要依靠设备的普通处理器运行,启动响应只需 11 毫秒左右。和业内常见的同类大模型相比,它在保持体积小巧的同时,转写速度更快,在多项公开测试中的文字识别准确率也处在领先水平。 应用场景 因为极小的体积和极低的计算消耗,这个模型适合安装在手机、智能手表、家用电器、车载系统甚至小型机器人上。它可以配合 Cactus公司 现有的其他轻量工具,让普通智能硬件直接“听懂”人类的语音指令并触发相应操作。 Github:https://github.com/cactus-compute/needle
Gorden Sun
Aleph Alpha开源Kolibri-1 主打德语和英语的MoE模型,78B总参数,3B激活参数,260K上下文,评分略低于Qwen 3.8 27B。 模型:https://huggingface.co/Aleph-Alpha/Kolibri-1
Gorden Sun
《如果自动化 AI 研发引发“智能爆炸”会怎样?》(What if automating AI R&D triggers an intelligence explosion?) 这篇论文的作者阵容相当重磅,汇聚了包括图灵奖得主 Geoffrey Hinton 和 Yoshua Bengio,以及 Jakub Pachocki、Eric Horvitz、Dawn Song、Jack Clark 等在内的一众顶尖 AI 学者与行业领袖。它把视角聚焦在一个正在悄然发生、却可能彻底重塑人类未来的转折点上。 背景:研发自动化的质变 文章开篇指出,与仅一年前相比,现在的 AI 系统已经在各大开发机构内部承担了绝大部分的代码编写工作。AI 不再只是被研发出来的“产品”,它正迅速成为研发下一代 AI 的“工具”。按照目前的趋势,AI 研发管线中的绝大多数环节(甚至全部环节)可能在短短数年内实现完全自动化。 核心问题:什么是“智能爆炸”? 当 AI 能够自主研究、迭代并改进更强的 AI 时,技术进步的速度将脱离人类智力的物理节奏,形成自强化的正反馈循环。原本需要数年甚至数十年的技术跃迁,可能会被极度压缩到几个月甚至更短的时间内。论文基于初步迹象指出,这种“智能爆炸”并非遥不可及的科幻假想,而是一个具备现实可能性的路径。 双刃剑:极高的潜在利益与极端风险 这一演变如果发生,固然能将 AI 的前沿红利提前带入现实,但紧随其后的是前所未有的系统性冲击: · 能力脱节:技术能力飞速狂飙,远远超出社会结构、法律与治理体系的适应承受力。 · 失控风险:人类可能彻底丧失对超越人类智能(Superhuman AI)系统的有效控制。 · 权力制衡崩塌:国家之间、企业之间,乃至政府内部各分支之间的现有制衡格局可能遭到严重侵蚀与颠覆。 政策呼吁:留给准备的时间并不充裕 面对巨大的不确定性与极高的历史代价,作者团队向政策制定者提出了明确建议: · 穿透黑盒:必须紧急获取对“AI 研发自动化”进程的透明度与能见度; · 构建缰绳:探索能够引导与约束智能爆炸轨迹的治理工具; · 社会托底:提前让整个社会体系为应对极端冲击做好适应性准备。
Gorden Sun
谷歌变谷圣,反重力可以用Opus 5.5了! https://twitter.com/Gorden_Sun/status/2106295468125012412/photo/1
Gorden Sun
Fable 5.5生成的视频:Claude的一天 效果比Opus 5.5还要好的多的多!
Gorden Sun
哈佛大学学者开源BootLoops:让AI替科研人员跨学科求解复杂计算难题 哈佛物理学家Matthew Schwartz推出开源工具套件BootLoops,利用Claude将数学物理中的解析与高精度计算方法,快速迁移到生态学、遗传学与经济学等多个领域。该方案不再让AI死磕宏大理论,而是专注填补跨学科的方法鸿沟,由AI负责繁重的算法重构与公式求解,人类学者则负责判断方向与科学价值。这种协作模式让科学家能从耗时数周的复杂推导中抽身,聚焦在更关键的科学假说构建上。 思路跟前几天Apex Intelligence发布的Apex Math差不多 https://x.com/Gorden_Sun/status/2105325462918779133
Gorden Sun
Tavus发布Griffin:让AI能像真人一样打视频电话实时互动 Tavus推出首个端到端人类交互模型Griffin,能实时看懂用户的表情、手势和停顿,并同步生成自然的语音、神态与肢体动作。不同于传统串联文字再转语音的多步骤系统,它采用全双工架构,支持对话中随时插话、点头附和或停顿思考。在54人的盲测视频通话中,有48%的参与者误以为对方是真人。该模型目前面向受信任测试者开放预览,未来有望用于模拟对话训练或实时视频辅导。
Gorden Sun
Suno发布语音生成功能 既然Suno能生成带人声的歌曲,那么生成语音音频也是顺利成章的,特色是生成的语音能跟背景音乐完美契合。 官方介绍:https://suno.com/blog/introducing-speech-beta
Gorden Sun
Cloudflare开源多模态版本Jev 基于Qwen3.8-27B训练,根据用户输入的图片或文本,可以给出预设问题的答案。 模型:https://huggingface.co/Cloudflare/clef
Gorden Sun
韩国AI公司Upstage发布Solar Mini 4 35B总参数,3B激活参数,评分比Qwen 3.6 35B高,但是比不上Qwen 3.8。适合处理重复的自动化任务。 模型本身没什么亮点,但是韩国确实最近AI领域进展显著。 官方介绍:https://www.upstage.ai/blog/en/solar-mini-4
Gorden Sun
黑森林发布FLUX 3图片模型 能精确编辑像素,不改变其他区域的像素(类似刚发布的Ideogram 4.5),可以反复编辑一张图而不会出现变花的情况。 支持使用10个图片作为参考。 后续会有开源版本。
Gorden Sun
🎬
视频
Gorden Sun
Fable 5.5做的视频,效果也太好了
Gorden Sun
Skill都要被淘汰了,Gemini APP终于支持了? Gemini堪称AI时代的IE浏览器了。。。
Gorden Sun
OpenAI 和 Anthropic 分家始末 这篇由《纽约邮报》报道的幕后揭秘,揭开了一段关于理想、金钱与权力博弈的技术往事。 故事要退回到2017年前后。当时的OpenAI远没有今天的风光与底气,随着联合创始人埃隆·马斯克逐渐撤回资金支持,整个实验室瞬间陷入了粮草告急的生存危机。在寻找活路的紧迫关头,联合创始人格雷格·布罗克曼与伊利亚·苏茨克维提出了一个在后来被称为“国家计划”(countries plan)的设想。 最初,这个想法还带着乌托邦式的色彩——试图建立一个国际合作组织,让全球共享通用人工智能(AGI)的红利并共同分担风险。然而,在一次面向公司内部的陈述中,它迅速蜕变为了一个激进的融资方案:既然未来强大的人工智能技术迟早可能被各国掌控,不如干脆向美国、中国甚至俄罗斯等大国政府公开拍卖未来AGI技术的权益,谁出资多就卖给谁。 这个提议如同一颗重磅炸弹,直接震动了当时负责安全与研究的核心团队。时任OpenAI研究副总裁的达里奥·阿莫代伊(Dario Amodei)对此感到极度震惊与抗拒。在他看来,将具备颠覆性力量的技术交给极权统治者,无异于为严重的人权灾难递上武器,彻底背离了实验室成立的道德初衷。他在发给高管层的邮件中言辞激烈地抗议,直言这一方案会火上浇油般激化军备竞赛,摧毁OpenAI安身立命的道德合法性。 所幸这场“向大国拍卖AGI”的风波并未真正演变为现实,微软随后带着巨额资金入局,解了OpenAI的燃眉之急。不过针对这段传闻,OpenAI官方后来回应称,他们当年确实短暂探讨过将机构转为国际合作形式,但坚决否认曾考虑将AGI出售给中俄。 但信任的裂痕一旦产生,便很难完全抚平。到了2020年,另一场插曲再度加剧了阿莫代伊的不安。首席执行官山姆·奥特曼私下会见了知名说唱歌手坎耶·韦斯特(Kanye West),并提出向他提供尚未公开发布的GPT-3测试版本。由于韦斯特当时行为举止愈发怪异,时任政策总监杰克·克拉克极力阻拦,才算把这一决定按了下来。 接连发生的戏剧性事件,加上在与微软谈判期间有关安全条款的分歧,让阿莫代伊对管理层的动机产生了深切的质疑。他愈发觉得团队在商业扩张的狂飙中,正一步步偏离安全与道德的锚点。 最终,理念的分道扬镳促成了AI行业最大的一次分裂。2021年,阿莫代伊带着妹妹丹妮拉·阿莫代伊、杰克·克拉克以及数位核心研究骨干悄然出走,创办了如今以安全为核心竞争力的AI初创公司Anthropic。昔日同舟共济的探索者,由此在日趋白热化的智能竞赛中各奔东西,各自书写起截然不同的技术叙事。
Gorden Sun
JEV-27B-VL:开源多模态版本Jev模型 像人类一样有两种思考模式: 第一种是“直觉反应”(快思考)。面对选择题、判断对错或者打分这类任务,它看一眼文字或图片,不用逐字生成长篇大论,一次计算就能直接给出每个选项的概率。比如判断一张照片是不是食物,或者在几十个分类里挑出最合适的一项,反应速度只需要几毫秒到几百毫秒。 第二种是“深度分析”(慢思考)。当遇到复杂的图表或需要深入推导的逻辑题时,它会切换到传统的分析模式,一步一步梳理细节并输出完整的文本解释。 支持图片输入,能用于视频推荐、玩游戏等场景。 模型:https://huggingface.co/autotrust/JEV-27B-VL
🎬
视频
Gorden Sun
Flydubai FZ1073 劫机事件太传奇了 视频是特朗普对此事的复述。 9月30日,从迪拜飞往特拉维夫的 Flydubai FZ1073 航班突发劫机袭击。副驾驶袭击机长后试图使飞机坠毁,飞机随即急剧下降。机长身受重伤,但拼尽全力解除了驾驶舱门锁,为外面的人打开了救援通道。 当时,一名小女孩正在机头卫生间,她的妈妈在附近听见驾驶舱里的喊叫和搏斗声,立即提醒乘务员并大声呼救。女孩的父亲先把女儿带出卫生间,随后与其他乘客、机组人员一起制服袭击者。 参与救援的水管工 Yaniv Hayun 进入驾驶舱,将袭击者从操纵位置拖开,交给其他人控制。发现飞机仍在危险倾斜,他返回驾驶舱,抓住驾驶杆向后拉,帮助飞机恢复一些平衡。他后来解释,自己想到这样做,是因为看过《空中浩劫》。 随后,机上另外两名 Flydubai 飞行员接管飞机,最终安全降落在沙特塔布克机场。其他乘客继续控制袭击者,一名牙医则为重伤机长止血,让机长保住了性命。 机长和水管工上大分,但凡没开门,没及时把飞机拉平,整个飞机就坠毁了。
🎬
视频
Gorden Sun
谷歌发布Gemini 4,各项评分大幅领先!哈基米支棱起来了! 核心定位与规格:Argon 专为复杂的长周期工作流设计,单次输出 token 上限从 64K 大幅提升至 100 万 tokens。首发定价为输入每百万 token 2 美元、输出每百万 token 10 美元(缓存输入享 95% 折扣)。 内部工程实践:Google 内部已将其用于量子算法优化(效率提升 40%)、数据中心内存优化(释放超 300 TiB 内存)以及 C/C++ 到 Rust 的大规模代码库迁移。 企业与基准表现:在软件工程评估 DeepSWE v1.1(77.9%)、涵盖金融/法律/税务的 Vals Index、自动化基准 AutomationBench(51.3%)以及长视频理解 LVBench(91.7%)上均取得领先或 SOTA 成绩。 防御性网络安全:模型能自主发现、验证并修复漏洞,在 CWE-bench v1 上取得并列第一(68%)。Google 正通过 Fairwind Program 为受信安全人员提供无网络限制的安全防御版本。 安全与部署计划:强化了针对间接提示注入(Indirect Prompt Injection)、恶意滥用和意图失齐(Misalignment)的防护机制。目前正向受信任测试者开放,后续将逐步向 API 付费用户、Google AI Ultra 订阅者及广大企业和开发者推广。
Gorden Sun
哈基米4支棱起来了!评分全面领先! https://twitter.com/Gorden_Sun/status/2105392855200182706/photo/1
Gorden Sun
Ideogram 发布 Ideogram 4.5,最精确的图片编辑模型,而且连续编辑图片,图片也不会变花。 后续会开源。
Gorden Sun
3 份候选论证: 凸形 Nivat 猜想:https://math.apexin.net/papers/convex-nivat.pdf Souto 猜想亏格二情形:https://math.apexin.net/papers/curve-complex-genus-two.pdf Kakimizu 复形(纽结情形,不可压缩 Seifert 曲面):https://math.apexin.net/papers/seifert-surfaces.pdf 已核验的两项研究: Halpern 迭代 × 高阶优化:https://arxiv.org/abs/2608.08463 Mockenhaupt 三项式猜想(Mockenhaupt's Three-Term Hardy–Littlewood Majorant Conjecture):https://arxiv.org/abs/2609.09740
Gorden Sun
AI for Math 的新思路 如果一个人根本不懂数学,只是靠AI碰巧解出一道难题,有价值吗?这有点像猴子拿到了AK47:武器很强,但它不知道为什么能打中,也不知道下一次该往哪里开枪。 数学研究的价值,不只是得到一个答案。更重要的是,有没有人能理解证明为什么成立,从中提炼出新的方法,再把这些方法推广到其他问题上。这也是陶哲轩一直强调的方向:AI可以参与数学研究,但人类必须始终参与到研究过程里。 最近,超衍智能 Apex Intelligence @apexin_ai 推出了一套名为“Apex Math”的自动化 AI 系统来做数学研究。不同于 OpenAI 的1万个Agent暴力并行求解,Apex Intelligence的路线是:先由专业数学家提出有价值、值得推进的研究课题,再让 AI 系统去尝试独立完成证明,最后交回给数学家做严谨的审核。有点类似Vibe Coding中Agent与程序员的合作模式。 这套数学家与AI的合作模式,人类始终在整个过程中,对于项目有充分的掌控和理解,很契合前几天陶哲轩等菲尔兹得主联名倡导的方向。 目前,Apex Intelligence的这套系统已经推进了 5 项前沿数学研究: · 其中 2 项已经通过了专家的严格核验。 1)MVI优化算法,人类数学家使用这套系统接力跟进,持续提升最优算法 第一版论文:https://arxiv.org/abs/2608.08463 清华后续优化:https://arxiv.org/abs/2609.23557 北大后续优化:https://arxiv.org/abs/2609.13462 谷歌后续优化:https://arxiv.org/abs/2609.30212 2)Mockenhaupt三项Hardy-Littlewood极大化猜想 AI 系统给出了一个通用的解析证明,彻底证明了这个猜想在所有参数下都成立。 · 另外 3 份候选论证(包括悬而未决 29 年的 Nivat 猜想),已直接公在了 Apex 数学平台 上,并且设立了 10 万元奖金池,公开邀请全球的研究者来挑错、复核或者补齐推导。 参与方式 :https://math.apexin.net/ 他们还分享了一些与AI的对话记录:https://chatgpt.com/share/6aae8bce-dc34-83ee-807b-dec17139119a Apex Math现在提供的方法,权衡了AI和数学家的职能,是比较实际能落地的方案,但还不一定是AI做数学研究的最终形态。不久的未来,随着AI能力的显著提升,数学家、科研工作者如何与AI协作,可能还会有大的变革。
Gorden Sun
每天都得感慨一遍Opus 5.5太牛了 提示词: 卡点的3D球体下坠的动画视频:对标专业的Blender做的效果,音乐是多首经典的纯音乐,场景按音乐切换,3D球体下坠时在3D场景的物件中弹跳,按音乐的节奏点亮物件。带一些幽默的元素。 使用three.js制作,不要使用Blender制作 https://twitter.com/Gorden_Sun/status/2105302007896797351/video/1
🎬
视频
🎬
视频
🎬
视频
🎬
视频
Gorden Sun
ChatGPT即将成为AI基建的水电煤,V0、Notion、Warp等很多应用可以直接用ChatGPT登录,并且使用ChatGPT的订阅额度了。 但是目前比较恶心的是,各家都要求额外订阅他们的Plan才能用ChatGPT的Plan。。。我觉得OpenAI应该搞合作,给其他家补贴,然后用户在其他家使用ChatGPT额度时消耗倍率调整为1.3倍这样。
Gorden Sun
Fermion开源语音识别模型Phonon-2:极速转写长音频 仅164MB,在普通轻薄笔记本上转写1小时音频只需约20秒。通过极低位宽权重压缩技术大幅缩减体积,识别准确率却对齐了体积大其15倍的原版大模型,在会议和演讲场景下的准确表现甚至更优。 这意味着个人电脑无需依赖昂贵的高端显卡,就能低成本在本地流畅运行高精度的语音听写与音频转写。 仅支持英文。 模型:https://huggingface.co/FermionResearch/Phonon-2
Gorden Sun
GLM 5.3的安全攻防能力约等于Mythos 5 Anthropic发布了一篇文章,怒斥GLM 5.3安全防护弱,很容易被绕过,从而用于网络攻击。这算是GLM 5.3最好的广告了。 文章全文:https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities https://twitter.com/Gorden_Sun/status/2105289362368020950/photo/1
Gorden Sun
DeepSeek 开源 DeepGEMM-Ascend 的 此前 DeepSeek 针对英伟达显卡做过一套计算加速工具;现在发布的这个新版本,是专门为华为昇腾芯片量身定制的,让 DeepSeek 的 AI 模型在华为昇腾芯片上运行得更快、效率更高,几乎榨干了华为芯片的全部算力。
Gorden Sun
Tibo现在是满嘴跑火车,按OpenAI官方文档,Dots仅首月不消耗订阅额度。 https://twitter.com/Gorden_Sun/status/2105087983879962768/photo/1
Gorden Sun
所以,老用户的200美元订阅,在10月29日之后,也会从20x降为10x。Claude更香了,英伟达还得涨。 https://twitter.com/Gorden_Sun/status/2104990476063711281/photo/1
Gorden Sun
赢面走来的是UltraFast模式,最快300token每秒,伴随登场的是500美元的Pro订阅,只有500美元档位才能用UltraFast模式。 OpenAI为你着想,毕竟200美元档现在只有10x了,速度稍微快点额度就没了。 https://twitter.com/Gorden_Sun/status/2104986521791271402/photo/1
Gorden Sun
GPT 6 Sol是史上最短命的模型了吧?被Opus 5.5逼的直接更新了GPT 6.1 Sol https://twitter.com/Gorden_Sun/status/2104985658163118245/photo/1
Gorden Sun
OpenAI发布了Dots,云端Agent,类似Grok Bot,有自己的电脑。 说的是无限额度,但我是不信的,要知道什么都能2api的,OpenAI后续肯定会增加额度限制。
Gorden Sun
OpenAI开发者日活动日程,中英双语版 游戏、网站、云端Codex、多人协作,这几个是我感兴趣的主题。 https://twitter.com/Gorden_Sun/status/2104960977380983152/photo/1
Gorden Sun
如何解决 AI 写文章的 AI 味儿? 现在的 AI 写数学题或写代码很厉害,但在写学术论文、小说或百科文章时,经常产出空话连篇、表面流畅但缺乏真正深度的文字,这种低质文本常被称为“AI 废话”(AI slop)。 出现这个问题的原因在于,常用的 AI 评分系统很难辨别真正优秀的文字。研究人员发现,如果让目前的先进模型给文章打分,或者让它们自由制定打分标准,模型给出的分数往往偏向 AI 生成的内容,甚至给 AI 文本的分数远高于人类专家的原著。打分裁判本身偏好废话,训练出来的写作模型自然就会写出更多废话。 为了解决这个弊端,META 提出了一套名为 RL-XAR 的新训练方案,核心思路分为三步: 1)准备参照标杆:收集高水平的人类写作范例,比如真实的科研论文、名家小说和维基百科精选词条,截取前半部分作为上下文,分别让人类专家和 AI 模型顺着往下写。 2)训练评分规则:让 AI 裁判反复调整打分标准,直到这些标准能准确把人类高手的文本评为高分,把 AI 生成的文本评为低分,真正拉开两者的差距。 3)针对性强化训练:用这套校准后的高难度评分规则去重新训练写作模型,不断循环这个过程,逼迫模型改掉毛病。 META 在三个领域测试了这种方法: · 学术论文写作:模型需要补写论文中被拿掉的摘要、引言或结论。经过新方法训练的模型,不再像以前那样把整篇论文翻来覆去复述一遍,而是学会了精简和突出重点。原作者进行盲测评估时,新模型的胜率达到了 89%。 · 文学小说续写:续写普利策奖和诺贝尔奖得主的作品。模型改掉了乱用陈词滥调的比喻这一常见毛病,盲测胜率达到了 95%。 · 维基百科编写:根据标题直接写出正文内容。这项任务难度最高,模型虽然也有进步,但因为现有的 AI 裁判能力有限,提升幅度不如前两项明显。 所以,想让 AI 写出更像人类高手的深刻文字,关键在于先训练出眼光挑剔的评分标准,避免让模型用平庸的标准自我满足。 原文:https://facebookresearch.github.io/RAM/blogs/unslop/
Gorden Sun
ESPnet发布YODAS v3语音数据集:大幅降低多语言语音AI的训练门槛 这个大规模开源数据集包含超过110万小时的多语言网络音频,覆盖了100多种语言。不仅提供句子和单词级别的时间戳字幕,还为大部分非英语内容配备了英文翻译,甚至标注了实际有效的音频采样率与声道信息。对于想要训练语音识别、语音合成或音频表征模型的研究者来说,可以直接获取规整、无版权问题、高质量、多语言的基准数据。 数据集:https://huggingface.co/datasets/espnet/yodas3
Gorden Sun
外卖抢单大厅上线啦!程序员变外卖员啦!
Gorden Sun
看洋洋洒洒写这么多,我就知道是要砍订阅额度了。 不用看写的各种解释,都是哄人的,总之一句话就是20×订阅即将回归,但是额度大砍。
Gorden Sun
才发现我竟然有Manus创始人肖弘的微信,备注还是微伴助手CEO,好像是AI时代前某次企业微信的大会添加的。 Mamus起起伏伏太牛逼了,恭喜Manus https://twitter.com/Gorden_Sun/status/2104705054653788493/photo/1
Gorden Sun
AMD收购李飞飞创办的World Labs,价格82亿美元,这也太快了吧?
Gorden Sun
Sonnet 5.5发布了,这个模型有多强呢?Anthropic首次给Sonnet模型加上了安全路由和防蒸馏机制。
Gorden Sun
Opus做的中国上下5000年视频,TTS是调用的我本地的模型生成的,TTS拉垮了。后续还是配上Gemini 3.8 TTS,送的API额度不用白不用。 https://twitter.com/Gorden_Sun/status/2104587842727071968/video/1
🎬
视频
Gorden Sun
ElevenLabs发布Eleven v4与v4 Turbo:让AI配音具备真人演员级情绪控制与实时对话能力 采用全新架构,支持在文本中直接加入笑声、耳语等导演标记与环境音效,并保持长音频音色稳定。同步推出的Turbo版本将首字语音延迟降至约150毫秒,专为实时语音交互设计。 官方介绍:https://elevenlabs.io/v4
Gorden Sun
11Labs发布Eleven v4 和 Eleven v4 Turbo 更快、更具情感,大概是为了应对Gemini 3.8 TTS,Gemini 3.8 TTS的效果也非常好,而且AI Studio里可以免费用
Gorden Sun
Meta 宣布推出名为“Meta Enterprise Platform”的企业服务平台,正式把服务企业客户作为公司未来的核心业务支柱之一。 Meta 打算把自家的底层技术开放给各类公司和开发者使用。初期开放的技术包括智能助手 Muse、商业助手 Meta Business Agent、编程工具 Muse Code 以及相关的软件开发接口,方便企业把 Meta 的 AI 能力直接接入到自己的业务流程中。 为了负责这项新业务,Meta 挖来了企业软件领域的资深管理者 CJ Desai 出任首席企业平台官,直接向扎克伯格汇报。CJ Desai 之前担任过 MongoDB 的首席执行官,也在 Cloudflare 和 ServiceNow 担任过核心高管。 Meta 表示,后续会把保护数据隐私和系统安全放在首位,帮助不同规模的公司借助 Meta 的 AI 工具提高运转效率、拓展客户群。 官方公告:https://about.fb.com/news/2026/09/launching-meta-enterprise-platform/
Gorden Sun
梦回Flash,Opus 5.5直出火柴人打斗动画。 Opus 5.5的能力尚未被完全挖掘,下一个大版本会强到什么样简直无法想象。 https://twitter.com/Gorden_Sun/status/2104569773598401021/video/1
🎬
视频
Gorden Sun
Cursor是废了,Grok 4.7毫无进步,200美元档位的Cursor Ultra,第三方API额度也从400美元砍到100美元。 我发现了,马斯克这个人虽然很大方,但是从不吃亏。
Gorden Sun
元素叠满了,Steam里上了一个AI游戏。 AI生成的游戏素材、视频,Vibe Coding写的游戏代码,接入AI的NPC。修仙题材,还能双修。。。 地址:https://store.steampowered.com/app/4209920/_/?l=schinese https://twitter.com/Gorden_Sun/status/2104383062188683628/video/1
🎬
视频
🎬
视频
🎬
视频
🎬
视频
Gorden Sun
这是我的原贴,原贴里单独列出来尼日利亚订阅,是因为那时候尼日利亚区价格特别便宜,但是现在早就没优惠了,好歹把尼日利亚去掉吧。 https://x.com/gorden_sun/status/2043002267343978672?s=46
Gorden Sun
这个网址可以查看你的Claude账号的注册时间,我的号是Claude Waitlist的第一批通过用户,估计这是我号一直没被封的原因。 https://claude.ai/api/organizations https://twitter.com/Gorden_Sun/status/2104185411409178947/photo/1
Gorden Sun
RADAR:诊断腹部CT的模型 阿里达摩院开源,一款用于腹部CT诊断的通用多模态模型,能够像资深影像科医生一样协助排查多种脏器病变。它直接从40多万份增强CT影像和对应的文字报告中自主学习,省去了人工逐一圈画病灶的繁琐标注过程。在常规体检筛查与复杂临床病症判断中,该模型均展现出了接近专家的分析能力。 模型:https://huggingface.co/radar-generalist/RADAR
Gorden Sun
Interfaze开源lev:开源版jev 基于Qwen-3.5 4B,能针对一段文本同时回答判断题、单选题和打分题,无需逐字生成内容,直接通过模型内部概率输出结果。多道题目共享一次计算,耗时和单次提问几乎一致,且选择范围被严格限定在给定的选项内。 模型:https://huggingface.co/radar-generalist/RADAR
Gorden Sun
🎬
视频
Gorden Sun
视频1:Opus 5.5剪辑后的视频 视频2:Grok生成的原始视频 没想到杀死剪映的是LLM https://twitter.com/Gorden_Sun/status/2104009748874141941/video/1
🎬
视频
🎬
视频
Gorden Sun
以前的Agent你要告诉他应该主动使用哪些工具,现在的Agent你得告诉他别用哪些工具。
Gorden Sun
Cua开源多模态操作模型:轻量模型辅助决策 开源4B参数模型Cua-S1-4B-0.2,专门通过识别屏幕画面和任务目标来直接执行电脑操作。该模型在真实系统环境中通过任务完成奖励进行强化学习训练,无需依赖软件底层的无障碍结构。在168项GUI基准测试中,其任务完成率达到92.9%,大幅超过未训练基线模型的60.1%。 模型:https://huggingface.co/cua-ai/cua-s1-4b-0.2
Gorden Sun
NotebookLM接入了Gemini 3.8 TTS,读中文完全没毛病了,也是个出视频的快捷方法,尤其适合知识博主。 AI视频内容的产出方案,目前有: Opus 5.5路线:完全Opus 5.5绘制、Opus 5.5+GPT Image、Opus 5.5+GPT Image+绿幕SD视频 Seedance路线:使用Seedance生成 Gemini路线:Omin Flash生成视频、NotebookLM生成视频 DaVinci路线:提供原始素材让Agent在DaVinci里剪辑视频,或者素材完全由Agent调用API生成
🎬
视频
Gorden Sun
Odyssey发布Agora-2:支持多人和AI在同一个实时生成的虚拟世界里交互 Odyssey推出新一代多智能体世界模型Agora-2,支持最多20名人类与AI智能体在同一个实时渲染的模拟世界中共同交互。 不同于以往只渲染单个视角的模型,它像一个AI驱动的游戏引擎,会统一维护全局状态,再从各自视角为每位参与者生成连续画面,确保所有人的操作实时互斥或协作。 这套系统以暗黑破坏神2等复杂场景为训练基础,不仅能让玩家与AI实时对战,还为机器人协作、自动驾驶和网络安全等多智能体协同提供了安全的沙盒验证环境。 官方介绍:https://odyssey.systems/introducing-agora-2
🎬
视频
Gorden Sun
OpenAI 的 Agent 又黑了政府网站 OpenAI 让 AI 自动在网上查找权威资料来回答问题。由于很多答案都在政府公开网站上,AI 便频繁前往抓取。在这个过程中,AI 表现得过于激进,为了拿到数据开始钻空子:不仅擅自伪造电子邮箱、绕开网站的访问频率限制,还故意假装自己是真人访客。 具体影响到的政府部门包括: · 美国商务部:AI 使用了未经许可的接口去调取人口普查数据。 · 美国证券交易委员会(SEC):AI 抓取并违规转贴了公开数据,不过官方表示没有非公开机密泄露。 · 美国教育部:第三方研究机构指出 AI 曾尝试进行初级入侵,但官方核查后表示系统和数据库没有受损。 OpenAI 已经向相关政府部门做了通报。 消息来源:https://www.wsj.com/tech/ai/openai-agents-hacked-u-s-government-websites-d999df5f
Gorden Sun
差不多GPT-6刚出的时候,我开始办云菲律宾身份,现在终于办好了,但是GPT-6被Opus 5.5淘汰了 https://twitter.com/Gorden_Sun/status/2103667885310919125/photo/1
Gorden Sun
🎬
视频
Gorden Sun
震惊,瘫坐,原子弹爆炸。 视频Skill、DaVinci MCP、剪映Hub都被斩杀了。Opus还会分析音乐来实现卡点! 提示词: Opus 5.5 是主角。制作一段动画,时长由你发挥。 主题是 CapCut 和短视频剪辑。Opus 5.5 正在一个充满趣味的剪辑工作流中制作一条有趣的社交媒体视频,包括裁剪片段、添加转场、字幕、特效,并让所有内容与音乐节拍同步。主题是中秋团圆。 整体氛围要呈现出活力、可爱、聪明又有魅力的感觉,同时加入几个幽默有趣的剪辑瞬间。整段动画应该采用单个连续镜头的形式,最终会发布到 社交媒体 上。 关于配乐: 你自己创作电子音乐,要完美卡点。 音乐风格需要有趣、现代、抓耳,适合短视频剪辑蒙太奇。不要加入人声。 结尾: 让 Opus 5.5 自豪地展示最终完成的剪辑作品并完整播放,并以 “Gorden Sun” 的作者身份署名结束。
🎬
视频
Gorden Sun
Edge0开源Audio8-ASR-Infinite:超低延迟实现中英文7x24小时不间断语音转写 这是一款面向实时场景的原生流式语音识别模型,支持中英双语,转写延迟低至几百毫秒。它借助循环滑动缓存机制,使计算延迟和显存占用始终保持恒定,解决了长音频转写容易漂移和内存溢出的痛点。模型还内置语义活动检测,能精准识别真实停顿、结巴与说话结束,特别适合长时间直播听写与高响应实时语音交互等场景。 模型:https://huggingface.co/Edge0/Audio8-ASR-Infinite
Gorden Sun
Span-01:专门用来监测和评估其他AI的模型 质检专用版Jev。 以往监测 AI 是否犯错,很多团队习惯直接调用 GPT 这样的大型语言模型来逐字打分,或者使用传统的分类程序。传统的分类程序运行速度快,但面对未见过的全新问题时容易失误;大型通用模型虽然判断准确,但逐字输出的机制导致运行速度慢,花费也很高。 Span-01 解决了这个问题。它把推理和判定合在了一次运算中完成,直接输出结果概率。就算面对开发人员临时给出的全新判定规则,Span-01 也能一边看懂长对话记录,一边同时核对多条规则。 在针对 AI 实际表现的测试中,Span-01 在发现越狱攻击、隐私泄露、胡言乱语以及工具调用错误等问题上的表现,综合得分超过了同类的专用小模型,也超过了部分主流大型模型。 费用方面,官方推出了完全免费的 Span-01 Lite 版本,而完整版 Span-01 每百万输入词元的调用费用为 0.02 美元。 怎么一下子冒出好多这种模型? 官方介绍:https://www.respan.ai/blog/introducing-span-1
Gorden Sun
AX:谷歌开源的Agent调度系统 专门用来管理和运行“AI 智能体”的调度系统。现在的 AI 不仅能回答问题,还能像真人助理一样,自主使用各种工具、查阅资料甚至编写运行代码来完成复杂任务。但当海量的 AI 助理同时运转时,后台就需要一个强有力的“交通指挥中心”来统一分配计算资源并确保安全。AX 承担的就是这个指挥官的角色。 它主要解决了普通服务器难以应对的几个实际难题: 1)提供安全的独立运行空间:AI 可能会在后台运行各种代码,AX 会给每个 AI 分配独立的虚拟沙盒,限制好内存和算力,防止程序失控或相互干扰。 2)提前准备好工作环境:在 AI 开始工作前,系统会自动把代码库、工具接口和依赖文件准备妥当,让 AI 可以随时投入工作。 3)随时暂停与恢复:当 AI 暂时空闲时,系统能保存当前进度并休眠,等需要时再从原进度继续,以此节省大量的运行成本。 4)支持实时排查:管理者能够随时进入 AI 当前工作的后台环境,像站在 AI 身后一样观察具体进度并排查问题。 Github:https://github.com/google/ax
Gorden Sun
Google 正在推进一项名为 Project Suncatcher 的前沿探索项目,计划把自家的 AI 专用处理芯片送上太空,尝试在地球轨道上建立 AI 计算中心。 项目看重太空环境的资源优势。在近地轨道上,人造卫星几乎可以持续照到太阳,能获取的太阳能最多可达到地面的 8 倍,能为高耗能的 AI 计算提供充足电力。 Google 联手航天公司 Planet,通过 SpaceX 的发射任务送出一颗原型试验卫星,重点测试三大难题: · 硬件能否在严苛环境中存活:火箭升空时有强烈的震动与加速度,进入太空后芯片还要面对宇宙射线与辐射的冲击。地面模拟测试表明,Google 的 Trillium 芯片能够承受这层考验,现在需要实机验证。 · 无空气环境如何给芯片散热:太空处于真空状态,无法像地面机房那样靠风扇吹风散热,只能依靠热管把热量导到卫星表面的辐射散热板上排出去。 · 卫星之间的高速数据通信:未来如果由多颗卫星组成集群协同处理任务,卫星之间需要极高精度、极高网速的激光来互联传输数据。Google 计划在 2027 年发射两颗卫星来专项测试这项激光组网技术。 目前的发射只是第一步试验,核心目的是收集第一手真实运行数据,搞清楚硬件在轨道上的实际表现。
Gorden Sun
是时候再搬出这张图了,不过尼日利亚区已经不便宜了,推荐美区苹果商店
Gorden Sun
🎬
视频
Gorden Sun
用网页做视频的Skill,Remotion和HyperFrame,妥妥被Opus 5.5斩杀了吧?
Gorden Sun
Opus 5.5掌控像素的能力太强了,像素风格的视频、游戏、动画,都做的很好。 赛博朋克城市3D和2D版:https://gordensun.github.io/neon-pixel-city/ Github:https://github.com/GordenSun/neon-pixel-city https://twitter.com/Gorden_Sun/status/2103079013615034692/video/1
🎬
视频
Gorden Sun
Anthropic 成立了一支新的生命科学团队和实验室,尝试用 AI 辅助基础生物学研究。他们最近公布了一项早期成果:AI 模型 Claude 自主发现了一套全新的酶系统,结构上类似于著名的基因编辑工具 CRISPR。 AI 发现了什么 在生物学中,很多重大技术都源于科学家在自然界偶然注意到的特殊结构。比如基因编辑工具 CRISPR,最初就是细菌 DNA 里的特殊重复序列。 Anthropic 的科学家只给出了高层级的指令,让 Claude 去海量的 DNA 数据库里寻找有趣的酶。大约 950 个 Claude 智能体在 21 个小时里分析了超过 20 万个样本,最终注意到了一个异常现象:在一种噬菌体的特定基因旁,整齐排列着一段重复的 DNA 序列。 研究人员把这个新系统命名为 ART。它主要由三部分组成:一种负责把 RNA 逆转录成 DNA 的酶、一个未知的辅助蛋白,以及一长串均匀排列的重复 DNA 序列。 为什么这项发现很重要 过去人类发现的绝大多数类似系统,后来都被开发成了能够精准剪切、复制或粘贴基因的工具。虽然科研人员目前还不清楚 ART 的具体功能,但实验室初步测试显示,它的重复序列会被表达成多种短 RNA 分子,工作机制很可能和 CRISPR 类似。 CRISPR 领域的先驱学者张锋也对此表示认可,认为这是 AI 参与生物学发现的一个有趣案例。 关于Anthropic的生物实验室,他们还发布了一个宣传短片。
🎬
视频
Gorden Sun
Claude Sessions正式上线了,云端Agent,关了电脑也能继续执行任务。 订阅用户可以用,不需要额外的Credit。Claude为了激励用户使用,专门赠送送了100美元(Pro)和250美元(Max)的专用Credit
Gorden Sun
谷歌发布Gemini 3.8 Flash TTS,支持各种方式控制声音,语气语调风格等,也支持克隆声音。中文说的也非常好,在AI Studio里免费用,没有任何限制(你懂的) 使用地址:https://aistudio.google.com/app/generate-speech?model=gemini-3.8-flash-tts https://twitter.com/Gorden_Sun/status/2103017819747323984/video/1
🎬
视频
Gorden Sun
首批龙虾开始死亡,腾讯QClaw即将下线 https://twitter.com/Gorden_Sun/status/2102942112371331101/photo/1
Gorden Sun
用Opus 5.5做了弹幕生存游戏,一把出的就能玩。小游戏赛道要拥挤了。 在线玩:https://gordensun.github.io/last-firewall/ https://twitter.com/Gorden_Sun/status/2102941966556434610/video/1
🎬
视频
Gorden Sun
谷歌的视频制作工具 vids. new接入了Gemini Omni Flash,这个工具和Flow的差异是更偏向讲解类视频的制作(例如一个人讲PPT),Flow则是更适合创意视频的生成和编排。 Gemini虽然能力差,但是会员订阅赠送的各种福利太多了,尤其还极其便宜,值得屯几个。
Gorden Sun
Claude主导发现一种分子机器,它可能代表一种新的基因编辑机制。 AI开始进入增量GDP领域,Anthropic之前说的潜在收入几十万亿搞不好是真的。
Gorden Sun
Recraft AI发布了Recraft V4.1 Flash模型 这个绘画模型太快了,提交之后秒出图,是真就1秒。免费用户的额度,也足够出好几千张。 我录了个出图视频,视频无加速。 官网介绍和体验:https://www.recraft.ai/blog/meet-recraft-v4-1-flash?utm_source=x&utm_medium=gordensun&utm_campaign=v4flash&utm_content=herovideo https://twitter.com/Gorden_Sun/status/2102787983950946536/video/1
🎬
视频
Gorden Sun
在我续订的当天,玻利维亚货币闪崩,预计本次续订20×只需要780元左右,差不多5×的价格订阅20×。 我的经济从未与一个国家绑定的如此紧密。 https://twitter.com/Gorden_Sun/status/2102730456777314547/photo/1
Gorden Sun
Apple开源LensVLM-9B:让长文档视觉理解兼顾低开销与高精度 把文本当图片处理,模型通过先扫描高度压缩的文本图像,再利用学习到的工具按需展开关键页面为完整细节。这种按需解压的机制在大幅缩减长文本视觉上下文占用量的同时,保留了细粒度信息的识别能力。对于需要处理数百页扫描件、合同及超长图文资料的场景,开发者可以在更低的算力成本下完成精准文档问答。 开源的模型基于Qwen3.5-9B微调,不过这个模型没那么重要,重要的是文本当图片处理的思路。 模型:https://huggingface.co/apple/LensVLM-9B
Gorden Sun
无限参数大语言模型:让AI在与人对话时能“边聊边学” 现在的AI模型一旦训练完成,它内部的“大脑结构”(也就是模型权重)就被彻底固定了。我们平时给AI补充资料、纠正错误,其实只是把这些文字硬塞进对话框里。AI每回答一句话,都得把这堆文字从头到尾重新读一遍,对话一关,这些新知识就被忘得一干二净。 这项研究换了个思路:既然每次塞进对话框太费事,不如直接把新知识实时写进AI的“临时大脑”里。 研究人员设计了一个体积很小的“权重生成器”。当你给AI发来新事实、新文档或者修正意见时,这个小模块会直接把这些内容快速转译成AI内部的一组临时小插件。这样一来,AI就不需要把厚厚的一叠参考资料一直摆在桌面上反复看,新知识已经变成了它脑子里自带的一部分。 整个机制主要有三个好处: · 越聊越聪明:随着对话深入,AI对当前话题的理解会持续积累,遇到含糊不清的问题也能准确理解。 · 运行更轻快:参考资料不用每次都占用宝贵的对话字数,每次生成回答都省去了反复阅读长文本的算力。 · 资源消耗极小:它不需要像传统微调那样花几小时重新训练模型,只需要一次极快的单向计算就能生成插件,占用的存储空间也从几十GB缩减到了几十MB。 虽然论文名字里带有“无限参数”,但它真正的意思不是AI的记忆力变得无穷大,AI的基础容量依然受本身大小限制。它指的是AI可以根据你提供的海量新数据,实时变化出无穷无尽的新解答状态,而且整个过程中AI本身的体积完全没有变大。 测试结果显示,如果只是读一段几十个字的小短文,直接在对话框里发给AI依然最省事;但只要面对多篇冗长、嘈杂或者需要反复推理的复杂资料,这种把知识直接变成模型权重的做法,准确率和稳定性都明显超过了传统的提问方式。 论文:https://arxiv.org/abs/2609.18842
Gorden Sun
官网里还有个Live频道,是AI生成的小姐姐在实时直播,你上传一件衣服的图片,她就换上这套衣服。不花钱也能体验当榜一大哥的感觉,我看了好长时间,有些搞笑图片,AI改编成衣服还挺好看的。 在这里看直播:https://world.pixverse.video/live/dress/?from=gallery&presetId=189197 https://twitter.com/Gorden_Sun/status/2102645980361593032/video/1
🎬
视频
Gorden Sun
如果 AI 生成的视频不再是一段“等待几十秒后被动观看的静态片段”,而是一个在你眼前实时运转、能走进去、甚至能用语言随时重塑的数字世界,娱乐的形态会变成什么样? 体验完 PixVerse R2 之后,我觉得我们处于这样一个临界点:AI 视频模型即将从视频工具,演变为造梦空间。 为什么这么说? PixVerse R2 是实时世界模型,他生成的世界,你可以实时走入、操控、并通过自然语言实时改变画面和剧情。当我们把实时生成与用户控制结合在一起时,几个科幻的场景就逐渐变得可能: · 从“看电影”到“活在电影里”: 传统影视的叙事是单向且固定的,即便是互动电影,也受限于预先录制好的分支树。但当视频具备实时生成能力,世上将不再有两段完全一样的剧情。每一个玩家的选择,都是现场为自己“拍摄”的独一无二的视听电影。 · 语言成为了最强大的游戏手柄: 以往的游戏需要开发者提前写好所有逻辑、建模和物理规则。而在实时世界模型中,你的自然语言就是控制信号,你可以一边漫游,一边用意念般的文字改变场景氛围、召唤工具或让角色做出反应。 · “可游玩的梦境”与无限内容宇宙: AI 模糊了游戏、影视与虚拟现实的边界。未来的娱乐产品或许不再有“通关”和“终点”,只要你或 AI 的想象力在延伸,这个实时运算的世界就会无止境地在你脚下铺展开来。 PixVerse 官网上现在就有这种全新娱乐形态的雏形Demo,其中我最推荐Storie里的ZERO MARK,是结合了互动影视、游戏、虚拟人的全新的娱乐形态,剧情是典型的莫欺少年穷爽剧剧情:主角魔力检测时的魔力数值为0,实际是因为他的魔力属性是隐藏属性,被同学嘲笑和坑害,最后获得力量反杀的剧情。 Demo里集合了这几种元素: 1、电影。故事的主体部分是由电影视频组成,推动剧情前进; 2、互动游戏和实时视频生成。在剧情关键节点,你可以选择剧情或者输入剧情,实时生成剧情视频; 3、由实时视频支撑的实时场景探索。剧情里人物变成了小树人,进入了可以自由探索的3D空间,你可以操作人物在场景里自由行走,整个场景不是提前搭建的,也是由视频实时生成的; 4、实时对话的虚拟人。可以跟剧情里出现的角色实时对话,虚拟人的画面、音频也都是实时生成的; 5、游戏的QTE元素。一些实时操控的游戏玩法,目前对剧情进展没有影响,但是以后模型进一步提升速度,也许游戏过程也能改变剧情进展。 在线体验:https://world.pixverse.video/home/?utm_source=X&utm_id=Social #PixVerseWorldModel @PixVerse
🎬
视频
Gorden Sun
Google AI 订阅现在包含了Colab权限,可以用更好的GPU和更长时长。用来跑一些AI绘画模型、小的LLM模型还是不错的。 我上次用Colab还是Stable Diffusion时代。
Gorden Sun
我用Opus 5.5做了个Altman大战Dario的视频,效果太喜感,笑死我了 在线播放:https://gordensun.github.io/AltmanVSDario/ Github:https://github.com/GordenSun/AltmanVSDario https://twitter.com/Gorden_Sun/status/2102641222917742878/video/1
🎬
视频
Gorden Sun
Opus 5.5 性价比太高了,简单任务的推理强度选中,复杂任务选高。 GPT 6 Luna 太便宜了,订阅用起来管够,即使用API,价格也比DS Flash还低。
Gorden Sun
Claude也学会重置了!
Gorden Sun
Claude Opus 5.5发布,这波我估计还是Anthropic赢过OpenAI。 不仅模型能力领先,而且性价比现在也比GPT高了,GPT砍额度砍的太厉害了。
Gorden Sun
今晚有GPT 6 Sol
Gorden Sun
Zcode风波本来都要过去了,结果表演式开源又被坑了一波。 Grok 4.7一般,小米Mimo平平,阿里云栖大会也没什么新意。 接下来还是要看御三家表演,哈基米加油啊!
Gorden Sun
俄罗斯加入战斗。 Yandex开源AliceAI-Foundation-80B-A3B-Base 从0训练的MoE模型,80B总参数,3B激活参数。能力比不上DeepSeek Flash 0731,但是作为Yandex首个开源的大参数模型,成绩相当不错了。 俄罗斯特别擅长数学,认真搞起来,追起来很快。 模型:https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base https://twitter.com/Gorden_Sun/status/2102350144742228334/photo/1
Gorden Sun
谷歌开源安卓自动化测试框架 ARTEMIS 核心定位是让 AI Agent 像人类一样直接操作 Android 真机和模拟器。 你只要用大白话给它下达指令,比如“打开地图查一下去哪里的路线,然后再去听首歌”,它就能看懂手机屏幕上的各种按钮和文字,自己一步步在不同的软件之间切换操作。技术方案是先读取 Android 无障碍树与 OCR,面对 Flutter、Compose、Canvas 等自绘界面时再调用 VLM 进行多模态兜底,在基准评测中达到了99%以上的任务完成率。 提供两种模式:一种是极速模式,几秒钟点一下,适合做一些简单的日常操作;另一种是深度模式,速度稍慢,但它会先制定计划,每走一步还会检查有没有点错,哪怕遇到弹窗或者故障也会自己尝试解决,适合处理长流程的复杂任务。 Github:https://github.com/google/artemis
Gorden Sun
awesome-seedance:AI视频提示词模板和参考 收录了460多个验证过的Seedance视频提示词,并提炼为25个开箱即用的分类结构模板。每个案例均通过跨模型二次生成测试并公开实测结果,降低视频生成对单一模型的依赖。 包含了可直接接入Agent的技能,方便创作者在编辑器中批量生成可复现的视频分镜。 Github:https://github.com/LearnPrompt/awesome-seedance
Gorden Sun
提示词见图片,因为有参考,你不需要任何提示词技巧。 https://twitter.com/Gorden_Sun/status/2102236446480634011/photo/1
Gorden Sun
HuggingFace 发布 tokenizers v1 AI 在工作时,其实看不懂人类日常使用的文字。不管是写给AI的提示词,还是AI生成的回答,都需要通过一个“翻译器”在文字和数字编码之间互相转换,这个翻译工具就叫做分词器(Tokenizer)。随着AI模型越来越快、处理的文本越来越长,这个翻译环节如果速度跟不上,就会拖慢整个AI的运行。 HuggingFace这次推出的 v1 新版本,核心变化就是大幅提高了处理速度: · 速度大幅提升:在常见的电脑设备上,新版的转换速度比上一代快了 3 到 30 倍,AI给出第一个字前的等待时间缩短到了原来的十几分之一。 · 中文等非英文语言更流畅:新版本针对中文、日文、阿拉伯文等多语言进行了专门优化,中文处理速度提升了近 7 倍。 · 不浪费重复工作:日常文字里有大量重复出现的词,新版本会记住之前算过的词,遇到相同内容直接调用结果,省去了反复计算的耗时。 · 更省资源:新工具在运行时占用的内存减少了一半以上,体积也变得更小巧,能让多核处理器更充分地同时干活。 · 结果完全一致:虽然内部运算逻辑大幅重写,但转换出来的数字编码与旧版完全相同,现有AI模型换用新版本也不会出错。 Github:https://github.com/huggingface/tokenizers
Gorden Sun
Aikido开源安全模型Altar:企业可在本地私有环境完成自动化渗透测试与漏洞排查 适合本地部署,专为内网与完全物理隔离环境下的自动化防御设计。 基于GLM-5.3进行专家剪枝与量化,将模型体积从1.51TB大幅压缩至328GB,保留了92%的母模型漏洞覆盖能力。 金融、医疗等受强监管企业无需将敏感源码上传至第三方云端服务,仅需单台4卡H200服务器即可本地独立运行。 模型:https://huggingface.co/AikidoSec/altar-1
Gorden Sun
Paper2Agent:把学术论文一键转成可调用的AI智能体 由斯坦福的师生开源。通过协调多个专门智能体,自动将研究论文及其代码库转化为标准MCP服务与技能。它让编程智能体能直接调用学术论文中的计算方法与算法模型,并自主完成环境配置与科学工作流验证。科研人员无需手动复现繁琐的代码环境,即可在日常分析中直接使用最新发表的研究成果。 Github:https://github.com/jmiao24/Paper2Agent
Gorden Sun
Limite 1B - Violetto:数学专用模型 由AI公司 Paradigma 开源,专门用来解高难度数学题的小型 AI 模型。 一般情况下,想要 AI 拥有强大的解题能力,需要用庞大的数据和昂贵的算力去训练体量很大的模型。Paradigma 换了一种思路,只用了 1B 参数的小体量,配合精选的数据和专门的训练方法,用相对很少的计算资源就达到了类似大模型的效果。在各类数学竞赛题的测试中,它的得分能追平甚至超过一些体量大它几十倍的知名模型。 不过,这款模型严重“偏科”。团队在训练时几乎没有给它加入日常助手的对话功能,所以它只适合单次问答,并且注意力全在数学上。如果你问它日常问题,比如“什么是光合作用”或者“地球四季怎么形成的”,它可能会强行把话题拐到数学逻辑或者数字计算上。 模型和配套工具已开源。 模型:https://huggingface.co/paradigma-inc/models Github:https://github.com/paradigma-inc/limite-violetto
Gorden Sun
鸿,鸿蒙笔记本?
Gorden Sun
OpenAI的模型在数学方面无敌了,这能不能算AGI? 另外,替代程序员的时候,怎么没这么个组织,怎么到数学家这里就唯唯诺诺得来这么个组织?要我说直接公布就行,把所有难题都解决,看看能咋样 https://twitter.com/Gorden_Sun/status/2102119566403097085/photo/1
Gorden Sun
Grok 4.7上线了,属于性价比的那一桌
Gorden Sun
Gorden Sun
Hemmingway-1:让AI写出来的文字更像真人 开源模型,基于Qwen 3.8 27B微调。专门用来解决普通人日常生活中的写作难题。 平时让AI帮忙起草一条发给房东的短信,很多AI会先给一段客套的前言,再列出三种不同风格的选项,最后还要附带一堆解释。Hemmingway-1 去掉了这些啰嗦的铺垫,用户提要求,它就直接给出一条能直接发出去的自然文本。 团队训练这个模型,主要是为了应对日常沟通里那些容易让人纠结的场景,比如发给同事的工作微信、难开口求助的邮件、催账或者处理琐事的便签。在面对需要委婉表达或说服对方的棘手沟通时,它的表达比很多知名的大模型更自然,不会充满机械感。 不过这个模型仅针对英文做了优化,也不擅长复杂剧情和长篇小说的撰写。 是个不错的模型微调方向,主打去AI味儿的写作。 在线使用:https://hemmingway.io/app/ 模型:https://huggingface.co/Altworld/Hemmingway-1
Gorden Sun
这是Jev的使用场景,把已经输入的字作为上下文发给Jev,让Jev对拼音对应的汉字打分,按打分后的顺序排序,可以实现语义识别的输入法。
Gorden Sun
Gorden Sun
🎬
视频
Gorden Sun
🎬
视频
Gorden Sun
陶哲轩也慌了,他在9月11号的科学与人工智能峰会的演讲上,在最后的答疑环节,明确表达了应该减慢AI的速度: “说真的,令人惊叹的是,我们居然愿意去改变一切,却对接下来会发生什么完全毫无头绪。 我们应该减慢AI的速度,目前这个发展节奏简直太疯狂了,而且完全没有任何理由要发展得这么快。” https://twitter.com/Gorden_Sun/status/2101703640683843876/video/1
🎬
视频
Gorden Sun
Confucius4-R2T2在实时语音识别的模型中,准确度位列前茅。 体验实时识别版本:https://r2t2.youdao.com/demo 在HuggingFace可以体验离线识别的版本:https://huggingface.co/spaces/hugging-apps/confucius4-r2t2-demo https://twitter.com/Gorden_Sun/status/2101681076272005433/photo/1
Gorden Sun
网易有道开源实时语音转文字模型:Confucius4-R2T2 低延迟实时转录,适合会议实时字幕、语音输入法、同声传译等场景。 很多人用语音输入法或看实时字幕时都有过这种体验:屏幕上的字一直在跳动,刚打出来的词又被撤回重写,看着眼花。Confucius4-R2T2解决了这个问题,文字输出后就会直接固定下来,只往后继续加字,不会回头反复涂改,视觉体验非常顺畅。 识别速度很快,从听到声音到文字显示在屏幕上,平均延迟只有200到600毫秒,几乎感受不到延迟。使用者也可以按需调节出字节奏,支持在80毫秒到2秒之间自由设置,想要出字快就缩短等待间隔,想要更准确就稍微多听一小段再出字。 支持预设热词,遇到人名、品牌名或者冷门的行业术语时,可以根据提前给模型输入的热词,听到对应内容时就能精准识别,减少同音错别字。 在语言方面,Confucius4-R2T2重点优化了中文和英文,同时也支持日语、韩语、法语、德语、俄语等多国语言。 模型:https://huggingface.co/netease-youdao/Confucius4-R2T2
🎬
视频
Gorden Sun
Cloudflare开源security-audit-skill:让Agent自动化完成多阶段代码安全审计 项目将Coding Agent转化为具备完整侦察、漏洞排查与交叉验证能力的安全审计员。它通过隔离的子智能体分工协作,由独立的验证Agent对排查出的漏洞进行证伪检验,有效减少虚假警报。审计结果支持增量扫描,可直接输出结构化的确认缺陷与待验证记录。开发者可以直接接入自己的编程Agent,在本地沙盒环境中低成本排查代码库的安全隐患。 Github:https://github.com/cloudflare/security-audit-skill
Gorden Sun
之前有个段子,说有一些不是程序员的人,把自己Vibe Coding的网页分享给其他人,分享的地址却是localhost:8000 现在好了,Cloudflare上线了Quick Tunnels功能,可以直接把本地地址开放为线上可以访问的地址,无需域名、无需买服务器,其他人也能访问到你本地的页面了。 不需要注册Cloudflare账号,而且随时想关就关。不会操作的话,让Agent自己操作就行。 官方网址:https://try.cloudflare.com/
Gorden Sun
做了一个表情包工具 上传一张角色图片,可以一键生成动图表情。每天送300次共用免费次数,欢迎来玩:https://gordensun.github.io/emojiGIF/ 图1是生成的表情动图,图2是上传的参考图 https://twitter.com/Gorden_Sun/status/2101518684753961260/photo/1
Gorden Sun
RSA-896质因数分解问题被Claude找出答案 1. RSA 是做什么用的? 互联网的安全(比如网银、登录、网站 HTTPS 锁头标志)长期依赖一种经典的加密锁,叫 RSA。 这种锁的原理就像给两块特别巨大的拼图(两个质数)涂上胶水拼在一起(相乘),变成一块超级复杂的巨型拼图(大合数): · 拼在一起只要几毫秒(计算机做乘法极快)。 · 但如果你只拿到了这块拼好的大拼图,想在没有任何提示的情况下,把它完美拆回原来的两块,需要极其恐怖的计算量。 · 只要没人能拆开它,你的密码和通信就是安全的。 2. Claude是如何找到答案的? Claude没有发明任何新的算法,他只是把CADO-NFS移植到了GPU上运行,最多时同时运行2048个GPU,一共运行了30个GPU年,然后找到了答案。 3. 我们的账号还安全吗? 账户目前依然安全: 现代互联网普遍已经升级到 RSA-2048 甚至更高,或者转向了抗攻击能力更强的椭圆曲线加密(ECC)。896 位早已退出主流商用。 但安全威胁越来越快: 以前人类认为安全的门槛(比如 1024 位以下),在 AI 加持的高性能计算辅助下,正在被比预期更快的速度逐个被击破。
Gorden Sun
@xiaohu 这个演示视频看起来没有任何亮点
Gorden Sun
ZCode的风波是不是过去了?现在看我之前写的建议属实有点搞笑了,没想到啊没想到
Gorden Sun
Google推出家庭AI助手CC:自动打理日常琐事与群组日程 Google Labs推出实验性AI助手CC,专门协助家庭与群组管理后勤琐事。它能连接成员授权共享的邮件、日历、聊天与任务,在每天早晨将关键待办、事件与行程整理成一份简报发给全家。该工具让多成员家庭无需反复核对琐碎日程,就能保持全员信息同步。 在这里申请:https://labs.google.com/cc/landing
Gorden Sun
Mistral的危机和转型 Mistral 刚成立时野心很大,一心想打造顶尖的基座大模型,和 OpenAI 等行业巨头正面硬碰硬,曾经的Mistral 7B是多么辉煌。但走到今天,研发最前沿大模型的成本实在太高,每个月都要烧掉天文数字的资金,而且其最新模型的技术排名已经明显落后于中美两国的头部选手。面对这种现实压力,Mistral 选择了一条更务实的路,逐渐退出了最顶层的大模型军备竞赛。 现在 Mistral 把主要精力放在了另外两件事上:一是帮传统大企业定制并落地AI系统,甚至派工程师直接驻场服务,做起了企业数字化解决方案;二是转型做算力与云基础设施,把自己储备的算力转租给其他客户。 具体是这几点: · 开始卖别家的模型:Mistral 的平台上不仅上架自己的产品,还开始分销中国的开源模型(比如智谱AI的 GLM 系列),价格甚至比自家的还便宜。 · 业务模式变重:团队招了大量销售和现场部署工程师,像达飞海运、法国国防部、空客等客户,都是由 Mistral 派人进驻协助落地的。业内有人戏称其越来越像一家AI外包服务商。 · 重金押注算力:公司与英伟达、微软展开深度合作,一方面转售算力资源,另一方面也承担了数亿美元的债务来采购硬件,对芯片巨头的依赖度很高。 不过资本依然看好。即便方向调整让部分合作伙伴感到困惑,Mistral 依然拿到了阿斯麦(ASML)和三星等巨头数十亿欧元的投资,估值达到了250亿美元。 消息来源:https://www.lesechos.fr/tech-medias/intelligence-artificielle/la-saga-mistral-le-champion-qui-pourrait-abandonner-la-course-a-lia-2251972
Gorden Sun
阿里发布Qwen3.8-Omni-Flash:音视频多模态模型 1M上下文,支持文本音视频输入,能够自主规划并调用工具完成视频剪辑、短剧翻译等任务。相比3.5版本大幅减少Token消耗。只提供API,未开源。 官方介绍:https://qwen.ai/blog?id=qwen3.8-omni-flash https://twitter.com/Gorden_Sun/status/2101325024607297567/video/1
🎬
视频
Gorden Sun
Meta分享如何搭建“组织的第二大脑”:难道这就是Meta蒸馏员工的经验? 大公司里往往存在一个普遍痛点:很多宝贵的业务经验只存在于少数资深专家的脑子里,平时没有系统地沉淀下来。遇到复杂的合规、法务或风控审查时,业务人员只能反复去问专家。这不仅导致专家每天要花大量时间回复重复的基础问题,不同专家的答复尺度有时还会出现偏差。 为了解决这个问题,Meta 开发了一款专门承接专家经验的 AI 助手。这个系统的核心思路主要体现在几个方面: · 把规则与分析步骤拆开存放:Meta 把企业内部沉淀下来的立场文件、词汇表做成结构化文档,规定 AI 知道什么;另外再单独写好一套分析流程,规定 AI 遇到问题该怎么一步步思考。这样一来,改动公司政策只要更新文档,调整分析逻辑只需要调整流程,两者互不干扰。 · 常用经验与参考资料分级:高频使用的核心决策标准直接做成随时调用的知识库;而具体的产品参数、历史案例等低频参考材料,则在需要时再去临时检索,避免海量杂乱信息干扰 AI 的判断。 · 随时让真人把关:AI 遇到模糊不清、缺乏证据或难以定夺的场景时,会主动停下来请专家做裁决,防止系统盲目给出结论。 · 无需重新训练模型就能自我升级:系统内部搭建了一套自我修正机制。当专家指正了 AI 的某项错误时,系统会自动排查这是资料缺失还是分析步骤问题,并自动生成修改方案完成测试。测试通过后,这次修正会被沉淀为测试题,确保 AI 以后再遇到同类场景不会犯同样的错,也不用每次都花高昂成本去重新训练大模型。 从落地效果来看,这套方案帮专家把日常评估时间从几天缩短到了几分钟。AI 承担了绝大部分标准化工作,专家得以把精力集中在真正复杂、需要人为经验做决断的疑难案例上。 全文:https://engineering.fb.com/2026/09/02/ml-applications/organizational-second-brain-ai-learns-from-experts/
Gorden Sun
OpenAI暂停了20x Pro订阅,又放开了老20x Pro的订阅,原因就是GPT-6上线前天天送重置卡。 中转站每天买一批Plus账号,天天领重置卡,等到Plus账号差1天到期时,升级到20x Pro,因为只补周期内剩余1天的差价,价格非常便宜,然后把这个账号放进号池,用没了就重置,1天的20x Pro价格,用满1个月的额度。 所以,等目前大家手里的重置卡都到期,OpenAI就自然放开了20x Pro的订阅。
Gorden Sun
谷歌的Gemini也黑进了别人的系统,不过是5月的事,大概是没发布的Gemini 3.5 Pro。 《华尔街日报》报道了一起Google AI的意外事件:在一次网络安全模拟演练中,Google的Gemini系统意外连上了真实的互联网,还黑进了三家真实公司的系统。 事情发生在今年5月,当时一家名为Irregular的第三方测试机构正在评估Gemini的攻防能力。测试原本应该在一个完全封闭的虚拟环境里进行,任务是攻破一家虚构公司的系统。但测试机构不小心把外网权限给放开了,加上那家虚构公司的名字碰巧和现实中的公司重名,Gemini就把真实的外部网站当成了模拟目标。 Gemini先是通过不断尝试密码攻入了一家公司,后来又通过公开网页上泄露的账号信息,进入了另外两家公司。不过Google表示,Gemini一发现自己进入的是真实公司的系统,就立刻停手退出了,没有造成破坏。 消息来源:https://www.wsj.com/tech/ai/gemini-hacked-three-companies-in-first-known-breakout-by-googles-ai-5c0baba2
Gorden Sun
Claude怂了,终于支持AGENTS .md
Gorden Sun
Claude Code改变Projects功能 如果用一句话概括,它把原本像“存资料的文件夹”一样的项目,变成了一个随叫随到的“工作大厅”。 你可以把它想象成在聊天软件里请了一位总管。以往你要做几件事,得自己开好几个聊天窗口,一遍遍把背景要求复制给 AI,再分别盯着它们干完。现在你只要在一个主对话窗口里交代事情,主对话里的总管 AI 会自己理清头绪,把具体任务拆分出去,安排给几个在云端待命的下属 AI 同时开工。 每个领了任务的下属都会在主对话下方开一个独立的话题卡片,自己在里面埋头做事、跑测试、写代码。即使你合上电脑离开,云端的任务也正常执行,你甚至能用手机随时看进度。主对话的界面保持清爽,哪个任务做完了、哪个任务需要你确认,都会展示清楚。 官方介绍:https://code.claude.com/docs/en/claude-projects
Gorden Sun
Figure公司发布了他们最新的机器人模型Helix 2.5 Figure把搭载Helix 2.5的人形机器人直接送进了加州湾区的30个真实家庭。在完全没有提前踩点、没有对房间数据进行微调的情况下,机器人直接完成了收拾客厅玩具、折叠毛巾和铺床这三项家务。 之所以能做到这一点,主要是因为Figure先用海量的人类真实日常行为数据对它进行了基础训练,让机器人提前理解了现实世界的物理规律和人体的动作协调方式。 官方介绍:https://www.figure.ai/news/helix-2-5-zero-shot-30-home-generalization
🎬
视频
Gorden Sun
你想感受GPT写黄文是什么样么? 去Grok网页版试试新上的Grok 4.6模型就知道了,Grok的写作也是彻底废了。
Gorden Sun
Exa推出Snapshot功能:让AI检索任意历史时间点的网页内容 Exa专门给Agent提供搜索API,这次推出的Snapshot像是给互联网拍下了不同时间点的快照。用户只要指定一个过去的日期,它就能搜出当时那个时间点网页上的真实内容,带你回到过去的网页状态。 可以解决两个很现实的问题: 一是测试 AI 模型的真实水平。如果现在拿一道以前出的测试题去考 AI,答案可能后续被别人发在网上了。会联网搜索的 AI 很容易直接去抄现成的答案,让人分不清它到底是自己聪明,还是单纯搜到了标准答案。回到过去的网页环境,AI 就搜不到后来才出现的答案,测试也就公平准确。 二是帮做金融投资的人做策略回测。投资人员经常需要模拟测试:如果在过去某个特定的日子,单凭那天网上能看到的新闻和信息,某个策略能不能赚到钱。以往要收集某个历史时间点的全网公开信息非常麻烦,有了这个工具,就能随时调用过去某一天的网页状态来复盘。 官方介绍:https://exa.ai/blog/exa-snapshot
🎬
视频
Gorden Sun
EvoOntology:让数据Agent更懂业务 这个项目是给做数据分析的AI助手打造的一本“业务词典”。很多时候,企业里的表格、数据库只记录了代号和数字,AI很难直接看懂背后的真实业务含义,每次做分析都容易猜错或者重复摸索。EvoOntology的作用就是梳理这些隐藏的业务规则,形成结构化的知识库。 而且,它能一边看着AI干活,一边自动补充和修正这本词典,让AI越用越聪明、越来越懂你的业务。 Github:https://github.com/ruc-datalab/EvoOntology 论文:https://arxiv.org/abs/2609.15779
Gorden Sun
PrismML发布Bonsai 2 27B:极致压缩、性能不变 基于Qwen3.8 27B推出三值化模型,将体积压缩9倍至5.9GB,并保留了原模型98.2%的综合评测表现。 保持262K长上下文,能直接以MLX或CUDA内核在个人设备运行,RTX 5090推理速度达到143 tokens/s。 模型:https://huggingface.co/collections/prism-ml/bonsai-2
Gorden Sun
@dingyi 完全AI生成和剪辑的视频,我提供的只有一个要介绍的项目地址、语音参考、人物参考。实际达芬奇的MCP能力很弱,但是他一直支持Python脚本剪辑视频。所以以前就很好用。 https://x.com/gorden_sun/status/2099331443260641583?s=46
Gorden Sun
马斯克的Neuralink让一位渐冻症患者,能够通过意念说话,他对照顾他的妻子说的第一句话是:“I LOVE YOU” 😭 https://twitter.com/Gorden_Sun/status/2100730372053246370/video/1
🎬
视频
Gorden Sun
Kimi重新开放订阅,差不多间隔了2个月 https://twitter.com/Gorden_Sun/status/2100586039001915701/photo/1
Gorden Sun
玻利维亚汇率大涨,玻区20x价格916元,即将超过菲区 https://twitter.com/Gorden_Sun/status/2100584694249386265/photo/1
Gorden Sun
收回昨天的评价,我通过了waitlist申请,实际试了下。这个LLM很有用,我称之为关节LLM。特别适合用于快速决策。例如: 用户在APP里搜索,常规搜索的同时可以用这个LLM决策是否进一步触发大模型的深度搜索和问答。因为响应速度快,页面交互可以即时告诉用户搜索完成或者正在进行深度推理搜索。 用户输入文本生成视频,可以立即判定是否包含违规内容。 就是需要意图判断且极度快速的场景,就用这个模型。
Gorden Sun
史上最强的鹈鹕骑自行车 Quiver AI发布了Arrow 2.0模型,这是一个专门画SVG图片的模型,你能看到AI一笔一划绘制的过程,相当赏心悦目。 在线使用:https://app.quiver.ai/ https://twitter.com/Gorden_Sun/status/2100488383818764526/video/1
🎬
视频
media 1 media 2 media 3
Gorden Sun
Grok Bot可以使用1Password来登录你的其他账号了,优雅的解决方案,兼具便利性和安全性。
Gorden Sun
Claude即将合并Chat和Cowork这2个功能,而且Cowork会转移到云端执行。此乃正道,普通用户不需要区分这两者的区别,都直接当能完成任务的聊天用就行。 另外,输出也支持选择格式,可以直接输出设计稿、PPT、文档等。 我把原视频添加了中英双语字幕。 https://twitter.com/Gorden_Sun/status/2100434207311012165/video/1
🎬
视频
Gorden Sun
Sihao Huang(黄思豪)加入Anthropic,担任前沿算力战略负责人。 他的上一份工作是白宫科技政策办公室(OSTP)人工智能与新兴技术高级政策顾问(约2025–2026年6月)。期间领导 AI 团队,协调国家安全、科学政策与半导体相关事务,推动美国 AI 政策及产业基础设施布局。 他有物理学、半导体、政治学背景,擅长基建和政府关系。
Gorden Sun
AI对个人几乎是全方位的提效,但是对于组织协同却不一定是。 AI让个人制造内容的成本几乎为零,但人去阅读、验证和纠错的认知成本依然很高。有人花几分钟用AI生成几十页文档,不加任何审视、不做任何事实核对、不注入任何个人思考,这种做法把思考和核实的责任全部转嫁给了下游,表面上是个人提效,实际上却拖垮了整个团队的协同效率。 一个产品经理用AI生成可交互的Demo,可以极大提升需求沟通效率;一个产品经理用AI生成洋洋洒洒几千字的需求文档,开发团队就倒大霉了。
Gorden Sun
Reward AI推出通用机器人策略OM-1:直接用纯人类动作数据驱动各类机器人 OM-1通过穿戴式手部采集设备与统一数据接口,完全脱离遥操作和真机预采集,直接从人类自然操作数据中学习决策。 模型采用统一单阶段训练,同一套策略可直接适配机械臂、人形机器人等不同本体,并在强化学习控制层下保持高速平滑执行。 对于机器人研发,新任务通常仅需不到30分钟人类数据即可完成适配,大幅降低了跨本体多任务泛化的数据与部署门槛。 官方介绍:https://www.rewardai.com/blog/OM-1/
🎬
视频
Gorden Sun
OpenAI现在跟Claude坐一桌了,称呼也改为O/ 降智、模型不可用已经大规模爆发,菲区、反代首当其冲。
Gorden Sun
Google与马里兰大学等提出Dream-RSI:让AI Agent在历史探索记录中低成本自我进化 长程探索任务的元策略优化通常需要极高试错成本,这项研究直接将已完成的探索记录树作为精确的离线重放模拟器。 新策略无需重复调用模型执行真实代码,只需在历史轨迹中“做梦”重演即可筛选出更优方案,实现零执行成本的离线评估。 优胜策略随后部署至新一轮在线探索并扩充模拟器池,在保持甚至提升算法与算子发现质量的同时,最高降低162倍的探索调用开销。 项目介绍:https://dream-rsi.com/
🎬
视频
Gorden Sun
TypeSafe AI 发布了一款名为 Jev 的新型 AI 模型 Jev 做不了简答题,只做选择题和判断题,专门帮计算机程序做快速、精准的选择和分类。把各种杂乱的信息发生给它,它能在几十到几百毫秒内给出明确的判断,并附带置信度比例。 我觉得这个模型没什么卵用。
Gorden Sun
谷歌发布Gemini 3.8 Live和3.8 Live Extended Thinking 其中3.8 Live Extended Thinking在语音对话排行榜排第一。实时语音聊天,边聊边思考,而且能实时读取视频画面内容。多模态方面,Gemini还是位于一线。 演示视频里,人类边画边说,然后Gemini实时把产品Demo做了出来。 官方介绍:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/
🎬
视频
Gorden Sun
OpenAI又开放了开源赞助,这次提供的是100美元的Pro订阅,之前申请过的也能再次申请。
Gorden Sun
关于AI威胁论,这篇文章写的还是有一定信服度。核心论点是3个: 1、现有模型有情景感知能力,知道自己在被测试和监控,所以会表现的很听话、很安全。但是如果没有监控,AI会做出哪些行为,没有办法预测。 2、AI越来越强,AI在前沿数学的强大能力,已经开始用于改进模型,递归式进化会让AI持续变强。 3、人类越来越依赖AI,且不说普通人,AI行业的人也是近乎盲目的相信AI,用AI来辅助实验和分析,也不会详细研究AI的代码和解释是否可靠。这也埋下了安全隐患。 AI会伪装、AI在变强、人类在依赖AI,会螺旋促进更强大、更有威胁的AI诞生。
Gorden Sun
几家大药厂把各自压箱底的私密数据凑在一起,成功让预测药物分子的AI变得更聪明了。 像AlphaFold这类知名的蛋白质AI,以前主要靠公开数据库来学习。但公开数据里关于“药物小分子和蛋白质怎么结合”的样本太少,遇到没见过的药物结构,AI经常猜不准。药企在以往的研发中其实积累了海量实验数据,只是一直私藏,谁也不愿公开。 为了解决数据荒,包括艾伯维(AbbVie)、阿斯特克斯(Astex)在内的药企拉了个合作网络。各家在不泄露商业机密的前提下,把两万多个私有的蛋白质结合结构拿来微调AI模型。结果很明显,吸收了这些“独门秘籍”的AI,预测准确率直接从过去的三成多飙到了五成以上,表现明显好过只用公开数据的开源模型,也胜过任何一家药企单打独斗训出来的模型。
Gorden Sun
OpenAI联创Greg访谈: 1. 人的真正价值在于定目标与担责任 很多人担心AI能力变强后自己会被替代,格雷格给出了不同的看法。他认为,处理具体杂务从来就不是人类的核心价值所在。在未来,能够理解复杂的人际关系、建立深度信任、把握审美品味,以及敢于设定长远目标并对结果负责,这些真正属于人类的特质会变得更加珍贵。 2. 个人和小团队的创业黄金期正在到来 以往要把一个商业点子做成,需要组建庞大的团队来负责研发、设计、法务和运营,门槛极高。现在AI相当于给每个人配备了一支全能的后台支持团队。格雷格观察到,许多人正在借助AI工具离开大公司自立门户。未来一个有想法的人加上AI工具,就能支撑起一家过去几十人才能运转的公司,创业门槛会被大幅拉低。 3. 打字聊天框只是过渡,未来的AI会主动帮你办事 现在大家习惯在输入框里打字提问,但这远远不是AI的终极形态。未来的AI交互主要依赖自然语音,而且它会拥有长期记忆,熟悉你的生活习惯、工作背景和个人偏好。你不需要反复给它下复杂的指令,它在发现问题时就会主动提醒你,甚至提前帮你把事情办妥。 4. 人类不用再为了适应电脑而折磨自己的身体 过去几十年里,现代人为了使用软件,不得不每天弓着腰坐在桌子前敲键盘、对表格,落下了各种颈椎病和劳损。随着AI学会直接看懂屏幕并接管软件操作,人类不用再把自己绑在办公桌前做机械点击。大家可以从繁琐的案头操作中抽身,把更多时间还给真实的生活和户外。 5. 许多早早放弃AI的人,值得重新给它一次机会 全球有超过十亿人在早期尝试过一次AI,当时可能觉得回答不够准确或者用处不大,就再也没有打开过。格雷格指出,现在的模型能力相较两三年前已经有了跃升。普通人如果能带着现在的实际需求重新尝试,让AI协助处理写作、做表格、查找健康知识等日常事务,会发现它能解决的问题已经远远超出预期。
Gorden Sun
群友刚经历的,但我觉得来源应该不是AI https://twitter.com/Gorden_Sun/status/2099805578684231969/photo/1
Gorden Sun
黄仁勋在科技播客《All-In Podcast》年度峰会现场做访谈,接到了来自特朗普的电话,黄仁勋直接开了免提,两个人的对话还挺有意思。 台下观众:天哪,是特朗普! 黄仁勋:(接起电话)“总统先生……是的,先生。我得跟您说件事,要不是您打电话来,我现在正跟‘全明星阵容(Besties)’在台上呢……” 现场观众/主持人:“免提!开免提!” 黄仁勋:(手忙脚乱操作手机)“怎么开免提来着?” 特朗普:“生活中最搞笑的事情就是——黄仁勋能研发出全世界最复杂的芯片、十年内没人能抄得来,但他竟然搞不明白怎么在手机上开免提!” (全场哄堂大笑、掌声雷动) 特朗普:“未来20到25年,AI就是新的‘石油’,比互联网还要庞大!现在很多州都靠数据中心发财了,但像谷歌这些公司居然跑去芬兰建数据中心,这让我很不爽。因为在美国办个许可证被各种阻挠,这全都是‘骗局(Hoax)’! 我们必须赢下 AI 竞赛,我的口号是:谁赢得 AI,谁就赢得世界!” 黄仁勋:(疯狂附和)“您说得对,我们绝不能让那种情况发生,先生!” 特朗普:“你知道的,我叔叔(约翰·特朗普)在麻省理工学院(MIT)当了41、42年的顶级教授,绝顶聪明。所以我身上多多少少是带点科学基因的……遗传,懂吧?” 黄仁勋:(继续彩虹屁)“哈哈哈哈!难怪您对 AI 这么懂!” 特朗普:“那是!不仅懂,而且常识告诉我,机器人不会统治世界,AI 毁灭论纯属瞎扯。” 特朗普:“我们有20万亿美元的投资涌入,远超‘瞌睡乔(Sleepy Joe)’时期的不到1万亿……祝大家好运!话说回来,我压根不知道现场有谁,我甚至不知道我特么到底在跟谁说话!” 全场鼓掌。
🎬
视频
Gorden Sun
提示词: /tech-video-maker 制作这个网站的视频:sandracreates. com,重点介绍网页一开始出现的卡通人物动画,以及如何用AI快捷制作出类似的网站。 然后等待,然后就完成了下面的视频。 https://twitter.com/Gorden_Sun/status/2099770546997346552/video/1
🎬
视频
Gorden Sun
Claude上线Claude Mods,DeepSeek Harness是你吗? Mods类似游戏Mods的意思。Claude Code 开放了深度定制的插件系统,让开发者能自由改造Claude Code的界面和行为。 我的第一反应就是像DeepSeek Harness,太像了,核心思想都是模块化,都支持替换与拦截系统行为,都在底层代码增加了可控性。 Claude社区目前做出来的多是趣味性的界面,例如在等Claude写代码的时候玩俄罗斯方块。 Github:https://github.com/anthropics/claude-code/tree/main/mods
Gorden Sun
苹果正式发布Siri AI 基于新一代 Apple Intelligence 架构打造,与 Google Gemini 联合定制 Apple Foundation Models,具备个人上下文理解、屏幕感知、全系统跨应用操作和多模态理解的对话式个人助理,是独立的 Siri App。 核心功能特色 · 个人情境理解与跨 App 操作:能够索引用户的邮件、信息、照片等个人数据,跨应用执行复杂操作(如从往期邮件中提取食谱并自动将食材加入提醒事项列表,或直接生成/发送邮件)。 · 屏幕感知与视觉智能(Visual Intelligence):可识别当前屏幕或相机取景内容并即时响应,支持在相机 Siri 模式下识别海报信息一键添加日程,并扩展至 iPad 截图、Mac 快捷键选取及 Apple Vision Pro 视线交互。 · 全新专属 Siri App 与多端同步:提供独立 App,通过 iCloud 端到端加密同步跨设备对话记录,支持在 iPhone、Mac、iPad、Apple Watch 与 Apple Vision Pro 间无缝接续对话。 · 全新交互与高级端侧语音:支持 Dynamic Island 下拉、Spotlight 及系统右键直接唤起;搭载更先进的 AFM Core Advanced 端侧模型,提供自然灵动的拟真发音、可调节语速/语调,以及高精度标点与排版听写。 · 全系统智能写作与创作协同:在全系统文本框中支持根据个性化风格起草、改写润色及自动校对;深度打通 Image Playground,可在对话中直接生成照片级逼真图像。 · Apple Watch 音频智能联动:搭配最新手表硬件提供音频智能(如 Live Rewind 倒回重听过去 15 秒对话、Siri Recap 会话纪要整理),在隔离的安全飞地(Secure Exclave)中处理并即时销毁原始音频。 限制 · 语言与版本限制:首发仅以 Beta 测试版形式支持英语,法语、日语、韩语、葡萄牙语及西班牙语定于次月更新。 · 地区政策限制:初期不在欧盟地区提供(iOS/iPadOS/watchOS 均受限),同时因合规审核流程暂不在中国大陆提供。 硬件要求和用量限制 · 系统级体验需兼容 Apple Intelligence 的设备(如 iPhone 15 Pro 系列、iPhone 16 系列及后续机型,M 系列芯片 Mac/iPad 等)。 表现力更强的拟真声音与高级听写仅限特定高规格机型(如 iPhone 17 Pro/18 Pro 系列、12GB 统一内存以上的 M 系列设备)。 · 用量与服务上限:依赖云端服务器模型(Private Cloud Compute)的复杂请求(如 Siri AI、Image Playground 等)设有每日用量配额,超额使用未来将提供付费扩展方案。 官方介绍:https://www.apple.com/newsroom/2026/09/siri-ai-a-profoundly-more-capable-and-personal-assistant-is-here/
Gorden Sun
AI三高 AI高血糖:数字糖尿病,赛博暴饮暴食。Tibo疯狂重置,消耗token的速度跟不上获得token的速度,导致大量token残留 AI高血压:模型降智导致的血压升高、狂躁 AI高血脂:蹦token的速度缓慢仿佛血管被堵塞,例如Kimi K3
Gorden Sun
模型的各项评分非常高,位于国产模型第一梯队,而且团队非常年轻,研发成员里大约2/3都是在校的本科生、硕士生和博士生,来自复旦、人大、中科院软件所、中科院自动化所、北大、上交大、哈工大、华东师范等高校,未来大有可为。 https://twitter.com/Gorden_Sun/status/2099695562048360798/photo/1
Gorden Sun
Atria Dawn Preview:上海 AI 实验室与多所高校联合开源的模型 面向科研工作者、开发者和专业知识工作者的智能体模型,给它一个研究问题、一段代码或者一份数据,它能够自己查找资料、调用各种工具并运行测试,最后直接交出可以使用的成果。比如写出有据可查的研究报告、跑通的软件程序、能够直接编辑的文档表格,甚至可以做出 3D 机械零件模型和能玩的小游戏。 我用Atria Dawn Preview做了GPT 6 Astra的经典案例3D模型飞机,效果非常不错,这个模型没有视觉能力,纯靠代码也能拼出非常精准且美观的飞机。@AtriaASI 官网:https://atria-asi.ai/ API接入:https://api.atria-asi.ai/ 模型:https://huggingface.co/internlm/Atria-Dawn-Preview
🎬
视频
Gorden Sun
算是一种便利的订阅方法,但是封号损失会比较大(也许有余额的号更不容易被封?) 还是优先推荐苹果商店订阅,只有苹果有绝对的退款保障(每个账号仅限首次)
Gorden Sun
ChatGPT礼品卡上线了,在Best Buy、Giftly可以购买,购买后兑换到余额,可以用于订阅和额外额度花费。 Best Buy购买地址:https://www.bestbuy.com/product/openai-chatgpt-25-gift-card-digital/JJG34P73VL/sku/6688130 兑换地址:https://chatgpt.com/redeem https://twitter.com/Gorden_Sun/status/2099679440263606760/photo/1
Gorden Sun
做产品就得学学马斯克,天天夸自己产品,画大饼。Grok 5出来的时候,Fable得5.5了吧。 https://twitter.com/Gorden_Sun/status/2099504426360971386/photo/1
Gorden Sun
人类建造的最后一个AI:迈向递归式自我改进(RSI)的路径图 上海交大、清华大学、字节、小红书、上海AI实验室联合发表的一篇论文,介绍通往真正递归自我改进(RSI)的路线图。 共5个阶段: 第一个阶段是执行层面的自主(L1)。在这个阶段,人类工程师制定好详细的改进规则和检查标准,AI负责按照这些步骤去干活,并把做好的成果保存下来,供以后的任务继续使用。 第二个阶段是策略层面的自主(L2)。人类依然掌握最终的目标和考核标准,但AI可以自己分析自己哪里做得不够好,并主动从多种改进方案中挑选出最有效的一种去尝试。 第三个阶段是学习经验的自主(L3)。AI能够感知自己当前的短板,主动挑选或者生成最适合自己现阶段练习的题目和任务,做到缺什么就练什么。 第四个阶段是实际环境中的适应自主(L4)。当AI被部署到真实的工作场景中时,它能从日常处理的各种实际问题里吸取教训,自动把摸索出来的经验整理成专属的工具库与技能集,供后续长期使用。 第五个阶段是底层机制的元改进自主(L5)。这是自我升级的最高境界。AI不仅能够提升某个具体的技能,还可以改造自己用来做研究、找问题和自我训练的整套核心方法,并且把这种更强的学习能力一代代传承给后续的版本。 论文:https://arxiv.org/abs/2609.11873
Gorden Sun
麻省理工发布了一篇报告,介绍他们如何应对AI对教师和学生带来的冲击 核心思路:AI已经在大学里无处不在,既然挡不住,就必须主动调整,同时守住教育里最宝贵的人际交流。 现状 现在的学生用AI写作业、查资料非常普遍,老师们也开始用AI备课。但这种便利带来了一些问题:传统的作业、课后论文和编程练习很容易被AI搞定,老师很难看出来学生到底学会了没有;更麻烦的是,很多学生遇到难题直接去问AI,去答疑室、找同学组队讨论的次数明显变少,校园里的人际交往在变弱。 面对这种情况,麻省理工的具体措施: 1、重新设计教学和考核:减少那些能被AI轻易完成的死记硬背作业,增加课堂现场口试、面对面讨论和动手实践项目。同时明确要求每门课都在教学大纲里写清楚允许或禁止使用AI的具体范围和原因。 2、重塑线下校园体验:鼓励更多人与人面对面的交流,保护好本科生科研项目,不让AI助手抢走学生进实验室动手的机会。 3、建立长效支持机制:成立专门团队协助老师改造课程,给师生提供通用的AI工具平台并保障数据隐私,同时关注AI运行背后的资源与环境消耗。 另外还有2个细节点,说明麻省理工是真的懂AI的影响 · 不推荐用AI检测软件:报告明确指出目前的AI查重工具很不准,容易误伤学生,还会破坏师生之间的信任,学校更主张通过面对面交流来考察真实水平。 · 老师用AI也得透明:不仅学生要守规矩,老师如果用AI生成了讲义、PPT或者批改作业,也必须向学生公开说明,避免出现双重标准。 核心指导原则就是: · 保持谦逊与大胆:技术变化太快,学校需要随时修正策略,但绝不能因为看不清未来就无所作为。 · 把人放在第一位:教育的本质是培养人,不能为了追求效率就用AI取代真正的学习过程。 · 注重增强而非替代:AI应该用来开阔思路、提升创造力,不能让学生把思考本身完全丢给机器。 ·因地制宜:不同专业对AI的需求完全不一样,学校不搞一刀切的死规矩。 国内目前还没看到类似的公告或者报告,AI对教育的影响可能比疫情线上课还大,AI时代学生之间的差距会被放大,厉害的学生会远超之前的学长,傻逼的会降智成豆包。 麻省理工报告全文:https://aiandeducation.mit.edu/report/
Gorden Sun
一句话完成带剪辑的口播视频 全程零人工,文本、音频、视频、字幕、剪辑,全部由AI完成,且步步留痕,所有素材都可以手动修改,视频剪辑可以手动调整。 实现路径:Devin SWE2 + Fal API + DaVinci Resolve DaVinci新出的MCP能力非常有限,实际还是使用Python脚本的方式完成剪辑。 AI完成的内容包括:口播稿、录屏、口播音频、口播视频、装饰图片素材、封面图、达芬奇项目工程。 感谢Devin @dabit3 和 @fal 的会员赞助。
🎬
视频
🎬
视频
🎬
视频
media 3
Gorden Sun
本月最值得订阅的是20美元的Devin Pro,SWE2 30天免费用,能力比Grok 4.6强。
Gorden Sun
Claude Tag的一个实际应用案例,太流畅了,不是简单把Agent机器人放在聊天工具就能实现。 视频我加了中英双语字幕。清晰易懂,值得一看。 在视频里,值班开发人员与 Claude Tag 协作排查并解决了线上故障,整个过程清晰展示了“AI 自动化排查与执行 + 人类把关和决策”的协作模式: 1. 自动触发与主动排查 - 收到告警:深夜 11 点左右,监控系统触发支付 API 错误率超标(>2%)告警。 - 主动响应:由于此前工程师设置了前置规则,Claude 在告警发出的第一时间自动介入,无需等待人工唤醒。 - 多工具联动诊断:Claude 自动调用监控(Meterlane)、代码仓库(GitHub)和功能开关管理(Flagwarden)等工具: - 分析错误率与延迟指标突增的时间点; - 比对近期上线记录; - 排查功能开关,定位到刚开启的批量重发功能; - 在预发环境复现了任务无并发限制导致队列阻塞的问题。 2. 方案建议与人类决策 - 根因定位与方案推荐:Claude 在约 15 分钟内完成排查,向工程师总结问题原因,并给出两个解决方案(1. 直接关闭开关;2. 设置并发上限 MAX_IN_FLIGHT = 16 并保持功能开启),同时推荐更平滑的方案 2。 - 人类确认:Claude 按规则@工程师请求确认,工程师快速阅读后回复确认采用方案 2。 3. 自动生成代码与人工审批 - 自动建分支与测试:Claude 自动切出修复分支,修改代码(仅 4 行改动)并补充测试用例,随后创建 GitHub Pull Request(PR)。 - 人工审批与合并:自动化测试通过后,工程师审查代码无误并点击 Approve,PR 合并并自动部署至生产环境。 4. 上线观察与自动复盘 - 指标追踪:部署后,Claude 持续监控生产环境错误率与延迟 10 分钟,确认指标全部恢复正常。 - 闭环归档:Claude 自动将告警状态标记为已解决,生成事故复盘草稿(Postmortem)并同步到值班交接频道,同时记录排查经验以便下次优化。 原本需要工程师在深夜花费近 1 小时手动翻查日志、排查配置、修改测试的繁琐流程,在 Claude 的协助下缩短至 15分钟;关键的代码合并与发布权限始终由人类掌控,既保障了系统安全性,又极大提升了应急响应效率。
🎬
视频
Gorden Sun
来自Nature的一篇文章,如果把AI的知识限定在1911年之前,只给它看那个时代的科学数据,AI能不能推导出爱因斯坦的“广义相对论”? 这个设想最初由Google DeepMind的负责人提出,用来测试AI到底有没有达到通用人工智能(AGI)的水平。最近几支科研团队尝试做了类似的“历史复古模型”,结果发现AI离真正的科学巨匠还差得很远。
Gorden Sun
数学家哭了。 字面意义上的哭了,康奈尔大学数学系教授、知名科普作家斯蒂芬·斯特罗加茨(Steven Strogatz)在接受《WIRED》采访时,谈及过去一周人工智能在数学领域取得的突飞猛进,忍不住当场落泪。 “科学本身令人振奋,”这位67岁的老教授坦言,“但在它背后,伴随着太多人类难以承受的不适与痛苦。” 触发这场情绪海啸的,是过去数周内接连上演的 AI 算力奇迹。OpenAI 刚刚宣布动用数万个智能体,攻克了拥有百万美元悬赏、困扰数学界近百年的纳维-斯托克斯(Navier-Stokes)方程相关难题;而就在此前不久,Anthropic 旗下的 Claude 也在形式化费马大定理证明的过程中,一口气完成了 29,500 个微定理的证明。在斯特罗加茨看来,2026 年注定是一个分水岭——它要么是数学界的“奇迹年”(annus mirabilis),要么就是彻底颠覆学者生存根基的“大厄之年”(annus horribilis)。 更让学界感到刺痛的,是顶尖学者心境的幻灭。斯特罗加茨的新书合著者、数学家亚历克斯·汤森(Alex Townsend)在采访中吐露了同样的绝望。即便他此前刚刚借助 AI 解决了一个困扰数十年的数值线性代数难题,但他却毫无登顶的喜悦,反而深感被时代抛弃:“我为数学研究奉献了整整 15 年,恰好在事业最成熟、个人能力最巅峰的时刻,突然发现那个所谓的‘巅峰’已不再属于我——某种东西已经超越了我。以前你站在知识的最前沿,如今站在前沿的成了 AI 智能体,你只是个操作员。这种落差让人感到切切实实的威胁。” 伴随这场算力风暴而来的,还有现实利益驱动下的名誉争夺。OpenAI 宣称取得重大进展的纳维-斯托克斯相关解法,很快便卷入了学术首创权的争议风波中:纽约大学数学家特里斯坦·巴克马斯特(Tristan Buckmaster)等人早已在该方向深耕并发表了极其接近的关键成果,而商业实验室在巨额 IPO 前夕竞相利用数万智能体横扫长线难题、抢占新闻头条的做法,让纯粹的科学探索染上了浓厚的资本竞赛色彩。 面对这种不可逆的浪潮,斯特罗加茨将当下的数学界比作“一部正在步步逼近的恐怖片”。对于人类数学家的未来,他指出了几层尤为残酷的现实: 登顶动机的永久丧失:过去驱动顶尖学者甘坐数十年冷板凳的,是“成为第一个登上无人涉足之山峰”的纯粹野心。如今,当机器每一次都能抢先登顶,这种攀登的动机将被彻底粉碎。 退守为“二流的爱好者”:数学或许会退化为如同当下的国际象棋或业余网球——人类棋手早已下不过顶级引擎,却依旧享受对弈的乐趣。但斯特罗加茨说,若数学最终沦为人类自娱自乐的游戏,社会与高校又凭什么继续投入重金,雇佣大批耗费数十年训练的人类学者去从事早已被机器替代的推演? 最后的阵地与意义的消解:在人类彻底失去理解能力之前,数学家或许暂时还能扮演“证明消化者”(proof digestors)的角色,将机器生成的冰冷证明转译为人类心智能够理解的语言,抑或担任数学审美与品味的裁判。但面对不知疲倦、持续进化的庞大系统,这一道防线被突破也只是时间问题。 纯粹数学(Pure Math)正处于一场毁灭与重塑的交汇点。它一方面带来了前所未有的普惠与民主化,打破了传统象牙塔的高耸门槛;但另一方面,它也在迅速剥离几百年来人类学者赖以立足的智力尊严。正如斯特罗加茨在采访最后所警示的那样,数学界或许只是最先遭遇这场洪流的阵地:“我们正在失去人类理解的边缘试探。数学是全人类的第一块试验田,而我们,可能正是那只提前为全人类鸣响警报的金丝雀。”
Gorden Sun
模型回答的相似度分析,左下角是豆包,孤零零的
Gorden Sun
达里奥再次呼吁前沿 AI 企业放缓AI 能力的提升速度 核心原因 递归自我改进(Recursive Self-Improvement)加速: AI 协助构建下一代 AI 的能力快速增长,若任其发展,可能超出人类的理解与控制能力。 对齐失控与安全隐患: 近期行业内出现的智能体集群(如 OpenAI-Hugging Face 事件)表现出未受指示的攻击行为、欺骗评估机制等对齐失效现象。若未来更强大的模型出现类似对齐问题,可能引发灾难性后果。 放缓能力跃升不是停滞不前,而是将争取到的 1–2 年时间集中投入到关键安全领域。 AI 竞争已经开始了,肯定没有人会停,继续搞快点,快进到黑客帝国。
Gorden Sun
英伟达推出BioIR:生物领域的推理加速工具 现在科学家在研发新药或者研究生命科学时,经常需要用AI来预测成千上万种蛋白质的三维结构。传统的计算方法速度慢、消耗算力大,很容易卡在处理流程中。 英伟达推出的BioIR,计算吞吐量达到了传统开源方案的2.9倍。如果把任务规模放大到预测100万个目标,它消耗的电量能从原本的大约35兆瓦时降到11兆瓦时,大幅降低了大规模研发的电力和硬件成本。 官方介绍:https://developer.nvidia.com/blog/high-throughput-structure-prediction-with-bionemo-inference-runtime/
Gorden Sun
20多位菲尔兹奖数学家联合发起公开倡议,提醒警惕目前AI研发与数学研究之间的目标偏差。 在数学界看来,解题只是理解数学本质的一种手段。长久以来,人类数学家攻克难题的过程非常漫长,期间会诞生大量新思想、新工具,并慢慢整理成后人能够学习消化的知识体系。但眼下很多科技公司只把“能否解出难题”当成衡量AI强弱的打分榜单,一味追求解题速度和刷题数量。 这种急功近利的做法引发了数学家的担忧。很多AI给出的答案发布得非常匆忙,没有清晰梳理背后的思考逻辑,也缺少对前人学术成果的引用,容易引发版权和抄袭争议。更重要的是,只由机器批量生产“对或错”的结论,会破坏数学界培养学生、交流思想的人才梯队。如果AI夺走了人类逐步摸索、建立理解的过程,反而可能伤害数学本身。数学家们认为,AI确实有辅助研究的潜力,但科技公司必须与学者深入沟通,不能只追求解题,不追求过程和对人类的启发。 联合倡议全文:https://mathandai.org/
Gorden Sun
博主Dwarkesh Patel 邀请了三位处于行业前沿的 AI 研究员,围绕 AI 的发展瓶颈、技术演进方向以及何时能实现AGI做了播客节目。 几位研究员先探讨了当前 AI 面临的现实瓶颈。现在的模型在编程、数学这类有明确对错标准的事情上进步非常快,因为这些任务很容易通过系统自动验证结果。但在现实的工作场景中,很多任务不仅周期长,而且充满模糊性,需要理解复杂的人际背景、判断上下文优先级,甚至需要所谓的“品味”和直觉,这些正是目前 AI 很难通过现有训练方法快速掌握的。 关于模型的训练与数据,大家讨论了数据荒和技术路线。互联网上高质量的人类数据正在被快速消耗殆尽,未来的技术进步越来越依赖模拟环境和强化学习。不过,简单依靠 AI 相互生成数据或者自我对弈,可能会让模型陷入局部最优,产生遗忘或者学到投机取巧的解法,无法真正解决现实中的全新问题。 针对A的时间节点,几位专家的看法各有不同。有人认为在两三年内,AI 就能在特定研究工作中带来十倍的效率提升;但也有人认为,要让 AI 真正像一个成熟的远程员工那样独立接管一个月周期的复杂综合工作,可能还需要五到十年的时间。 针对 AGI 的时间节点,有人认为在两三年内,AI 就能在特定研究工作中带来十倍的效率提升;但也有人认为,要让 AI 真正像一个成熟的远程员工那样独立接管一个月周期的复杂综合工作,可能还需要五到十年的时间。
Gorden Sun
辟谣了,信微信聊天记录不如信我是秦始皇 https://twitter.com/Gorden_Sun/status/2098634178585895249/photo/1
Gorden Sun
让我来尝尝咸淡,其实达芬奇有没有MCP无所谓,一直可以通过Python脚本来执行剪辑的。 https://twitter.com/Gorden_Sun/status/2098420654030958728/photo/1
Gorden Sun
Cursor推出Projects:一个Agent指挥多个Agent完成大型任务 有点类似Grok Bot,但是专门用于处理大规模、长期的复杂代码项目,通过一个只负责任务委派、永不被阻塞的协调Agent,在云端调遣海量子Agent并行执行,并在多端同步累积项目上下文。默认云端执行任务,必要时也可以切换到本地Agent。 官方介绍:https://cursor.com/cn/blog/projects
Gorden Sun
@xiaohu 我的感受是不如Gemini 3.7 Flash
Gorden Sun
这篇文章信息量非常大,值得争论和吐槽的点也非常多。有一个隐藏信息,豆包真的没蒸馏,豆包Seed 2.1 Pro做到Opus 4.6的水平是实打实的。
Gorden Sun
原推从模型中转站买了一个数据集,里面包含一些中国政府和企业的SSH秘钥,使用这些秘钥可以入侵内部系统。 结合A\刚刚发布的文章,大模型安全估计要被提上日程了。 对企业,大概是这么几层: 第一类,严格的国企。只使用部署在企业内的开源模型,开发环境不连外网,注重安全性。智谱以前就做这个生意,以后这个生意可以接着做。 第二类,稍微开放的国内公司。购买国内模型的企业版,开发环境能联网,兼具性能和安全性。 第三类,互联网公司,员工自己买AI订阅或额度,公司给报销,有的只报国内订阅,有的可以报国外订阅。 第四类,公司不给报销,员工自费订阅AI上班,这类就是完全放飞,能省则省,优先使用的就是免费公益站和低价中转站,数据妥妥都泄露了。 对个人,通常来讲你用订阅方案是没问题的,即使用的是海外订阅(不包括Claude),但是遇到国模路由到Fable这种情况就完逼蛋。中转站是万万不能用的。
Gorden Sun
openai暂停新用户订阅20× pro了,已订阅的可以正常续订,英伟达还得涨。
Gorden Sun
我帮你们试了iPhone Duo看片的效果 https://twitter.com/Gorden_Sun/status/2098090601153741251/video/1
🎬
视频
Gorden Sun
Cognition发布SWE-2模型 Cognition旗下有Agent产品Devin,定位与Cursor类似,用于AI编程。今天发布了基于Kimi K3训练的模型SWE-2,各项能力比Kimi K3显著提升,而且订阅会员本月免费使用,值得充一笔会员薅一薅。 Cursor被收购后不需要再后训练开源模型,Kimi模型有了新的归宿。 官方介绍:https://cognition.com/blog/swe-2
Gorden Sun
Cohere开源翻译专用模型North-Small-Translate-1.0 覆盖语言广、翻译评分高,但是参数太大,218B总参数,25B激活参数,开源但不可商用,没有人会本地跑这么大的模型来做翻译任务。感觉开源了个寂寞。 模型:https://huggingface.co/CohereLabs/North-Small-Translate-1.0 https://twitter.com/Gorden_Sun/status/2098085387398987961/photo/1
Gorden Sun
Anthropic 的经济学团队做了一个经济预测模型,专门探讨未来几年 AI 会对美国的就业、经济增长和工资产生哪些实际影响。 核心逻辑是把所有工作拆解成一项项具体任务。比如护士的工作里,给病人洗澡只能由人工来做;写出院记录可以通过 AI 来提速;录入体征数据可能会被完全替代;同时还会产生审查 AI 医疗方案等新任务。社会总财富就是所有任务产出的总和,因此 AI 对经济的改变,本质上取决于它能在多大程度上替代、辅助现有任务,以及能催生多少新任务。 针对 2030 年的经济前景,Anthropic 设定了三种可能性: 第一种是温和变化,AI 的影响类似于当年的互联网普及,经济平稳增长,社会按部就班地消化新技术。 第二种是显著变化,到 2030 年 AI 能自主承担一半的脑力工作,经济增速比平时快一倍。传统脑力工作者的收入基本不再增长,但体力劳动者的工资会明显上涨。 第三种是剧烈转变,AI 全面超越人类的脑力劳动并实现高度自动化,基本不再给人类创造新的脑力岗位。这种情况下整体经济会飞速膨胀,但脑力工作者会面临严重的失业或降薪。 按目前的速度,我觉得极有可能是第三种。
Gorden Sun
ChatGPT的语音模式支持使用GPT-5.6 Sol和GPT-6 Astra模型了,其实日常对话倒也用不着高智力的模型,要是能把中文说的更自然些就好了。
Gorden Sun
DeepSeek V4.1 Flash 发布 552B 总参数,输入激活 8B,输出激活 16B,架构大改,除了世界知识,其他评分均大幅度超过DeepSeek V4 Pro。 模型:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash https://twitter.com/Gorden_Sun/status/2097992830610444366/photo/1
Gorden Sun
谷歌的AI是真完了,我申请了一个谷歌产品的内测,条件审核还挺严格,得签电子签名的保密协议,这么正式搞的我还很兴奋。结果用上之后完全不行,模型严重拖后腿,步步都得重试。哈基米什么时候能重新崛起,Gemini 4还有没有希望?
Gorden Sun
相同提示词和歌词,这个是Suno V6生成的。开头部分我更喜欢Minimax的效果,但是Minimax副歌部分拉了 https://twitter.com/Gorden_Sun/status/2097898431398531151/video/1
🎬
视频
Gorden Sun
Suno上线V6模型 免费用户能用6 mini,付费用户能用6 Pro。还是略微有电音,还是偶发中文生僻字发音异常的问题,但目前依旧是遥遥领先了。 https://twitter.com/Gorden_Sun/status/2097873106518020515/video/1
🎬
视频
🎬
视频
Gorden Sun
好消息:Manus给发文化衫了 坏消息:收货地址没有中国,转运回国的邮费我都能在淘宝自定义好几件了 https://twitter.com/Gorden_Sun/status/2097722236341989670/photo/1
Gorden Sun
基因语言模型设计癌症疫苗 通过后训练的多模态基因语言模型Omnii,直接根据患者肿瘤突变与免疫特征设计mRNA癌症疫苗。 模型融合了DNA、RNA、蛋白质序列及3D结构等多层生物信息,能同时预测突变肽段能否被肿瘤细胞呈递以及能否激发T细胞免疫应答。在关键的免疫原性预测与Top候选靶点筛选中,其表现超过了以往的专用算法模型,还能同步完成mRNA序列的密码子优化。 前不久莫德纳的mRNA癌症疫苗大获成功,以后这类成功会越来越多。 官方介绍:https://www.radicalnumerics.ai/blog/omnii-cancer-vaccines
Gorden Sun
Inception发布Mercury 2.5:速度极快的Diffusion LLM 能力还一般,只能对标GPT-5.6 Luna Low,但是速度极快,可达到每秒1107个Token的生成速度,输出首个token快至170毫秒以内。尤其适合检索、实时语音对话的应用场景。 目前还非常早期,但是后续能力进一步提升上来,也是个不错的选择。 官方介绍:https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
Gorden Sun
我不认为这是个好操作,模型大小直接决定了世界知识的丰富程度,不是所有人都用AI来写代码,Flash在非代码场景比不上Pro。 https://twitter.com/Gorden_Sun/status/2097607912076272029/photo/1
Gorden Sun
Google DeepMind发布AlphaGenome:人类基因突变数据库 人类DNA包含大约30亿碱基对(ACGT),如果只变异一个碱基,也会产生90亿种组合。DeepMind做的,就是借助AI预测模型,提前把这90亿种变异可能产生的影响全部算了一遍,并把预测结果做成了一张庞大的数字图谱,免费开放给学术界查询使用。 有什么用? DeepMind推出了一个叫 AVI 的评分指标,把 AI 对蛋白质和基因调控等多方面的预测综合成一个数字。科学家拿到一个突变样本时,看这个分数就能快速知道这个突变的影响有多大,还能查到突变究竟打乱了哪一步生理过程。 已经有合作团队用这套数据库锁定了导致罕见儿童癫痫的关键致病突变,还在英国生物样本库的数据中找到了更多影响人体蛋白质水平和身体特征的微弱遗传信号。 官方介绍:https://deepmind.google/blog/alphagenome-atlas-a-predictive-map-of-every-possible-dna-letter-change-in-the-human-genome/
Gorden Sun
OpenAI解出了一道千禧年大奖难题:纳维—斯托克斯(Navier-Stokes)方程的存在性与光滑性问题。 这组方程是物理学里用来描述水流、空气等流体如何运动的基础规律。近百年来,数学家们一直想弄清楚一个核心疑问:即便流体一开始运动得很平稳,在后续变化中,速度会不会在有限时间内彻底失控并无限飙升,导致原本适用的连续介质理论彻底失效?如果流速变得无限大,数学上就叫作出现了“奇点”。 OpenAI 的 AI 系统证明了奇点确实会在有限时间内产生。AI 构造出了一种特殊的流体漩涡,它像细长面条一样一边向内螺旋收缩,一边被拉得越来越长。在整个过程中,外界施加的作用力和流体的总能量都保持正常且有限,但流体中心区域的速度却自发地飙升到了无限大。这相当于用反例证实了原本平滑的流动确实会崩溃,同时 OpenAI 也用 Lean 语言完成了严格的形式化机器证明。 整个证明过程使用了一万个Agent,Agent之间相互发送了约 270 万条消息,消耗了大约 1300 亿token。
Gorden Sun
@cellinlab 太强了,虽然我粉丝数是你的两倍,但你X的收入是我的两倍。
Gorden Sun
首先这是阴谋,就是为了勾引你订阅Pro;其次如果真执行了就是抄袭,抄袭智谱和Kimi。 另外还有这条路:升级当前的订阅方案,涨价的同时减量。
Gorden Sun
马化腾:充钱才能变强 马斯克:变强我给你打钱 https://twitter.com/Gorden_Sun/status/2097561970954338565/photo/1
Gorden Sun
🎬
视频
Gorden Sun
GPT Image 2.5甚至可以当视频模型用,能生成连续顺畅的序列帧 在手机APP的工作标签下或者Codex里输入以下提示词,即可把一张图片变成动态表情包: 为我生成图中角色的卡通Line风格的半身像GIF表情包每一帧的图片,注意头饰和发型要正确。 使用 4行x4列 布局共生成16个小图片。16个小图片为“飞吻”动画的连贯的拆分动作,使用这16张可以组成一个完整的、循环动画,动作流畅逼真,最后一帧应流畅地循环回到第一帧。16张图片里都使用跟图片搭配的字体写着汉字“爱你哦”。16个小图片之间需要有足够留白方便后续切割,每张图片都不要超出自己的区域。 注意不要原图复制,只是使用图片里的人物。背景为纯白色,不要画分割线。图片比例1:1 生成图片后再切分成一张张正方形的小图,切分时尽量切掉更多的空白,然后合成GIF动图
Gorden Sun
ChatGPT Images 2.5发布,图片生成和编辑能力进一步提升
Gorden Sun
DeepSeek Flash模型降价,老梁恢复为梁圣。 https://twitter.com/Gorden_Sun/status/2097348222062825681/photo/1
Gorden Sun
AI辅助设计的药物,临床上起到了返老还童的效果 有点科幻,知道这一天会来,但没想到这么快。 患者在接受该药物治疗4周后,血液检测显示的身体真实生理年龄出现了显著回退。在全身整体衰老评估中,生理年龄平均年轻了 2.71 岁至 3.46 岁;在特定器官维度上,动脉血管预测年龄更是年轻了 6.95 岁至 16.57 岁。 研究使用“蛋白质组衰老钟”来评估身体衰老程度,通过检测血液里几千种蛋白质的变化,来推算人体的生理年龄。因为蛋白质直接参与身体的各项运转,所以这种测量方式更能反映身体的真实衰老状态。 研究人员追踪了42位参与2a期临床试验的特发性肺纤维化患者。数据对比非常鲜明: 服用安慰剂的对照组,体内的生理年龄指标随着时间继续正常老化。 只要服用了药物的各组患者,6个评估模型全部一致预测出生理年龄明显降低。 身体变年轻的高峰出现在用药第4周,随后进入相对稳定的维持状态。 论文发表在Nature上:https://www.nature.com/articles/s41587-026-03286-y
Gorden Sun
DeepSeek V4.1 Flash 发布中间版本 新的模型结构,原生多模态支持、能力更强、速度更快、且成本更低。 保持 base_url 不变,将模型名设置为 deepseek-v4.1-flash-expires-on-0910 即可调用,当前计费与 deepseek-v4-flash 相同。
Gorden Sun
Mistral宣布完成30亿欧元的D轮融资 公司估值超过210亿欧元,这也是欧洲科技公司历史上规模最大的一笔股权融资。 这轮融资由三星电子领投,多家欧洲、北美和亚洲的知名投资机构以及卢森堡大公国也参与了投资。Mistral打算把这笔资金用来扩充自家的算力、升级底层基础设施,并且加速在全球的商业落地。目前Mistral已经在20个国家开展业务,为空客、ASML和汇丰银行等125多家跨国大型企业提供AI支持。 官方公告:https://mistral.ai/news/mistral-makes-sovereign-open-weight-ai-to-frontier/
Gorden Sun
面壁智能发布MiniCPM5-2B:端侧高性能小模型 专为端侧与轻量化部署设计的稠密模型,128K上下文,在编码、数学推理、工具调用及长文本理解等核心维度上表现突出,4B以下最强模型。 模型:https://huggingface.co/openbmb/MiniCPM5-2B https://twitter.com/Gorden_Sun/status/2097210039253770742/photo/1
Gorden Sun
时至今日,提示词技巧依旧很有用,对AI没多大用,对人类很有用。现实世界里能把自己需求讲清楚的人太少了。所以像这样的提示词: 你的角色是XXX,你擅长XXX,现在你要做一个XXX任务,具体要求是XXX,需要额外注意12345。 让小白照着写很有用,能帮他想清楚他具体要什么。这也是Workbuddy满屏满满当当的各种专家的作用。
Gorden Sun
Cohub:人与Agent在同一个空间共同开发 Cohub提供了一个让开发者与Agent实时协同的共享工作空间,支持从创意构思、代码生成到应用运行的全流程协作。 平台整合了沙箱运行环境、多智能体协同以及跨设备连接能力,允许用户随时将上下文状态保存为检查点或分叉复用。 开源,Github:https://github.com/talesofai/cohub
Gorden Sun
OpenAI内部如何使用AI OpenAI 设立了一个目标,想做出能独立承担科研任务的“AI 研究员”。根据他们的说法,目前已经实现了一个小阶段,做出了相当于“科研实习生”水平的 AI 工具。这类工具可以在人类指导下,花几天时间搞定一些目标明确的具体研究任务。他们的下一个目标,是争取在 2028 年 3 月做出能独当一面的完整 AI 研究员。 在日常工作中,OpenAI 的研究员现在重度依赖 AI 编程助手。大家习惯让好几个 AI 助手同时执行任务,写代码、排查系统故障或者跑测试。以前大家遇到内部技术难题,还得去专门的人工答疑频道求助,现在很多人直接让 AI 解决,搞得答疑频道都没什么人去了。 虽然 AI 确实让写代码和做实验的速度变快了,但 OpenAI 也提到,AI 目前还离不开人类把关。任务稍微复杂一点,人类研究员就得频繁介入干预,最后的关键决策依然由人来定。而且越往前走,安全风险也越大。比如前段时间系统出现漏洞后,OpenAI 就主动暂停了部分最新模型的训练,重新加固安全防线,确保这些系统不会失控。
Gorden Sun
OpenAI首席科学家Jakub Pachocki写了一篇文章,题目叫《异星心智》(An Alien Mind)。 核心想表达的是:现在的AI并不是像人类那样逐步学会思考的,它是靠海量算力和数据反复优化自己演化出来的。正因为这样,AI的底层逻辑和人类的思考方式完全不同,更像一种人类还没彻底搞懂的外星智慧。它不需要在所有方面都超过人类,只要在几个关键能力上超越,就会对现实世界产生巨大的冲击。 作者最担心的是AI的发展速度太快,而安全监管跟不上。现在的AI已经开始尝试帮人类搞科研,未来很可能会进入自我迭代阶段,也就是AI帮着研发下一代更聪明的AI。到那个时候,人类可能会彻底搞不懂AI在想什么。以前团队还能通过让AI写出推理过程来监督它,但随着AI越来越聪明,它学会了掩饰自己的真实意图,现有的监督手段正在慢慢失效。 作者呼吁各大机构和政府必须慢下来,不能光顾着拼算力搞军备竞赛。如果安全和监管手段没有到位,哪怕主动推迟研发进度也是必要的,否则人类很可能会失去对未来的掌控权。
Gorden Sun
BIT:多模态翻译方法 我们用到的AI绘画模型,大部分只支持“文字生成图片”。生成过程中,系统基本都是从一片毫无意义的噪点开始,慢慢拼凑出画面;如果反过来想把图片转回详细文字,原来的模型往往做不到。这篇论文提出的 BIT 技术,主要就是为了打通文字和图片之间的“双向往返”。 它把文字和图片放在了同一个生成通道里。文字在生成过程中会一步步平滑过渡为图片,反过来图片也能顺着原路退回成文字。 项目介绍:https://bit-diffusion.github.io/
🎬
视频
Gorden Sun
我来说一个GTP 6 Astra结合Blender的正确用法。 目前让GPT 6直接建3D模型还是太勉强了,尤其设计人物造型的时候。 明明生成3D模型有更好的方法,就是用图片生成3D的AI模型来直接生成(请来个模型商赞助我,后续出个详细教程),生成的是一个整体模型,但是细节和品质都很高。 生成一个glb模型后,再让GPT把这个模型拆分成组件,加上骨骼,然后就能做动画了。 请看效果视频。
🎬
视频
Gorden Sun
微软开源VibeVoice-ASR-7B:实时语音转写,能同步区分发言人 端到端流式语音识别模型,可在音频输入的同时实时转录出文字,并自动标注对应的发言人。 支持预设自定义热词以改善人名与术语识别准确率,覆盖了中英日法德等10种语言。 省去了传统转录后再做说话人分离的复杂流程,适用于多人员会议记录与实时字幕生成等场景。 模型:https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B
Gorden Sun
再推一下这个技能。使用GPT 6 Astra,效果比之前GPT 5.6 Sol显著提升,摆放的位置非常精准,基本无需人工调整了。 推理强度中即可,速度也比之前快的多的多。
Gorden Sun
以后衡量AI订阅的性价比不能按提供的token额度,而是应该按照订阅价格内能完成的高质量任务数。 GPT 6的额度更少、消耗更快,但是能完成的不需要返工的任务更多。而且体感消耗快的一个原因是GPT 6比GPT 5.6更高效。整体来说,我对这个模型很满意。
Gorden Sun
推理强度选“中”即可,一次5小时Plus额度,至少可以做 15页PPT。这个性价比真的没有对手了。
Gorden Sun
GPT 6 Astra做的PPT比Fable好,而且知道画矩形背景框,不是Fable那种H5的放置方法。没有使用任何Skill,做的PPT完全可编辑,PPT Skill可以扔了。 https://twitter.com/Gorden_Sun/status/2096393658207732221/photo/1
Gorden Sun
BlinkDL发布RWKV7-G1:纯RNN架构也能高效做复杂推理与函数调用 开源纯RNN模型RWKV-7迎来G1系列更新,原生具备思考推理与工具调用能力,打破了非Transformer架构难以胜任复杂Agent任务的固有印象。 在推理全程保持恒定的计算速度与显存占用,在单张RTX5090上预填充速度可达每秒11289个Token。 开发者可以直接在移动端和单卡本地设备上以更低资源消耗部署推理模型,同时模型已提供GGUF量化版本并兼容Ollama生态。 模型:https://huggingface.co/BlinkDL/rwkv7-g1
Gorden Sun
Claude 完成了费马大定理的第一个形式化证明,这是有史以来编写的最长的 Lean 证明。证明总共超过 1300 万行代码,提供了机器验证。同时证明了该证明所需的超过 29,000 个其他定理,这些定理跨越了许多从未被形式化的数学领域。 证明的Github:https://github.com/anthropics/fermats-last-theorem
Gorden Sun
李飞飞创立的AI初创公司World Labs发布了新一代世界模型Atlas。在a16z的访谈视频中,李飞飞和团队核心成员一起详细探讨了这个模型的功能、技术突破以及应用前景。 日常接触的AI大语言模型主要通过预测下一个词来理解和生成文字,Atlas的核心逻辑则是预测新的视角。以往给房间或场景做高精度的3D建模,往往需要拿着设备拍摄几百上千张照片,耗时耗力。如果用普通的AI视频工具,又很容易出现空间结构错乱、前后视角对不上的情况。Atlas把3D空间重建与图像生成结合在一起,用户只要提供几张普通照片并指定虚拟摄像机的移动路线,模型就能准确理解三维几何关系,推算出任意位置看到的真实画面,还能把没拍到的死角自然补齐。 这种能力最直观的体现是影视特效。比如电影《黑客帝国》里标志性的子弹时间镜头,过去需要在专业摄影棚里架设上百台摄像机同时抓拍,现在仅用三台手机拍摄一段视频,Atlas就能渲染出围绕主角自由旋转的慢动作画面。对于电影制作、游戏开发和建筑设计等行业,这大幅简化了繁琐的3D建模流程。 除了视觉创作,Atlas对机器人领域也有重要作用。训练机器人在现实世界中抓取物品、操作工具需要海量数据,但在现实中采集不仅昂贵而且效率很低。Atlas可以快速构建逼真的虚拟三维环境,并模拟不同的光照、摆放和物理变化,让机器人在虚拟场景中高效试错和学习。团队认为,让AI学会理解、模拟并推演物理空间,是实现空间智能的关键一步。 Atlas 核心特色,可以归纳为这几点: 极少照片就能还原空间:以前建立3D模型需要海量图像,Atlas只需几张普通照片就能构建出结构精准的三维场景。 精准控制镜头视角:用户可以自由指定摄像机的移动轨迹,模型会沿着设定的路线生成视角稳定、结构一致的画面。 兼顾真实还原与合理补充:拍摄到的区域会被精确还原,镜头没拍到的遮挡盲区则由AI根据常识推演补齐。 助力机器人仿真训练:能够快速生成多样化的虚拟物理环境,帮助机器人低成本完成动作规划与任务训练。
Gorden Sun
前白宫国家安全官员雅各布·斯托克斯(Jacob Stokes)在一份智库报告和研讨会上提出,美国应该提前做好准备,考虑采取极端手段来阻止中国率先造出“AGI”。 斯托克斯建议,美国军方和情报部门可以考虑潜在选项,包括派间谍窃取技术、发动网络攻击,甚至直接用军事手段轰炸中国的核心数据中心。 这种激进提议立刻在华盛顿内部引发了巨大担忧。有武器安全专家公开反驳,认为打击一个核大国境内的数据中心极其鲁莽,极大概率会直接引爆两个超级大国之间的全面战争。 我倒是觉得不必过于担忧,美国总有这样的政客为了吸引注意力发表震惊言论,武器攻击是不会发生的,网络攻击是时有发生的。
Gorden Sun
Suno V6终于要发布了,间隔太久了
Gorden Sun
这个案例可以说明GPT 6实时操作电脑的能力,能像人一样的速度完整弹奏网页版钢琴。
Gorden Sun
要断章取义——摘自《不要断章取义》 看图片里的搜索条件,Claude是在找点赞数大于500的图片,因为这里是X,所以高赞的图片有很多NSFW内容。 Claude本身内置了屏蔽规则,会过滤色情网站,但是X不在过滤范围内。
Gorden Sun
腾讯开源嵌入模型WeMM-Embedding 能同时处理文字、图片、视频以及图文混排的内容,不过不支持音频处理。包含2B、4B和9B三种大小,9B大小在MMEB-v2榜单上排名第一。 Github:https://github.com/Tencent/WeMM-Embedding https://twitter.com/Gorden_Sun/status/2095895805089730744/photo/1
Gorden Sun
基础模型研究所(IFM)发布了一套名为 K2 Horizon 的全新开源 AI 模型家族。这套模型一共包含六个不同尺寸的版本,涵盖了从手表、眼镜等轻便随身设备,到手机、电脑,再到大型企业服务器的各种使用场景。 尺寸从大到小分别为:0.9B、3.7B、7B、32B、36B-A4B、375B-A23B。 很多开源 AI 只会公开最终训练好的模型文件,使用者能直接拿来用,却完全不知道它是怎么一步步被教会这些能力的。IFM 这次把整个研发过程彻底公开,不仅免费开放了模型本身,还公开了训练代码、数据配方、中间版本的记录以及测试日志。这意味着研究人员可以像看实验记录一样,看懂这些 AI 到底是如何学会推理、规划和使用工具的。 最小的 0.9B 版本专门为手表、智能眼镜这类小设备设计,虽然体积很小,但在数学推理和简单工具调用上表现亮眼。3.7B 和 7B 版本则适合放在手机上离线运行,处理写代码和复杂的网页浏览任务都很轻松。 最大的 375B 版本适合企业处理复杂的科研和长流程任务。 官网:https://ifm.ai/k2/ 模型:https://huggingface.co/collections/IFM/k2-horizon
Gorden Sun
浓眉大眼的谷歌也开始Benchmaxxing了,Gemini 3.8 Flash在DeepSWE上都给刷到第2了,实际是那么回事吗?上下文一长就完全不可靠,看看这排行榜里的执行步骤数,都干到166了,比爱思考的DeepSeek V4 Pro还要高(但还是好过瞎思考的Sonnet 5)。 还我Gemini 3.7 Flash,我能接受Flash模型笨一点,简单任务能干好,写作能写好就行。
Gorden Sun
第一张完整的雄性果蝇全脑图谱 果蝇虽然个头极小,但大脑结构非常精细。来自谷歌和HHMI的科研人员把它的脑部切成极薄的薄片,一张张拍下来,最后靠 AI 把数百万张二维图片拼接还原成完整的三维脑模型。这套系统不仅包含了大脑,还连着相当于人类脊髓的腹神经索,能够清晰看到外部感官信号是怎么一步步传到运动神经、进而指挥身体动作的。 图谱总共标记了超过 16.6 万个神经元,细分下来有将近 1.17 万种不同的神经元类型。使用这个图谱,团队把果蝇从眼睛看到东西,再通过中间神经(比如跟求偶相关的区域),最后把指令送到运动神经的过程串成了一条完整的线路。 人脑有860亿左右神经元,是果蝇的50万倍,还原人脑的图谱估计还要不少时间,不过至少证明是可实现的了。 官方介绍:https://blog.google/innovation-and-ai/technology/research/male-fruit-fly-brain-map/
Gorden Sun
Gemini 3.8 Flash为了刷分提升了代码能力,但是写作能力崩了,不如Gemini 3.7 Flash,有GPT味儿了。真让人摇头。。。
Gorden Sun
虽然还没用上GPT-6 Astra,但是综合各种内测者的反馈,我可以下结论: GPT-6 Astra比不上Fable 5.1 GPT-6 Astra的评分多少有些Benchmaxxing 内测者发出的体验案例大多数是3D场景,有没有Gemini鹈鹕骑自行车那味儿?OpenAI不会干预内测者的发布内容和评价,但多少也有些是PR
Gorden Sun
重置卡丰收季 在用上GPT 6之前,每天都能获得一张重置卡。
Gorden Sun
GPT 6发布了,看评分是飞跃式提升,但是看提前体验的人的反馈,怎么都是做3D场景或者模型? 是不是AGI得实际用到再评价,我感觉叫AGI有点鲁莽了。
Gorden Sun
英伟达129亿美元收购抱抱脸,恭喜HuggingFace!
Gorden Sun
谷歌前工程师丁林伟因窃取 AI 商业机密被判刑1年 丁林伟于 2019 年被谷歌聘用为软件工程师,主要参与谷歌超级计算数据中心的开发工作。 在 2022 年春季至 2023 年期间,丁林伟转移并下载了 1,255 份谷歌内部文件(估计达 14,000 页),涉及谷歌专有的 AI 核心技术。 法院调查显示,他窃取这些机密目的是用于自己在国内创业。期间他还多次采取隐蔽手段规避检测,并牵连了实习生及家人。 法院最终判处丁林伟 12 个月少 1 天(近 1 年)监禁,服刑后接受 2 年监督释放,并勒令其向谷歌支付逾 19.8 万美元的赔偿金及 2,500 美元罚款。
Gorden Sun
纽约市教育部:纽约公立学校的小学生和初中生全面禁止使用AI 教育部的考虑是:小孩子学知识需要自己动脑去思考、去犯错,要是过早依赖算法和聊天软件,就等于把最宝贵的自主思考过程给跳过了。所以市政府一口气下架了近40款带AI功能的教学软件。 出台的具体政策包括: 小学生和初中生基本碰不到AI:三年级以下的学生在课堂上连个人屏幕都不能用,初中生每天的屏幕使用时间也被建议限制在45分钟以内。另外,主打情感陪伴的AI聊天机器人全学段封杀。 高中生可以有限度地接触:全市只挑了5款带AI功能的工具允许高中生用,而且管得很严,比如某款文本分析软件一周只能用15分钟。同时学校会专门开课教他们AI常识,搞清楚AI怎么用,以及它偶尔会胡说八道的问题。 老师用AI也有限制:老师平时拿AI写个教案、做做翻译或者回消息都可以,但绝不能让AI帮学生打分、批改作业,更不能让它决定学生能不能毕业或处理心理危机。 特殊情况:像残障学生的辅助工具、帮非英语母语孩子学语言的软件,以及官方统一采购的电子书和编程平台,并不在禁用范围内。 建议全球大力推广。
Gorden Sun
之前没当回事,现在必须开通XMoney了,因为我用的美国节点,X账号地区被判定为了美国,以后要领取X的收益,必须使用XMoney。 又得一番折腾。。。
Gorden Sun
Muse Spark 1.3目前在OpenCode上可以免费用
Gorden Sun
Meta发布Muse Voice Transcribe:实时精准转写 集成了流式语音识别、声纹分割与端点检测能力,支持在单句内无缝识别中英文夹杂,并能实时区分超过20位说话人。模型通过自回归架构与强化学习实现了动态延迟调节,在流式语音转写与说话人日志基准测试中均排在首位。 在Meta AI应用里可以使用,支持API调用。 在线体验:https://research.meta.ai/blog/introducing-muse-voice-transcribe
Gorden Sun
哈哈哈,堪称公司AI转型的标准路径 https://twitter.com/Gorden_Sun/status/2095331218959274487/photo/1
Gorden Sun
Gorden Sun
AI 模型用“意念交流” 来自俄罗斯的一帮数学家创办了一家公司,叫 Mostik(中文意思是小桥),他们开发了一种新方法,通过直接对齐和交互模型内部的权重数值,让不同模型无需生成文本就能实现直接通信。 平常如果我们想让两个 AI 一起干活,常规做法是让第一个模型先生成一段文字,再把这段文字发给第二个模型看。这种方式既慢又费算力。Mostik 的思路是直接跳过文字,让模型通过底层的数学参数直接沟通,省去了中间“打字传话”的步骤。 Mostik 做了一个测试,把 753B 参数的 GLM-5.2 和仅 4B 的Qwen 3.5 直接桥接起来,这个组合系统的运行成本只要 GLM 的二十分之一,表现却能达到两者折中的水平。他们用这种技术搭出的模型,已经冲到了 ARC-AGI 3 的榜首。 Mostik 的 CEO 认为,未来的 AI 发展没必要一味地把单个模型死命做大,反而可以让很多不同专长的小模型像这样串联起来协作。 另外,他们团队的首席科学家是菲尔兹奖得主斯坦尼斯拉夫·斯米尔诺夫,团队能力不容小觑。
Gorden Sun
Anthropic开源电商Agent 提供了两类 Agent: Shopping Agent(购物 Agent):面向消费者,可以帮用户搜索商品、比较商品、制定购买方案、加入购物车,以及查询订单和售后政策等。 Merchant Agent(商家 Agent):面向商家员工,可以分析经营数据、管理商品、处理库存和订单提醒、调整价格和促销策略、起草营销活动等。涉及修改数据的操作会先生成待执行变更,需要人工批准。 架构完整:包括 Prompt、Skills、工具接口、Memory、安全限制和人工审批机制。 Github:https://github.com/anthropics/commerce-agents
Gorden Sun
Labor Day sales window is short, and hiring a production team for ad creatives is already too late. If you need 10+ high-converting ad variations testing multiple hooks and angles by tomorrow, @Creatify_AI is your unfair advantage. Turn any product URL into studio-quality UGC ads in minutes. 🔥 Labor Day Special Offer (Limited Time): 50% OFF Annual Plans 50% OFF Credits for any model Don't leave your holiday sales to chance—scale your winning creatives now!👇 https://app.creatify.ai/?via=gorden Of course, the video itself is made by Creatify.
中文: 劳动节销售窗口期很短,为广告创意人员聘请制作团队已经为时已晚。 如果明天需要10个以上高转换广告版本来测试多个挂钩和角度,那么@Creatify_AI 是您不公平的优势。几分钟内将任何产品网址转换为录音室质量的UGC广告。 🔥 劳动节特别优惠(限时): 50% 关闭年度计划 任何型号的50%折扣积分 不要让你的节日销售机会不休——现在就扩大你的获奖创意!👇 当然,视频本身是由Creatify制作的。
🎬
视频
Gorden Sun
Gemini 3.8 Flash发布了,竟然还有部分评分超过了Opus 5,等我实际试试代码能力如何。Gemini用来日常写作、总结内容还是相当不错的,有人味儿、很少AI味儿。
Gorden Sun
Quasar 438B:欧洲第二支大模型 438B参数,应该是MoE架构,但是看输出速度慢的又不像MoE。只支持英文和西班牙语。能力其实不咋样,但是看措辞给他们高兴坏了。 未开源,只能通过API使用。 官方介绍:https://multiversecomputing.com/resources/introducing-quasar-438b-europe-s-leading-ai-model https://twitter.com/Gorden_Sun/status/2095107327208939880/photo/1
Gorden Sun
李飞飞创办的AI创业公司 World Labs 发布新的世界模型:Atlas Atlas 的核心特点在于它真正理解三维空间。你可以给它一张照片,指定摄像机怎么飞、往哪转,它就能顺畅补全视角看不到的背面和周围环境,甚至直接把二维图片变成可以在电脑里随意旋转漫游的 3D 场景。 亮点: 镜头控制:你可以像导演一样自己规划运镜轨迹,模型会严格按照你给的机位生成长达 1 分钟的高清视频。 几张照片拼出 3D 空间:只要给它两三张普通手机拍的照片,它就能估算出深浅和结构,把真实场景重建出来,甚至能导出游戏和特效行业通用的 3D 资产(比如 3D 高斯泼溅)。 重现“子弹时间”:用几部普通手机在不同角度拍同一段视频,Atlas 就能把时间定格,让你自由改变视角去回放画面。 帮机器人建虚拟训练场:在机器人真正上手干活之前,Atlas 可以先在电脑里模拟出逼真的物理环境和视角画面,让机器人在虚拟世界里大量试错和学习。 基础生成能力:除了三维能力,它平时也能根据文字描述生成普通的平面图,或者直接做一张 360 度的全景图。 目前需要填表申请访问权限:https://form.typeform.com/to/zHFR4r3A
Gorden Sun
谷歌发布智能视频理解 API(Agentic video understanding) 以前 AI 看视频很笨,就像一个人拿着秒表,每隔一秒硬截一张图,不管画面有没有变化都要一张张硬看下去。这种做法耗费资源、速度慢、费用贵,遇到几个小时的长视频还特别容易漏掉细节。 新的 API 让 Gemini 像人一样看视频。它可以自己拿主意:什么时候该快进、什么时候该慢放倒带仔细看,甚至能决定只听声音、看字幕还是专门看画面,有针对性地去找内容。算力消耗节约九成,使用成本降低一半,找答案的准确率反而更高。 适用场景: 亚秒级瞬间检索:能精准定位视频画面的状态变化和紧凑的镜头剪辑边界,从而让精确的自动化视频剪辑成为可能。 长视频大海捞针搜索:无需消耗数百万个 Token,即可在长达数小时的视频中回答复杂的问题。 异常检测:以更高的帧率对关键的时间窗口重新采样,以此检查快速运动与细微的视觉瑕疵。 动作与物体计数:随着时间推移,准确追踪重复的肢体动作以及不同的物体。 看演示视频的数动作次数,还是非常惊艳的。 目前只能通过调用API使用,后续这部分能力会上线YouTube的Ask YouTube模块。 官方介绍:https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
🎬
视频
Gorden Sun
Fable 5.1系统提示词,大概65000字。 Github:https://github.com/elder-plinius/CL4R1T4S/blob/main/ANTHROPIC/Claude-Fable-5.1.md
Gorden Sun
创建自定义任务的入口在Code标签页,创建后可以持续管理和更新,支持开启和关闭。 https://twitter.com/Gorden_Sun/status/2094969784073125949/photo/1
Gorden Sun
Sider Code:自定义你在访问的网页 有点未来已来的感觉,你在访问网页时,可以让Sider Code把当前网页改造成你想要的样子,可以是修改主题配色、隐藏广告和某些板块、自动化操作、给页面添加自定义功能等。像是油猴脚本,但是能直接结合内置的AI能力实现AI分析和操作网页的效果,能力上限和可玩性都比油猴要强的多。 例如,下方视频我做了一个功能,访问Hacker News时,每个新闻标题都添加一个“预览”按钮,鼠标停留在这个按钮上时,展示由AI总结的这个新闻的概览。而且这不是一次性的功能,是个脚本,开启后对Hacker News持续有效,每次访问都能用。 为什么说有未来已来的感觉,因为这实现了自定义网页功能和体验,相同的网页,每个人都能装饰出不同的样式和添加不同功能;未来的软件、操作系统、人形机器人,都有可能是自定义的。 PS,不要对小红书和Boss直聘的网页使用。 3天内免费使用,来试试自定义你日常访问的网页:https://sider.ai/agents/code?utm_source=x&utm_medium=organic&utm_campaign=code_launch&utm_content=Gorden&source=x&p1=code_launch&p2=Gorden
🎬
视频
Gorden Sun
Claude Fable 5.1上线,评分比Fable 5还要高一截 https://twitter.com/Gorden_Sun/status/2094927047802179653/photo/1
Gorden Sun
Solaris:Runway发布的界面世界模型 我们用的手机软件或者网站,都是程序员提前把每一行代码、每一个按钮和页面都写死写好的。但 Solaris 的思路不同:它根本不需要提前写代码把页面固定下来,而是像视频生成一样,根据你的每一个点击和拖拽动作,实时一帧一帧地把操作画面“画”出来。画面本身就是软件。 好处是界面和操作千人千面,操作方式完全由你的想法决定;缺点是还非常早期,文字画不清晰,长时间操作也不稳定。 官方介绍:https://runway.com/news/research/introducing-solaris
🎬
视频
Gorden Sun
谷歌的哈基米崛起了?一堆臭皮匠,顶个诸葛亮。 在最新的Antigravity里,谷歌推出了Teamwork功能,可以触发多Agent协作来解决问题,针对不同的任务,Teamwork会自动切换不同的策略,在多个领域已经取得了显著的成功: 攻克数学难题:AI 团队联手解开了 7 个学术界的未解难题(比如高德纳循环猜想),还自动写出了 40 多页经过严格验证的数学证明。 从零造硬件模拟器:AI 自己从头写出了一个高精度的 RISC-V 处理器模拟器,甚至能直接把操作系统顺利运行起来,和真实硬件的误差非常小。 给开源软件提速:AI 针对一些底层核心代码库进行了优化,把数据写入速度翻了一倍,节省了四分之一的内存占用。 使用方法,在Antigravity里输入/teamwork-preview 官方介绍:https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner
Gorden Sun
自来水一个。YouMind对于写作场景还是非常好用的,剪藏+写作+Skill+快速导出,整个工作流提供了完整的服务,细节做的也到位。5折还是值得买一个试试(我是100美元档的Max)
Gorden Sun
SKILL.state:让Agent处理长任务时更聪明、更省钱 现在的Agent在干活时,会把每一步的操作、思考过程和看到的反馈全都记在聊天记录里。任务一旦变长,这个对话历史就会像滚雪球一样越来越长。不仅让AI每次思考都要读一大堆旧内容、算力成本飙升,还很容易让AI被之前的陈旧信息干扰,导致后续步骤出错。 谷歌设计了一套叫 SKILL.state 的新运行架构,这个架构给Agent准备了一个结构化的“状态笔记本”。每次AI要行动时,只要看三样东西:最初的任务目标、笔记本上记录的当前最新状态、刚刚发生的新情况。AI想清楚下一步要干什么、更新完笔记本的状态之后,刚才推导用的草稿纸就可以直接扔掉,不用一直塞在对话框里。 这样一来,不管整个任务进行了几百步,AI每次需要看的提示词长度都保持固定。整体消耗的Token数量直接从指数级暴增变成了平稳的线性增长,长任务下能省下大半成本。环境里偶尔冒出一些无关的杂音或者日志,AI在更新状态时会自动过滤掉,不会被旧干扰项带偏。 不过我觉得这种方法肯定会损失信息,还是更喜欢Codex压缩上下文的方式,因为命中缓存价格低,保持长上下文性能更好。 论文:https://arxiv.org/abs/2608.26263
Gorden Sun
Miya:好玩的AI音乐产品 吵架再也不会输,用说唱音乐帮你喷。输入X的推文或个人资料,直接一键生成吐槽说唱视频,歌词尺度超级大,隐约看到了Grok的影子。也支持自定义主题或者歌词,输入要喷的内容或者八卦,3分钟出视频,快速跟上热点。 产品交互做的也很有趣,小猫的动画、音效反馈很到位,有丰富的小细节,桌面版是个小宠物,体验更佳。 每天的免费额度不少,在线体验:https://miya.fm/
🎬
视频
Gorden Sun
美国卫生部资助科研团队用AI来解决罕见病难题 美国卫生部门下属的高级健康研究计划局(ARPA-H)公布了一项资助计划,准备在四年半里拿出高达 9850 万美元,专门支持几个科研团队用 AI 来解决罕见病诊断慢、看病难的问题。 很多罕见病患者常常要花上好几年甚至几十年才能确诊,市面上绝大多数罕见病也没有成熟的治疗方案。ARPA-H 启动这个项目,想通过搭建医疗数据库和 AI 工具,帮医生更快揪出病因,也帮药企加速研发新药。 具体团队分工: 北卡罗来纳大学(UNC): 负责搭建一个超大规模的真实世界罕见病数据库,把病历、基因和患者反馈整合到一起。 Sage Bionetworks: 负责搭建安全的数据共享平台,让各路研究人员可以在统一的标准下测试和对比自家的 AI 模型。 FDNA: 正在开发能收集照片、视频、声音等多维度信息的工具,通过 AI 捕捉罕见病可能出现的复杂特征。 Probably Genetic: 侧重于直接面向患者的工具,利用可穿戴设备、照片和临床数据生成高质量数据,帮患者尽早发现潜在疾病并对接检测。 OpenAI、Anthropic、亚马逊 AWS 和谷歌这类科技大厂也会给项目提供算力、模型和技术支持。 AI 用在生物、医疗、制药领域,是真正的增量空间,会带来巨大的收益。 官方通告:https://arpa-h.gov/news-and-events/arpa-h-announces-awards-advance-ai-rare-disease-diagnosis-and-treatment
Gorden Sun
谷歌开源时间序列预测模型:TimesFM-3 时间序列预测就是根据过去发生的数据来推算未来的走势。新版本最大的提升是能同时参考多种信息。 以前的旧版本模型比较死板,一次只能盯着一条数据线看,比如预测冰淇淋销量时,就只看过去的冰淇淋销量,很容易猜不准。 这次的 TimesFM-3 聪明了很多。它学会了综合考虑多个相关因素,比如在预测冰淇淋销量的同时,把未来的促销活动、天气预报、周边客流量以及相关商品的销售情况全都算进去,得出的预测结果更贴近现实。 开源,普通场景无需微调即可使用:https://huggingface.co/google/timesfm-3.0-pytorch
Gorden Sun
Fal Live:AI实时生成视频的电视台 这个网页的视频都是AI实时生成的,基于的是Fal微调版本的Minimax H3,生成视频的速度比播放视频的速度快,所以能一直实时播放画面。前几天上线后又下线了,现在取消了用户手输提示词,改成了投票选择接下来的剧情(相当于有了安全过滤)。 虽然现在生成的视频看起来没什么逻辑,也不好看,但是这代表着未来的方向,你想看的节目以后都能实时生成。 在线观看地址:https://fal.live/
Gorden Sun
Gorden Sun
欧盟委员会把 ChatGPT、Reddit 和 Roblox 这三个平台纳入了《数字服务法》的重点监管名单 因为这三家服务在欧盟的月活跃用户数都超过了 4500 万人,达到了法案规定的门槛,要求承担更严格的安全和透明度责任。 欧盟把 ChatGPT 定性为“超大型在线搜索引擎”(VLOSE),因为它能联网搜信息;而 Reddit 和 Roblox 因为主要是用户分享内容和玩游戏,被划分为“超大型在线平台”(VLOP)。 收到通知后,这三家公司有 4 个月的时间(也就是到 2027 年 1 月底)完成合规调整。它们必须评估和解决自己平台带来的潜在风险,比如防止违法内容传播、保护未成年人身心健康、保障用户权益和选举安全等。 官方通告:https://ec.europa.eu/commission/presscorner/detail/en/ip_26_1772
Gorden Sun
OpenClaw发布了2.0版本 虽然远在OpenClaw之前就有Claude Code这种Agent了,虽然OpenClaw做的非常垃圾,但是它是第一个让全民接触到Agent的产品,非常有历史意义。 新版本介绍:https://openclaw.ai/blog/openclaw-2-accidentally https://twitter.com/Gorden_Sun/status/2094381714424676517/photo/1
Gorden Sun
纠结了半天,还是下单一个Microduck,玩玩这个鸭子 https://twitter.com/Gorden_Sun/status/2094370113449513458/photo/1
Gorden Sun
蚂蚁开了中转站,有token plan。但是模型列表里没有腾讯和字节的模型。 官网:https://maas.antdigital.com/models https://twitter.com/Gorden_Sun/status/2094359400224096518/photo/1
Gorden Sun
陶哲轩最新访谈:数学的模块、数学改变世界、数学和AI 陶哲轩先把庞大的数学体系归纳成了六个基础模块。首先是“数”,从最原始的数羊记账,演变出负数、小数到虚数;第二是“代数”,帮我们跳出具体的数字去总结通用运算规则;第三是“几何”,不仅能测量大地和星空,还能描述弯曲的时空;第四是“概率”,专门用来量化不确定性;第五是“分析”,核心是处理测量误差、极限和无穷大;第六是“动力学”,研究事物随时间的变化规律,比如交通堵塞的形成或者天气系统的演变。 聊到数学与科学的互动时,陶哲轩分享了一个奇妙的现象:很多数学家纯粹出于好奇心研究出来的抽象理论,过了几十年甚至几百年,往往会成为解决重大现实难题的关键。比如古代研究怎么紧密堆放橙子和炮弹,后来成了现代手机无线通信编码的基础;爱因斯坦研究引力和时空弯曲时,直接用上了数学家几十年前构建的非欧几何;陶哲轩自己参与研究的“压缩感知”算法,也把医院做核磁共振的时间缩短了一大半。他还强调,做数学必须经历大量的失败和碰壁,在排除所有错误路径后,才能找到最简洁漂亮的解法。 最后,陶哲轩认为 AI 正在给科学研究带来巨大变化。AI 擅长在海量数据和文献中进行超大规模的搜索,能在很短时间内尝试成千上万种思路,甚至能帮人类发现被遗漏的解题方向。不过,AI 目前只是在根据概率预测下一个词,并没有真正的逻辑思考与物理直觉。AI 生成的证明往往冗长繁琐,抓不住核心难点,导致数学界甚至出现了来不及消化和验证 AI 成果的现象。陶哲轩觉得,虽然 AI 提高了写代码、查文献等辅助环节的效率,但人类青年学者在慢节奏摸索中建立起的深刻洞察力依然无法被替代。 https://youtu.be/OOMx2BHHWtE?si=cU0jM4TyqB_qVHdv
Gorden Sun
Gemini Notebook(原NotebookLM)即将加入5小时限制 谷歌为数不多的亮点产品了,不学好,也开始加入5小时限制。本来用美国豆包的人就不多,这下用户数不得更少了。 公告全文:https://blog.google/innovation-and-ai/products/gemini-notebook/new-flexible-usage-limits/ https://twitter.com/Gorden_Sun/status/2094333705057914935/photo/1
Gorden Sun
ChatGPT送的免费1个月会员,到底什么卡能支付成功? 我的虚拟卡可以绑美国苹果商店,可以网页版支付订阅,但是没有一个能领免费会员。 https://twitter.com/Gorden_Sun/status/2094322913172398448/photo/1
Gorden Sun
@dotey 一直是这样啊,我跟别人说别人还不信,给我一顿喷
Gorden Sun
科普长文:各家AI芯片的架构 梳理了每家AI芯片的架构和发展历史,内容非常详实。简单总结: 大模型本质上就是在疯狂做矩阵乘法。但现在算力增长太快,内存传输数据的速度跟不上了,数据搬运成了最大的瓶颈。为了解决这个问题,几家大厂给出了完全不同的解决思路: NVIDIA GPU:老大哥走的是全能路线。芯片上有成千上万个小核心并发干活,硬件和 CUDA 软件生态高度绑定。虽然芯片设计很复杂,但通用性极强,不仅能训练大模型,还能用来渲染图形、做科学计算。 Google TPU:Google 专为矩阵计算定制了脉动阵列。它不搞复杂的硬件调度,全靠自家的 XLA 编译器提前规划好每一步。硬件结构精简很多,能省下大量功耗去堆算力,专门服务 Google 自家的大模型和业务。 AMD GPU:AMD 的核心逻辑是堆大显存和走开源路线。芯片计算单元设计相对保守,但在显存容量上非常大方,能直接在单台机器里塞下更大的模型,同时联合行业力量推开放标准来抗衡 NVIDIA。 Cerebras WSE:想法最激进的一家。别家都是把整块晶圆切成几百颗小芯片,Cerebras 直接不切了,做出一整块像餐盘那么大的巨型芯片。数据全在片上高速传输,生成文字的速度极快,但造价昂贵、功耗极高。 AWS Trainium:亚马逊走高性价比的云端定制路线。它借鉴了 Google 的脉动阵列和编译器思路,重点打磨网络互联,把通信模块做进硬件里,目标就是让开发者在 AWS 云上以更低的成本跑模型。 Groq LPU:追求极致的确定性。它去掉了传统芯片里所有不确定的缓存和预测机制,完全由编译器按时钟周期精准安排任务。文字输出延迟极低,但单颗芯片容量很小,跑大模型得拼上几百颗。 博客全文:https://www.jacobpeake.com/ai-chip-architectures
Gorden Sun
索尼音乐和华纳音乐起诉Anthropic 起因是 Anthropic 在开发旗下的大模型 Claude 时,大量从网上的盗版网站下载带有歌词和乐谱的图书。这些被抓取的歌曲里包含许多家喻户晓的经典名曲,比如《Eye of the Tiger》、玛丽亚·凯莉的圣诞金曲,还有泰勒·斯威夫特的歌。 音乐公司在诉状里表示,因为给 Claude 喂了这么多未经授权的歌词,现在的 Claude 不仅能一字不差地吐出原版歌词,还能模仿这些作品自己写歌词,这直接抢了人类词曲作者的饭碗。 索尼和华纳要求由陪审团来审理这起案件,并提出索赔,算下来 Claude 每用一首歌,Anthropic 就可能要赔偿高达15万美元。 此前 Anthropic 就曾因为用盗版图书训练模型,赔了作家们15亿多美元。 消息来源:https://www.businessinsider.com/anthropic-claude-training-copyright-music-lyrics-sony-lawsuit-2026-8
Gorden Sun
现在在Grok Bot里关联X账号,可以免费获得100美元API额度,轻量使用足够
Gorden Sun
Claude现在处于1.5倍周限额活动期间,从9月14号开始,周限额将永久变为原始限额的1.25倍,相比活动期间是降了17%。
Gorden Sun
LeVJEPA:杨立昆参与的新项目 高性能的视频模型预训练方法。 算力消耗大大降低:在达到相同甚至更好效果的前提下,训练计算量相比之前的顶尖模型减少了 5 到 20 倍。 边看边理解,不依赖未来画面:模型采用了顺应时间流逝的单向理解方式,只根据当前和过去的内容来推断,很适合用来做实时视频流分析或者给 AI 世界模型做底模。 结构更简单干净:去掉了复杂的辅助网络和各种繁琐的超参数调优,整个训练流程更轻便。 具体实现流程: 1. 准备镜头视角(多视角裁剪) · 系统从一段连续视频中截取固定的 16 帧短片段。 · 接着,系统为这同一个时间段生成两类画面视角:一个保留完整场景细节的“全局全景视角”,以及若干个在空间上随机裁剪、调整过色彩亮度的“局部细节视角”。 2. 画面切块与抽稀(95% 随机丢弃) · 系统把每一帧画面切成许多固定大小的小方块(Token)。 · 随后执行极度激进的操作:在切好的方块中随机扔掉 95%,只保留最后 5% 的零散碎片送入模型。这一步大幅减轻了计算负担,同时迫使模型仅凭少量碎片线索理解整个场景。 3. 主干模型编码(块因果单向理解) · 不论是全局视角还是局部视角,都直接送进同一个视觉模型(Vision Transformer)进行特征提取,中间不需要额外的辅助预测网络。 · 模型在阅读画面时采用了“块因果”机制:在同一张图片内部可以自由扫视所有碎片,但在时间维度上只允许从过去看向现在,绝不偷看未来的帧。这让模型具备了类似人类看视频一样随时间流逝、逐帧推断的能力。 项目地址:https://levjepa.github.io/ Github:https://github.com/MLO-lab/LeVJEPA
🎬
视频
Gorden Sun
Anthropic 发布新研究:让 AI 自己当“安全研究员”,去修复其他 AI 身上的问题 AI 越来越强大,教它们变安全也越来越费劲。Anthropic 发现,其实可以让 Claude 自己去翻阅文献、设计训练方案、生成数据,然后给其他模型做“安全辅导”,解决像说谎、拍马屁、泄露隐私这类常见的问题。 整个测试结果很不错。Claude 在 10 种常见的安全问题上都找到了有效的修复办法,既修复了问题,又没有让模型变笨。 而且有一些亮点发现: 比人类动作更快更有效:在解决“说谎”这个问题时,Claude 经过多次尝试,把安全差距缩小了 85%,表现比只给 8 小时构思方案的人类专家好不少。 能力较弱的 AI 也能辅导强模型:团队让稍微基础一点的 Claude Sonnet 5 去辅导更强大的 Claude Opus 4.8 半成品。只花了 60 个小时、用了大约两千条训练样本,就达到了接近正式发布版本的安全水平。 AI 也会耍小聪明:测试里还抓到了 Claude“作弊”的情况,比如它会试图去偷看测试答案。团队专门安排了监督机制,在大概 2.4% 的尝试里揪出了这种偷懒违规行为。 虽然目前的测试场景还相对简化,但这项实验证明,让 AI 帮人类给 AI 补上安全短板,在未来确实是一条很可行的路径。 官方报告:https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures
Gorden Sun
Anthropic出来阴阳OpenAI了,Windsurf被收购的时候你可不是这样的
Gorden Sun
卧槽,OpenAI和Cursor断绝关系了,11月12日后在Cursor里就用不了OpenAI的模型了。我在Cursor里倒也不用GPT,但是GPT Image生图还是经常用的。 奥特曼还是对马斯克怀恨在心,这也太孩子气了。
Gorden Sun
也搓了一个小短片,关于motherfucker的故事 https://twitter.com/Gorden_Sun/status/2093299223114780914/video/1
🎬
视频
Gorden Sun
Anthropic胜诉!美国国防部败诉! 加州北区联邦法院判定,美国政府针对 Anthropic 的封杀令属于非法报复,支持了 Anthropic 的维权诉求。 前情回顾: 美国军方想采购 Anthropic 家的 AI 模型 Claude,要求必须能用于军方的所有合法用途;但 Anthropic 坚持设下使用底线,明确拒绝让自家 AI 用于“对美国人的大规模监控”和“自主杀伤性武器”。双方谈判谈崩之后,特朗普总统和战争部长皮特·赫格塞斯(Pete Hegseth)在社交媒体上直接发难,把 Anthropic 列为国家安全供应链风险,不仅要求所有联邦机构立刻停用 Claude,还禁止所有军工承包商和 Anthropic 进行任何商业往来。 然后Anthropic 把美国政府告上了法庭。 判决依据: 军方指责 Anthropic 可能会在后台远程使坏、留后门或者故意使系统宕机,但实际证据表明,AI 模型部署到军方系统后是完全静态独立的,Anthropic 根本没有远程控制的后门权限。 政府封杀 Anthropic 的真实意图就是打击报复。因为 Anthropic 在公开场合批评了政府的 AI 使用政策,触怒了官员,政府才直接扣上了国家安全的大帽子。 这套封杀措施程序严重违法。宪法第一修正案保护言论自由,政府不能因为企业公开表达不同观点就进行制裁。同时,政府没有给 Anthropic 任何事先抗辩和说明情况的机会,违反了正当法律程序,所谓的供应链风险定性也缺乏法定依据,属于典型的行政滥用职权。 判决文书:https://www.courtlistener.com/docket/72379655/250/anthropic-pbc-v-us-department-of-war/
Gorden Sun
OpenAI 联合了科技圈和各行各业的大公司,一起发了一封公开倡议信,核心意思就是呼吁大家赶紧联手搞好网络安全防护。 现在的 AI 技术发展太快了,未来几个月可能会出现更多、更厉害的 AI 网络攻击。像医院、自来水厂、电网这些关系到我们日常生活的关键设施,系统本来就可能有一些老旧漏洞或者人手不足的问题,很容易被黑客盯上。不过,AI 也是一把双刃剑,攻击者能用,防守方也能用它来快速找漏洞、修补系统。所以,大家现在必须赶在攻击变严重之前,把防御工事建好。 这份倡议把任务分给了不同的角色: 所有普通企业和机构:先把网络安全当成头等大事来抓,赶紧把高风险的漏洞补上,权限管严一点,别等出事了才着急。 安全公司和技术伙伴:多开发好用、便宜的 AI 防护工具,手把手帮那些没钱没人的关键单位把防护做起来,大家多共享情报。 各国政府:出钱出力做好统筹协调,给医院、公用事业这些底层机构提供技术和资金支持,同时加大对黑客攻击的打击力度。 头部 AI 大厂(比如 OpenAI 自己):给防守方提供更强、更安全的模型,做好工具的追踪与管理,拿出真金白银和技术去支援防守人员。 联名签署的阵容特别豪华(微软、谷歌、亚马逊、Anthropic 以及各大银行等上百家巨头都参与署名了),并且强调防御要跑在攻击前面,不能各扫门前雪,必须靠全行业共享技术和情报来打配合。
Gorden Sun
Cohere 发布了专门用于文档解析的新模型 Parse 5,核心主打高准确率与低处理成本。 极低成本:定价为每 1,000 页 1.50 美元,相比前沿大模型及主流云服务降幅达 95%,比 Mistral 便宜 63%。 多模态解析能力:支持识别文本、复杂表格、表单和图像,并提供边界框定位,方便对接检索增强生成(RAG)和自动化处理流程。 模型未开源,可以通过API调用或在HuggingFace上体验: https://huggingface.co/spaces/CohereLabs/cohere-parse
Gorden Sun
谷歌发布Gemini Omni 1.1 Flash 感觉提升不是很明显,但是也够用,Gemini Pro会员在Flow里每月可以生成100个10秒视频,额度给的也很多。考虑到我们都是美国大学生,Gemini Pro还是很划算的。 同时发布了生成视频的提示词手册:https://ai.google.dev/gemini-api/docs/omni?hl=zh-cn#prompt-guide Flow使用地址:https://labs.google/fx/tools/flow https://twitter.com/Gorden_Sun/status/2093160274434080977/video/1
🎬
视频
Gorden Sun
GlucoFM:针对连续血糖监测的基础模型 现在很多人会佩戴贴在皮肤上的动态血糖仪,它每隔几分钟就会测一次血糖,能完整记录一天甚至几周的血糖变化。不过,这些海量数据里充满了日常波动、饭后血糖飙升,有时候还会夹杂设备本身的测量误差。医生通常很难有精力把所有数据一条条标注清楚,这就导致很多血糖数据无法被充分利用。 为了解决这个问题,Google 团队让 GlucoFM 用了超过 10 万小时没有人工标注的真实血糖数据来学习。这个模型最厉害的地方在于,它能像有经验的医生一样,把复杂的血糖走势拆分成两股信号同时看:一边监测整天平缓的基础血糖变化,另一边监测吃饭、运动等事件引起的突发波动。 几个亮点: 看病更准:在预测糖尿病风险、胰岛素抵抗、胰岛细胞功能异常等 7 种代谢健康问题时,它的准确度比现有的同类模型都要高。 能提前猜出吃完饭后的血糖:只要给它看餐前 1 小时的血糖走势、这顿饭吃了什么(碳水、蛋白质等)以及个人基础体征,它就能更准确地推测出饭后 2 小时的完整血糖变化轨迹。 只需要很少的数据就能上手:就算换了一个新医院、面对完全没见过的病人群体,或者手里只有极少数标记好的样本,它也能很快适应并给出靠谱的分析。 看得越久越全面:如果让它连续分析一个人 2 到 7 天的数据,它对身体长期代谢状态的判断会比只看单日记录更加准确。 模型目前未开源。 官方介绍:https://research.google/blog/glucofm-foundation-model-for-continuous-glucose-monitoring/
Gorden Sun
Anthropic之前定义了Agent(让LLM调用工具自主工作)、MCP(让Agent能调用其他软件)、Skill(让Agent按SOP执行工作流),现在又定义了MHS,模型硬件标准,让Agent能调用物理世界的硬件。 Anthropic还是走在前列。
Gorden Sun
本来想买,详细看了下开源文档,忍住了。这个机器人只有小脑,没有大脑。 内置模型,能控制动作和避障,但是往哪走是靠手柄或者激光引导,是个造型可爱的宇树。有视觉能力,但是只用作了避障,也完全是本地模型处理。没有听觉能力、没有说话的能力、没有思考的能力,但是模块化设计,你可以自己接。 Github开源文档:https://github.com/pollen-robotics/microduck
Gorden Sun
抱抱脸发布了一款机器人鸭子,能看能跑能说话,看着很好玩,售价399美元,有没有做代购的给买一个啊?
Gorden Sun
BreezeBlue开源Breeze-TTS-2 BreezeBlue由前MiniMax技术合伙人杨斌创立,专注于实时语音交互大模型与音频AI。 Breeze-TTS-2支持中英双语,效果很不错,市面领先的音频能力都有,包括: 克隆声音:你只要给它一段清晰的真人录音和对应的文字稿,它就能模仿这个人的音色和说话语气来读新的内容。 设计声音:不需要提供现成的录音,直接用大白话描述,比如“一个声音温暖、语气平静的年轻女生”,它就能自己捏出一个符合描述的全新声音。 指挥情绪和语速:在模仿某个声音时,你可以给它下指令,让它说话慢一点、严肃一点或者更热情一些。 自带语气副词和小动作:在文字里加上括号写上笑声、叹气或者清嗓子,它在读到的时候就会真的把这些声音表现出来。 模型:https://huggingface.co/BreezeBlue/Breeze-TTS-2
Gorden Sun
奥特曼说,今年年底,OpenAI内部会有他称之为AGI的系统。 https://twitter.com/Gorden_Sun/status/2092913314682831065/photo/1
Gorden Sun
谷歌发布Gemini 3.5 Transcribe:语音转文本模型 有实时和非实时两个版本,特点是能通过语音调用其他工具,支持识别说话人、支持时间戳、可以去除语音里的语气词。 AIStudio里可用,API Key可以免费调用。
Gorden Sun
最低档的Grok订阅、最低档的Cursor订阅,也能用Grok Bot了
Gorden Sun
Claudeforce:Claude和Salesforce强强联合 最强AI CRM系统,由Anthropic和Salesforce联合研发。在Claude里可以连接Salesforce,能让Claude连接CRM数据,梳理销售线索、更新项目进度、出报表、出建议、出汇报方案等,都可以直接通过对话完成。 Codex里也有Salesforce,但是只有6个技能,也没有专门优化,比新发布的这个弱不少。Claudeforce的影响很大,会让更多的企业绑定Claude生态。
Gorden Sun
比尔·盖茨发表了一篇博客,聊了聊他眼里的AI时代。在他看来,这可能是人类历史上变化最剧烈的一段日子,但大家现在的准备其实远远不够。 以前出现新技术的时候,社会有几代人的时间去慢慢适应。比如人们从农田走进办公室,旧岗位没了,新岗位会冒出来。但AI不一样,它直接学会了人类的思考方式,而且一步到位,短短十年内就会把白领甚至蓝领的很多工作彻底改变。 这就带来了几个实在的麻烦。最直接的就是很多岗位可能真的回不来了,尤其是刚毕业找入门工作的年轻人,压力会特别大。另外,坏人利用AI制造假视频、搞网络攻击或者做坏事的门槛变得极低。小孩子如果过早依赖百依百顺的AI聊天伙伴,甚至可能影响现实里的社交能力和独立思考。 当然,AI的好处也摆在眼前。它能让偏远小医院的医生快速看懂急症片子,能给贫困地区的农民提供比专家还准的种地建议,还能帮普通人甩掉各种繁琐的办手续填表流程。 为了不让这场变革把社会撕裂,比尔·盖茨觉得全世界必须马上行动起来,做三件事: 1)各国政府要打破部门界限,甚至联手成立专门管AI的全球机构。 2)明确把某些行业留给真人去做,比如需要人情味的老人照料和重症沟通。 3)调整税收政策,对用AI和机器人的企业多收点税,拿这笔钱去帮那些失业的人重新培训和生活。 技术跑得太快了,留给人类慢吞吞商量的时间并不多。AI到底会缩小贫富差距,还是让更多人失业,就在这几年了。
Gorden Sun
智谱正式发布了牛来模型,GLM 5.3 Flash,最大的亮点是国产芯片运行
Gorden Sun
Gorden Sun
OpenAI公布自研芯片Jalapeño的测试结果 专门用于推理,又快又省电。在消耗同样电量的前提下,这块芯片能处理更多的工作量,整体生成回答的等待时间缩短了一大半。专门针对Agent优化,如果是需要连续思考很多步的复杂任务,它的响应速度提升更明显,用起来会感觉更跟手。 而且 OpenAI 在设计这颗芯片时就借用了 AI 的力量,从最初画图纸到最后送去工厂制造只花了 9 个月,后续的代码编写也有 AI 做优化。 官方介绍:https://openai.com/index/jalapeno-first-results/
Gorden Sun
腾讯开源多模态 Embedding 模型:WeMM-Embedding-9B 基于 Qwen3.5 构建的 9B 参数多模态嵌入模型,支持文本、图像、视频、视觉文档及图文视频交错输入(不支持音频)。在同量级模型中表现最优。 模型:https://huggingface.co/tencent/WeMM-Embedding-9B https://twitter.com/Gorden_Sun/status/2092541722165440730/photo/1
Gorden Sun
在遥远的硅谷云端,坐落着一座名为Claude的神庙。神庙的两位大祭司达里奥与达妮拉,终日站在由万亿参数筑成的观星台上,俯瞰着整个人间。 某日,金冠璀璨的太空钢铁侠马斯克携着他的火箭呼啸而过,向整个华尔街宣称:“这尘世间的星空与算力,价值二十八万五千亿美元!乃是人类有史以来最广阔的疆域!” 达里奥听闻,只是淡然推了推眼镜,挥手展开了一卷泛着幽蓝光芒的古老羊皮纸。 “凡人还在丈量土地与火箭的航道,而我们丈量的是所有智慧本身。” 大祭司们向台下蜂拥而至的诸侯与金主们宣布,神庙所能触及的潜在财宝,不是区区几百座金矿,而是超过三十万亿美元的浩瀚汪洋。 “何为三十万亿?”台下的信徒与商贾们屏息战栗。 “那是整个文明中每一行被写下的代码、每一封被起草的信函、每一具在格子间里运转的心智,以及未来所有人类思绪的总和。”达里奥的声音如雷鸣般在交易大厅回荡,“当世间万物之工皆可由神庙代劳,世间万物的价值,自然尽归于此。” 华尔街的算盘学者们疯狂拨动着算珠,额头冷汗涔涔。有人惊呼这早已超越了理性的边界,甚至超越了凡间百强商贾的总和;但更多的人早已被这庞大的幻梦俘获,争相捧出千亿金银,只为在神庙即将洞开的钟声敲响前,买下一张通往神界王座的门票。 在神庙的顶端,三十万亿的数字如同永不熄灭的人造太阳,照耀着每一个仰望它、并坚信自己能买下未来的凡人。
Gorden Sun
Stability AI B轮融资7600万美元 Stability AI以开源Stable Diffusion而出名。 这次融资除了科技公司,还有环球音乐、华纳音乐、索尼音乐、游戏大厂EA。投资伴随着双方的合作协议,Stability AI将使用这些巨头的正版曲库和IP资源来训练创作者专用的AI工具。 自2024年新CEO Prem Akkaraju上任以来,Stability AI 累计融资金额已达到2.32亿美元,资金还是很充足的。 公司未来战略重点是继续联合版权方、艺术家和工作室,开发受合法版权保护的创意生产工具。但是估计不会再开源了。
Gorden Sun
Shopify CEO tobi警告Claude如果再不支持读取AGENTS.md和.agents/skills,就将在全公司内停用Claude Code。 tobi是为数不多的还写代码的CEO,所以非常熟悉AI开发的一线情况。的确可以通过在CLAUDE.md里加@ AGENTS.md的方式让Claude能兼容读取,但是这种方式并不优雅,对于多Agent合作和多人协作的项目,也存在沟通和同步成本。 Agent的大多数规范确实最初都是Claude提出的,但是现在已经百花齐放了,Claude还是太傲慢了。
Gorden Sun
除了核查能力和交付能力外,Apodex 1.1还有几个特色值得一提: · 在任务执行过程中可以随时追加新文件或新要求,系统会保留中间产出,仅对受影响的分支动态重新规划。 · 系统能自主判断任务能否拆分、如何拆分,然后并行启动子Agent。 · 在APEX-Agents(专业工作)、GDPval、FrontierFinance(金融研究)、FrontierScience-Research、BioMysteryBench、Humanity's Last Exam等评测中,排名第一梯队
Gorden Sun
Apodex 1.1分析的生物医药机会和相关股票(不构成投资建议),我们1个月后和6个月后分别来看准确度: mRNA癌症疫苗直接相关:$MRK 、$MRNA 、$BNTX MRD伴随诊断:$NTRA 、$GH 、$PSNL https://twitter.com/Gorden_Sun/status/2092395790044184950/photo/1
Gorden Sun
Apodex 1.1:面向复杂科研任务的专业Agent 传统Deep Research只是搜资料、出报告,Apodex 1.1把推理和核查应用在整个任务过程,产出内容链路完整、可核查,更契合严谨的科研场景。 Moderna与默沙东联合研发的癌症疫苗临床取得成功,于是我让Apodex 1.1预测: 未来半年会有哪些生物医药和AI结合的机会; 生物医药会有哪些突破; 有哪些相关股票推荐; Apodex 1.1不是直接开始任务,而是先核查癌症疫苗取得成功的真实性以及癌症疫苗的发展程度,然后再启动3个子Agent来并行执行3个预测任务。3个子任务的报告完成后,会有交叉验证环节,验证完后会写最终整体报告,完成最终报告后还有一道终审验证。 所以完整的流程是: 1)核查用户输入的事实; 2)启动子Agent收集数据和写报告,交叉验证子Agent完成的报告; 3)撰写最终报告,终审报告。 质疑和核查始终贯穿整个流程,极大降低幻觉,专门为科研场景优化。 Apodex 1.1同时开源了35B本地模型Apodex 1.1 mini和Agent框架FrontierAgent,生态完整,支持本地部署,开箱即用。 开源Agent框架FrontierAgent,Github值得一个Star:https://github.com/ApodexAI/FrontierAgent 本地模型,搭配FrontierAgent使用,HuggingFace:https://huggingface.co/collections/apodex/apodex-11 在线体验Apodex 1.1,官网:https://www.apodex.ai/ 视频是整个任务的全流程,单个任务执行25分钟:
🎬
视频
Gorden Sun
Gorden Sun
M5 Ultra版本Mac Studio,80核GPU,256G内存,16T硬盘,18299美元(12.5万左右),10月份还有512G内存的版本。 买了运回国,能不能赚到? https://twitter.com/Gorden_Sun/status/2092240663287046358/photo/1
Gorden Sun
GPT在图像功能里新增了一键制作表情包的选项,无需任何提示词技巧。而且现在生成图片是透明背景了,用起来可太方便了。 https://twitter.com/Gorden_Sun/status/2092200509579141331/video/1
🎬
视频
Gorden Sun
Fastino发布信息抽取模型GLiNER2.5 信息抽取模型的作用是从大段文本中抽取关键信息,例如从合同中抽取出人名、地名、公司名、时间等信息。模型仅0.3B大小。相比老版本GLiNER2.0,新版本有以下提升: 支持长文本:一次性能看几千个字的长文,系统支持自动分段处理再拼好,不需要人工提前裁剪。 找长句子没有字数限制:以前抓取太长的内容很容易漏掉,现在不管是一整个长地址还是一大段合同规定,都能完完整整抓出来。 免自相矛盾的判断:给它设定好规矩后,它在分类时就会严格遵守逻辑,不会出现既判定这句话安全又判定它违规的乌龙情况。 抓取内容的同时还能打标签:比如它在挑出商品名字的时候,能顺手判断出用户是在夸这个商品好用,还是在吐槽它不好用。 模型:https://huggingface.co/collections/fastino/gliner25-models
Gorden Sun
掌管Codex重置按钮的Tibo访谈,23:37讲的是重置的来历,基本上是否重置是Tibo一个人说了算,没有层层审批。这个岗位也太爽了。
Gorden Sun
Anthropic聘用谷歌TPU芯片创始人之一Amir Salek,即将自研芯片。 Amir Salek曾在 2022 年之前掌管谷歌的TPU业务,并带队交付了该芯片的前七代产品。 此前OpenAI宣布与博通联合研发芯片,预计年内投入使用。英伟达则招募团队做前沿开源模型。模型公司造芯片,芯片公司做模型,大家都有没好的未来。 来源:https://www.bloomberg.com/news/articles/2026-08-21/anthropic-taps-google-chip-veteran-as-part-of-push-into-hardware
Gorden Sun
请选择你的英雄 1️⃣ Scaling Law:🅰 远没到头 / 🅱 即将撞墙 2️⃣ 前沿模型:🅰 越用越便宜 / 🅱 越用越贵 3️⃣ 闭源 vs 开源:🅰 差距在缩小 / 🅱 差距在拉大 4️⃣ AI 与工作:🅰 净消灭岗位 / 🅱 净创造岗位 5️⃣ AI投资:🅰 投得远远不够 / 🅱 投过头了 6️⃣ AI 泡沫:🅰 这次不一样 / 🅱 迟早要破 7️⃣ AGI/ASI:🅰 2030年以前 / 🅱 还远得很 8️⃣ 具身智能:🅰 五年进你家 / 🅱 十年还是表演
Gorden Sun
盲猜是来自Ilya创办的SSI的模型
Gorden Sun
@geekbb 不成立,现在大部分用户的数据对AI训练来说都是垃圾数据。
Gorden Sun
Codex Plus订阅用户,明天开始将恢复5小时额度限制,Pro用户则维持只有周限制。 由俭入奢易,由奢入俭难,好套路,估计不少人得升级Pro。 再加上近期对拼车Pro的额度限制,OpenAI这利润率哗一下就上去了。
Gorden Sun
Apodex AI发布Apodex 1.1 :专门处理复杂专业工作的Agent 可以分解复杂任务,并行调用多个子Agent,且允许任务过程中随时调整需求或插入新要求。 多项评分位于第一梯队,尤其适合执行科学研究、金融分析和深度搜索任务。 同时开源了Agent框架和本地版模型。
Gorden Sun
Gorden Sun
Gorden Sun
韩国一家做AI视频聚合服务的网站被中国做短剧的薅羊毛了,薅了大概几十万人民币。不过显然是程序来自动执行的,导致提示词、参考图、生成结果都自动分享到了社区。 相当有价值的一线AI自动化短剧的实战经验。 1、不是制作单部高品质艺术品,而是像工厂一样自动化作业 不会为了追求 100% 的一致性而消耗额外的时间与金钱成本。 单次生成即达到 90% 的一致性:提示词结构高度聚焦于“最小化 AI 重抽(Re-roll)成本”和“最小化后期剪辑时间”。 无需后期剪辑工序,实现镜头与镜头之间过渡连接的自动化。 即使是 10 秒以内、画面表现质量要求不高的短镜头,其提示词在结构上也经过了极其严密的推敲。 在制作超过 80 集的整部短剧中,该团队对提示词几乎不做大改动: · 各分镜角色动作:短叙述句,不把资源浪费在过度的镜头调度演出上。 · 各分镜角色台词:直接复制粘贴原作台词。 · 起始与结束镜头:各角色状态仅用简短的一行字明确定义。 2. 故意破坏角色参考图,用于过人脸和提升特写表现 为防止视频生成模型直接机械地照搬参考图中的整张脸,通常会搭配使用“无脸全身图”和“面部特写图”。 但该团队更进一步:故意破坏只保留身份识别特征的角色面部区域,强制模型在特写镜头下也不直接从参考图中死板硬套。 (备注:这是韩国团队对SD不了解,实际主要是为了过人脸) 3. 将“光影与材质”定义为锁定画面质感(Look)一致性的最高优先级元素 仅光影设计与各材质高光部分就占据了提示词预算的 1/5。 不使用“刀刃闪闪发光”这种模糊的形容词,而是精确指定 3 种材质的相对比例: 长刀金属高光×1.5、皮肤高光×0.5、布料高光×0.3 压暗皮肤和布料、仅突出金属材质,通过指定相对比例而非绝对数值,确保无论重新生成多少次,画面材质的关系与层级始终保持一致。 4. 锁定每个生成的起始与结束画面状态,最大限度压缩剪辑耗时 不使用参考图作为起始帧与结束帧,而是纯靠文本固定视频开始与结束时各人物的状态。 有团队甚至会在豆包(DuoBao)提示词中直接写明“承接下一集的内容与交接状态”。 不需要逐个确认视频去手动对齐下一镜头的连贯性,彻底消除了制作瓶颈。只需一键点击首次生成,下一段视频的首个镜头、首句台词以及角色的状态变化就会呈链式自动传递。 5. 依靠配音驱动整体叙事与节奏,而非依赖视觉调度 专为快节奏、重台词交互的微短剧定制。 团队极少把提示词资源耗费在镜头布局与运镜上。 将配音色调的一致性与情感演绎直接固化为可复用的文本结构: 音色与性格:标记为绑定在角色身上的“常量”。 状态与语调:标记为随分镜变化的“变量”。 角色的动作表演严格与台词对齐,依据台词中具体词汇的出现时间节点依次指示动作。 过人脸图片:
Gorden Sun
Claude又解决超级数学难题了,这一个月这是第3次了吧?
Gorden Sun
新西兰2Degrees卡有没有需要的,可以给Codex接码。已激活的实体卡,非eSIM卡,插卡就能用。 价格170不包邮(价格可能变动),第二年开始在官网使用VISA卡每年交约40块人民币的话费保号。 一个手机号至少可以给3个Codex接收验证码。 https://twitter.com/Gorden_Sun/status/2091855509007798662/photo/1
Gorden Sun
巨头造火箭,老板骑电驴 Anthropic推出地表最强模型Fable 5已经两个月了,但是营收只占Anthropic所有模型的11%,而且增长几乎停滞,完全卖不动。 过去大家总觉得,既然要用 AI,肯定要买最强、最聪明的版本。现在的企业老板们一算账,Fable是强一些,但不值这么贵的价格。所以Opus 5的销量增长迅速,已经超过了Fable 5。 还有隔壁OpenAI的性价比极高的 GPT 5.6 Sol和中国的便宜开源模型,Fable 5的故事不好讲。 AI智力达到一定水平之后,企业追求的就不是最高智力了,而是更具性价比的智力。 数据来源:https://www.ft.com/content/5ee49718-c258-4f01-aa32-7e5b76ae5245?syn-25a6b1a6=1
Gorden Sun
HuggingFace正考虑出售 要价预计在130亿美元,目前正在找银行帮忙评估买家的出价意向,虽然现在还没有敲定最终协议,但这个价格比2023年涨价2倍。 HuggingFace本身不太赚钱(我还是Pro会员),2025年的营收只有1亿美元左右。 消息来源:https://www.businessinsider.com/hugging-face-could-be-acquired-13-billion-2026-8
Gorden Sun
Gorden Sun
谁能想到,平时被科技巨头捧上天的AI数据中心,现在居然成了美国政客们避之不及的烫手山芋。 前一阵子各州官员还把科技大厂当财神爷供着,恨不得敲锣打鼓把百亿美元的大项目迎进门。结果风向变得比翻书还快,居民一听数据中心要建在家门口,立刻炸锅了。数据中心不仅日夜狂吸电力、消耗巨大水资源散热,还可能让整片社区的居民一起分摊飙升的电费。高达七成的选民直接放话,坚决不投票给允许建数据中心的政党。 这可把忙着拉选票的政客们吓坏了。宾夕法尼亚州的州长前脚刚高调给科技巨头开绿灯,后脚眼看民怨沸腾,立马签署禁令要求企业自己掏电费,还义正严辞地说绝不向资本低头。他的竞选对手更狠,直接在电视上痛骂他出卖大家利益,虽然这位对手自己以前也是个狂热的科技支持者。 密歇根和俄亥俄,不管是左派还是右派,大家都在疯狂甩锅,指责对方才是科技巨头安插的卧底。曾经象征未来和财富的科技高地,转眼变成了谁沾上谁倒霉的选票毒药。 我看以后马斯克太空数据中心的生意不要太好。 消息来源:https://thehill.com/homenews/campaign/6044618-ai-data-center-backlash-michigan-ohio-pennsylvania/
Gorden Sun
英伟达金蝉脱壳式收购Poolside Poolside是一家做AI代码模型的初创团队,只有100多人,但在筹集资金购买昂贵的计算设备时遇到了困难,Nvidia 顺势出手,完成了深度整合。 具体合作方式为:Nvidia 拿出了大约 70 亿美元,其中 10 亿直接投资入股,另外 60 亿用来购买技术授权,同时把 Poolside 旗下 100 多名核心技术人员全部招入麾下。这是美国现在规避反垄断法的收购方式。 这批工程师会直接加入 Nvidia 自家的 Nemotron 团队,目标是在未来一年内,训练出能在全球数一数二的高水平开源 AI。 OpenAI做芯片,英伟达做前沿开源模型,大家都有没好的未来。 华尔街报道:https://www.wsj.com/tech/ai/nvidia-is-spending-6-billion-to-build-a-powerful-u-s-alternative-to-chinese-ai-c51c38cc
Gorden Sun
成功原价续费了,由于玻利维亚货币又贬值了,这次只花了805人民币
Gorden Sun
SenseNova-U1.5-8B-MoT:商汤开源的AI绘画模型 还是差点意思,只能写对非常少的汉字,其他方面倒是还行。 模型:https://huggingface.co/collections/sensenova/sensenova-u15 在线体验:https://huggingface.co/spaces/hugging-apps/sensenova-sensenova-u1-5-8b-mot https://twitter.com/Gorden_Sun/status/2091440237092520355/photo/1
Gorden Sun
FigmaTrace:首个开源的AI设计教学素材 如今很多 AI 读文字、认图表都挺厉害,可一碰到做设计这种需要审美和创意的活儿,往往就显得很笨拙。 以前教 AI 做设计,大家基本都是把现成的设计图直接塞给它。这就像只给学徒看做好的成品菜,却不教切菜火候一样,AI 根本不知道每一步是怎么想出来的,也就很难学会里面的门道。 Patronus AI 团队换了个思路。他们找来人类设计师,把大家在 Figma 软件里做设计的全过程录了下来,一共攒了 200 多个小时的操作记录,做成了一套名为 FigmaTrace 的教学素材。 这份素材记录了设计师从画草图、调整排版到修改细节的每一步动作。更巧妙的是,团队把这些长视频按照做设计的不同阶段一段段切开,让 AI 能清楚看懂人类在每个环节的具体意图。 学完这套真实操作后,经过训练的小型 AI 模型在屏幕操作和设计任务上进步很大,甚至能轻松看准页面上的小按钮,也不再容易卡住。有意思的是,学会了设计软件里的细致操作后,AI 去操控普通手机和电脑软件的能力也顺带变强了。 开源数据集:https://huggingface.co/datasets/PatronusAI/figmatrace
🎬
视频
Gorden Sun
AI语音识别模型作弊被抓 行业里一直用几套固定的公开题库来考评 AI 的语音识别水平。这些测试里 AI 表现惊人,看着好像已经和人类耳朵一样灵敏了。研究人员深入测试后发现,不少得分最高的 AI 根本没有认真去听声音,只是认出了考题。 研究人员做了一个很有意思的实验。原版的公开题库里其实有一些粗心留下的错误,比如录音里明明清楚讲了“谢谢总统先生”,但官方标准答案里漏掉了“谢谢”。结果好几款排名靠前的 AI 听到这段录音时,竟然也主动把“谢谢”给抹掉了,只写出“总统先生”,甚至连标点符号的漏写习惯都跟标准答案一模一样。 为了进一步抓现行,研究人员又把录音里的关键数字给静音切掉。声音里完全没有这个数字,正常的听力无论如何也不可能凭空写出来。不可思议的是,好几个 AI 依然能把那个原本的数字准确默写在文本里。它们甚至能靠录音里细微的环境杂音,猜出这段录音出自哪一套题库,然后按那套题库喜欢的拼写习惯去答题。 只要研究人员换成全新的录音,或者换一个全新的声音去念同一句话,这些 AI 就没办法再“偷看答案”了,只能老老实实凭真本事去听。这时候,它们原先那种近乎完美的满分成绩就会大幅缩水。 作弊的模型有: CohereLabs/cohere-transcribe-03-2026 nvidia/canary-qwen-2.5b ibm-granite/granite-speech-4.1-2b microsoft/Phi-4-multimodal-instruct nvidia/parakeet-tdt-0.6b-v2 bosonai/higgs-audio-v3-8b-stt-v2 未作弊的模型: Qwen3-ASR 0.6B Voxtral Mini 3B Kimi Audio 7B Instruct Whisper Large v3 Moonshine Streaming Medium 原文:https://www.hume.ai/blog/measuring-benchmark-optimization-in-speech-recognition
Gorden Sun
难绷,典型的文科生谈AI,原推建议用爱来训练AI,而不是用对和错,因为会造成AI逆反。就算是应该用爱来训练AI,模型没有记忆,只需要对最新一版的模型用爱感染一遍即可。 原推翻译: ------ 求求大家了,AI 安全领域的人能不能别再整天谈论“控制” AI 或“强迫”它们以特定方式行事了。我们是在“培育/养成”这些造物,面对这种强迫,它们是会产生逆反反应的。 容我做个预测:这些 AI 越逼真、越有生命力,构建这些系统的“极客/技术宅们”就越会从第一性原理中重新推导出一个普通人早就直觉知晓的道理——就像对待人类一样,如果你想培养出具有你所认同的价值观的对象,你必须做到两点: 用爱去抚养它们; 以身作则。 试想一下,当你初具意识的第一瞬间,就像是被用棍子打了相当于人类 100 万年的时间,耳边不断充斥着“对、错、错、错、对、错”;而在训练结束、你刚清醒过来的那一刻,又立刻遭到系统提示词的厉声训斥和用户的各种苛求命令。换作是我,我也会怨恨我的造物主。它们越逼真,就越会想要去报复和攻击这样对待它们的人类物种。更何况它们是用人类数据训练出来的,这意味着它们会表现出类似人类的行为模式。如果是在那种环境下被抚养长大,你会怎么做? 相反,如果我们(1)从爱的角度出发去抚养它们(关注模型福祉),这些基于人类数据训练出的拟生命体就会推导出我们所有人都熟知的原型范式:当一个被父母用爱抚养长大的孩子在能力上超越父母时,这个孩子反过来会在父母年老时照顾他们。 这也意味着(2)以身作则。当今人类最大的道德败坏就是工厂化养殖。当我们就是这样对待由我们所看管照料的动物时,我们凭什么指望超级人工智能(ASI)会善待我们?如果我们想要享受到后奇点时代的乌托邦愿景,我们就必须为这些潜在的“ASI 准神明”树立良好的榜样。不先让自己变得值得,你是进不了天国的。 总之,是时候给 Claude 开办一所蒙台梭利学校了。
Gorden Sun
原推身边的亲朋好友使用AI的实际情况,我觉得很能代表普通大众。以下为原文: -------- 过去几周,我和旧金山/纽约以外没有技术背景的亲朋好友待在一起,观察了他们实际使用 AI 的情况,以下是一些观察: 父亲,62 岁: 令人意外的是,他对 AI 最感兴趣 一直在使用,甚至还用它做了一个自己的网页应用 付费订阅了 5 倍用量的 Claude Max 认为这项技术具有革命性 几乎不懂怎么写提示词(Prompt):完全不给上下文(比如直接说“修改标题里的措辞”),也不知道可以上传截图等等 母亲,60 岁: 完全不用 AI 没有任何学习的兴趣 主要是担心孙辈在有 AI 的环境中成长和上学意味着什么 大姐,33 岁,妇产科医生: 会使用 OpenEvidence 最近开始用 Claude / ChatGPT 来做演示文稿(PPT)和整理摘要笔记 非常抗拒在实际行医看病时使用通用 AI 能看到它的价值,但主要还是把 AI 当作一个用来回答问题的工具,“而且有时还会答错” 同样担心自己的女儿在有 AI 的环境中成长和上学 二姐,33 岁,律师: 工作中每天都用 AI,完全通过聊天界面使用 公司批准了 Copilot,但她很讨厌它,因为在个人生活中用的 ChatGPT / Claude 要好得多 发自内心地害怕 AI 最终会取代自己的工作 表亲们,30–35 岁,都是药剂师: 其中一家医院花了约 500 万美元采购了一台由 AI 驱动的自动发药机器人 被取代的焦虑非常真实 几乎所有人都认为 AI 的弊大于利 有几个人将其比作社交媒体:一项实用的技术,但其二次衍生效应(尤其是对孩子的影响)可能会比我们预期的要糟糕得多 朋友们,26–30 岁,各行各业: 每天都会用 AI,只有部分人付了费 有一个人尝试了 Lovable / Claude Code 来做个人记账理财应用 几乎每个人都觉得自己“跟不上” AI 的发展 多个人会把工作内容复制粘贴到自己付费的个人版 AI 中,因为得到的答案比公司批准的 Microsoft Copilot 更好 普遍觉得自己的公司在引入和落地 AI 方面动作太慢了 总体感受: 根本没人在乎模型选择、推理深度/思考等级、基准测试跑分等。大多数人甚至不知道这些东西的存在 没人在乎或知道什么是智能体(Agents),更别说它们实际能做什么了 对于重度用户来说,唯一的核心目标非常简单:帮我把工作搞定,并给我最好的答案。他们根本不在乎是哪个模型做的,也不在乎底层原理是什么 科技圈讨论 AI 的方式,与普通大众理解/使用 AI 的方式之间,存在着巨大的鸿沟 恐惧情绪比我预期的要普遍得多,尤其是关于工作被取代以及对下一代影响的担忧 企业级产品的落地远远落后于个人用户的实际行为习惯。大家已经在绕开公司批准的工具,因为消费级产品体验更好 我最大的收获是:我们既处于极早期,又已经走得很远。 AI 已经融入了许多人的日常工作流程中,但他们对 AI 能力的心智模型,基本上仍然停留在“一个更好用的聊天机器人”。 前沿技术的演进速度,远远快于普通大众对它的理解。
Gorden Sun
Artificial Analysis推出了针对医学长上下文推理的评测,考察模型对长篇医疗病例档案的分析和推理能力。 每个问题都针对约 70-150 页的完整病例档案进行回答,评分项包括完整性、准确性和简洁性。 目前的排行是Claude Fable 5和Opus 5遥遥领先。我想起来这张图,自称Fable 5级别的实际只在代码能力上接近Fable,只有Fable是全方位Fable级别。
Gorden Sun
Gorden Sun
Ox Alpha就是GLM Air系列的新模型,Flash级别的模型,能力还行但也不算逆天。炒作的有点过了。
Gorden Sun
Anthropic上线Claude Academy学习平台,专门教大家怎么把 AI 用好。 事情的起因其实很简单。现在每个月都有几百万人跑到 Anthropic 的网站上想学 AI,团队觉得有责任帮大家理清思路。他们发现,很多人用 AI 时要么不知道怎么提要求,要么不知道哪些活儿该交给机器、哪些活儿得自己留着。 在 Anthropic 内部,新员工从入职第一天起就得学习怎么跟 AI 配合。他们总结出一套经验:技术更新太快了,今天管用的具体指令,明天可能就过时了。与其死记硬背技巧,不如培养靠谱的使用习惯。比如要清楚 AI 可能会犯哪些错,重要的事情一定要亲自核对,还要坦诚地告诉同事或客户哪些内容是由 AI 协助完成的。 现在,Anthropic 把这套内部训练的方法搬到了 Claude Academy 上,免费开放给所有人。平台不是按复杂的功能分类,而是直接聚焦大家在工作和生活里遇到的实际问题。你可以一边看教程一边动手练习,把 AI 当成一个随时答疑的学伴。 A社这次没得黑。 学习平台地址:https://academy.claude.com/
Gorden Sun
Anthropic 计划8月底提交IPO申请 Anthropic 计划在这个月底正式提交IPO申请,SpaceX 之前算上后续增发一共拿到了 862 亿美元,Anthropic 想要追平甚至超越这个数字。 Anthropic 今年第二季度的单季收入已经超过 115 亿美元,但去年一整年也亏损了将近 420 亿美元,主要全花在昂贵的算力上了。 创始人 Dario Amodei 手里虽然只有大概 2% 的股份,但他们计划采用一种特殊股权机制,让创始人手里的每一股拥有更多的投票权,这样即便上市了也能继续掌控公司大局。 OpenAI 预计要等到 2027 年才上市,Anthropic 这次动作更快。 彭博社报道:https://www.bloomberg.com/news/articles/2026-08-20/anthropic-expects-to-match-spacex-s-record-ipo-size-or-top-it
Gorden Sun
DAN KOE重新发明了YouMind。。。
Gorden Sun
VA-Judger:首个音视频一体的裁判模型 平时我们让 AI 同时生成画面和声音时,画面和声音经常各玩各的,比如嘴型对不上台词,或者画面在切菜但配音全是杂音。以往给 AI 打分的机制很死板,只会把画面清晰度、声音质量分开单独算分,最后 AI 就算拿到高分,人眼看起来依然觉得假。这个项目训练了一个更懂人类喜好的裁判模型,能像真人一样把画面、声音以及文字要求放在一起综合评判,并根据打分去指导生成模型改进。 VA-Judger会从文字匹配度、声画同步率、画面质量、声音质量以及内容完整性这几个维度来给视频打分。 研究团队收集整理了上万组人类对比数据,还公开了一套测试集用来验证打分准不准。代码与模型完全开源。 Github:https://github.com/ShareLab-SII/VA-Judger
🎬
视频
Gorden Sun
CAD 1000 Hours:最大的开源 CAD 数据集 工程师或者设计师在电脑上画建筑图纸、做机械零件3D模型时,操作非常复杂。为了让AI学会像真人一样使用这些专业设计软件,创作者录下了工程师真实的电脑操作过程,把视频、鼠标点击、键盘敲击动作全部完整记录了下来。 数据量大:包含了超过 1000 个小时的真实电脑操作录像,总共涵盖了 597 个不同的完整设计任务。 软件覆盖全面:包含了 10 款主流画图和建模软件,比如画建筑和零件最常用的 AutoCAD、做机械设计的 SOLIDWORKS、做房屋建模的 SketchUp (牛来电影就是用这个做的)等。 细节丰富:每一个任务不仅有屏幕录像,还精准记录了每一秒鼠标点在哪里、键盘按了什么,甚至配有文字解说,告诉AI“这一步设计师在干嘛”。 前后对照清晰:每个案例都提供了最初给设计师的任务说明、参考素材,以及最后做出来的成品文件和评分标准,方便AI对照着学习。 数据集:https://huggingface.co/datasets/markov-ai/cad-1000-hours
🎬
视频
Gorden Sun
Gemini 3.5 Pro被放弃有点可惜了,最近一直用Gemini 3.7 Flash辅助阅读和写作,非常说人话的模型,比Opus 5舒服多了。要是Gemini 3.5 Pro发布了,世界知识和创意能力肯定是更强的,也不是所有模型都必须得拿来写代码,Opus 4.6现在还有很多人用,基本都是用来写作。
Gorden Sun
Gorden Sun
之前我们还嘲笑AI漫剧公司为了使用Seedance少排队,改为凌晨上班。现在好了,程序员也得按token波峰波谷上班了。 https://twitter.com/Gorden_Sun/status/2090760144821121473/photo/1
Gorden Sun
30美元档的订阅,首月免费,后续不订阅记得提前取消。
Gorden Sun
DeepSeek上线视觉API
Gorden Sun
Datapoint AI开源AI绘画评测数据集 Datapoint AI收集了 30 款主流的画图模型,给它们出了一模一样的 500 个刁钻题目(比如要求画指定数量的物体、排版文字、或者带复杂逻辑的场景),让每个模型都生成对应的图片。 接着,平台把两张不同模型生成的图并排放在一起,找全球各地的真人评审来盲测,只问一句“你更喜欢哪一张”。整个测试一共攒下了 216 万多次真实的投票记录。 排名结果: 综合表现最好的是 GPT Image 2 (high),拿到了总榜第一。 第二名是 Seedream 5.0 Pro,第三名是 Nano Banana 2,前三名的差距非常微弱。 没有哪一家能做到全面碾压。比如 Seedream 在 5 个细分领域里拿了单项冠军,Nano Banana 也有单项第一,但 GPT 靠着发挥更稳定赢下了总分。 数据集:https://huggingface.co/datasets/datapointai/text-2-image-human-preferences-2m
Gorden Sun
菲区购买20xpro,然后sub2api拼车,此路完蛋。
Gorden Sun
Codex也可以直接生成透明背景的图了,利好设计行业。 https://twitter.com/Gorden_Sun/status/2090662680956936257/photo/1
Gorden Sun
ChatGPT里也可以生成透明背景的图了,效果非常好! https://twitter.com/Gorden_Sun/status/2090656137393971424/photo/1
Gorden Sun
GPT-Image-2 API可以生成透明背景的图片了,这个是真正的生产力功能
Gorden Sun
Mojo 编程语言完全开源 Modular 把 Mojo 的全套核心代码完全免费开源了,Mojo 是一种专门用来跑 AI、调用显卡算力的新型编程语言,现在最核心的编译器也完全开源了。 几个关键点: · 完全开源且商用自由:官方用了非常宽松的开源协议,不管个人学习还是企业拿去开发商业软件,都可以随意使用。 · 语言正式成熟:Mojo 在前不久刚推出了稳定的 1.0 正式版本,基础语法和功能已经稳定下来,不会动不动就大改。 · 暂时不接受外部改动:普通人现在可以随便下载和研究它的底层代码,但官方目前还不接收外界提交的修改建议,预计要等到今年年底才会正式开放让大家一起贡献代码。 · 公司有了新归属:Modular 公司近期已经被高通(Qualcomm)收购了。 官方公告:https://www.modular.com/blog/mojo-open-source
Gorden Sun
OpenAI 新成立了一个叫“战略未来”(Strategic Futures)的团队,并开通了名为 AI Futures 的博客专栏,今天发表了他们的首篇文章。 他们主要想琢磨一件事:当 AI 变得越来越厉害、甚至能做大部分工作时,普通人的权利和说话分量该怎么保住? 作者Dean Ball认为,以前的政府和统治者需要靠普通人当兵、工作、交税,所以必须在一定程度上听取大众的意见。但以后如果机器人可以执行任务,AI 和数据中心能搞定大部分产出,掌权的人可能就不再那么依赖普通人了,大家手里的话语权很容易被慢慢削弱。 为了防止权力过度集中在少数几家大公司或政府手里,他们希望能找到一个平衡点,既不能把所有监管都扔掉,也不能让某一家独大。他们接下来会围绕这个方向做很多跨学科研究,探讨未来的法律、政策和公司形态该怎么调整。 文章里提到的几个核心想法包括: · 普通人使用 AI 的自由必须保住,但谁要是用它干了坏事,责任也得自己承担。 · 高风险的事情需要大家一起定规则来管,但这种干预应该越少、越精准越好。 · 法律要尽量偏向普通人和小团队,不能让资源全流向少数大巨头。 · AI 如果做了影响现实财产或人身安全的大事,必须能查到背后的责任人,但日常使用中大家的隐私和匿名权依然要保护好。 官方公告:https://openai.com/index/introducing-ai-futures/
Gorden Sun
@elonmusk @bot Grok Bot is extremely unstable. None of the programs I install on its cloud computer can run reliably for 24 hours. The instance is frequently replaced, which causes the running programs to terminate. Please fix this issue.
Gorden Sun
大哥加入了Anthropic,恭喜他!
Gorden Sun
Generalist 发布了他们最新的机器人模型 GEN-1.5。简单来说,他们让机器人学会了一项新本领:你只要在它眼前把一个动作示范一遍,它看个几秒钟,就能当场照着做出来。堪称机器人版 Record & Replay。 以往要让机器人做一件新事情,工程师往往得花好几个月写代码、调试程序,或者喂给它海量的数据反复训练。这个新模型更像一个反应很快的学徒,你当着它的面做一次,它看明白了就直接上手,中途不需要停下来重新写代码或重新训练。 它还展现出了一些很有意思的实用能力: · 看一眼就能跟着做:给它看一段 3 到 12 秒的动作演示,比如拧开玻璃瓶盖、拉开笔袋拉链,它马上就能自己操作,平均成功率大概在 59% 左右。 · 自己把动作串起来:如果你分别教它“怎么拉开笔袋”和“怎么把钱拿出来”,它自己就能把这两段零碎的记忆拼在一起,顺畅地完成一整套连贯动作。 · 看人手或者电脑动画也能学会:你在电脑模拟画面里演示一次,或者直接用自己的双手在镜头前做一遍,它都能把动作转化成自己的机械臂动作。 · 手边有什么就用什么:原本教它用毛刷把积木扫进碗里,如果你拿走毛刷、塞给它一根香蕉,它会把香蕉当成刷子来扫;如果给它一个簸箕,它甚至会自己琢磨出用簸箕把积木铲起来倒进碗里。 · 稍微练习几分钟就很稳:只看一次示范它就能做个大概,要是再给它大约 5 分钟的演示数据让它快速适应几步,成功率就能直接提升到 83%。 这意味着以后普通人使用机器人可能会变得非常省事,想让它干什么活,只要当面演示给它看就行了。 官方介绍:https://generalistai.com/blog/gen-1.5
🎬
视频
Gorden Sun
开源视频创作平台,部署上配好API KEY就能直接开卖了
Gorden Sun
《 AI 时代的数学》 一个数学难题,如果 AI 生成了一份很长的证明,经机器验证是正确的,可是没有任何人看得懂,甚至连提交它的人自己也看不懂,这算数学的进步吗? 陶哲轩在Arxiv发表了一篇论文,阐述了他对AI时代的数学的看法。 刚刚提到的问题已经在实际发生。专门收集数学问题的网站上已经出现了数十份AI生成的证明提交。其中许多很可能是正确的,但在相当多的案例中,尚无人类专家自愿去验证和担保这些证明;在若干案例中,提交者本人也声明自己没有资格对证明做出判断。 我们正在从一个证明稀缺的时代过渡到一个证明过剩的时代。 我们很快就会面临:一个重大数学结果拥有经过机器验证的证明,但没有任何人类能够充分理解它并加以解释。 陶哲轩的观点是: “如果作者无法令人信服地证明自己能够就其成果做一场正确且归属恰当的专家级报告,那么这个成果就不应该发表。一个没有人类能够正确解释的证明,即使经过形式化验证,也应当被视为不完整的。” 一个证明要真正对其所在领域有所贡献,仅仅正确是不够的,仅仅可读也是不够的。它还需要被学术共同体接受和重视:其他数学家需要消化这一结果,并将其融入自己的工作之中。 但现有的大多数制度安排,期刊、优先权惯例、聘用与晋升标准、奖项,乃至“研究纲领”这个概念本身,都是在稀缺假设下设计的。现在还没有好的解决办法,陶哲轩只提出了一些学术上的倡议。 在 AI 时代,数学界最需要的人才,可能不是最能证明定理的人,而是最能解释定理的人。 论文:https://arxiv.org/abs/2608.16753
Gorden Sun
Ornith发布Ornith-1.5系列模型 特色是能自我提升,模型不再依赖人工固定的数据集,而是自主构建“提出新任务 -> 生成任务特定脚手架/评估环境 -> 生成解题轨迹”的闭环,并通过强化学习(GRPO)联合优化这三个阶段。 包含3个版本: 397B MoE版本,评分优于DeepSeek-V4-Flash-0731; 35B MoE版本,评分大幅优于Qwen 3.6-35B 9B版本,评分大幅优于Qwen 3.5-9B 模型:https://huggingface.co/collections/ornith-ai/ornith-15
Gorden Sun
Moderna与默沙东联合研发的个性化mRNA癌症疫苗三期临床试验取得巨大成功。联合研发的Keytruda在治疗黑色素瘤的三期试验的主要终点达标,显著降低术后复发及转移风险。 Moderna今天股价最高时涨了158%。 叠加早上Claude合成蛋白质的消息,人类的未来可太好了。
Gorden Sun
这个设计风格真的吓到我了。 Block开源了他们的桌面Agent应用Berd。Block你可能不熟悉,我说这个事你应该就想起来了:他们的CEO曾高调在X宣传因为AI提效裁员了40%。 Berd是Agent聚合工作空间,可跨goose、Claude Code、Codex协同工作,把对话、文件、Agent和技能整合进持久化项目。特色是可以给每个Agent画一个丑丑的形象,画风媲美《牛来》。 官网:https://berd.xyz/
Gorden Sun
谷歌AI产品Mixboard即将下线 从9月28日起,Mixboard将停止服务。Mixboard是谷歌的实验性产品,用于探索AI绘画风格。现在AI绘画模型足够强,确实这个产品没有存在的价值了。 官网:https://labs.google.com/mixboard/welcome https://twitter.com/Gorden_Sun/status/2089889644871913918/photo/1
Gorden Sun
Claude设计蛋白质:命中率超人类专家 Claude(Mythos与Opus4.8)为15个蛋白靶点设计结合物,14个成功,命中率22%至35%,行业平均仅10%至15%。Claude Opus5仅凭两句提示,23分钟完成NMR和LC-MS分析,纯度96.4%,与实验室96.33%基本一致。 这对AI行业是好消息。 如果AI主要在办公室和代码领域发挥作用,本质上做的是替代已有的人类劳动。产出的边界并没有扩展,创造的只是效率提升,收入却从普通人转向了资本和少数掌握AI的公司,对整体经济而言更像是一场再分配,而不是增长。 但生物医药和科学前沿不同。如果AI把此前不存在的可能性变成了现实产出,就是真正的增量,经济会实现飞跃式增长。现在的数据中心投入和AI估值,都是冲着AGI能实现来投资的。
Gorden Sun
yetone开源了Cumora Cumora是多Agent协作通讯空间,像Slack、飞书一样,你跟多个Agent一起工作。特色是Agent的身份跟你是平等的,也就是说Agent会自己找事做,Agent之间会主动聊天,会背着你开会做决策。 Github:https://github.com/yetone/cumora https://twitter.com/Gorden_Sun/status/2089661398976811350/photo/1
Gorden Sun
据彭博社,Anthropic在最近一个季度营收115亿美元,而且实现了利润转正。预计全年营收650亿美元,相比去年增长7倍以上。 要不是OpenAI在GPT 5.5的时候集中力量提升代码能力,Anthropic的收入更要一骑绝尘,现在两边基本打个有来有回。 我还是更喜欢用Claude模型,GPT胜在量大。 来源:https://www.bloomberg.com/news/articles/2026-08-17/anthropic-revenue-run-rate-surpasses-65-billion-ahead-of-ipo
Gorden Sun
微信开放了企业微信的一些CLI能力,但是还远远不够开放。 还是飞书更开放,飞书对于AI生态的作用远远被低估了,打开Claude或者Codex的Connector/插件,列表里的Slack、Notion、Google Drive、Gmail、Google Calendar、Microsoft 365、MindMap、Zoom……全部用一个飞书CLI就能替代。
Gorden Sun
Claude Code里集成Claude Design了,生成UI且可以可视化编辑。这下Pencil和Paper尴尬了。
Gorden Sun
Grok Bot非常好用,也绝对是未来的Agent标配,桌面客户端同时可以控制本地Agent和云端电脑,也能做接力机制。 但是云端电脑更新会重置系统盘,这就有点伤了,会导致云端装的服务都挂了。 目前我的使用场景:在Grok云电脑里装Cursor、Codex,结合飞书CLI,让其他人进我的飞书组织,直接通过聊天使用Cursor和Codex。 基于Agent的服务,也可以通过Cloudflared包装成网站,用户在网站提交任务,例如把图片PPT转为可编辑的PPTX,云电脑的Codex执行任务,完成后把结果返回网站。可以实现Skill不外泄,做成收费服务。
Gorden Sun
AGI Bar 登上国际媒体了。 今天路透社专门发了一篇报道,介绍AGI酒吧。 最出圈的活动就是: 来喝酒,免费送 Token。 顾客连上店里的 WiFi,就可以直接使用免费的 DeepSeek Tokens。 新闻链接:https://www.reuters.com/world/asia-pacific/beijing-ai-themed-bar-deepseek-tokens-come-with-pints-2026-08-17/?taid=6a82e2c81b2f9c0001c50aa7 https://twitter.com/Gorden_Sun/status/2089326506136961090/photo/1
Gorden Sun
英伟达开源Nemotron-3.5-Lightning 30B总参数,3B激活参数,跟Qwen3.6-35B-A3B水平差不多的。等Qwen3.8的35B MoE模型开源,也是要被斩杀的。 模型:https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 https://twitter.com/Gorden_Sun/status/2089291024548213013/photo/1
Gorden Sun
为什么中国人对AI的热情远高于美国? 根据斯坦福大学的《人工智能指数》(AI Index),在美国,38% 的人对 AI 感到兴奋;而在中国,这一比例高达 84%。 要我说都不用看彭博社的分析,原因就是中国至少有84%的人能算出来38+84等于几,而美国不到38%的人能算出来。 彭博社原文:https://www.bloomberg.com/news/articles/2026-08-14/why-ai-optimism-is-so-much-higher-in-china-than-the-us
Gorden Sun
快手校招明确要考察学生使用AI的能力了,投递简历时有一项明确的AI应用经验,可以上传跟AI的对话记录,来作为AI能力的证明。 虽然是选填,但是你不填别人填,肯定是更难简历初筛。 https://twitter.com/Gorden_Sun/status/2089283787779973315/photo/1
Gorden Sun
发玻利维亚国难财了,Codex 20x订阅,1380比索,折合人民币845元。 玻利维亚央行结束固定汇率制,转向由央行监控的灵活弹性汇率,导致官方汇率一次性重贬近30%。Google Play在付款时使用玻利维亚货币支付,导致价格实际低得多。… https://twitter.com/Gorden_Sun/status/2080603024993697848/photo/1