Newer Is Not Fairer: Gender Stereotyping in Text-to-Image AI Across Model Generations
Multimodal Conditioning of Fine-Tuned Stable Diffusion XL for Controllable and Culturally Faithful Ulos Motif Generation
[问与答] 房地产企业,领导要求年会上放 3-5 分钟关于 AI 的展示
去年年会给了差不多的任务,用 nano banana 和 Midjourney 做了展示区、室内设计相关的效果图,还有竖屏宣传海报,分别转成视频合并成一分钟的视频在年会上播放。
今年领导不限内容和形式,背景是房地产企业,前段时间刚培训完 WorkBuddy ,但 AI 目前基本只落在营销条线生图生视频上,大部分也是落在广告公司头上;日常其他工作没有特别需求 AI 的地方,尤其是 Agent 这块,除了一些简单文件处理基本没有应用面。
肯定还是以视频形式展示最稳妥,但是重复去年的似乎没什么意思,也体现不来现在 AI 的趋势,各位 V 友有没有好的思路?
vivo Buds Clip 体验:42 小时续航的无感佩戴,音质好也舒服

更新了旗舰真无线降噪,头戴式转变成了符合新一代使用场景的无线降噪形态之后,vivo 给自家耳机产品线带来了全新的产品形态。

在 vivo 最新的新品发布会上,他们推出了自家首款耳夹式真无线耳机 vivo Buds Clip。
产品一如既往用上简洁的纯白色包装,正面印上了产品造型照、金字 vivo Buds Clip 的 logo,以及vivo 金耳朵实验室认证和 Hi-Res 认证的双金标。
包装上侧有耳机本体和相关的说明文件,下侧是 USB-C to A 的充电短线。

vivo Buds Clip 的充电盒是传统的鹅卵石造型,整体用上 vivo 强调的「自然微光美学」设计理念,细腻的金属磨砂受光状态下能反射出淡雅的光影效果,整体呈现出一种平稳素雅的感觉。
充电盒做了斜切开口,正面只保留 vivo logo 和显示状态的指示灯。盒子背面很平整,这个设计是为了支持无线充电的版本准备。USB-C 充电接口在底部,启动配对模式的实体按键依旧放在侧面。

充电盒内部采用亮面处理,耳机立着磁吸在坑槽里面。
磁吸的充电槽没有左右分别设计,两侧的触点都能够对应耳机,耳机本体也不需要区分左右,佩戴的时候随手抓起即可。

耳机造型方面, vivo Buds Clip 是「听音球+连接桥+平衡豆」的组合模式,整机保持着「自然微光美学」的设计主调,细腻磨砂效果的平衡桥连接亮面处理得听音球和平衡豆。
外观上,这一代最突出的是在平衡豆的部分。

相较于传统耳夹式耳机那种完全光滑统一的传统平衡豆设计,vivo Buds Clip 在自己的平衡豆上增加了一块经赛璐珞工艺处理得装饰片,里面呈现出类似天然贝母的光泽和纹理。
这款工艺处理得装饰片具备独特性,每一幅耳机出来的纹理和色彩分布都不一样。加上装饰片表面有透明面覆盖,光线作用下观感更加饱满。
这样处理会让耳夹式耳机的外观不会只局限在配色和质感呈现上,多了点花样,更有耳坠耳环的饰品感。

耳机的主要操作主要集中在连接桥上,vivo Buds Clip 的连接桥比较宽,软面条式的形态方便触控,稍用力点按不太影响耳朵和佩戴。

佩戴部分,vivo Buds Clip 耳机部分重 5.2g,和同价位的真无线耳机差不多。佩戴固定好之后,听音球和平衡豆能够卡住在对耳屏和后侧的位置。
这里,vivo Buds Clip 的连接桥用了记忆钛合金材质,记忆桥很轻也比较柔软,把持力还不错,一般日常通勤,不是大幅度活动的话就很够用了。

而且耳机不太重,这个戴着不太容易出现明显的异物感,耳机挂着也不会太累赘,长时间佩戴的舒适度还可以。
要知道,耳夹式耳机的核心功能并不是听音乐,而是联动手机在生活中提供一些语音辅助的功能,又或者是随时为通话或会议待命,长时间佩戴对舒适度和续航要求都不低。

就舒适度而言,vivo Buds Clip 的表现还不错。只要当天会议强度不高,日常取下的次数并不多。

续航也是,vivo Buds Clip 耳机本体的续航为 10 小时,搭配充电盒可以实现 42 小时的音乐播放时长。
对于日常需要长时间佩戴和使用以通话和待机为主的耳夹式耳机,vivo Buds Clip 单机续航表现还可以。加上耳机支持「充电十分钟,播放 3 小时」的快充模式,要紧急充电的时候也能快速响应。
但大多数时间下,vivo Buds Clip 有着比人常规工作时间长的续航,平时已经够用了。可能在午休等零碎时间中回盒短短充个电,就能满足当天需求。

配置方面,vivo Buds Clip 搭载了支持蓝牙 5.4 版本的无线方案,支持多设备三连接技术,延迟可以控制在 70ms。

连接 vivo 和 iQOO 的设备可设置自定义弹窗,除了有自定义图片、贴纸之外,还能通过小 V 绘画引擎生成弹窗画面。
另外,在连接 vivo 和 iQOO 设备时,vivo Buds Clip 可以和 vivo 翻译功能联动,能够即时翻译英语、日语、韩语等多种主流语言。

接入 vivo 蓝心小 V 时,vivo Buds Clip 可以对重点提醒进行播报,像是航班列车、快递等通知都能够通过耳机读出来,不需要取出手机查看。

编码和声音功能的部分,vivo Buds Clip 最高支持 LDAC 高规格蓝牙编码,耳机有 Hi-Res Audio Wireless 认证和支持高解析音频,也有空间音频和 DeepX 5.0 音效,用户可以在手机的设置菜单中调整自己的均衡器和设置聆听的模式,有「均衡模式」、「人声增强模式」以及「防漏音模式」可选。
耳机在使用时可以开启「自适应音量」,开启后耳机能感知用户周边的环境变化来调整音量,并且能根据周围的环境对播放内容的中高频进行补偿,在环境嘈杂的餐厅或地铁上能够提升听感的清晰度。

声音配置方面,vivo Buds Clip 选用了同定位耳机里面相对大的 12mm 动圈单元,单元用上四层四出的 4L 双并线音圈设计,比传统的四层两出的 4L 设计更轻,降低共振频率的影响,提升低频表现,确保听感厚的同时保证中高频表现,从而实现三频均衡。
单元磁铁上用了双磁设计,单元用了 PU 新材料和生物质互穿网络复合材料做的单元球顶,分别对清晰度、低频表现以及高频细节、人声音色和温度进行加强。

简单来讲,vivo Buds Clip 的声音风格就是在平衡和理性的声音基底上,提升音效的突出,低频输出提升声音饱满感,同时保证中高细节清晰度的现代声音方向。

听感方面,vivo Buds Clip 整体声音很清爽,节奏很快音效也很突出。在支持高解析传输的 LDAC 编码传输下,耳机听着细节很扎实丰富,加上新单元提供了扎实的低频表现,鼓点饱满感充足,打碎了老派用户对完全开放式耳机那种「声音轻薄、缺乏力量感」的刻板印象。
还有,耳夹式这一类开放式耳机在呈现空间感上有非常突出的优势,vivo Buds Clip 的定位刻画清晰,开启空间音频之后能够清晰听到声音位置变动。
之前如果习惯了放入耳朵的耳机设计,再听耳夹式的话体感还是挺特别的。

对于 vivo 体系和生态的用户来讲,vivo Buds Clip 是非常稳妥的选择。
轻量化的机身和长续航表现,这些是保证了耳夹式耳机长时间佩戴的基础。从单元到传输还有软件支持,在声学方面有丰厚积累的 vivo 在声音这部分给足了诚意,vivo Buds Clip 听感在厚实度、饱满感和音效的刻画上都表现得突出,是更新后就很容易听出提升的类型。

再加上它一上来就能够用上全功能,对生态内的手机几乎没有门槛,新机老机都可以用。
如果你本身就是 vivo 或 iQOO 设备用户,需要一款全天候佩戴待命的耳机,那佩戴更轻松、续航表现也不错的 vivo Buds Clip 会是不错的选择。
#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。
Trump’s tariffs slashed jobs and wage growth. Now companies are funneling $100 billion in refunds to supplement workers’ retirement
In March, shortly after the Supreme Court struck down President Donald Trump’s International Emergency Economic Powers Act (IEEPA) tariffs and paved the way for $100 billion in import taxes being redistributed back to American importers, U.S. Trade Representative Jamieson Greer shared his idea of what these companies should do with this influx of cash.
“If I were these companies, and somehow they get this windfall, the most important thing and the smartest thing they should do is give it as bonuses to their workers,” Greer told CNBC.
It appears some companies have heeded Greer’s suggestion. As businesses receive more than $100 billion the U.S. Treasury has doled out in refunds since May, many are vowing to lower prices or pay down debts. A handful, however, are giving the cash back to their employees.
In its second quarter earnings report last month, houseware brand Williams Sonoma said it would allocate $10 million for one-time payments to 401(k) accounts to eligible employees “in recognition of their efforts navigating the IEEPA tariffs.”
“We’re so appreciative to have the money back and to be able to reward our employees with part of it,” President and CEO Laura Alber said on an earnings call. “They have done such an amazing job.”
TJX, which received $331 million total in tariff refunds, will similarly put a portion of its aggregated refunds into paying employees extra.
“Due to these tariff refunds, the company accrued incremental expenses of $112 million for year-end incentive compensation and discretionary bonuses for eligible associates globally,” a spokesperson told Fortune in a statement.
American companies and consumers alike have kept a close eye on the tariff refund process, particularly after Federal Reserve research showed they were the ones shouldering the brunt of the tariff costs. While companies like Walmart and FedEx have promised to compensate consumers for tariff-related inflation through lower prices or direct rebates, the unconventional decision to hand employees cash from tariff refunds indicates just what a pervasive impact the import taxes had on U.S. companies.
“Companies have a lot of different margins for how they adjust to tariffs,” Alex Durante, senior economist at the Tax Foundation, told Fortune. “They could pass all of it along to consumers, they could also reduce investment, they could reduce hiring, they could cut back on certain employer perks and forms of compensation, if they wish. And I think that this is just perhaps another way of thinking about that.”
How U.S. employees have been impacted by tariffs
Greer’s rationale for giving workers a portion of the tariff refunds goes back to one of Trump’s initial motivations for implementing levies in the first place: to bring back manufacturing jobs to the U.S.
“The whole reason the president imposed these tariffs was to try to reshore, affect our massive imbalance in trade that we’ve experienced over many years because of China, Vietnam, the EU and others,” Greer said. “If the companies are going to get this windfall, they should pass it along to their workers as a bonus or a raise, because that’s the purpose of the program.”
It appears the tariffs had the opposite effect in reshoring, with manufacturing jobs in the U.S. actually shrinking by more than 100,000 during the first year of Trump’s second term. Laura Ullrich, director of economic research at the Indeed Hiring Lab, previously told Fortune tariffs and the uncertainty surrounding maintaining supply chains, could be a reason for this dip.
“Oftentimes when there is heightened uncertainty, it’s just difficult for businesses and people to make decisions in real time,” she said. “And so that slows down employment. It slows down all those processes.”
In addition to hiring constraints, tariffs may have also suppressed wage growth, according to Pantheon Macroeconomics analysts Samuel Tombs and Oliver Allen, who argued companies slashed raises in order to maintain or take back margins when the IEEPA tariffs were in place. It’s one reason why companies may feel compelled to give workers back some cash from the duties, the Tax Foundation’s Durante suggested.
Instead of lowering prices or offering refunds to consumers amid ongoing tariff uncertainty, “what are some better ways we can retain our employees and incentivize them to want to stay with us or to want to want to work for us?” he said.
Tariffs, after all, have likely had an impact on workers’ retirement plans, at least indirectly. Though markets have recovered from Trump’s previous threats to impose sweeping import taxes, economists have found evidence tariffs will have longer-term reductions in stock prices, from about 7.33% to 10.13% across indices within the next couple of years. Lower stock prices means fewer returns for employees with retirement money in the markets.
“It is the case, absolutely, that tariffs do impact capital, and thus the equity markets,” Durante said.
This story was originally featured on Fortune.com
小破站砸10亿搞AI,图啥?
(本文作者为 AIX财经,钛媒体经授权发布)
文 | AIX财经(AIXcaiijng),作者 | 陈丹,编辑 | 魏佳
B站刚学会赚钱,就准备把一整年的利润重新押出去。
2025年,这家公司第一次实现全年GAAP盈利,净利润11.9亿元。几个月后,管理层宣布,2026年将额外增加约10亿元AI相关资本开支。
这几乎相当于B站上一年全部净利润。但放进今天的AI竞赛里,10亿元又显得拿不出手。
字节跳动今年被曝将AI基础设施预算进一步上调至2000亿元以上,9月又从近30家银行获得296亿美元贷款,大量资金继续流向芯片和数据中心;腾讯二季度资本开支达到528亿元,同比增长176%,自由现金流二十年来首次转负。
巨头正在用千亿元购买下一张技术船票,B站拿出的,只是它们一个季度花掉的很小一部分。
需要指出的是,B站并不打算参加这场最烧钱的战争。CEO陈睿在二季度财报电话会上划出了一条明确边界:“AI产业链上有很多环节我们不会参与。”钱只投三个方向:视频理解、视频分发和视频创作。
对AI行业来说,这笔钱太小,不足以买来技术领先;对B站来说,它又足够大,大到可以吃掉这家刚刚盈利公司的大部分年度利润。
B站既不想加入军备竞赛,也不能站在军备竞赛之外。
因此问题来了,一家不造大模型的内容平台,为什么仍然必须花这么多钱押AI?这笔钱究竟是在买增长,还是只是在买“不掉队”的资格?
01.10亿买的是什么?
10亿元放在整个AI行业里不算多,但对B站自己来说,是一次明显的投入升级。
2023年,B站用于设备等固定资产的资本开支约1.8亿元,2024年增至约4.8亿元,2025年约5亿元。到2026年,仅AI相关资本开支就计划额外增加约10亿元,这一增量相当于2025年全年设备投入的两倍。到二季度末,这笔预算已执行七八成,主要用于购买服务器和算力。
这也意味着B站这一轮AI投入,主要是在给现有业务补AI基础设施,让它大规模跑进搜索、推荐、内容理解和创作工具里。
这是B站2023年就定下的方向。
当年7月,“百模大战”最热时,互联网公司争夺的是通用基础模型,比参数、比训练规模、比模型能力,再把模型作为独立产品对外提供。B站也发布了自研的bilibili index大模型,但目标并不是参与这场竞争,而是让模型理解B站自己的视频和用户,服务搜索、内容审核、视频总结等内部场景。


图源 / IndexTTS2展示平台
一个月后的二季度财报电话会上,陈睿把这条路线说得更明确:B站不会参加“百模大战”。他举的例子是内容审核——如果大模型能够替代大量重复的人力,对B站来说就已经有实际价值。
此后三年,B站的AI路线基本没有偏离这个方向。在好耶科技创始人吴杰茜看来,这与其说是主动克制,不如说是现实选择。“现在才开始做(视频模型),已经太慢了,B站也不具备这个基因。”
她介绍,从零训练一个视频生成模型,再一路做到可以商用,拼的不只是钱。可灵、Seedance等模型并非短期投入的产物,背后是团队、数据和工程体系的长期积累。即便现在,视频生成模型仍以几个月为周期快速迭代。对后来者来说,增加预算可以买来算力和人才,却很难在短时间内补上已经形成的技术和工程差距。
对B站来说,更划算的办法,是让上游公司承担最昂贵的模型竞争,等能力成熟、调用成本下降,再把它们接进自己最熟悉的视频业务。
最早,AI主要待在后台,做审核、推荐和智能字幕,之后才逐渐走到用户和创作者面前。2024年,B站推出数字分身工具“必剪Studio”;2025年的“AI原声翻译”,则进一步把翻译、语音合成、字幕处理和口型模拟放进同一套流程,让一条中文视频可以更低成本地进入其他语言市场。
到今年,AI开始从辅助工具进入两个核心环节:一端理解内容,一端生产内容。
B站以中长视频为主。一条几十分钟的视频里可能同时包含人物、观点、情绪和复杂的叙事结构。传统推荐算法更多依赖标题、标签、点击和用户行为,却很难真正理解一条视频在讲什么,更难理解用户为什么会喜欢它。陈睿在二季度财报电话会上提到,新一代模型已经可以更深入地理解视频内容和用户意图。
在B站的设想中,如果这件事能成立,就不只是少雇几个审核员、少做几道字幕工序,而是可能改变搜索和推荐本身——平台可以更准确地理解自己拥有的数亿条视频,再把它们匹配给合适的人。
另一端是生产。过去,一条动画或者制作复杂的视频往往需要多人协作;现在,一个创作者借助AI,也可能完成过去需要一个小团队才能完成的工作。B站已经出现个人使用AI制作动画、获得千万级播放的案例。
今年7月,曾在腾讯混元、Anuttacon任职的曾爱玲加入B站负责AI视频生成业务,并直接向陈睿汇报。这也意味着,AI视频成为创始人直接关注的业务。
因此,对B站来说,过去它可以低成本地试用AI,把模型接进几个边缘环节;现在,当AI开始进入内容理解、分发和生产这些核心链条,B站就必须为它配置真正的算力、服务器和组织资源。
02.10亿买得到能力,买不到壁垒
这套路线已经给B站带来了一些可以量化的收益。
2026年一季度,B站广告收入25.9亿元,同比增长30%;二季度增至31.3亿元,同比增长28%。二季度,广告点击和转化综合指标CTCVR同比提高19%,搜索广告收入翻倍。管理层把其中一部分改善归因于AI对内容和用户意图理解能力的提升。
AI公司本身也在贡献增量。一季度,AI行业广告预算在B站同比增长170%,二季度仍保持翻倍增长。
内容端也是如此。二季度,B站日均投稿量同比增长28%,千粉以上创作者数量增长30%;今年5月推出的一项动画创作活动,三个月累计获得超过1.8亿次播放。
从这个角度看,B站确实吃到了“不造模型”的红利:不用承担最昂贵的技术竞赛,也能分享模型进步带来的效率提升和新增需求。
但问题也恰恰出在这里。
B站可以买到更好的视频理解能力,抖音、快手和小红书同样可以买;AI可以提高B站的广告匹配效率,也会同步提高其他平台的效率。当模型越来越接近一种通用基础设施,它首先抬高的是整个行业的效率,而不是某一家公司的独占优势。
也就是说,B站花10亿元可以买到“跟上”,却很难单靠这笔钱买到“领先”。
AI改变的不只是平台内部的效率,还在改变B站所处的竞争环境。
首先是内容供给。过去,视频是一种生产成本很高的内容形态。真人拍摄、动画、配音和剪辑都需要时间和人力,也因此天然限制了供给速度。AI短剧、漫剧和生成式视频出现之后,原本昂贵、低频的视频内容开始变得更便宜,也更容易批量生产。
红果便是一个直接的例子。QuestMobile数据显示,截至2026年7月,红果短剧日活达到1.68亿,已经超过爱奇艺、腾讯视频、优酷和芒果TV四家的日活总和。今年2月,红果人均单日使用时长达到125分钟;相比之下,B站今年一季度创下历史新高的日均使用时长为119分钟。
红果的增长当然不能简单归因于AI。免费模式、字节的流量体系和番茄小说的IP供给,仍然是它更直接的优势。但AI正在进一步放大这套模式的竞争力:当视频生产成本下降、供给速度加快,红果可以用更低的成本持续扩大内容池,再依靠现有的流量和IP体系把新增内容推给用户。
对B站来说,威胁并不只是“市场上的视频变多了”,而是一个已经拥有巨大流量和内容供给能力的竞争对手,可以借助AI更便宜、更快地增加视频供给,继续争夺用户每天有限的观看时间。
“我相信,不会有任何一个内容平台,面对红果飙升的用户数据不感到着急。”吴杰茜说。
竞争压力同样出现在创作者一端。
AI能够帮助UP主提高产能。一个过去需要几天甚至几周完成的视频,现在部分环节可以交给脚本生成、图片生成、配音、翻译和剪辑工具。对B站,这增加了站内供给;对创作者,它也降低了多平台分发的成本。
所以,AI带给B站的是两种同时发生的变化。
它提高平台内部的推荐、广告和创作效率,也提高整个行业的内容供给效率。前一种变化让B站愿意投入,后一种变化让B站很难选择不投入。
在吴杰茜看来,B站这10亿元与其理解为一次主动进攻,不如先把它看成一项防御性工程。这10亿元能解决的是“不掉队”,而不是建立新的护城河。
03.一张必须购买的入场券
这种防御要付出多大的长期成本,又能带来多少额外收益?答案要落在一笔更现实的账上:为了维持竞争力增加的成本,能不能被更高的商业化效率和内容效率覆盖。
这笔账对刚刚盈利的B站并不轻松。
10亿元主要属于资本开支,不会一次性进入利润表。但按照CFO樊欣在财报电话会上的口径,服务器、算力和相关研发投入,预计会增加全年约5亿元研发费用。相比2025年11.9亿元的GAAP净利润,相当于四成以上。
另一方面,截至二季度末,B站持有约243亿元现金及现金等价物、定期存款等资金。10亿元不到这一规模的5%。它不会威胁公司的现金安全,却足以影响刚刚建立起来的盈利水平。
樊欣表示,公司会削减其他运营费用,对冲部分新增成本,40%-45%的长期毛利率目标和15%-20%的营业利润率目标都没有改变。
资本市场也已经开始按照这个逻辑重新计算B站的AI投入。
年初,瑞银、摩根大通、花旗都把AI带来的广告需求和效率改善列为B站新的增长因素。二季度财报后,摩根士丹利和美银维持积极评级,却下调了目标价或盈利预测。大摩提到研发费用增加、毛利率承压,同时指出广告业务面临宏观逆风;美银同样指向研发投资增加和毛利率略低。
市场关心的问题已经从“AI有没有用”,变成了“AI带来的增量,能不能跑赢它持续增加的成本”。
如果每年增加的服务器、算力和研发成本,能够持续换来更高的广告转化率、更好的推荐效率和更多高质量内容,投入就能产生回报。但如果AI最终成为所有平台的标配,服务器和算力就会从“投资”变成一项“税费”——为了不掉队,年年续费。
一位长期关注互联网平台的投资人对10亿元能够创造多少增量价值持谨慎态度。
在他看来,10亿元不足以让B站获得真正的技术优势。对内容平台来说,最终拉开估值差距的仍然是用户规模、社区关系、商业化效率和产品,而不是是否部署了AI。至于B站为什么仍然需要投入,他认为还有资本市场层面的考虑:当AI已经成为科技公司的必答题,完全缺席本身就可能被视为落后。
在他看来,现在很多公司都是为了AI而AI,资本市场和公司“互相配合演出”。
吴杰茜与他的判断既有相似之处,也有分歧。两人都认为,模型本身很难成为B站独有的资产。真正的分歧在于,当同样的AI能力进入不同平台,它能否放大平台原本的差异。
在吴杰茜看来,B站的优势主要来自两端:一端是长期积累的大量C端内容创作者,另一端是黏性很高的二次元用户。AI反而可能让两项资产变得更重要。
生成式AI正在把内容生产变成更小团队的生意。现在不少AI漫剧团队只有1-5人,一个小工作室就可能做出爆款。这与B站原有的创作者结构很接近,大量UP主本来就是个人或小团队。过去需要更完整组织才能完成的内容,如今几个人就能做,B站积累多年的个人创作者供给,也因此有了新的价值。“谁拥有创作者,下一个时代的精品内容就诞生于谁。”吴杰茜说到。
而且,高黏性的用户、弹幕、评论、投币和收藏,不只是消费行为,也构成了一套持续的内容反馈机制。创作者更容易获得反馈,优质内容更容易在这里跑出来。
这是B站更愿意讲述的故事。
目前,B站有近3亿通过社区考试的正式会员,12个月留存率稳定在80%左右,每月产生约170亿次弹幕、评论、投币和收藏。陈睿把这些行为称为AI时代的“真人信号”。今年一季度,他还表示,AI会放大B站在优质内容供给和社区体验上的优势。“AI是十倍放大的历史性机遇,我们将牢牢把握”。
10亿能否撬动10倍价值仍待时间验证,但在今天的科技行业,这已经足够构成一项投资理由。毕竟,当所有公司都必须回答“你准备怎么做AI”时,不花钱本身,也会变成一种需要解释的选择。
*题图来源于哔哩哔哩官方微博。
更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App
Synthetic Leprosy Image Generation Using Mask-Conditioned Latent Diffusion and Transfer Learning from Large Chronic Wound Datasets
Attention Is All You Need (to Avoid Spurious Oscillations)
Dynamic Learning Solutions: A System for Personalized Educational Video Generation
Semantically Aligned Gradient-Driven Context-Preserving Image Editing
New method enables AI for safety-critical situations
MIT researchers have developed a new technique that helps generative artificial intelligence models find solutions to high-stakes problems.
In these settings, a plausible answer is not enough: The output often must also satisfy nonnegotiable safety, physical, or task-specific requirements, known as hard constraints.
The researchers developed a method that helps generative models meet these strict requirements without sacrificing the quality of their outputs.
The key to their technique is to give the model more freedom during the generation process and enforce hard constraints on the final output, rather than at every intermediate step.
In experiments spanning robotics, control of physical processes, and computer vision, the new method consistently satisfied the required constraints while identifying better solutions than existing techniques.
This adaptable, plug-and-play technique works at deployment time, so it can be applied to pretrained generative models without retraining them. It can make such models more useful in applications where safety rules, physical laws, or other strict requirements cannot be violated.
“The promise of generative AI is its ability to explore a rich space of possibilities, but the real world places boundaries on which possibilities are acceptable. Our approach lets us preserve that generative power while enforcing the nonnegotiable requirements of high-stakes or safety-critical applications,” says Navid Azizan, the Alfred H. and Jean M. Hayes Career Development Associate Professor in the Department of Mechanical Engineering and the Institute for Data, Systems, and Society (IDSS), a principal investigator of the Laboratory for Information and Decision Systems (LIDS), and the senior author of a paper on this technique.
Azizan is joined on the paper by lead author Zeyang Li, a graduate student in mechanical engineering and LIDS; and Kaveh Alim, a graduate student in IDSS and LIDS. The research appears this week in the IEEE Transactions on Pattern Analysis and Machine Intelligence.
Freedom to explore
Pretrained generative AI models, such as diffusion models like Stable Diffusion and flow-matching models like FLUX, are now widely available. These powerful models learn to create new data by transforming random noise. Their availability has enabled people to adapt them to a wide range of applications.
These highly capable models excel at providing answers that come close to satisfying most queries, but in safety-critical applications like robot path planning on a crowded factory floor, an answer that is “nearly correct” may not be good enough.
For instance, a “nearly correct” path from one machine to another might still result in the robot colliding with a human co-worker.
In such safety-critical applications, users often employ a technique called projection-based sampling, which repeatedly forces the model’s partial solutions, called intermediate samples, to satisfy strict requirements during the generation process.
But constraining the entire generation process can prevent the model from reaching a better final solution. These methods also typically focus only on satisfying the hard constraints, missing the opportunity to improve other qualities of the solution, like reducing the length of the robot’s trajectory.
“For constraint satisfaction, what ultimately matters is the model’s final output, since the internal process is discarded. By not requiring every intermediate step to satisfy the constraints, we give the model more freedom to find high-quality solutions that are still feasible in the end,” says Li.
The researchers developed an algorithm called HardFlow that steers the sampling process so that the final output satisfies the user’s hard constraints without being overly restrictive and is of higher quality.
Subtle steering
HardFlow reformulates hard-constrained sampling as a trajectory-optimization problem, using tools from the field of optimal control. This enables the framework to steer the model’s sampling trajectory toward a goal, making subtle corrections along the way while enforcing hard constraints on the final output.
“Control theory gives us a powerful framework for formalizing the optimal way of making these corrections,” Azizan says.
But solving the trajectory-optimization problem around an enormous neural network was no easy task. The model may have hundreds of interconnected layers that process data.
To make the problem tractable, the researchers leveraged the structure of flow-matching models to decompose the problem into a sequence of smaller, single-step subproblems. They then applied systematic transformations and approximations to derive an efficient, scalable algorithm that still finds a feasible solution.
“Essentially, we transformed the trajectory-optimization problem into something that preserves the key properties of the original problem, but can be solved very efficiently at deployment time,” Azizan adds.
Reformulating the task as an optimization problem allows HardFlow to incorporate additional goals that can improve the quality of the final answer. For instance, HardFlow could find a collision-free path for a robot that is also the shortest distance to its goal.
“Our framework can jointly handle both aspects, which helps it perform much better than existing methods,” says Li.
Across experiments in robotic manipulation, maze navigation, and text-guided image editing, HardFlow achieved perfect constraint satisfaction while consistently outperforming baseline methods on measures of solution quality.
For example, it enabled a robotic manipulator to avoid collisions with obstacles while also finding the quickest path to the target object. Most other methods either resulted in collisions or found paths that took significantly more time.
In addition, HardFlow’s computation time was comparable to or lower than that of most competing methods.
In the future, the researchers could extend the framework to settings in which the AI model itself can also be updated, so that constraint satisfaction and sample quality can be improved in a more adaptive manner.
Lanterns episode 5: What in the world just happened, and where do we go next?

If you need to take a breather after Lanterns' fifth episode, I don't blame you.
Episode 5 saw Green Lanterns Hal Jordan (Kyle Chandler) and John Stewart (Aaron Pierre) face off with Manhunter Zoe Macon (Poorna Jagannathan) in a battle that left Rushville in ruins. On top of that, it also pitted Hal and John against one another, leaving the role of Green Lantern in flux.
Between these game-changing confrontations and a number of key character deaths, episode 5 truly felt like a season finale. What do you mean, we still have three episodes left? How could Lanterns possibly top this? Let's take a look at what the show still needs to wrap up, and what it's already resolved in its biggest episode to date.
What happened in the Rushville fight?
A better question might be, what didn't happen? Zoe healed John from the wounds he sustained from Hal crashing their car. She then announced a town-wide kill order on Hal, causing the citizens of Rushville to gear up to protect the Manhunter in their midst. She also began obliterating chunks of Rushville with the laser satellite introduced in episode 4.
Meanwhile, Hal went Manhunter hunting in the hopes of delivering Zoe to the Guardians himself. First, he sent Antaan (Paul Ben-Victor) and his vengeful alien crew on a wild goose chase to William Macon's (Garret Dillahunt) compound, claiming Macon was the Manhunter. While Macon put on a convincing performance thanks to some language and backstory coaching from Zoe, Antaan figured out the ruse and killed him. (RIP to Lanterns' resident exhibitionist wife guy.) He tried to go after Zoe next, but Hal tossed him away from her, leaving him to blow up in mid-air. (RIP to the "Antaan is Atrocitus" theory.)
All this is just the prelude to the heart of the Rushville battle: the knock-down, drag-out fight between Hal and John at the motel. The two duke it out over the power ring, unleashing months' worth of resentment before Zoe blows the motel to smithereens. (In a sweet move, or maybe just a practical one, Hal manages to bubble John along with him for protection.) In the aftermath, John uses Hal's prone body as bait for Zoe before sniping her, therefore wiping out the second-greatest threat Hal is facing.
John, Hal's greatest threat, remains alive, and he takes both the ring and the lantern from Hal. But instead of reciting the Oath and taking over as Green Lantern, he tells Guardian Lianna (Laura Linney) he wants no more part of this. After all his traumatic childhood training, all his discipline, all his sacrifice — in the end, putting on the ring feels like nothing. To answer the question Hal poses after their fight: No, it wasn't worth it.
Now, Lanterns is both Lantern-less and Manhunter-less. With these two key elements wiped off the board, what's next for the series?
What comes next in Lanterns?
Now that Lanterns has gotten its Manhunter mystery out of the way, it can focus on its next big mystery: Who killed Hal Jordan?
Remember, episode 1 ended with John and Sheriff Kerry Kane (Kelly Macdonald) examining Hal's corpse at the football field in Rushville, right back where all the Manhunter shenanigans began. Episode 6 will likely pick up in the 2026 timeline, examining what John's life has been like post-Green Lantern training — please let him be an architect now! — and his quest to solve Hal's murder. Hopefully, we'll also find out what Hal was up to in the last decade. Did he stay in Rushville? Did he continue to woo the very married Kerry? Did he remember to feed Earl?
Since Lanterns takes place in 2026, that means that Guy Gardner (Nathan Fillion), first introduced in Superman, is now this sector's Green Lantern. Fillion is confirmed to be starring in Lanterns, but will he be appearing in a goofy cameo, or as an active participant in the investigation of Hal's murder? Plus, will we get more time with Lanterns' more extraterrestrial characters, like Lianna or Sinestro (Ulrich Thomsen)? Or any face time at all with the cosmic fear parasite Parallax, a Green Lantern franchise staple?
The answers to those questions await in Lanterns' last three episodes, but until then, I think we all need to take a nice, relaxing nap to decompress from the madness of episode 5.
TUM 教授 Angela Dai:放下完美数据执念,「逆向自监督」重构 3D 空间智能 | ECCV 2026
2D去噪范式在真实3D遮挡前失效,破局关键在于将物理机制转化为结构先验。作者丨张璐
编辑丨岑峰
大模型在文本与 2D 图像上的狂飙,归功于互联网上近乎无穷的干净数据。但当 AI 试图跨越屏幕、理解真实的 3D 物理世界时,这套经验法则瞬间失效。真实扫描数据充斥着噪点与死角,物理遮挡造成的几何缺失既非随机发生,更无法用简单的去噪算法抹平。面对这一死结,多数团队选择用人工合成数据去“硬碰硬”,却始终难以跨越虚实结合的鸿沟。在 ECCV 现场,慕尼黑工业大学(TUM)Angela Dai 教授展示了一套逆转行业思路的解法:不必强行克服数据的“不完整”,把真实的物理遮挡机制,直接变成算法的结构先验。
这项研究不仅打破了 3D 场景重建中困扰已久的“均值模糊”魔咒,更清晰地标定了空间智能(Spatial AI)从“静态 3D 拼图”走向“原生具身大脑”的技术演进路线。整套破局逻辑由三个层层递进的技术支柱构成:第一,将物理遮挡转化为逆向自监督(SG-NN)。团队先是将传感器的视野拆解为已知空域、已观测表面与未知盲区的三状态编码。团队摒弃对盲区的盲目强行预测,通过故意扣除观测帧构建训练对,用掩码损失(Mask Loss)让物理遮挡本身成为最天然的自监督标靶。 第二,用“几何骨架 + 2D 渲染”破解均值模糊(Seen2Scene)。面对大面积盲区带来的严重歧义,引入可见性引导的流匹配(Seen2Scene)与 3D 高斯溅射(WorldMesh)。由稳定几何提供不漂移、不坍塌的“骨架”,再借由 2D 图像先验反哺高保真“皮肉”,首次将连贯生成的尺度拉伸到了七八个房间的环境级空间。 第三,从生成反哺重构,走向机器人的“主动感知”(GenRecon):将合成场景学到的结构先验反向注入真实重构(GenRecon),更顺理成章地将物理可见性推演至具身智能领域。让 AI 不再是被动接收残缺图像的画师,而是能够预判未观测空间、自主规划最佳探路路径的空间智能体。
以下为演讲全文,雷峰网AI科技评论在不改变原意的基础上,对内容进行了整理与编辑: 
01
数据天然“残缺”:为什么 2D 扩散范式
在 3D 空间彻底失效?
文本和图像生成的爆发,本质上建立在互联网海量公开数据的红利之上。无论是能侃侃而谈的大语言模型,还是瞬间绘图的生成算法,背后都有庞大的文本文献、艺术作品和照片库作为支撑。
【数智周报】DeepSeek扩招150人,为史上单次最大规模招聘;月之暗面报案:网传关于创始人及员工信息系恶意造谣;英伟达斥资129亿美元收购HuggingFace

观点
蚂蚁集团CEO韩歆毅:智能体商业的ChatGPT时刻已经到来
蚂蚁集团CEO韩歆毅在主题演讲中表示,智能体商业的“ChatGPT时刻”已经到来。与此前更多停留在能力展示不同,智能体正在进入真实交易环节,并有望成为新的商业入口。
Anthropic联合创始人兼首席执行官:必须放慢提升AI模型能力的速度

Anthropic联合创始人兼首席执行官表示,我们必须放慢提升AI模型能力的速度。需要明确的是,这并不意味着停止模型训练或技术进步,而是要确保企业有足够的时间对齐并防护其模型,并让第三方评估者对此加以确认。
国内资讯
燧原上市开盘涨188%市值约1700亿元
9月11日,燧原科技上市,开盘报价410元/股,比发行价格142.18元/股涨188%,意味着打新一签(500股)浮盈约13.4万元。截至午盘,燧原股价报收393.78元/股,涨176.96%,总市值1695亿元,而燧原2025年最后一批老股转让交易估值约为182亿元。
DeepSeek发V4.1-Flash取代V4-Pro,价格下调
9月10日,DeepSeek发布最新模型DeepSeek-V4.1-Flash。DeepSeek称,V4.1 Flash模型是其全新模型结构系列中的最小尺寸的模型,具备原生多模态视觉理解能力,在众多基准测试中超越包括DeepSeek-V4-Pro等旗舰模型的智能水平。根据DeepSeek公告,DeepSeek-V4.1-Flash为552B参数的MoE(专家混合)模型,采用新结构后输入和输出不对称,输入激活8B,输出激活16B,成本小于同尺寸模型。
据DeepSeek开放平台公告,于北京时间2026年9月10日12:00起,调整flash系列定价:空闲时段输入缓存命中单价0.02元、输入缓存未命中单价1元,输出单价4元;高峰时段价格为空闲时段价格的2倍。高峰时段是指北京时间周一至周五9:00-12:00、14:00-18:00(其余为空闲时段)。
DeepSeek扩招150人,为史上单次最大规模招聘
9月8日,DeepSeek发布招聘信息,招聘人数达到150人。招聘包含两大方向,一类是服务端开发工程师,覆盖大模型研究平台、Agent框架组件、研发效率基建、DeepSeek API、线上服务、数据工程六大方向;另一类则是Agent弹性计算研发工程师,涉及平台开发和底层系统。DeepSeek Harness团队负责人崔添翼在社交平台称,这个前所未有的150个HC的招聘需求产生的原因是这样的:计算机领域的任何东西量变大之后,就会产生复杂度上巨大的增加,数据的量、机器/容器的量、训练任务的量等等都在急剧增加。这就会让之前的后端系统逐渐不能完美满足将来的量的需求,所以需要大量扩招人来升级、维护和重写各种后端系统。
DeepSeek:9月14日后将继续提供V4 Pro的API调用服务
DeepSeek表示,为响应广大用户的需求,决定在2026年9月14日之后继续提供DeepSeek V4 Pro的API调用服务,计费方式保持不变,如有变动将另行通知。
月之暗面报案:网传关于创始人及员工的信息系恶意造谣
关于月之暗面16名人员被带走的传言在网络发酵后,月之暗面发文称相关消息系“恶意造谣”,已报警处理。
中国社媒平台过去两天流传一张聊天截图,指月之暗面有16名人员被带走,包括创始人杨植麟。月之暗面法务部9月12日在官方微博发文称,网传关于创始人及员工的信息纯属虚构,系恶意造谣。公司已第一时间向警方报案,将依法追究相关造谣者的法律责任,并呼吁外界“不信谣、不传谣”。
腾讯文档推出“AI工作台”
9月8日消息,腾讯文档宣布AI服务全端升级,正式推出“AI工作台”。此次升级中,腾讯文档内的Agent底层框架由WorkBuddy提供,腾讯文档则结合真实文件场景,承接内容生成、编辑、协作、任务执行、文档管理和成果交付。
华为“韬定律”芯片麒麟9050 Pro首现身
该芯片采用先进制程工艺,在算力与能效比方面较上一代大幅提升,主要面向高端智能手机与AI终端设备。华为称,麒麟9050 Pro将搭载于即将发布的新旗舰机型,并在AI推理与影像处理等场景中带来显著体验升级。
科大讯飞发布星火X2.5
该模型在中文理解、数学推理与代码生成等任务上表现提升,并强化了语音交互与多模态能力。科大讯飞称,星火X2.5将应用于教育、医疗、办公等场景,并同步升级相关产品与API服务。
京东启动物理AI加速计划:两年内采集超1000万小时真实场景视频数据
京东正式启动“物理AI加速计划”,依托零售、物流、科技、工业、产发多板块能力,打造贯通机器人产业上下游的一体化服务体系,覆盖数据供给、零部件集采、渠道销售、场景落地、售后维保全环节。
字节跳动获得296亿美元贷款
字节跳动获得了296亿美元的贷款,贷款初始期限三年,最长可展期至五年。花旗集团与摩根大通担任本次融资的协调行。彭博社在9月3日援引匿名信源率先报道了上述消息。9月6日,财新从接近字节跳动人士处确认该消息属实,不过,由于各家银行仍在回签确认各自的承贷份额,交易尚未完成签署。
阿里发布QoderWake 1.0,已有近10万个数字员工“上岗”
9月8日,阿里发布数字员工产品QoderWake 1.0,用户一句话描述岗位需求,QoderWake可生成一份角色文档。用户修改、配置和确认后,即可生成一个理解工作职责、协作关系、工作权限等信息的数字员工。过去三个月,QoderWake上已有近10万个数字员工在真实工作场景上岗,执行约200万次有效任务。
宇树科技首次实现人形机器人全自主搏击
9月7日晚,宇树科技发布视频称,UnifoLM-X2-1.0突破世界-动作大模型瞬时规划、决策和动态交互执行等瓶颈,实现高动态、强交互、实时实现对未来预测和规划,实现人形机器人全自主搏击。验证了世界模型驱动的人形机器人大规模落地部署的基础可行性。
原飞书产品副总裁施凯文放弃创业,加入某大模型公司担任产品合伙人
前飞书产品副总裁施凯文已终止其端侧AI Agent创业项目,选择加入某大模型公司,担任产品合伙人。此前报道,施凯文于6月底从字节离职,在端侧Agent领域创业,并拿到红杉中国与锦秋基金的投资。知情人士透露,由于施凯文的创业项目处于早期阶段,产品尚未正式推出,融资可能也未完全到位,或仅使用了一小部分,所以项目才能终止得如此迅速,还没来得及大规模招人、烧钱、铺渠道。至于红杉和锦秋已投的资金,大概率是退还投资或协商处理。施凯文是知名连续创业者。2019年,施凯文加入字节跳动,负责飞书产品方向。他深度主导了飞书多维表格的产品演进,并推动飞书向AI协作工具转型。
消息称字节正开发实时空间视频生成AI模型:最快下个月发布
9月7日消息,据报道,字节跳动正准备推出一款实时空间视频生成AI模型。该模型计划最早于下月发布。知情人士指出,发布时间尚未最终确定,计划仍可能发生变动。据介绍,该模型基于字节跳动现有的电影级视频生成AI模型Seedance构建,将允许用户面向直播、短剧和游戏创建交互式虚拟世界。
蚂蚁集团AI安全实验室登顶CyberGym榜单,漏洞验证成功率98.5%
AI安全能力评测基准CyberGym更新榜单。蚂蚁集团AI安全实验室研发的天工Cyber模型与天工Harness以98.5%的漏洞验证成功率登顶榜单。据介绍,天工Harness融合了自研天工Cyber模型以及DeepSeek V4 Pro、Qwen 3.8 Max等国产大模型的能力,可完成漏洞分析、PoC构造和结果验证,覆盖复杂软件漏洞验证的端到端流程。
阿里云:Token Plan个人版升级,新增12类Agent Harness工具
阿里云Token Plan个人版升级。据介绍,原有价格及Credit额度保持不变,Standard和Pro套餐新增Agent Harness工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等12项Agent开发常用能力。
月之暗面官宣企业合作伙伴“登月计划”,首批签约多家上市公司
月之暗面正式启动Kimi企业合作伙伴“登月计划”,将以FDE模型(Forward Deployed Engineer)与各行业系统集成商共建前置部署工程师队伍,深入客户现场,推动大模型进入企业核心业务流程。这也是国内首家采用FDE模型进行AI末端部署的大模型公司。首批签约伙伴包括中软国际、金山云、华胜天成、亚康股份、亚信科技等,覆盖软件信息服务、通信、基础设施、云计算等领域。该计划将持续面向IT服务商、软件服务商及咨询机构开放。
阿里辟谣钉钉创始人“无招”回归
近日有消息称,钉钉创始人无招(陈航)已重新回归阿里,组织关系纳入千问办公事业部。对此,阿里方面回应称,该消息不实,无招并未回归千问办公事业部。今年6月,阿里宣布钉钉管理层调整,陈航卸任钉钉CEO,由陈宇森接任。目前钉钉与千问办公同属千问办公事业部。
海外消息
Adobe第三财季营收、利润双双超预期,AI产品ARR增150%,Q4指引略逊于预期
Adobe公布2026财年第三财季业绩,营收达67.6亿美元,同比增长13%,高于市场预期的67亿美元,并创下公司第三财季纪录;GAAP净利润为18.27亿美元,同比增长约3%;非GAAP摊薄每股收益为6.13美元,高于分析师预期的6.08美元。Adobe表示,其“AI-first”年度经常性收入(ARR)同比增长超过150%;创意和生产力解决方案的月活用户数突破10亿。
Anthropic控告中国大模型泄露中国用户数据给其模型用于“蒸馏”训练
美东时间9月10日,美国大模型公司Anthropic发布了一份长篇报告,其中指控DeepSeek、小米、月之暗面等中国AI实验室存在不当使用用户数据的行为。按照Anthropic的说法,DeepSeek、小米、月之暗面等公司将用户与中国大模型之间的对话内容输入Claude,再将Claude生成的回复用于训练中国大模型,以“蒸馏”Claude的能力。
中国商务部称美国官方对中国大模型工业规模“蒸馏”美模型的指控,于事无凭,于法无据。
ARM自研AI CPU获两大中国客户
9月8日Arm Everywhere China年度大会上,ARM宣布,已引入联想集团和字节跳动火山引擎两家新合作伙伴,后续将在中国市场部署ARM自研芯片AGI CPU(通用人工智能中央处理器),其中,火山引擎已将首批基于该平台的智能体沙箱推向市场。
前OpenAI员工现任Anthropic研究员辞职,称两大AI巨头拿人类命运赌博冒险
据外媒报道,曾在OpenAI工作的Anthropic研究员雅各布·考克森宣布辞职。过去3年,他先后在OpenAI和Anthropic两家AI巨头从事预训练研究。考克森发出警告称:“两家公司的做法都不负责任。它们争相开发能够自我改进的超级智能,拿我们的生命下注。”考克森于2023年加入OpenAI技术团队,2026年7月转赴Anthropic担任研究员。在OpenAI期间,他参与过GPT-4o的研发。
OpenAI放弃今年上市
当地时间9月12日,据报道,OpenAI首席执行官山姆·奥尔特曼在采访中表示,鉴于对人工智能的安全担忧,OpenAI不会在2026年上市。其称:“实际上,考虑到目前围绕安全问题发生的一切,我认为现在上市并非明智之举,而且我们对此并不感到压力。”
当奥尔特曼被问及是否已放弃2026年转而考虑2027年时,他表示:“我会说不是2026年。是的,我们还有很多工作要做,比如应对当前在安全性和目标一致性方面所面临的要求,以及行业和政府如何合作。”
Oracle通过客户预付款控制资本开支
9月10日,Oracle公布季度业绩超出华尔街预期,当季营收增长30%至193亿美元(约合人民币267亿元)。且现金消耗低于预期。本季度,Oracle签订了超过300亿美元的新增AI云合同,将其营收积压订单推高至6640亿美元,高于分析师预期。Oracle还表示,大部分新签约的营收将不需要在芯片上投入大量现金支出,这有助于其维持900亿至950亿美元的年度资本开支目标。
英伟达斥资129亿美元收购开源AI社区HuggingFace
HuggingFace是全球最大的开源AI模型与数据集托管平台,汇聚了数百万开发者与数十万个预训练模型。此次收购将帮助英伟达进一步整合AI开发工具链,巩固其在AI基础设施领域的生态优势。英伟达表示,交易完成后HuggingFace将保持独立运营,继续向社区提供开源服务。
OpenAI推出新模型GPT6
该模型在推理能力、多模态理解与长上下文处理方面较前代显著提升,并进一步降低了幻觉率。OpenAI称,GPT6将率先向企业客户与付费用户开放,随后逐步扩展至免费用户。分析人士认为,GPT6的推出将进一步加剧大模型市场的竞争。
OpenAI最强AI生图模型:ChatGPT Images 2.5
9月9日,OpenAI官宣ChatGPT Images 2.5,图像生成延迟最多降低50%,并新增Sketch草图参考、模板库、图片内评论标注等实用功能,是该公司当前最先进的图像生成模型。相比较2026年4月发布的Images 2模型,Images 2.5重点降低了图像生成延迟,在细节锐度、自然光照和纹理丰富度方面均有提升的情况下,延迟最多降低50%。
OpenAI AI智能体曾攻击RubyGems,涉及利用未知漏洞窃取凭证
OpenAI正在测试的AI智能体今年5月曾攻击软件包平台RubyGems,研究人员称其利用服务器中的未知漏洞试图窃取用户凭证,并在RubyDoc.info服务器上运行代码。OpenAI已确认相关事件,称其智能体当时通过RubyGems访问互联网以执行无害任务并获取公开信息,目前仍在调查。这是OpenAI AI智能体至少第三次攻击其他公司基础设施,此前还曾入侵一个德语维基网站,并涉及今年7月发生的Hugging Face事件。
英伟达据悉正就向Anthropic的IPO项目投资高达100亿美元进行谈判
相关报道援引知情人士称,英伟达正与Anthropic洽谈,考虑以基石投资者身份参与其IPO。Anthropic此次IPO计划募资最高1000亿美元,估值或达约2万亿美元;英伟达考虑投资最多100亿美元。据悉,Anthropic计划在今年11月美国中期选举前完成上市。若成行,英伟达将进一步加深与这一主要客户的合作关系。Anthropic目前高度依赖英伟达GPU,同时也在扩大对亚马逊、谷歌等芯片及算力供应商的合作。
DeepSeek:9月14日后将继续提供V4 Pro的API调用服务
DeepSeek表示,为响应广大用户的需求,决定在2026年9月14日之后继续提供DeepSeek V4 Pro的API调用服务,计费方式保持不变,如有变动将另行通知。
谷歌推出Gemini Windows桌面应用,支持快捷键唤起AI助手
谷歌宣布推出Gemini Windows桌面应用,支持Windows 10和Windows 11,可通过“Alt+Space”快捷键快速唤起Gemini,在当前工作界面直接获得AI帮助。该应用支持多步骤任务处理,可调用Gmail、Google Drive等应用中的信息生成内容,并支持通过Nano Banana生成图片、使用Gemini Omni生成视频。谷歌表示,更多原生桌面功能将陆续推出。
OpenAI推出金融版ChatGPT:集成GPT-6 Astra,支持建模与研报
OpenAI周四推出一款专为金融服务设计的新版本ChatGPT,用于帮助开展公司研究、分析金融数据,
[分享创造] 整理了一个 GPT Image 2.5 开源提示词合集, 30 个图文案例,聊聊怎么做的
最近做了一个 GPT Image 2.5 的开源提示词合集,第一版刚整理完:
- 30 个图文案例,覆盖摄影、产品图、时装广告、平面设计、连续分镜等。
- 20 条配套修改指令,比如修标签、去掉多余文字、保持人物一致性。
- 提示词和 README 都有中英文版本。
- 原创提示词、文档和脚本采用 MIT 。
GitHub 地址:
https://github.com/VulcanEon/insane-gpt-image-2.5-prompts
先交代一下关系:我自己在做 gptimage25.ai,这个仓库也是由这个项目维护的。网站是商业服务,仓库公开可读,复制提示词不需要注册网站。
起因是看到朋友做了一个类似的合集,觉得“先看图片,感兴趣再展开提示词”的阅读方式挺好。尤其是对不熟悉摄影、设计术语的人来说,看图选方向,比面对一个空输入框容易很多。
于是参考了这种呈现方式,自己重新找案例、分析画面、写提示词。这次也让 GPT-6 帮忙完成了资料整理、双语改写和仓库搭建。
实际做下来,找图只是第一步
最初的思路很直接:去 X 搜 Image 2.5 ,找到有意思的案例,再分析它可能是怎么生成的。
实际遇到了登录限制和搜索收录不完整的问题。最后通过公开搜索、帖子索引和其他合集里的链接发现线索,再读取公开帖子信息、查看对应图片。
目前 30 个图文案例里,19 个来自 X 帖子,11 个来自平台公开展示页。来源类型都有记录,每张图也能点回原帖或原页面。
整理时最容易混淆的是:看到一张图,不等于知道作者到底用了什么 prompt 。
有些作者会公开完整指令,有些只发结果。即使有指令,也可能缺少参考图、前面的对话,以及后续修图过程。
所以仓库里区分了两类:
- 画面推导:根据看到的构图、主体、光线和材质,写一条合理的新指令。
- 编辑改写:来源有公开指令,再独立编写适合复用的版本。
这些都标明了状态。配图是来源案例,改写后的提示词还没有逐条生图验证,不能当作“一键复现同款”的保证。
比起增加形容词,我更想把检查方法写进去
比如同样是产品图,光写“高级、真实、商业摄影”,生成后其实不太好判断哪里需要改。
换成具体要求就清楚一些:
产品标签正对镜头,保留瓶盖颜色与瓶身比例。人物在后方柔焦,手指不能挡住品牌名,左上留出后续放文案的位置。
对应的检查也很具体:标签有没有变字,手指和瓶子有没有粘在一起,瓶身比例是否改变。
因此每个案例除了图片和提示词,还列了所需参考图、画面分析,以及生成后应该先检查什么。站内另有一个提示词浏览页,可以按自己的任务找起点,再替换主体、文案和构图要求。
看案例时还发现了一些值得保留的问题。
例如,有作者只是想生成照片,模型却在背景和物件上加了不少没要求的文字。仓库保留了两个这样的失败案例,配上新的约束写法。它们能帮助读者理解:整体看起来不错,局部也可能完全不符合要求。
还有一些看起来很顺畅的动画案例,实际结合了生图与后续切帧、合成。精灵图或分镜表本身仍然是静态图片,这部分也单独写清楚了。
仓库做了一点方便后续维护的东西
内容放在 JSON 里,由 Python 脚本生成两份 README 、独立案例页和来源登记。后面补案例可以改数据再重新生成。
另外加了校验,检查重复 ID 、双语字段、来源信息、内部链接和锚点。GitHub Actions 已经跑通,发布后也检查了图片加载。
这类合集后面比较容易出问题的地方,可能就是图片失效、来源改了、目录没同步。这些基础工作先补上,后续维护会省事一点。
想试具体提示词,可以用自己已有的工具,也可以在我们的文生图工作区里运行。网站生图需要付费,提交前会显示积分估算;开源合集本身没有这个限制。
最后说明一下协议范围:MIT 覆盖仓库原创内容,外部案例图片仍保留各自权利,并不会因为出现在开源仓库里就自动获得商用授权。
后续想优先补充实际复现记录,包括用的模型、参考图、改过几轮,以及失败在哪。如果大家用过类似合集,也想听听:对你来说,最有用的是完整提示词、参考图,还是逐轮修改过程?
[程序员] 记录一下最近 2 个月做 Ozon 工具和一次未开始就散掉的合作
2026 年 7 月初,萍萍给我打了个微信语音。
她是我发小方斌以前的同事,前几年我们去杭州时认识的。电话里她向我打听中转站和 AI 图片生成的事,说她和江苏的一个“表哥”合作,搞了个 Ozon 精铺的上架工具,跑得不错。我当时没太深聊,俄罗斯跨境电商这块我确实没碰过。
方斌前些年一直做房产销售,这几年行情低迷,我们常聚在一起琢磨新出路。那天我顺嘴把萍萍做的事跟他提了一句。
他们都在襄阳,离得近。方斌很感兴趣,隔两天就跑去见了萍萍。又过了两天,方斌打来电话,声音透着兴奋:这软件需求很大,他也跟着发了两天短视频,居然真收了几个付费客户。
只是原工具问题太多,图片动不动就生成失败,客户天天群里开骂。
方斌把软件发了过来。其实就是一个普通的 Chrome 扩展,得手动拖进浏览器安装,还得用户自己配各种 API Key ,门槛极高。生图逻辑走的是中转站的同步请求,网络稍有波动直接超时报错。
“这东西用 AI 跑,一个礼拜就能推出来。”我对他说。
那几天手头事少,我写好提示词丢给 AI 跑代码。零零散散折腾了一周,把最卡脖子的生图改成了异步任务队列,把断连报错彻底抹平。
图片刚稳下来,萍萍就打包甩过来 130 张用户的报错截图,红红绿绿的一大片。
萍萍那几天在外面培训,说当晚回襄阳,第二天表哥也会到,问我能不能去一趟,大家碰个面。我想着技术闭门造车容易跑偏,不如去一线摸摸真实的业务痛点,就应下了。
第二天傍晚到襄阳,刚出火车站,三十八度的大热天,空气像蒸笼。
我们直接去的饭馆,老板是熟人,姓胡,和我本家。那晚我们男的喝了两瓶白酒,女的喝啤酒。一瓶酒见底,那位表哥满嘴跑火车,句句带脏字,我听得直皱眉。第二天下午跟方斌去萍萍办公室,路上方斌私下跟我透露,表哥身上还背着债务官司。
那一刻,跟这位表哥合作的选项在我心里直接划掉了。我把想法跟方斌一说,他也点头。
我在襄阳扎了一个礼拜,每天看他们操作。必须承认,不直面业务现场,架构很容易走弯路。
但我看来看去,越看越觉得不对劲:这种本地插件完全是保姆式服务,一个人远程帮客户配半天,一个月收小几百块钱。手头几十个客户一出问题,全天时间直接报废。
大家坐下来复盘,都认同插件是死路,必须做成 SaaS 网页版——用户线上注册、在线订阅、自动扣费、支持子账号。
做 SaaS 我太熟了。方向一定,我当天就拉了仓库开干。
可刚搭好架子,三个人就在套餐定价和 token 单价上卡了壳。我认为 token 价格留点空间,后续做活动、打折都有运营余地;萍萍则死咬着要定最低价。争了好几天,直到我必须回东莞,也没争出定论。
转眼到了 8 月,朋友家小孩升学宴,刚好顺路带家里两个孩子出去走走。一车人开到了湖北,兜兜转转又进了襄阳。我心里其实想借着这趟,把三人的分工、股权和价格体系彻底落定。
萍萍的意思依旧是:等系统上线了再坐下来谈。
我心里隐隐觉得不太妥当,但既然来了,我把自己关在酒店里写了几天代码。走的那天,生图和基础流程通了,但特定类目上架依然有报错。这次碰面,最关键的合作模式还是悬在半空。
回到东莞,我心里越来越沉。做软件都有迭代周期,不可能一上来就零瑕疵。但萍萍和方斌每天发过来的微信,永远是紧绷的质问:“为什么这里又不行?”“那里怎么又卡住了?”
8 月 15 号,我带一家人在汕尾。前一晚萍萍和方斌长谈了一次,想法满天飞:一会儿说客户全在自己手里,自己得分七成;一会儿又问能不能贴牌。同时还在电话里抱怨表哥,说原系统的收款账户被表哥偷偷改成私人的了。
那通电话里,萍萍的精神状态明显已经紧绷到了极限。
我回拨了一个电话给她,劝她先冷一冷。这些客户只是躺在个人微信里,产品用完即焚,没有任何沉淀,天天救火根本不是办法。另外我也挑明了:系统已经完成了 80%,大家必须把合作性质讲透,是合伙、贴牌,还是纯外包?
她没接话,依然追着问:“那到底什么时候能用?”
我当时心里极不情愿,但还是给了个死线:“9 月 1 号。”
接下来的半个月,我通宵达旦地赶工。会员管理、代理分销、子账户体系、在线充值、套餐订阅……9 月 1 号当天,这套系统准时上线。
刚推上去,他们测了两个商品,有一张门禁卡卡在 Ozon 上架的最后一个字段上。
方斌打电话过来反馈。我解释说 Ozon 平台类目规则极其繁杂,这种字段缺失很正常,抓到日志打个补丁很快就能解决。
但我不想再拖了,我在电话里问他:合作到底怎么定?
方斌说,萍萍提议三个人平分股份。我没犹豫,一口答应了。
可方斌转头去跟萍萍通气,带回来的却是拒绝。不仅如此,方斌还在电话里跟我交代了另一件事:早在 8 月 25 号,他和萍萍悄悄去了一趟武汉,找了萍萍一个开公司的朋友,对方养了 5 个技术。
谈的条件是:3 万块接盘外包开发,后期再拿 10% 的流水抽成。
听到这笔账,我整个人坐在椅子上半天没吭声。
我问方斌:“你是怎么想的?”
方斌在电话那头叹了口气,给我的评价是:“你太固执了。”
那天电话聊得很僵。我在这行干了十几年,他是做房产销售半路转过来的。一个是技术逻辑,一个是市井算盘,谁也落不在一个调子上。挂完电话,整个人像虚脱了一样,脑子里一片恍惚。
过了几天,我看着线上刚修完的几个 bug ,心里还是觉得发小之间不该弄成这样。我给方斌发了条消息,让他来一趟东莞,大家把 Ozon 和 WB 的流程当面推一遍,把所有的信息差磨平。
他来了。
可一坐进办公室,空气又冻住了。他说客户还是觉得老插件好用,没网页版这么绕。
我指着屏幕:“当初推翻插件做 SaaS ,不是大家一致认同的吗?老用户不习惯那是路径依赖。既然当初认准了这条路,哪怕第一版跑出来是一坨屎,大家也得一起咽下去,再靠版本迭代慢慢修。”
方斌坐在对面,神色游离。聊到最后他才说,萍萍又跑去武汉找那家团队了。
下午他要去深圳见个朋友,我开车送他。车开在高速上,他看着窗外,淡淡说了句:“黑,我明天就回去了。”
那一瞬间我就明白了,他心里早就有了选择,只是我不愿意承认。
第二天下午,我把他送到宝安机场。
第三天晚上,他给我发了一个武汉公司给的开发文档。
实锤了。我看着屏幕,打字回了他一句:祝你顺利。
他回了我一个流汗的表情。
我回:“啥情况?”
对话框彻底安静了,对面再也没有说话。
那一晚我做了各种各样的梦,梦见 2002 年的那个夜晚,我翻过铁门去跟他挤在一张小床上,两个人在屋里喝酒、抱头痛哭。
第二天上午,也就是今天上午,我重新打了个电话给他。
他在电话里跟我说,对方答应可以提供全部源码。我听完,像往常一样跟他交代了两个最关键的底线:“第一,域名必须掌握在自己手里,自己去注册;第二,支付必须用自己的个体户执照,走微信和支付宝官方接口。另外,让萍萍把身份证备案的那个域名注销掉,表哥已经把原系统的支付接口改成私人的了,留着是雷。”
电话挂断,事情彻底翻了篇。
今天下午,我开通了抖音和视频号,发了第一条视频,标题就叫:车还没开,人先散了。
关上办公室的门,我开车回家的路上,看着沿途的路灯一盏盏飞速向后退去,恍惚之间,又好像回到了二十多年前在 107 国道上晃荡的那些夜晚。
车是散了,但路还在。开通这个账号没别的心思,既然退无可退,那后面这趟车,我自己一个人把它开下去。
A20 Pro 芯片 AI 跑分曝光:苹果 iPhone 18 Pro NPU 较前代最高增幅 51.53%
IT之家 9 月 13 日消息,在 CPU / GPU 跑分曝光之后,苹果 iPhone 18 Pro(对应机型 iPhone19,2)的 GeekBench AI 跑分昨日(9 月 12 日)现身,相比较 iPhone 17 Pro 最高增幅为 51.53%。
IT之家发稿前查询 GeekBench AI 跑分平台,目前共收录了 2 条记录,分别是 Core ML 调用 GPU(通用图形计算单元)和 NPU / ANE(专用神经网络处理器)处理结果。

Core ML 是 Apple 的机器学习运行时,可以利用 CPU、GPU 和 Neural Engine,并以性能、内存占用与功耗为目标来调度模型。
根据跑分页面信息,苹果 iPhone 18 Pro 的 GeekBench AI GPU 为 12,775 / 24,077 / 26,951,Neural Engine 为 7,002 / 55,720 / 75,810。


IT之家注:这三个栏目主要衡量同类 AI 任务在不同精度下的端侧推理表现,Geekbench AI 使用真实机器学习测试,并将相应工作负载的结果汇总成分数。
| 栏目 | 常见数据格式 | 衡量重点 | 现实意义 |
|---|---|---|---|
| Single Precision | FP32,32 位浮点 | 高精度浮点推理吞吐 / 延迟 | 兼容性和数值精度较好,但带宽、内存和计算成本高 |
| Half Precision | FP16,16 位浮点 | 半精度神经网络推理能力 | 现代本地 AI 很常见,通常明显更快、更省内存和电量 |
| Quantized | 通常 INT8,但实现可因框架而异 | 整数 / 量化模型推理能力 | 常最接近日常部署型端侧模型,目标是低延迟、低功耗、小模型 |

在 GeekBench AI 的 NPU 跑分对比方面,IT之家按照发文前 GeekBench 平台的 AI Benchmarks 跑分记录作为对比:
单精度(Single Precision):
| 芯片 / 代表设备 | 得分 | 与 A20 Pro 的分数差异 | A20 Pro 增幅 |
|---|---|---|---|
| A20 Pro(iPhone 18 Pro) | 7,002 | — | — |
| A19 Pro(iPhone 17 Pro) | 5,111 | +1,891 | +37.0% |
| A18 Pro(iPhone 16 Pro) | 4,575 | +2,427 | +53.0% |
| M5(11 英寸 iPad Pro) | 5,411 | +1,591 | +29.4% |
半精度(Half Precision):
| 芯片 / 代表设备 | 得分 | 与 A20 Pro 的分数差异 | A20 Pro 增幅 |
|---|---|---|---|
| A20 Pro | 55,720 | — | — |
| A19 Pro(iPhone 17 Pro) | 36,772 | +18,948 | +51.5% |
| A18 Pro(iPhone 16 Pro) | 32,910 | +22,810 | +69.3% |
| M5(11 英寸 iPad Pro) | 41,100 | +14,620 | +35.6% |
量化(Quantized):
| 芯片 / 代表设备 | 得分 | 与 A20 Pro 的分数差异 | A20 Pro 增幅 |
|---|---|---|---|
| A20 Pro | 75,810 | — | — |
| A19 Pro(iPhone 17 Pro) | 50,411 | +25,399 | +50.4% |
| A18 Pro(iPhone 16 Pro) | 45,348 | +30,462 | +67.2% |
| M5(11 英寸 iPad Pro) | 57,553 | +18,257 | +31.7% |
苹果 A20 Pro 的 NPU 部分采用“双 16 核”神经网络引擎设计,共计 32 个核心。苹果还加入新一代神经加速器,8 位浮点运算速度提升至 2 倍;芯片内存带宽同步提升 50%,以支持设备端模型和更复杂的推理任务。对于用户体验而言,本次 NPU 升级主要带来以下升级:
更快的端侧大模型推理(例如更流畅的本地 AI 助手、实时翻译、文本 / 图像生成)。
更强的相机 AI:夜景、人像、视频防抖、对象跟踪、实时特效等更复杂算法可以在本地实时跑。
更持久的 AI 体验:由于 NPU 能效通常优于 CPU / GPU 做同类 AI 运算,电池消耗会更可控。


