首页 > 调查 > 正文

支付宝

阿里最强图像模型,变了_我的网站

千金女佣

一 |     8月26日消息,微软资深工程师Raymond Chen在博客中回顾了一段Windows 95发售前的插曲:包装盒上的防伪全息图因婴儿图案被某国政府认定涉嫌裸体,微软不得不紧急更换设计。     Windows 95包装盒上的防伪全息图最初设计为一个婴儿坐在电脑前的场景,转动包装盒时,全息图会显示婴儿指向显示器上的微软Logo。    今天,7月21号。         阿里发布了它最强的图像模型,Qwen-Image-3.0,接下来,估计你会看到一大堆实测;发布会官方的关键词,就一个字:实;内容丰实、细节真实、知识厚实;三个词,阿里自己给的答案。         但我想退一步,先问一个问题:图像模型发展到今天,到底在比什么?          搞懂这个,比看一场花里胡哨的演示重要得多。         为什么这么说?          过去几年,你对AI生图的印象,大概还停在「画得像不像、美不美」这一层。手指头画对了没,光影真不真实,AI味重不重。    问题出在婴儿上半身没有穿衣服,某国政府在审查进口商品时认定这一设计涉及儿童裸体,理由是“既然上半身没穿衣服,下半身应该也没穿”。         这套比赛规则里,图像模型是个画师,考画功。          修改后的第二版全息图给婴儿穿上了上衣和背带裤,但由于赶工进入生产,新版婴儿的手臂角度发生了变化,不再指向显示器上的微软Logo。         Chen在博客中提到,原版无上衣婴儿的全息图有一段短视频记录,第一批印有无上衣婴儿全息图的Windows 95包装盒成为了稀有收藏品。

二 |     

    Chen写道:“Windows会激发每个人的罗夏测试本能,如果你的包装盒上的婴儿没穿上衣,那你手里的是一件真正的收藏品。可这场发布会,阿里声称的所有升级,指向的都不是画功。         是另一个指标:一张图里,能装下多少东西。”     Chen在博客末尾补充了一个时间巧合:Windows 95在1995年8月24日发布,Windows NT 4.0在30年前的同一天发布,Windows XP也在25年前的同一天进入制造阶段,三个里程碑都落在8月24日。

三 |          说一个最直观的数字。

四 |               

     【本文结束】如需转载请务必注明出处:      责任编辑:黑白     文章内容举报     

五 | 提示词长度。上一代Qwen-Image-2.0,一次最多吃进去1K token的指令。3.0直接拉到了4.5K。翻了4.5倍。

六 |          这意味着什么?          过去你给图像模型下指令,只能压成一句话。现在你可以像给设计师写需求文档一样,把画面结构、文字内容、排版细节,完整地写进去。

七 |          发布会现场演示的一条提示词,3700个token,折合约13000个字符。什么概念?一份小型说明书的体量。         这份说明书生成了什么?          一张九宫格。九个格子,九个不同学科的知识图解。

八 | 数学公式、几何图形、逻辑推导,各画各的,互不串门。

九 | 一条指令,一次生成。         作为对照,现场把同一条提示词喂给了2.0;超出1K限度之后,模型就开始「胡字」,连九宫格的框都排错了位置。         另一组演示往纵深走,让模型生成一个VSCode编程界面,界面里打开着千问App,App的聊天窗口里躺着一张手冲咖啡海报。         三层界面套娃,每一层的结构和风格都要对,最里层海报上的文字还得清晰可辨。         官方演示里,手机截图上的时间数字,小到只有10个像素,现场还把一张YouTube界面图放大20倍来看,这些字小到只占原图的1%,字字可辨。

十 |          把这些演示摆在一起,动作是同一个:          往一张图里塞进更多的东西。更长的指令、更多的画面、更深的嵌套、更小的字;塞进去,还要保证每个字都是对的。

十一 |          这就是「实」的人话版本:信息密度;图像模型比赛项目,正在从「画得好不好」,换成「装得下,装不下」。         ......          问题来了:一张图塞这么满,给谁看?谁买单?          这就要算一笔账了,图像模型这门生意,主流模式简单到有点原始:按产出量。

十二 |          我查了一下现在市面上的计费方式。国内厂商的图像API,普遍按张收费,生成一张收一张的钱。         OpenAI的GPT-Image-2按token计费,产出的图越多越大,token烧得越多。名目不同,骨架是同一副:客户为产出的量买单。         阿里的3.0目前还在公测申请阶段,没有定价;不过,记住「按量收钱」这四个字。我们再回头看发布会上一个不起眼的案例。         讲商业化的架构师举了短剧行业:          过去客户做一部短剧的前期素材,人设图、场景图、每个镜头的分镜图,要一张一张生成,几十张起步。现在这些元素可以融在一张图里,一次出完。         官方的原话:过去生成几十张图的事,今天一张搞定。         这笔账发布会没有算下去,我替它算完;按量计费的模式下,几十张变一张,客户这个环节的账单就压到了原来的几十分之一,单价一分没动,客户掏的钱少了一个数量级。         这不是短剧一个行业的特例。

十三 |          讲到办公场景时,同一位架构师又算了一笔时间的账:过去自己调一个复杂的PPT页面,字号、字距、排版一处处抠,要半小时甚至一小时,用3.0生成,最快半分钟。

十四 |          张数的账、时间的账,算的是同一件事:图的信息密度越高,客户为一份可用素材付出的成本就越低。         C端是同一个逻辑的零售版。         发布会上,千问App的产品经理举的例子是手帐和社媒封面;过去要找模板、挑图、拼字、调排版,做到一半就想放弃。现在一句话丢给模型,文字、排版、贴图一次成型。         企业省账单,个人省那个熬夜拼图的晚上,这大概就是信息密度在商业上的真实身份:一种不打价格战的降价。         直接降单价是价格战,人人都会,也人人都伤,把降价做成技术能力就不一样了:一张图装得下九张图的内容,等于用一张的价格卖九张的货。         而这个折扣,只有装得下的模型给得起,想给同样折扣的对手,得先把4.5K token的长指令、互不干扰的排版这些能力做出来。         降价,被做成了门槛。         这也解释了为什么发布会把GPT-Image-2挂在嘴边。

十五 | 那是目前公认的天花板,也是把文字渲染、信息图当主打能力的模型。

十六 |          两家瞄着的是同一个方向:图不再是画,可以直接商用的信息载体。         方向对不对,市场用脚投票;各家走到哪一步,得看第三方的尺子。         这里如实交代一句:阿里闭源旗舰没有上过第三方盲测榜,今天「仅次于GPT Image」的信息,来自自家评测,毕竟还没放出来。

十七 |          但这笔降价的账,往下多想一步,会碰到一个悬着的问题:          按量计费的生意,收入等于单价乘以量;信息密度把客户要买的量压掉一个数量级,单价又没人敢涨。这门生意的收入,以后从哪里长出来?我不知道。         能确定的只有一件事:这个能往图里塞东西的本事,正在变成竞争的胜负手。         ......          既然是胜负手,为什么偏偏只有这几家能做到?因为回头看那些演示,考的都不是画笔。

十八 |          把10个像素的字写对,考模型认不认识这个字。九个学科各画各的、互不串门,考它知不知道对数函数长什么样、蜻蜓的翅膀分几节。         三层界面套娃不乱,考它捋不捋得清「界面里的App里的聊天窗里的海报」这种嵌套关系;这些能力拼在一起,有一个统一的名字:语言模型的能力。         文字渲染、世界知识、长指令理解、逻辑结构,没有一样是传统图像模型的看家本领,全是从大语言模型那边外溢过来的。         外溢还有一个更直接的证据:编辑。         这一代模型把生图、编辑做进了同一个架构。官方的说法是,文生图里积累的文字渲染、细节质感和世界知识,会自然迁移到编辑场景。         所以,你能看到古画修复前后文字不丢、手绘草图直接转成PPT这类演示;能迁移,说明这些本事长在底下那个理解世界的模型里。         另外,线上发布时,有一句话值得单独摘出来。         演示九宫格时,技术负责人说,这个case试了目前市面上的模型,只见到两个能做到;一个是千问3.0。另一个他没点名,语境里指向GPT-Image-2。

十九 |          注意这两家,都是先把语言模型做进第一梯队,再回头做图像的公司。         牌桌上剩下这两位,不是巧合,图像模型的门槛,已经挪到了语言那一侧。         发布会的结尾也在往同一个方向指,外部嘉宾被问到还期待什么,他说:「我发一张图给你,你捣鼓完直接返我十张能用的。」          技术负责人接的词是agentic image generation。

| 他管这叫三思而后行:一思用户意图,二思收集素材,三思整合统筹。最后才轮到生成。         四步里,前三步全是语言模型的活;生成,那个我们以为的主角,排在最后一步。         我翻了翻这条产品线的发布记录,商业身段的变化也对得上。         1.0在2025年8月发布时是开源的,那是千问递给开源社区的一张名片;2.0起,旗舰不再开源。到今天的3.0,直接走API公测申请。

|          开源线没有断,早先的编辑模型至今仍是开源阵营里最能打的,只是旗舰收进了柜台。         会画图的模型,开源社区里已经不稀缺了;会读需求文档的模型,稀缺,收进柜台的是后者。

|          90分钟的发布会,讲一个图像模型,拆到最后,图像可能只是入口,一个「实」字背后,是提示词变成需求文档,一张图当九张图卖,是画画的本事让位给读题的本事。         再往前一步,问题就变成了:          当塞图的能力全部来自语言,图像模型还是一个独立的物种,还是语言模型的一个输出头?          这个问题很有意思。不过看演示的方向,阿里自己可能也在思考。它只是把每一步都往「更实」的方向踩,踩到哪算哪。         我先把我听到、理解后的思考发出来;回头体验一下,也许会有新想法。

Current article:http://d9n.cuancuguanzhongnieqinyazhun.cyou/wjnc475/20260826/96000.html

Published on:04:23:12


[责任编辑: 辛开石戏]

评论

 
[ 正定:古城燃动“夜经济” ]  [ PM2.5 falls 6.2% across China in first seven months, water quality improves ]  [ 《地铁 2039》全新预告片亮相 2026 科隆游戏展,2027 年 2 月发售 ]  [ 신한은행, 고금리 가계대출 금리 인하 1년 연장 ]  [ Alligator Kills Person in South Carolina, Dragged Man into a Retention Pond ]  [ “2024北京榜样”大型主题活动启动 ]

 
  • 关于我们 | 我的网站 版权所有

    Copyright ? 2019 我的网站 All Rights Reserved