诗人继续沉默,AI灿烂烟火

诗人继续沉默,AI灿烂烟火

松鹅 · 2022-10-15

诗人继续沉默

某天我偶然发现了亚伯拉罕•耶霍舒亚的《诗人继续沉默》,一下就被标题吸引住了。“诗人”和“沉默”天然带着反差,而且还不是“诗人沉默了”,而是“继续沉默”。一共六个字,道了一生故事。

一个诗人突然失去了自己的才华,老年得子,一个先天有智力缺陷的孩子。两个不幸的人凑在一起,一个先天不幸,一个后天辉煌灿烂之后不幸。这篇短篇小说就是在这样的背景下展开,两个不幸的人摩擦和碰撞,文字像诗一样优美,值得看看。

我们的共同生活就这样开始了。在这幢香水瓶和撕烂的手帕仍随处可见的安静的房子里,我们开始朝夕相处。我,一个陷入沉默的诗人;他,一个孤独的低能儿。

——《诗人继续沉默》

我称不上有才华,但好久之前就在思考才华流逝的痛苦,先天下之忧而忧。很多时候,才华和创意都是不容易捕捉的,“灵光一现”是常态,稳定输出不太容易。我偶尔也会冒出来一些不错的点子,但是不会依赖这些“灵光一现”,我会担心我有一天冒不出来新点子,从“不稳定出现”到“稳定不出现”了。沉默的诗人遭遇交稿 DDL,想想简直是灾难。

正是因为我幻想过,所以我对这位沉默的诗人非常共情,那种用力挥舞但于事无补的无力感。我曾经看过一些产生创意的方法,大致是将一堆名词塞到一个口袋里,摇一摇,随便抽出两张,去建立二者的关联。排列组合再加以人为理解,虽然低效,但确实能挤出一点新东西。

不过时代变化了,这篇小说是上个世纪80年代出版的,到了2022年,世界发生了很多变化。对AI来说,排列组合是最基本的技能,它甚至能吞噬人类有记录的所有语料,再创造出无数的新东西。在算力大幅提升的现在,AI生产内容成为了接下来的一大趋势。

AI灿烂烟火

前段时间,红杉美国发了一篇生成式AI的文章(Generative AI: A Creative New World),掀起了新一轮对AI未来的畅想。我把几个主流的模型体验了一遍,想从应用层产品化的角度分享一些我的感受和看法。

惊艳、逼真又诡谲的体验感受

新技术的效果,不能只看演示图,还是要亲自试试。演示图往往是精挑细选下的最优结果,距离大规模使用可能还有很远的距离。经常是看起来非常酷炫,指定一个命题跑出来的效果就让人下头了。

所以,我体验了Dall-E2、Stable Diffusion、Craiyon以及国内几款产品,把“诗人继续沉默,AI灿烂烟火”作为命题来生成图片。最终一通操作后用 OpenAI 的 Dall-E2 搞了张封面图。

整体效果很惊艳,Dall-E2的效果很好,搭配基本的编辑器,已经具备了从玩具走向工具的潜质。部分AI生成的图片容易掉进“恐怖谷”,逼真又诡谲。

用文本生成图片的感觉就像在霍格沃茨初学魔法,每条咒语的效果都不太一样,猜不到下次冒出什么黑魔法。要努力用自己拙劣的“咒语”尝试,加各种描述测试,找到自己想要的效果。

虽然AI生成的图片效果已经很好,让人感到惊艳,但是距离“生产环境”的使用还有距离,很难“原图直出”。真正想用,还是需要人工参与处理。

Dall-E2提供了基本的编辑器,很聪明地解决了一部分问题。编辑器可以拓展图片的边界(每次拓展也可以重新描述)、擦除不想要的部分重新生成、每次生成有多个结果挑选。为了让构图好看一些,我把图片的边界扩大了一圈,同时调整了一些烟花的位置,擦掉了一些不好看的。但是如果想精细化地调整,还是需要打开Photoshop编辑。由于是没有图层信息的图片,所以调整也不够灵活。

如果想用AI生成的图片用起来,生成后的灵活编辑器很重要。就像程序员在做小工具的时候,更偏爱自己写,而不是用别人的代码改造。学习别人的代码再改造一遍的成本很高,甚至不如自己从头写一个。AI生成的内容也是同样的情况。


还有一个有意思的事情,AI不理解什么是“AI”,所以生成出了相近的“AIi”,再配上这张诡异的图,一下就有了新的理解角度。我当机立断发给了某互联网大厂的朋友。

产品化的机会

红杉的文章中列举了不同的领域:文本、图片、视频、3D等。视频和3D方向的技术还偏早期,文本和图片的生成更成熟,同时有大量论文和开源模型,具备产品化的基础。

尤其在体验之后,我认为AI生成图片的技术已经初步成熟,到了产品化的阶段,接下来就是看谁能更快找到痛点切进去了

AI 生成图片有两个产品化的方向:一是以内容生产为导向,将AI生成的内容直接作为结果,或者作为结果的一部分;二是作为新的表达方式,语言讲不清楚,手绘示意图效果不好,让AI画出来500张图,我来找到我想要的感觉。

内容生产的辅助工具

目前的技术成熟度是不足以“原图直出”的,需要人工编辑和审核。在内容生产上,AI可以作为辅助工具,在图片里“添砖加瓦”;也可以作为灵感来源,出几张初稿。可能要到七八年后,算法和工程更加成熟后,才能独立扛起内容生产的大旗。

AI和人工相辅相成可以大幅提高效率,但AI需要嵌入到人的工作流中。比如以插件的形式嵌入Adobe的全家桶、Figma或者其他编辑工具、内容发布平台上。

Adobe早在2010年发布的Photoshop CS5就提供了“内容识别”的填充方式,迭代到2022年,已经支持用户编辑内容识别的区域,再做调整。

这两者的区别是Photoshop提供的内容识别的填充能力是“融为一体”,而AI可以基于文本进行创造。内容识别可以把沙滩补全,但无法在沙滩上增加一个火堆。封面图就是用内容识别补充了边缘的空白,变成完整的长方形。

生成式AI的差异化是根据描述,生成出画风相符的新内容。把画面“融为一体”的细节交给Photoshop的图层、内容填充和色彩调节。

由于本鹅的拖延症严重,这篇原定在十一发布的文章拖到现在,业界有了新动作:

微软发布了 Microsoft Designer,整合 DALL-E 2 系统并提供数千个创意模板,可帮助用户快速完成海报、邀请函、推广图等设计工具。

除了嵌入工作流外,还有一系列的问题需要解决。生成式AI是发散的,但需要解决的问题是收敛的。艺术品上可以天马行空,但现实中待解决的问题是约束条件下的具体的,明确的。

比如,我在体验的过程中发现,已有模型并不能很好地理解“上下左右”的相对位置关系。可能是深度神经网络的解释性比较差,想训练好相对位置关系、比例和大小关系是困难的。我想让画面中沉默的诗人和海平面上的烟火分布在对角,视觉上更均衡好看一些。但是在一通尝试后,果断放弃。不过在与工具结合的过程中,有工程上的办法解决问题。在左上角200px*200px的位置渲染烟花,在右下角渲染一个沉默的诗人。

比如,我要认真端详这位坐在海边的沉默诗人的模样,可别像了谁。

新技术的产品化有没有做成,有一个衡量标准是用户使用后,标榜自己用了新技术的比例。新技术刚出现的时候,人们蜂拥而至,展示自己用这项新技术做了什么东西。当一项技术逐渐成熟,人们关注的热度会降下去,尝鲜的人变少,真正使用的场景变多,真正能解决的问题变多。

当有一天,大家习惯使用生成式AI制作内容的时候,也就不会刻意强调“我用AI生成了十张图,快来看看!”

继文本、白板涂鸦后的新表达方式

目前AI生成的效果很难作为终稿,需要人类去做处理,但是可以作为杰出的交流工具,成为一种新的表达方式。

人与人之间的交流充满着错位,表达者脑中想的、口中说的、媒介传播后的内容、听者听到的和听者脑中想到的,可能都不一样。表达就意味着误解,工具可以将误解减少。

我们用语言沟通,我们用肢体和表情增强人们的感受,我们用涂鸦、图片和富媒体来丰富自己的表达。形式丰富的表达是有成本的,更直观更准确也更贵。AI能够根据描述生成大量的图片,我来找到我脑中的画面,再来辅助我的表达。可能AI生成的图片有很多问题,但基于一张图的描述会清晰很多。未来的白板不仅可以涂鸦贴便签纸,还可以放张效果图。

创意沟通的场景很多,甲方脑中有一个想法,但很难描述清楚,乙方也非常难理解,只能凭感觉做一些看看。在反复交流的过程中,找到彼此妥协的点。我关注的一位新up主最近发视频坦言自己接商业广告的艰难,投入了一个月,当甲方拿着作品给老板看的时候,被老板否了。于是他被迫改成非商业的内容发布。甲方的层层向上汇报不能只拿着想法,需要有一些直观的内容,而AI可以低成本地生成用于沟通的素材。

如果用户真的用起来,这种新的表达方式,对内容的消耗量是巨大的。在当前生成式AI的发展状态,用AI作为表达工具会比直接生成内容的市场潜力更大,同时还可以放缓版权的问题。


沉默的诗人能用AI创造艺术吗?

AI有着无限排列组合的能力,可以源源不断地产生灵感。不可解释性又为AI的作品蒙上了神秘的面纱,在艺术领域有时可以诞生新的理解。就像我

对于人类的创作,我们会说作者赋予了作品一层含义,而读者会让作品诞生新的含义。目前的弱AI是没有通常意义的自我意识的,他没有主观给作品赋予含义,但却可以产生有特定含义的作品。如果我们仔细地欣赏和审视,AI生成的作品也可能有不低的艺术价值。

我倾向于认为艺术价值不应该受限于作品的生成方式,无论是人类的创作还是AI的生成,只要作品有价值便是有价值的。不过版权是个不小的问题。

或许有一天,沉默的诗人可以和他先天智力缺陷的儿子一起天马行空,用AI创作出新的作品,迎来艺术事业第二春。


挑战与风险

生成式AI的版权未来且有几场仗

如果AI生成的内容是要商用的,版权的问题就很麻烦。举一个最极端的例子:用一堆有版权的素材训练,用的是大家公认的模型,但是就正巧地生成了一副目前世界上版权最贵的图。

这个概率非常非常低,但是AI本身是个黑盒,没人能够预测生成的内容是什么。在使用量极大的情况下,小概率事件也会发生。基于AI生成内容的版权问题将会很复杂,且有几场仗要打。

用以AI训练的素材内容不是核心问题,AI生成出来的内容能不能用是主要矛盾,也可能会成为大规模商用的阻塞点。

规模效应能压低成本,谨防高射炮打蚊子

AI模型的训练成本是巨大的,靠云计算和规模效应可以把成本压低。但是要谨防高射炮打蚊子,产品化找了一些痒点,规模就很难做,而用户的付费能力或付费意愿很低,成本再低也很难做出利润空间。很多问题可以用AI解决,但它的替代方案可能已经足够强了,用高射炮打蚊子真不一定比电蚊拍好用。

做一个玩具很容易,做一个在复杂约束条件下能解决问题的工具不易。

未来的展望

我是个技术乐观主义,我对AIGC的未来很看好。现在的AI决定了把哪些内容推荐给你,每次上滑刷出的内容都是AI基于人性的“洞察”和对内容的“思考”而来。未来是AI做内容的生产,基于人性源源不断地渲染。这种内容生产也是有雏形的,就是那些套着模板,从新闻中拿文本和图片,随便配一个音乐的短视频内容。从模板和规则中,逐渐演变成基于AI的内容生成。

那些模糊片段的梦,寥寥数笔勾勒一下,就可以为你渲染出 8K 杜比视界的视频了。这么一想,我仿佛已经知道哪个行业会最先落地了。

感兴趣的话,也欢迎看看松鹅历史文章~

浅谈平台做生态的边界

云计算科普:从连网线到Serverless

三十本好书和一部五星著作