这段时间。注意力以都被ChatGPT这类的文本生成AI给吸引过去了。满脑子都是什么transformer,注意力机制之类的新鲜名词。在这之前玩的挺开心的图像生成式AI——Stable diffusion就没怎么玩了。但是state diffusion——文生图的AI技术并没有停下来休息,而是仍在飞速的发展。就在我没怎么关注的这段时间,就有了非常重大的突破。
Stable diffusion的原理。简单来说就是把一张照片拿给AI学习,这个学习的过程是这样的:就是在给AI学习的图片中不停的加入噪点。经过很多步以后。一张非常清晰的图片就变成了毫无意义的随机噪点就像。很多年以前 CRT电视机,在没有收到电视信号时,显像管上的雪花点一样。然后AI会将这个过程记下来。当人类要求AI生存一副同一概念的画面的时候,AI就会先用程序产生一幅完全是雪花点的随机噪声图片,然后将他上学习到了过程倒过来推演,最后就得到了一幅画。但是因为AI是从一张随机噪声图片开始的。所以虽然最后生成画面的内容和文字描述基本上能对上,但是美术创作中非常重要的一个方面——构图则很难用文字来进行控制。但是没想到这个问题这么快就得到了几乎完美的解决。这就是最近出现的控制网络(control network)的技术。
简单来说。就是除了给模型输入文字来控制AI模型生成我们想要的图像之外,还可以给他一张图,这张图也可以,用来控制最终图像的生成。这就有点想现在非常时髦的多模态AI模型了。因为在这之前的AI模型要么是专门用来处理图。要么是专门用来处理声音。要么就是stable diffusion这样接收文字输入的。还有现在最火的ChatGPT,也是只能接受文字输入。
使用控制网络之后,模型就可以同时按照图片的指引和人类文字的提醒来生成更符合人们要求的图像,可以在真正的意义上进行 AI的艺术创作了。
下面是我简单的试用了一下。主要是用了两种控制网络,一种是素描草图(scribe)。当然这个是我用鼠标随手画的,非常的难看的一张人脸。但是就是这样一张非常随意的人脸也可以作为控制网络的输入,然后在文字提示词的加持下,变成一幅幅还不错的人物肖像画。
另一个叫open pose就是“开源姿势”的意思。这个我觉得更加神奇,也更有实际意义。就是它可以检测出输入图片中人物的姿势,然后让AI生成的人物可以做出一模一样的姿势。比如下面这张图是最近刘亦菲主演的一部很火的国产电视剧中的剧照。将它作为输入图。然后AI生成的人物就会摆出和刘亦菲一模一样的姿势,非常的神奇。