Midjourney V5 AI绘图神器:深度剖析与评测,限时领取8K超高清壁纸包
Midjourney V5在16号早上发布了(以下内容均以V5代替),这次V5的升级相较于V4有了非常多的改动生成速度、生成质量、语义理解能力有了非常大的提升。写这篇文章主要想详细介绍一下V5升级之后如何使用以及一些使用的注意事项。同时对V5在各个方面的能力做了详细的测试总结了一些要点,帮助大家更好的书写提示词以及优化图像。评测中所有的图片都会提供提示词。
8K分辨率壁纸包领取
上次做材质测试的时候发了一套流动的金属材质的图,很多朋友很喜欢希望我做成壁纸。所以处理了一下放大到了8192*4591大小。下载地址在这里:https://pan.quark.cn/s/53cdc13a6612
提取码在公众号回复【壁纸】获取。
如何使用V5
现在有两种办法可以使用V5模型:
一种是直接在提示词后面加上 --v 5 命令;
另一种是通过输入 命令回车后,选择MJ version V5的模型版本
V5的新功能
据官方公告所说V5已经开发了5个多月的时间,加入了很多他们自己研发的神经网络架构以及美学相关的技术。我们先来看一下官方自己发布的新功能描述,我会搭配例子逐条解释相关新功能。当然V5还有些其他惊人的特色官方没有说明,这个会在文章后面的V5新特性中展示。
V5 基础模型有什么新功能?
更广泛的风格范围和更具响应性的提示
更高质量的图像(2倍分辨率增加),动态范围改善
图像更详细。
改进了图像提示性能
支持无缝平铺 --tile 参数(实验性)
支持大于 2:1 的纵横比 --ar (实验性)
支持权衡图像提示与文本提示 --iw
更广泛的风格范围
首先V5具有更广泛的风格范围更广泛的风格范围这个很好理解就是以前实现不了的一些风格V5会支持,比如非常明显的一个改变,以前V4版本在绘制照片风格的图片时总是有很明显的涂抹感现在生成的图片会更加逼真。比如下面这组图片(上面的图片为V5 下面为V4):
提示词:35mm Photograph of a young woman, with long Black hair, white Teint, round glasses --ar 16:9
更具响应性的提示
更具响应性的提示包含两个特点,第一个就是官方在公告里说的这次测试的是V5的专业模式对提示词的输入非常敏感,简短的提示可能效果不佳。应该尽量编写更长、更明确地描述您想要什么样式或效果(例如:“带有戏剧化灯光效果”的电影照片)。简单来说描述的越详细效果可能会越好。
第二个是V5貌似可以更好的理解自然语言,自然语言书写的提示词会比原来V4的关键词分割效果更好。可能V5利用了一些LLM相关技术来理解输入的提示词。
比如下面这两段提示词同样都用的v5,上面用自然语言写的,下面是原来的关键词写法,可以看一下对比。
提示词:street style photo of an elderly french woman with deep wrinkles and a warm smile, walking down the streets of soho, wearing a white gucci blazer made of cotton & black eyeglasses, natural morning lighting, shot on Agfa Vista 200, 4k --ar 16:9
提示词:Old french woman with deep wrinkles and warm smile, wearing white gucci blazer, black glasses, street in soho in background, street photo, morning, street in soho --ar 16:9
另一个提示词理解能力的提升可以从下面的提示词上面体现了出来,它完美的理解了前面这一段提示词涉及的数学概念和空间关系,真的为后面的海洋照片增加了一个圆角矩形分割的前置遮罩。
提示词:An infinite row of floating overlapping transparent aligned glass square panels, and each panel has a grid of uniform multicoloured circles all perfectly aligned on the x and y axis to form a mesh with equal spacing to represent one decimal place of π, with no two panels alike, All floating above swirling ocean waves at dusk, photo taken with 35mm lens, accent lighting, global illumination, cinematic realism, fantasy, surreal, --ar 2:1
更高质量的图像
这个很好理解V5生成的图片在2倍分辨率放大时拥有更高的分辨率,这个因为目前 V5 的upsampler功能还没有开放,所以V5放大后生成的图片分辨率与V4一致,比如下面两张图(上面V5下面V4)。
提示词:A blonde woman with blue eyes, face of( Blake Lively, Gemma Ward, Natalie Dormer) wading through a hot spring wearing a ratty tube top and short shorts, plunging neck line, wide angle, full shot, side facing shot, photography, gorgeous detailed blue eyes, messy blonde hair, dynamic pose, perfect shading, cinematic composition, elaborate, cinematic lighting, dramatic lighting, hdr, 8k --ar 16:9
动态范围改善
首先我们来看一下什么是动态范围““动态范围”是一个用于定义相机可以在多大范围内捕捉图像的影调细节的术语,通常指由最低值到最高溢出值之间的范围。简单地说,它描述的是相机在单帧内可以记录的最亮和最暗影调之间的比率。”当你拍摄的图像在光线上有巨大的差异时,更大的动态范围就能获得更大的影调空间。
比如下面这种涉及到从室外拍摄室内的内容的时候如果动态范围不足的时候图片就很容易特别黑细节不足(上面V5下面V4)。
提示词:photography shot trough an outdoor window of a coffee shop with neon sign lighting, window glares and reflections, depth of field, little girl with red hair sitting at a table, portrait, kodak portra 800, 105 mm f1. 8 --ar 2:1
图像更详细
V5对于图像相关内容的细节会更加丰富,不需要加诸如“详细的”这类关键词,也可以生成正常的细节比如下面的图,建议放大查看细节(上面V5下面V4)。
提示词:Shamrock engagement ring --ar 16:9
改进了图像提示性能
这个上面的几条已经说过了比如不需要更加细节的提示词也可以还原物品本来的细节,同时对自然语言描述的提示词理解的更好等。还有的是性能上的明显感觉V5发送完提示词以后相应更快了,之前V4发送完会等待模型理解提示词才会开始生成图片,V5几乎是发送完立刻就会开始生成图片。
支持无缝平铺
这个在V3的时候就开始支持了,后来V4推出后过了一段时间才支持。这次V5刚出就支持这个功能了。具体表现就是在提示词后加上--tile 参数后可以生成无缝的纹理贴图(下面分别为相同提示词加了--tile和没加的对比)。
提示词:Handpainted flat azulejo ceramic tiles, photorealistic, blue geometric border with white tile background, symmetrical, decorative tile, seamless, portugal, hd
支持大于 2:1 的纵横比
支持大于2:1的纵横比,代表着你可以输出4:1甚至5:1的超宽屏图像或者全景图。
提示词:City scape, distance wide angle photography of neoparis, futuristic eiffel tower,360-degree views, cyberpunk holograms, dot matrix led lighting at night --ar 5:1
支持权衡图像提示与文本提示
这个也是之前就有的功能,指的是在图生图功能的时候,在提示词后面输入 --iw 加数字命令。数字越大生成的图片就会跟原图越像,数字越小就会跟原图差异越大。这个具体可以看官方说明文档这一页:https://docs.midjourney.com/docs/image-prompts
V5新特性
除开官方已经明确的一些变化外,V5也有非常多官方没有提及的变化,我做了一系列测试目前发现的就是这些,也许还有其他特性,大家要是发现了也可以跟我交流。
画手的成功率大幅提升
V5最显而易见的一个新特性就是很大程度的纠正了AI不会画手的问题,不只是张手这种简单的手势不会出问题,握手、OK之类的手势出问题的现象也变得很少,比如下面两张图。
提示词:Close - up, handshake, scene in the office, hyper quality, highly detailed --ar 16:9
提示词:Close-up photo of the miner's open palm, low saturation style, photography award winning entry --ar 16:9
光线的折射和反射处理非常强
V5处理光线的折射和反射的能力非常强,具体的表现比如光线照射在液体上的反光,以及物品在镜面物体或者液体上的倒影,或者第二张图中阳光穿过树木的丁达尔效应。
提示词:Rain made of rgb paint, rgb bokeh effect in the background, rgb sunlight, rgb sunlight diffusing through the rain, diffused lighting, dark atmosphere, photorealistic, photorealism, photorealistic image, cinematic shot, cinematic, shot on canon 30mm, extreme detail --ar 21:9
提示词:Waterfall stone steps path covered with shamrock clovers and tiny red flowers through fern canyon oregon sun rays ray tracing damp wet rich colors photorealistic 4k hd crisp --ar 16:9
亚洲人像的生成更加自然
之前Midjourney生成的亚洲人像充满了欧美的刻板印象,五官非常的扁平,同时眼睛非常小。导致生成的亚洲人照片图像基本不能用。这次V5升级以后对于亚洲人或者中国人的人像不在是之前非常扁平的形象,现在变得非常自然(上图为V5下面的是V4)。
提示词:Portrait of Beautiful chinese girl in her Late 20's with a serious look on her face,in a studio backdrop --ar 2:1
体积效果更加逼真
V5在生成体积效果时不再象是通过绘制出来的画面,反而像真的在一些3D或者特效软件通过运算生成的,非常的自然(上图为V5下面的是V4)。
提示词:On the night of the aurora borealis in the Arctic Circle, a volcano erupted and red ash gas was ejected into the sky, landscape photography photos, National Geographic award-winning works --ar 16:9
更好的生成地标建筑
现在V5能够很好的还原现实中的地标建筑和相关景色,比如下面这张图里的纽约中央公园和的帝国大厦。当然光线的处理也非常好,也还原了诺兰电影的常见画面风格(上面V5下面V4)。
提示词:Actual photos of the alien invasion of New York, with images of alien spacecraft, New York's Central Park, and the Empire State Building. Stills from the science fiction film directed by Christopher Nolan. Magnificent, epic --ar 16:9
对一些热门产品的还原非常好
对于现实中存在的一些热门的产品比如独特版式服饰、汽车等还原的非常好,上面所有的细节甚至标志都没有问题,与画面的结合也非常好。
提示词:Women modelling Gildan 18500 Black Hoodie --ar 16:9
提示词:Matt black 2022 Mercedes - Benz V - Class W447 and luxury company entrance in the background, modern design, aggressive, stunning look, hq render --ar 16:9
非常好的还原航拍场景
V5对于航拍场景下地面内容的细节还原的也非常好,跟其他照片的表现类似涂抹感大幅减少,相关物体的细节表现也更自然(上面V5下面V4)。
提示词:Aerial View of Dot Matrix green matrix code rivers in an Icelandic landscape, vibrant inner illuminated, photography by Andreas Gursky --ar 16:9
不同角度的同一个人像肖像还原的非常好
顾名思义,V5现在可以生成非常连续的同一个人不同角度的照片,我们直接看照片吧。这个细节太棒了无法描述了。
提示词:hyper realistic portrait photography of beautiful happy girl, pale skin, golden earrings, summer golden hour, kodak portra 800, 105 mm f1. 8; image split into 2, different angles of the girl --ar 2:1
提示词:hyper realistic portrait photography of beautiful happy chinese girl, golden earrings, summer golden hour, kodak portra 800, 105 mm f1. 8; image split into 3, different angles of the girl --ar 2:1
对于不同材质的细节处理更加好
现在V5能够准确理解对于不同材质的描述,从而非常好的还原各种材质的形状和表面特点,以及与环境交互的变化。
提示词:Quartz stones, healing minerals, meditation, bright and light, studio setting, studio light, white background, negative space, 8K --ar 2:1
提示词:Many transparent and pure acrylic cards are scattered from the air, dark background, color, blurred, delicate, soft scene --ar 16:9
提示词:A light floating silk fabric floating in a white space, fluorescent light caustics, wide angle shot,blurred, delicate, soft scene --ar 2:1
以上就是这次Midjourney V5升级的主要内容和我发现的一些新的特性,总的来说这次升级的模型质量非常之高,不仅解决了一些之前存在很久的问题,在提示词理解和图像质量上也有全方位提高。有传言说V6模型会在5月底6月初发布。很期待V6模型会多么巨大的提升。
由于这个模型刚刚发布肯定还有很多没有来得及发现的新特性。也欢迎大家将自己发现的相关特性跟我沟通。