Stable Diffusion 3 发布,AI生图效果,再次到达全新里程碑!

AI生图效果,再次到达全新里程碑!

alt

Prompt:Epic anime artwork of a wizard atop a mountain at night casting a cosmic spell into the dark sky that says "Stable Diffusion 3" made out of colorful energy
提示(意译版):在一幅充满史诗感的动漫画面中,一位巫师屹立于夜幕笼罩的山巅之上,正用他的法杖向漆黑无垠的夜空中施展一道震撼宇宙的魔法。这道法术在夜空中绽放,化作由五彩缤纷的能量构成的「Stable Diffusion 3」字样,犹如夜空中最璀璨的星辰。

网友复刻版,同样惊艳:

alt

网友惊呼:这种prompt的一致性是我见过最好的!

alt

这次的Stable Diffusion 3,在图像质量、多个对象、拼写能力方面,都得到了显著提升。

甚至,它似乎还涌现出了对物理世界的「理解」。

alt

Prompt: A horse balancing on top of a colorful ball in a field with green grass and a mountain in the background.
提示(意译版):一匹马优雅地站在一个五彩斑斓的球上,周围是一片生机勃勃的绿色草地。远处,一座雄伟的山峦巍峨地矗立。

alt

Prompt:Photo of a red sphere on top of a blue cube. Behind them is a green triangle, on the right is a dog, on the left is a cat
提示:一个红色的球体放在一个蓝色的立方体上面。在它们后面是一个绿色的三角形,在右边是一只狗,在左边是一只猫。

而DALL-E 3就相形见拙了。

alt

关于Stable Diffusion 3.0的核心技术进展,CEO Emd总结了一份「太长不看版」摘要——

alt

- 采用了与Sora类似的Diffusion Transformer技术,并结合了流匹配(Flow Matching)等多项技术改进。
- 通过利用对Transformer的改进,不仅使得系统扩展性更强,还能处理多种类型的输入数据。
- 将以开源形式发布,通过预览版的测试来进一步提升系统的质量和安全性。
- 发布时,将包含一套完整的工具。
- 基于最新硬件技术打造的新平台,可以支持多种规模的版本。
- 支持生成视频、3D以及更多类型的内容创作。
- 需要更多的GPU来实现更强大的计算能力。

不得不说,最近这段时间,DiT实火!

目前,模型可选择的参数范围在800M到8B之间。

现在,已经可以在这里加入候补名单,申请SD3的访问权限了:https://stability.ai/stablediffusion3

Stable Diffusion 3,文字渲染能力超进化

按照prompt生成指定文字,一直以来都是文生图模型的老大难问题。

alt

从左到右:DeepFloyd IF、DALLE-2、Bing Image Creator、Midjourneyv5.2、SDXL v0.9(2023年7月)

但是这次,SD3模型对于prompt理解得很好,在黑板上正确写出了「go big or go home」。

而且画面非常写实,远近位置、光影,都显得极其自然。

alt

Prompt: cinematic photo of a red apple on a table in a classroom, on the blackboard are the words "go big or go home" written in chalk.
提示(意译版):这张电影级视觉效果的照片,捕捉到了一个静谧的教室瞬间,一颗鲜红的苹果静静地躺在桌子上,而在它背后的黑板上,则用醒目的粉笔字写着——「要么做大,要么回家」。

相比之下,Midjourney的图是这样的:

alt

Gemini Advanced / Ultra的图是这样的:

alt

DALL-E 3的图是这样的:

alt

各种形式的文字渲染,SD3 都出色地完成了。

alt

Prompt:Resting on the kitchen table is an embroidered cloth with the text 'good night' and an embroidered baby tiger. Next to the cloth there is a lit candle. The lighting is dim and dramatic.
提示:厨房桌上铺着一块精美的绣布,上面绣着「good night」字样和一只可爱的小老虎。旁边,一支蜡烛静静燃烧,散发出柔和而略带戏剧性的光影。

alt

Prompt:Photo of an 90's desktop computer on a work desk, on the computer screen it says "welcome". On the wall in the background we see beautiful graffiti with the text "SD3" very large on the wall.
提示:一台放在工作桌上的90年代的台式电脑,屏幕上写着「welcome」。在背后的墙面上,有一幅醒目的涂鸦艺术作品,写的是「SD3」。

alt

Prompt: Anime style illustration of a newsstand on top of a small grassy hill, on top of the newsstand we see the text "it's here!". In the background we see a big rain approaching.
提示:这是一幅充满动漫特色的插画,一个报刊亭坐落在一片绿意盎然的小山丘上,亭顶醒目地展示着「it's here!」的字样。而在这个宁静的场景背后,一场壮观的暴雨即将来临。

alt

Prompt: Night photo of a sports car with the text "SD3" on the side, the car is on a race track at high speed, a huge road sign with the text "faster".
提示:在这幅夜幕下的摄影作品中,一辆标有「SD3」字样的运动赛车正在赛道上疾驰。背景里,一块巨大的路牌显眼地展示着「faster」一词。

alt

Prompt: Three transparent glass bottles on a wooden table. The one on the left has red liquid and the number 1. The one in the middle has blue liquid and the number 2. The one on the right has green liquid and the number 3.
提示:一张木桌上摆放着三个透明的玻璃瓶。从左至右,每个瓶子内分别充满了鲜艳的红、蓝、绿色液体。瓶子上,用数字1、2、3进行了标记。

alt

Prompt: Photo of a rectangular orange neon sign with the text "even more stable", the sign is on the wall in a metro station, subway speeding by in the background, perspective photo.

Stable Diffusion 3.0能在文字渲染能力上取得显著提升,是因为Stability AI在新模型中采用了全新技术——Transformer和新增的文本编码功能。

CEO Emad Mostaque解释说,因为上述原因,现在SD 3不仅能生成完整句子,还能保持风格的一致性。

宇航员骑着粉色芭蕾舞裙猪,除SD 3竟然全军覆没?

处理包含多个对象的Prompt的能力,也是考核AI生图模型的一大关键指标。

下面这个prompt,着实难倒了一大片选手——

一幅宇航员撑着粉色雨伞、骑着一只穿着芭蕾舞短裙的猪的画,猪旁边的地上是一只戴着高顶帽子的知更鸟,画面的角落里写着「stable diffusion」。

这个prompt,要求模型正确理解对象的属性、位置,以及正确呈现字体很小的文本,着实是一道难题。

如此要素拉满的细节要求,SD3.0全部理解,并且精确地完成了!

宇航员,粉色雨伞、穿着粉芭蕾舞裙的猪、戴高帽的知更鸟、角落里的字,100%符合prompt的要求。这就表明:模型很好地理解了prompt。

alt

Prompt: a painting of an astronaut riding a pig wearing a tutu holding a pink umbrella, on the ground next to the pig is a robin bird wearing a top hat, in the corner are the words "stable diffusion"

对于同一prompt,其他模型的表现就落后了。

DALL-E 3画出的画倒是过关了,但它把「Diffusion」拼错了。

alt

Bing的表现就更是离谱了,有的图中芭蕾舞裙的颜色不对,有的知更鸟站在了猪脑袋上,有的更是画面中飞满了知更鸟。而「Stable Diffusion」更是错得离谱。

alt

Gemini Advanced这个差生的答案就更惨不忍睹了,除了拼写问题,画也没画对。

alt

下面出场的,就是以画面质量精美著称的优秀文生图选手Midjourney了。

从画面美感上说,MJ依然甩其他模型一条街,但是考试就是考试,「Stable Diffusion」,它也没拼对。

alt
alt

总结下来,这一道考题唯一的满分选手,就是Stable Diffusion 3!

和Sora同样的Diffusion Transformer架构

所以,Stable Diffusion 3.0为何有如此突飞猛进的表现?

原因在于,它采用了全新的架构设计。

Stability AI的首席执行官Emad Mostaque表示——

「Stable Diffusion 3 采用了Diffusion Transformer架构,这是一种新型的架构设计,与OpenAI最近推出的Sora模型采用的架构相似。」

在以前的Stable Diffusion版本中,并未采用Transformer技术。

而Stable Diffusion 3.0采用了一种全新的方法,引入了Diffusion Transformer 技术。如果你对最近的爆火的sora有所了解,肯定对这个技术已经耳熟能详了。

alt

Transformer技术是,当前生成式AI革命的核心,广泛应用于文本生成模型中。而图像生成技术,则主要基于Diffusion模型。

Sora作者之一William和谢赛宁,在这篇论文中共同提出了Sora的基础架构。

alt

论文地址:https://arxiv.org/abs/2212.09748

这篇详细介绍DiTs的论文指出,这种基于扩散模型的新架构,可以用在图像patch上运行的Transformer替代了传统的U-Net架构。

这样,DiTs方法就可以更高效地利用计算资源,并且在图像生成方面超越了其他扩散模型技术。

一篇因「缺乏创新性」被CVPR 2023拒收的论文,竟成了Sora和Stable Diffusion 3.0的奠基之作,学术创新和工程创新的区别,着实引人深究。

alt

Stable Diffusion 3.0 的另一个创新亮点,就是流匹配技术。

一篇关于流匹配的研究论文介绍了这一新方法,它可以用于训练连续归一化流(Continuous Normalizing Flows, CNFs),以便更准确地模拟复杂的数据分布。

论文地址:https://arxiv.org/abs/2210.02747

研究表明,通过结合使用条件流匹配(Conditional Flow Matching, CFM)和最优传输路径,可以实现更快的训练速度、更高效的样本生成,并且在性能上超越传统的扩散路径方法。

alt

其实,Stability AI一直在探索多种新颖的图像生成技术。

就在本月初,他们就推出了一项名为Stable Cascade的新技术。

它基于一种名为Würstchen的先进架构,旨在提升生成图像的性能和精确度。

alt

一大波整活来了

在图像质量上,SD 3.0也取得了令人震惊的进步。

「变色龙在黑色背景上的摄影棚照片特写」,它生成的图是这样的。

alt

Prompt:studio photograph closeup of a chameleon over a black background.

Gemini Advanced/Ultra生图是这样的。

alt

Midjourney是这样的。

alt

因为题干没有区分度,所以大家表现差不多。

从更多的演示中可以看出,无论是在自然写实风景,还是在漫画、海报中,SD 3不仅做到了正确还原文字,还让文字和画面做到了很好的融合,一点都不突兀。

alt

Prompt: Trees photographed under the Milky Way, the moon and twilight shine on the Valley. The full moon appears high in the sky and the twilight glow can still be seen.

再比如黑客帝国中的Neo狗。

alt

威尔史密斯吃面,AI模型的终极图灵测试。

alt
alt
alt
alt
alt
alt
alt
alt
alt
alt
alt
alt
alt
alt
alt

Stable Video同时发力

此外,就在不久前,Stable Video也正式开放公测了。

背后还是基于Stable Video Diffusion 1.1。

alt

体验地址:https://www.stablevideo.com/

从前,这个模型需要用户自己上手部署,现在已经人人可用了,甚至不需要排队!

虽然跟登月级的Sora还有很大差距,但视频效果已经可以和Runway一拼。

alt

2024年才一开年,节奏就已经这么炸裂了。今年注定是AIGC史上不平凡的一年。

本文由 mdnice 多平台发布

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://xiahunao.cn/news/2805318.html

如若内容造成侵权/违法违规/事实不符,请联系瞎胡闹网进行投诉反馈,一经查实,立即删除!

相关文章

mybatis常用标签

一.定义sql语句 1.select 标签 属性介绍: (1)id :唯一的标识符. (2)parameterType:传给此语句的参数的全路径名或别名 例:com.test.poso.User或user (3)resultType :语句返回值类型或别名。注意&#xff…

一周学会Django5 Python Web开发-Http请求HttpRequest请求类

锋哥原创的Python Web开发 Django5视频教程: 2024版 Django5 Python web开发 视频教程(无废话版) 玩命更新中~_哔哩哔哩_bilibili2024版 Django5 Python web开发 视频教程(无废话版) 玩命更新中~共计25条视频,包括:2024版 Django5 Python we…

架构篇36:微服务架构最佳实践 - 基础设施篇

文章目录 自动化测试自动化部署配置中心接口框架API 网关服务发现服务路由服务容错服务监控服务跟踪服务安全小结每项微服务基础设施都是一个平台、一个系统、一个解决方案,如果要自己实现,其过程和做业务系统类似,都需要经过需求分析、架构设计、开发、测试、部署上线等步骤…

document.cookie中expires 格式设置问题导致部分iphone safari上登录失效

一、问题描述 设备信息:iPhone 12, iOS 16.3 昨天有个小伙伴发现自己的iPhone safari打开网页登录时,登录页面显示登录成功,但实际进入首页后仍然显示未登录。多次测试,该问题在该设备上属于必现问题。 二、问题排查与解决 经过…

【办公类-16-10-01】“2023下学期 中4班 自主游戏观察记录(python 排班表系列)

背景需求 上学期的周安排里,每班每周的自主游戏会轮到多个不同的内容 因此在每周的自主游戏观察有2次记录,观察的项目可以写不一样的, 如一位老师写沙水游戏,另一位写表演游戏 本学期,中班的自主游戏全部是户外的&am…

高并发系统实战课个人总结(极客时间)

高并发系统实战课 场景 读多写少 我会以占比最高的“读多写少”系统带你入门,梳理和改造用户中心项目。这类系统的优化工作会聚焦于如何通过缓存分担数据库查询压力,所以我们的学习重点就是做好缓存,包括但不限于数据梳理、做数据缓存、加缓…

[yolov9]使用python部署yolov9的onnx模型

【框架地址】 https://github.com/WongKinYiu/yolov9 【yolov9简介】 在目标检测领域,YOLOv9 实现了一代更比一代强,利用新架构和方法让传统卷积在参数利用率方面胜过了深度卷积。 继 2023 年 1 月 正式发布一年多以后,YOLOv9 终于来了&a…

月之暗面:Moonshot AI接口总结

前言: 开发者们只需访问 platform.moonshot.cn,便能创建自己的 API Key,进而将 Kimi 智能助手背后的同款 moonshot 模型能力,如长文本处理和出色的指令遵循等,集成至自己的产品中。这不仅增强了现有产品的功能&#x…

C++之stack与queue的模拟实现

一、 stack的介绍和使用 1. stack的介绍 stack 的文档介绍 翻译: 1. stack 是一种容器适配器,专门用在具有后进先出操作的上下文环境中,其删除只能从容器的一端进行元素的插入与提取操作。 2. stack 是作为容器适配器被实现的&#xff…

【Ubuntu】Anaconda的安装和使用

目录 1 安装 2 使用 1 安装 (1)下载安装包 官网地址:Unleash AI Innovation and Value | Anaconda 点击Free Download 按键。 然后 点击下图中的Download开始下载安装包。 (2)安装 在安装包路径下打开终端&#…

华为配置WDS手拉手业务示例

配置WDS手拉手业务示例 组网图形 图1 配置WDS手拉手业务示例组网图 业务需求组网需求数据规划配置思路配置注意事项操作步骤配置文件 业务需求 企业用户通过WLAN接入网络,以满足移动办公的最基本需求。但企业考虑到AP通过有线部署的成本较高,所以通过建立…

二百二十四、Kettle——曲线实现从Hive插入更新到ClickHouse(分区字段是month或year)

一、目的 对于以month、year为分区字段的数据,不是像day字段分区那样每天增量插入更新即可,而是要以部分字段查询、部分字段更新,但是ClickHouse数据库并不适合更新操作,直接使用Kettle的插入更新控件会导致问题,必须…

Win11系统cmd输入“ipconfig”报错:ipconfig不是内部或外部命令

方法一: 正常系统添加系统变量,看佬的wp:【网络】解决‘ipconfig不是内部或外部命令,也不是可运行的程序_ifconfig不是内部或外部命令,也不是可运行的程序-CSDN博客 方法二: 1.下载everything 2.搜索ipconfig 3.去…

网络安全笔记总结

IAE引擎 1.深度检测技术--DFI和DPI技术 DFI和DPI都是流量解析技术,对业务的应用、行为及具体信息进行识别,主要应用于流量分析及流量检测。 DPI:深度包检测技术 DPI是一种基于应用层的流量检测和控制技术,对流量进行拆包&#x…

个人博客系列-前端部署-创建框架(4)

项目环境介绍 Vue3 Vite TypeScript 服务器:阿里云contos node版本:v18.18.2 npm版本:v10.2.4 执行下面一行命令,创建vue3框架 npm create vuelatest修改端口:9528, 此步骤可以忽略(使用默…

发电机组启动前的准备和检查注意事项

发电机组启动前的准备: 1.检查润滑油的油位、 冷却液液位、燃油量; 2.检查机的供油、润滑、冷却等系统各个管路及接头有无漏油漏水现象; 3.检查电气线路有无破皮等漏电隐患,接地线电气线路是否松动,机组与基础的连接是…

工作中常见问题总结

工作中常见错误清单 1、springboot实现无数据库启动 问题 springboot往往是作为b/s系统的server端的架子来使用,但是有些时候,是作为静默的server,并没有界面和数据库,但是springboot默认是链接数据库的,如何解决这个…

bean 实例化的三种方式与生命周期

目录 构造方法(常用)静态工厂实例工厂与 FactoryBeanbean 生命周期控制配置方法接口方法bean 生命周期阶段 构造方法(常用) 提供可访问的构造方法 public class BookDaoImpl implements BookDao {public BookDaoImpl() {// ...}…

Rust之构建命令行程序(四):用TDD(测试-驱动-开发)模式来开发库的功能

开发环境 Windows 11Rust 1.75.0 VS Code 1.86.2 项目工程 这次创建了新的工程minigrep. 用测试-驱动模式来开发库的功能 既然我们已经将逻辑提取到src/lib.rs中,并将参数收集和错误处理留在src/main.rs中,那么为代码的核心功能编写测试就容易多了。我…

STM32F103x 的时钟源

AHB (Advanced High-performance Bus) 高速总线,用来接高速外设的。 APB (Advanced Peripheral Bus) 低速总线,用来接低速外设的,包含APB1 和 APB2。 APB1:上面连接的是低速外设,包括电源接口、备份接口、 CAN 、 US…