AI快讯 | Stable Diffusion 3技术报告流出，Sora构架再立大功！

Stable Diffusion 3技术报告流出，Sora构架再立大功！

来源：商都网新闻中心发布日期：2024-03-06

声明:本文来自于微信公众号新智元（ID:AI_era），作者:新智元，授权站长之家转载发布。【新智元导读】Stability AI放出了号称能暴打闭源模型的Stable Diffusion3的技术报告，采用DiT构架的新模型在灵活性和性能上都达到了新的高度。Stability AI在发布了Stable Diffusion3之后，今天公布了详细的技术报告。论文深入分析了Stable Diffusion3的核心技术——改进版的Diffusion模型和一个基于DiT的文生图全新架构!报告地址:https://stabilityai-public-packages.s3.us-west-2.amazonaws.com/Stable+Diffusion+3+Paper.pdf通过人类评价测试，Stable Diffusion3在字体设计和对提示的精准响应方面，超过了DALL·E3、Midjourney v6和Ideogram v1。Stability AI新开发的多模态扩散Transformer（MMDiT）架构，采用了分别针对图像和语言表示的独立权重集，与SD3的早期版本相比，显著提升了对文本的理解和文字的拼写能力。性能评估在人类反馈的基础之上，技术报告将SD3于大量开源模型SDXL、SDXL Turbo、Stable Cascade、Playground v2.5和 Pixart-α，以及闭源模型DALL·E3、Midjourney v6和 Ideogram v1进行了详细的对比评估。评估员根据与给定提示的一致性、文本的清晰度以及图像的整体美观度选择了每个模型的最佳输出:测试结果显示，无论是在遵循提示的准确性、文本的清晰呈现还是图像的视觉美感方面，Stable Diffusion3都达到或超过了当前文生图生成技术的最高水平。完全没有针对硬件进行过优化的SD3模型具有8B参数，能够在24GB显存的RTX4090消费级GPU上运行，并且在使用50个采样步骤的情况下，生成1024x1024分辨率的图像需耗时34秒。此外，Stable Diffusion3在发布时将提供多个版本，参数范围从8亿到80亿，从而能以进一步降低使用的硬件门槛。架构细节曝光在文生图的过程中，模型需同时处理文本和图像这两种不同的信息。所以作者将这个新框架称之为MMDiT。在文本到图像生成的过程中，模型需同时处理文本和图像这两种不同的信息类型。这就是作者将这种新技术称为MMDiT（多模态Diffusion Transformer的简称）的原因。与Stable Diffusion之前的版本一样，SD3采用了预训练模型来提取适合的文本和图像的表达形式。具体而言，他们利用了三种不同的文本编码器——两个CLIP模型和一个T5——来处理文本信息，同时使用了一个更为先进的自编码模型来处理图像信息。SD3的架构是在Diffusion Transformer（DiT）的基础上建立的。由于文本和图像信息的差异，SD3为这两种信息各自设置了独立的权重。这种设计相当于为每种信息类型配备了两个独立的Transformer，但在执行注意力机制时，会将两种信息的数据序列合并，这样就可以在各自的领域内独立工作的同时，能保持够相互参考和融合。通过这种独特的构架，图像和文本信息之间可以相互流动和交互，从而在生成的结果中提高对内容的整体理解和视觉表现。而且，这种架构未来还可以轻松扩展到其他包括视频在内的多种模态。得益于SD3在遵循提示方面的进步，模型能够精确生成集中于多种不同主题和特性的图像，同时在图像风格上也保持了极高的灵活性。通过重赋权法改进Rectified Flow除了推出的全新Diffusion Transformer构架之外，SD3对于Diffusion模型也进行了重大的改进。SD3采用了Rectified Flow（RF）策略，将训练数据和噪声沿着直线轨迹连接起来。这种方法让模型的推理路径更加直接，因此可以通过更少的步骤完成样本的生成。作者在训练流程中引入了一种创新的轨迹采样计划，特别增加了对轨迹中间部分的权重，这些部分的预测任务更具挑战性。通过与其他60种扩散轨迹（例如 LDM、EDM 和 ADM）进行比较，作者发现尽管之前的RF方法在少步骤采样中表现更佳，但随着采样步骤增多，性能会慢慢下降。为了避免这种情况的出现，作者提出的加权RF方法，就能够持续提升模型性能。扩展RF Transformer模型Stability AI训练了多个不同规模的模型，从15个模块、450M参数到38个模块、8B参数，发现模型大小和训练步骤都能平滑地降低验证损失。为了验证这是否意味着模型输出有实质性的改进，他们还评估了自动图像对齐指标和人类偏好评分。结果表明，这些评估指标与验证损失强相关，说明验证损失是衡量模型整体性能的有效指标。此外，这种扩展趋势没有达到饱和点，让我们对未来能够进一步提升模型性能持乐观态度。作者在256*256像素分辨率下，在4096的批大小下，用不同参数数对模型进行了500k步训练。上图说明了长时间训练较大模型对样本质量的影响。上表显示了GenEval的结果。当使用作者提出的训练方法并提高训练图像的分辨率时，最大的模型在大多数类别中都表现出色，在总分上超过了 DALL·E3。根据作者对不同构架模型的测试对比，MMDiT效果非常好，超过了DiT，Cross DiT，UViT，MM-DiT。灵活的文本编码器通过在推理阶段去除占用大量内存的4.7B参数的T5文本编码器，SD3的内存需求得到了大幅降低，而性能损失微乎其微。去除这个文本编码器不会影响图像的视觉美感（不使用T5的胜率为50%），只会略微降低文本的准确遵循能力(胜率为46%)。然而，为了充分发挥SD3在生成文字的能力，作者还是建议使用T5编码器。因为作者发现在没有它的情况下，排版生成文字的性能会有更大的下降（胜率为38%）。网友热议网友们对Stability AI不断撩拨用户但是不让用的行为显得有些不耐烦了，纷纷催促赶快上线让大家使用。看了技术报考后，网友说看来现在生图圈子要成第一个开源碾压闭源的赛道了!参考资料:https://stability.ai/news/stable-diffusion-3-research-paper

【腾讯云】11.11云上盛惠！云服务器首年1.8折起，买1年送3个月！

11.11云上盛惠！海量产品 · 轻松上云！云服务器首年1.8折起，买1年送3个月！超值优惠，性能稳定，让您的云端之旅更加畅享。快来腾讯云选购吧！

Stable Diffusion 3发布文字渲染能力超强，图像生成质量超越Midjourney

StableDiffusion3终于发布了，这一版本在文字渲染、多主题提示和图像质量等方面都有重大突破。这一版本的发布标志着人工智能生成模型的又一次进步，极大地提升了生成图像和视频的质量和真实感。随着技术的不断演进，人工智能生成模型将会在更多领域发挥重要作用，为人们带来更加丰富和精彩的视听体验。

荐Stable Diffusion 3突然发布！与Sora同架构，一切都更逼真了

StableDiffusion3，它终于来了!足足酝酿一年之多，相比上一代一共进化了三大能力。来，直接上效果!首先，是开挂的文字渲染能力。主要支持文生视频和图生视频两个功能。

Stable Diffusion 3入口在哪？如何加入Stable Diffusion 3候选名单？附案例提示词

2月22日，stability.ai发布了StableDiffusion3早期预览版。这一版本在文字渲染、多主题提示和图像质量等方面都有重大突破。灯光昏暗富有戏剧性。

stable diffusion手机版下载地址在哪 AllenTom/diffusion-client产品入口

安卓用户可以用手机玩sd了!最近，小编发现了一个非常强大的工具——AllenTom/diffusion-client。这是一个专门为Android设备设计的强大的Stable-Diffusion-WebuUI客户端。AllenTom/diffusion-client为Android用户提供了一个强大便捷的图像处理工具，让他们能够更轻松地实现各种图像处理任务。

Stable Diffusion安卓版客户端AllenTom/diffusion-client来了手机也可以玩SD

AllenTom/diffusion-client是一个为Android设备设计的强大的Stable-Diffusion-WebuUI客户端。该项目的目标是为Android用户提供一个直接与Stable-Diffusion-WebuUI服务进行交互的解决方案，支持多种图像生成、编辑、修复和换脸等功能。AllenTom/diffusion-client为Android用户提供了一个强大便捷的图像处理工具，让他们能够更轻松地实现各种图像处理任务。

字节发布ResAdapter 可以解决Stable Diffusion肢体异常、画面崩坏问题

字节发布了一款名为ResAdapter的新型工具，该工具可以解决StableDiffusion在生成超大图片以及非训练分辨率图片时出现的肢体异常和画面崩坏问题。ResAdapter还可以与现有的IPadapter以及Controlnet模型兼容。ResAdapter的推出，无疑为图像生成领域带来了新的可能性，期待它在未来的应用中能够带来更多的惊喜。

Stable Diffusion 3官网体验入口文本到图像AI生成模型免费在线使用地址

StableDiffusion3是stability公司推出的新一代文本到图像生成AI模型，相比早期版本在多主体提示、图像质量和拼写能力等方面都有了极大提升。该模型采用了diffusiontransformer架构和flowmatching技术，参数量范围从800M到8B不等，提供了从个人用户到企业客户多种部署方案。想要了解更多信息并开始体验StableDiffusion3的强大功能，请访问StableDiffusion3官方网站。

荐Stability.ai开源全新文生图模型，性能比Stable Diffusion更强！

2月13日，著名大模型开源平台StabilityAI在官网，开源了全新文本生成图像模型——StableCascade。SC是根据最新W rstchen基础模型开发成，大幅度降低了对推理、训练的算力需求，例如，训练W rstchen模型使用了约25，000小时性能却更强劲StableDiffusion2.1大约使用了200，000小时。在训练W rstchen基础模型时，参数总量比SDXL多14亿，但训练成本仅是其8分之一。

Stable Diffusion 3官网体验入口文本生成图像AI模型内测排队地址

StableDiffusion3是stability公司推出的新一代文本到图像生成AI模型，相比早期版本在多主体提示、图像质量和拼写能力等方面都有了极大提升。该模型采用了diffusiontransformer架构和flowmatching技术，参数量范围从800M到8B不等，提供了从个人用户到企业客户多种部署方案。相比早期版本，该AI助手具有更强大的理解和创作能力，是新一代安全、开放、普惠的生成式AI典范。

ResAdapter官网体验入口 Stable Diffusion AI图片生成风格一致性工具免费使用地址

ResAdapter是一个为扩散模型设计的分辨率适配器，它能够在保持风格域一致性的同时，生成任意分辨率和宽高比的图像。与处理静态分辨率图像的多分辨率生成方法不同，ResAdapter直接生成动态分辨率的图像，提高了推理效率并减少了额外的推理时间。如何使用ResAdapter想要了解更多关于ResAdapter的信息以及开始使用分辨率适配器的工具，请访问官方网站：ResAdapter官方网站。

SellMate:Ai动力跨平台销售

SellMate是一个通过人工智能技术提升电子商务游戏的平台，可以无缝跨平台在Amazon、eBay等平台上进行列表，并利用先进的分析和定价见解优化您的列表。

跨平台销售

Vocalo.ai:通过与AI对话成为流利的英语口语者

Vocalo.ai是一个AI驱动的语言学习平台，专注于通过真实的对话体验和即时反馈提高英语口语技能。它模仿真实对话，提供即时反馈，帮助用户在任何时间、任何地点练习英语口语。

AI Studios by DeepBrain AI:AI Studios是一个人工智能创作平台

AI Studios提供了一个用户友好的仪表板，让用户可以轻松创建和管理AI项目。该平台可能包含多种AI工具和功能，以支持用户在图像、视频、音频等领域的创作和编辑。

SimplyNews.ai: 是一个利用人工智能技术简化新闻内容创建和分发的平台。

SimplyNews.ai 提供了一个平台，使用户能够通过人工智能技术轻松创建和分发新闻内容。它可能包括自动生成文章、优化内容以提高可读性和吸引力等功能。

AI文档工具

ReadWeb.ai:免费即时多语言网页翻译与双语查看工具

ReadWeb.ai是一个提供即时多语言网页翻译和双语查看服务的平台，旨在简化全球信息获取。用户可以一键将任何网页转换成多语言资源，提供独特的双语阅读体验，并简化内容分享，促进跨语言的全球连接和沟通。

多语言支持

NUWA-Infinity:是一个艺术作品生成平台

NUWA-Infinity是微软推出的一个艺术作品生成平台，它能够创作西方油画、自然风景、抽象艺术等多种风格的艺术作品。该平台支持文本到图像、图像到视频、图像外扩等多种创作方法。

AI艺术创作

NUWA-XL:基于脚本生成极长视频的多模态生成模型

NUWA-XL是微软开发的前沿多模态生成模型，能够根据提供的脚本以“粗到细”的过程生成极长视频。该模型能够产生高质量、多样化且有趣的视频剪辑，并具有真实的镜头变化。

AI视频编辑

AI动画制作

NUWA:用于视觉合成的统一3D Transformer流水线

NUWA是由微软开发的一系列研究项目，包括NUWA、NUWA-Infinity、NUWA-LIP、Learning 3D Photography Videos和NUWA-XL。这些项目涉及视觉合成的预训练模型，能够生成或操纵视觉数据，如图像和视频，以执行多种视觉合成任务。

AI图片拓展

chatnio:一站式Chat + 中转API站点

Chat Nio 是一款下一代 AI 一站式解决方案，支持多种 AI 模型，具有丰富的功能和优势，提供定价和定位服务。它包括丰富的对话功能、AI 聊天对话功能、模型市场功能、用户管理和计费体系等功能。

vidyo:AI驱动的视频内容再利用平台

vidyo.ai是一个利用人工智能技术将长篇播客和视频转换成适合TikTok、Instagram Reels和YouTube Shorts的短视频剪辑的平台。它提供自动字幕、视频剪辑、模板定制等功能，帮助内容创作者和品牌制作高质量的视频内容。

AI视频编辑

ComfyUI-Flowty-TripoSR:Flowty的TripoSR用户界面改进项目

ComfyUI-Flowty-TripoSR 是一个旨在改进Flowty的TripoSR用户界面的项目，使其更加舒适和直观。该项目可能包含对现有功能的增强以及新功能的添加，以提高用户体验。

sd-forge-layerdiffuse:使用Latent Transparency的透明图像层扩散工具

sd-forge-layerdiffuse是一个用于生成透明图像和图层的工作在进行中的扩展，它利用了潜在透明度技术。该工具目前支持图像生成和基本图层功能，但透明图像到图像的转换尚未完成。代码库高度动态，未来一个月可能会有大量变化。

AI图片拓展

AtomoVideo:高保真图像到视频生成框架

AtomoVideo是一个新颖的高保真图像到视频（I2V）生成框架，它从输入图像生成高保真视频，与现有工作相比，实现了更好的运动强度和一致性，并且无需特定调整即可与各种个性化T2I模型兼容。

图像到视频生成

高保真视频

视频内容创作

ResAdapter:为扩散模型提供一致性分辨率适配

ResAdapter是一个为扩散模型（如Stable Diffusion）设计的分辨率适配器，它能够在保持风格域一致性的同时，生成任意分辨率和宽高比的图像。与处理静态分辨率图像的多分辨率生成方法不同，ResAdapter直接生成动态分辨率的图像，提高了推理效率并减少了额外的推理时间。

分辨率适配

NavAIGuide:多模态智能框架，识别页面任务并执行动作。

NavAIGuide是一个可扩展的多模态智能框架，通过访问移动和桌面生态系统中的应用程序，实现计划和用户查询。具有视觉任务检测、高级代码选择器、面向动作的执行和鲁棒的错误处理等功能。定位于为用户提供高效的自动化解决方案。

ComflowySpace:开源跨平台的 AI 图像与视频生成工具

ComflowySpace 致力于打造精致的 AI-Gen 工具，提供 ComfyUI 和 Stable Diffusion，为开发者和用户打造一个充满活力的社区。ComflowySpace的目标是做出人人都可以使用的ComfyUI & Stable Diffusion产品，从下载安装到插件管理、工作流程模板、流程编辑，每一步都有良好的设计。ComflowySpace 提供工作流程管理功能，您可以在其中查看所有历史工作流程。有了它，您不再需要手动导出和保存工作流程。此外，我们还提供多选项卡功能，允许您同时打开和运行多个工作流程，提高多任务处理效率。在ComflowySpace中，您可以使用各种模板来构建工作流程，让工作流程构建更加简单便捷。

AI 生成

工作流管理

Joia:为团队协作设计的轻量级ChatGPT替代品

Joia是一个为团队协作设计的轻量级ChatGPT替代品，注重隐私保护且开源。它允许用户轻松地为组织中的每个人提供AI聊天访问权限，创建特定用途的聊天机器人并与团队共享。Joia直接与OpenAI等大型语言模型提供商通过API链接，只按实际使用的令牌付费，相比ChatGPT的定价计划可节省高达75%的订阅成本。

聊天机器人

Sudowrite:您一直期待的非评判性、永不枯竭创意的AI写作伙伴

Sudowrite是一款革命性的AI写作辅助工具,旨在成为你永不评判、永远在一旁支持创作、永不枯竭创意的写作伙伴。它集成了GPT-3和GPT-4等大型语言模型,可为你提供各种创作支持,从生成描写、情节发展到角色塑造、修改润色等,全方位提高你的写作效率和质量。主要功能包括:自动续写、情节扩展、重写修改、反馈建议、构思助手、视觉呈现等。无论你是在写小说、剧本还是其他作品,Sudowrite都能给你源源不断的灵感和指导,让创作变得轻松有趣。Sudowrite提供付费订阅服务,定价合理,同时也有免费试用版本。它致力于让写作爱好者重拾对创作的热爱,帮助专业作家提高工作效率。

AI写作辅助

创作灵感激发

小说写作辅助

my Student AI:智能学习助手，提升学生学习效率

Student AI是一个专为学生设计的智能学习助手，它利用人工智能技术提供个性化学习建议、作业帮助和考试准备。该平台旨在通过智能分析学生的学习习惯和理解能力，提供定制化的学习资源和辅导。

智能学习助手

个性化学习

Stable Diffusion 3技术报告流出，Sora构架再立大功！

Stable Diffusion 3技术报告流出，Sora构架再立大功！

借力人工智能推动制造业转型升级

万物互联-集和诚AI边缘计算赋能腾讯无人驾驶车

明治传感器解决方案 | 聚焦智能新能源，AI超级平台让制造无忧

人工智能调节器/调节记录仪在烧结自动配料中应用

2021年中国AI+安防行业发展

AI手机概念沾着就暴涨？多家A股公司紧急回应

智能机器人移动平台：思岚底盘的创新应用扩展

长盛基金杨秋鹏：人工智能应用端或有更多增量

巴展专题｜300多家中国企业亮相竞逐全球AI产业机遇

加入Vicor，让机器人供电系统设计更有“料”

中国春来(1969.HK)纳入港股通，布局AI教育，民办高教龙头打开多重成长空间

元宇宙：连接现实与虚拟的无限可能

中国正在加速进入元宇宙时代，预计2023年将会有大发展

金融元宇宙赋能实体经济-赵永新教授演讲

妈祖文化|推进妈祖元宇宙建设！这份协议签了

疫情时代，元宇宙旅游

元宇宙与数字藏品的联系

普陀创办“元宇宙”工博会，为企业发展建构“内循环”新赛道

光谷元宇宙研究院成立推动科幻产业发展

元宇宙服装已形成产业？Roblox公司在数字服装上赚取数数亿美元

“元宇宙”直播展现顺义冰雪魅力

Stable Diffusion 3技术报告流出，Sora构架再立大功！

Stable Diffusion 3技术报告流出，Sora构架再立大功！

借力人工智能 推动制造业转型升级

万物互联-集和诚AI边缘计算赋能腾讯无人驾驶车

明治传感器解决方案 | 聚焦智能新能源，AI超级平台让制造无忧

人工智能调节器/调节记录仪在烧结自动配料中应用

2021年中国AI+安防行业发展

AI手机概念沾着就暴涨？多家A股公司紧急回应

智能机器人移动平台：思岚底盘的创新应用扩展

长盛基金杨秋鹏：人工智能应用端或有更多增量

巴展专题｜300多家中国企业亮相 竞逐全球AI产业机遇

加入Vicor，让机器人供电系统设计更有“料”

中国春来(1969.HK)纳入港股通，布局AI教育，民办高教龙头打开多重成长空间

元宇宙：连接现实与虚拟的无限可能

中国正在加速进入元宇宙时代，预计2023年将会有大发展

金融元宇宙赋能实体经济-赵永新教授演讲

妈祖文化|推进妈祖元宇宙建设！这份协议签了

疫情时代，元宇宙旅游

元宇宙与数字藏品的联系

普陀创办“元宇宙”工博会，为企业发展建构“内循环”新赛道

光谷元宇宙研究院成立 推动科幻产业发展

元宇宙服装已形成产业？Roblox公司在数字服装上赚取数数亿美元

“元宇宙”直播展现顺义冰雪魅力

借力人工智能推动制造业转型升级

巴展专题｜300多家中国企业亮相竞逐全球AI产业机遇

光谷元宇宙研究院成立推动科幻产业发展