浮之静

WebUI v1.6 发布,SDXL 油画微调模型,冠军级无人机竞赛,Chrome 全新 UI,Copilot Chat

WebUI v1.6 发布

AUTOMATIC1111/stable-diffusion-webui/releases/v1.6.0[1]

近日,AUTOMATIC1111 公布了其 Gradio 网络用户界面的 1.6.0 版本的更新日志。本次更新带来了一系列新特性、小修正、扩展和 API 更新。具体更新请查看日志,以下为摘要。

新特性:

  • 渲染与编辑:现支持 refiner、样式编辑对话框、多重模型内存加载以及 NV 选项,让 CPU/AMD/Mac 上生成的图像与 NVidia 显卡相同。对提示编辑和关注进行了改进,并增加了空格支持(如:[ red : green : 0.5 ])。

  • 采样器与去噪器:推出了多种新的采样器如 DPM++ 2M SDE 系列。同时,DDIM、PLMS、UniPC 已经重构,与 k-diffusion 采样器使用相同的 CFG 去噪器。增加了与 img2img 的兼容性,可进行提示组合(AND),SDXL 可用。

  • 为 SDXL 添加了文本反转推理支持,加入了只为 SDXL 模型启用的 --medvram-sdxl 标志。

  • 用户界面与性能:UI 中始终显示额外的网络选项卡,模型创建时使用更少 RAM,并改进了批处理默认行为,帮助避免内存溢出。

  • 文本与 VAE 编辑:增加了文本反转推理支持,VAE 的选项允许用户为每个检查点选择自己的 VAE,并将其加入到信息文本中。

  • ...

次要更新:

  • 性能与使用性:增强了 RAM 和 VRAM 的节省策略,对 img2img 和 txt2img 的处理有所优化,使图片查看更加贴合整个页面,且进度条更新更加频繁。

  • 界面与设置:加入了新的 Gradio 主题,并提供用户自定义值的说明,加入了多项设置选项,如缩放和平移、快速设置项目的宽度可变等。

  • Lora 与采样器:在 UI 中为 Lora 添加了 Norm 模块和偏见支持,同时对一些采样器进行了修正和调整。

  • ...

扩展和API:

  • 版本更新:Gradio 已更新至 3.41.2,并为多个包如 transformers、GitPython 等也提供了版本 bump。

  • UI 与脚本:增加了自定义的 UI 元素,合并了手风琴和复选框,并为脚本提供了不使用 gr.Group 的 UI 选项。

  • API 调整:支持在 API 中的 http/https URLs,并加入了多个命令行参数如 --loglevel 和 --disable-extra-extensions。

  • ...

SDXL Allaprima

sdxl-allaprima[2] 一个用块状油画和静物微调的 SDXL 模型(网站还提供了很多精美示例)。

Image

Image

Swift 击败人类冠军

近日,Nature 上发表了一篇名为 Champion-level drone racing using deep reinforcement learning[3] 的文章,大意为一个神经网络驾驶的无人机,以极高的速度飞行,在 FPV 无人机赛中击败了人类冠军。

"Swift" 是一个自主无人机系统,能够在真实世界的比赛中与人类无人机世界冠军竞速。通过结合仿真中的深度强化学习(deep reinforcement learning)和真实世界中的数据,Swift 成功地在与人类冠军的多场比赛中取得胜利,并创下了最快的比赛时间记录。此研究标志着移动机器人技术和机器智能领域的一个重要里程碑。FPV 无人机竞速是一项电视体育活动,其中飞行员通过戴头盔来实时控制并观看无人机的第一人称视角,体验高速、高度敏捷的飞行。

ImageSwift 与 2019 年无人机赛事联赛世界冠军 Alex Vanover 进行了正面对决。比赛轨道由七个须依次通过的方形门组成。要赢得比赛,参赛者必须在对手之前连续完成三圈。图 b 展示了 Swift(带有蓝色 LED 灯)和人为操控的无人机(带有红色 LED 灯)的特写视图。本研究中使用的自主无人机仅依赖于机载传感器的测量,不需要外部基础设施的支持,例如运动捕捉系统。图 c 从左至右展示了:Thomas Bitmatta, Marvin Schaepper 和 Alex Vanover 正在比赛轨道上飞行他们的无人机。每位飞行员都戴着头盔,上面显示从他们飞机上的摄像头实时传输的视频流。这种头盔为飞行员提供了沉浸式的“第一人称视角”体验。图 c 的照片由 Regina Sablotny 拍摄。
ImageSwift 由两个关键模块组成:一个感知系统,可以将视觉和惯性信息转化为低维状态观测;以及一个控制策略,可以将此状态观测映射到控制指令。控制指令指定了所需的集体推力和身体速率,这与人类飞行员使用的控制模式相同。图a中,感知系统由一个 VIO 模块组成,该模块从摄像头图像和由惯性测量单元(IMU)获得的高频测量中计算无人机状态的度量估计。与神经网络结合使用的 VIO 估计可以在图像流中检测赛道门的角落。角点检测被映射到一个 3D 姿势,并使用卡尔曼滤波器与 VIO 估计进行融合。在图 b 中,我们使用模型无关的在线深度 RL 在仿真中训练控制策略。在训练过程中,策略最大化了一个奖励,该奖励结合了朝向下一个赛道门中心的进展和一个感知目标,以保持摄像头的视场中有下一个门。为了将赛道策略从仿真转移到物理世界,我们使用由赛道上收集的实际经验识别的数据驱动的残差模型来增强仿真,对车辆的感知和动力学进行模拟。MLP 表示多层感知机。

Chrome 新 UI

Chrome 新版本 UI 开启,带来全新体验:

  • 在浏览器输入 chrome://flags

  • 然后搜索 Refresh 2023

  • 找到 Chrome Refresh 2023 和 Chrome WebUI Refresh 2023 启用

  • 重启浏览器即可生效

Image

Image

GitHub Copilot Chat

VS Code 插件推荐,GitHub Copilot + GitHub Copilot Chat 将带给你全新的写代码体验,直接在插件市场搜索 GitHub.copilot 和 GitHub.copilot-chat 安装即可。

Image

References

[1]

AUTOMATIC1111/stable-diffusion-webui/releases/v1.6.0: https://github.com/AUTOMATIC1111/stable-diffusion-webui/releases/tag/v1.6.0

[2]

sdxl-allaprima: https://replicate.com/doriandarko/sdxl-allaprima

[3]

Champion-level drone racing using deep reinforcement learning: https://www.nature.com/articles/s41586-023-06419-4