AI绘图新秀FLUX爆火,Figure 02人形机器人正式发布,一张照片实现实时直播换脸,这就是这周的AI大新闻!
8.05~8.11,又是刺激的一周。
这周的AI大事件,就都在这里啦。
1.FLUX的周边生态发展迅速
链接:https://x.com/javilop/status/1821814987737735344
前段时间由于SD3的问题,开源的图片生态发展一度停滞,值得关注的
新项目和模型几乎没有。
FLUX上周发布后这个态势被快速改变了,由于其优秀的图片质量,高昂的训练成本并没有阻止开源社区。
而且由于在其偏向真实的美学调教风格,也使生成的发布会写实图片在
推上的热度爆发使得FLUX模型快速出圈。再加上Runway把那张AI生成的照片变成视频让更多人对现在图像和视频模型的发展进度有了更多的了解。
2.Figure发布 Figure 02人形机器人 链接:https://x.com/Figure_robot/status/1820791819023909031 Figure上周发布了Figure 02人形机器人,他们说这是世界上最先进的Al 硬件。2023年2月他们就完成了Figure 02的概念设计,用了18个月才将这个机器人变成实体。
其他动态 ✦ 1.阿里发布通义发布支持语音输入的模型Qwen2-Audio,该模型能够 分析音频信息,包括语音、声音、音乐等,并配有文本说明。 https://qwenlm.github.io/blog/qwen2-audio/
2.阿里推出Qwen2-Math系列的LLM,专注于提高解决数学问题的能 力。模型包括Qwen2-Math-Instruct-1.5B/7B/72B,其中72B在数学测试中超过了GPT-4o和Claude 3.5。 https://qwenlm.github.io/blog/qwen2-math/
3.谷歌的Gemini 1.5 Flash也降价了。输入成本下降了78%,输出成本 下降了71%。1.5Flash现在所有人都可以微调。 https://developers.googleblog.com/en/gemini-15-flash-updates-google-ai-studio-gemini-api/
4.Mistral发布了La Plateforme。支持用自己的数据对已有的Mistral模 型进行微调。另外还有Agents平台,支持对模型进行详细调整构建Agents。 https://mistral.ai/news/build-tweak-repeat/
5. Comfyui上周主要更新内容有提供Hunyuan DiT和FLUX的支持,第四个稳定版本发布,新的TypeScript前端将推出,引入更强大的核心执行引擎,允许实现for循环等高级功能。 https://blog.comfy.org/august-2024-flux-support-new-frontend-for-loops-and-more/
6.GPT-40 0806模型推出,输入Token便宜50%,输出Token便宜 33%。还支持了结构化输出,另外支持16K的输出长度。 https://x.com/OpenAIDevs/status/1820987573793386527
7.Groq宣布获得6.4亿美元的D轮融资,目前估值为28亿美元。此轮 融资由BlackRock Private Equity Partners管理的基金和账户领投。 https://wow.groq.com/news_press/groq-raises-640m-to-meet-soaring-demand-for-fast-ai-inference/
8.Cursor Al 宣布获从a16z、Thrive等公司获得了6,000万美元的A轮 融资,估值达到4亿美元。 https://techcrunch.com/2024/08/09/anysphere-a-github-copilot-rival-has-raised-60m-series-a-at-400m-valuation-from-a16z-thrive-sources-say
9.John Schulman是OpenAl的联合创始人之一,他已经离开该公司加入了竞争对手AI初创公司Anthropic。Greg Brockman也在推上宣布自己开始休假。据The Information报道,ChatGPT的产品负责人Peter Deng也即将离职。 https://x.com/johnschulman2/status/1820610863499509855 https://x.com/gdb/status/1820644694264791459
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。 >/ 作者:歸藏 >/ 投稿或爆料,请联系邮箱:[email protected]
2.Figure发布 Figure 02人形机器人 链接:https://x.com/Figure_robot/status/1820791819023909031 Figure上周发布了Figure 02人形机器人,他们说这是世界上最先进的Al 硬件。2023年2月他们就完成了Figure 02的概念设计,用了18个月才将这个机器人变成实体。
- 语音到语音: 能够通过内置麦克风和扬声器连接自定义AI模型与人类对话。
- 摄像头: AI驱动的视觉系统由6个内置RGB摄像头组成。
- 手部: 第四代手具有16个自由度并具有人类等同的力量。
- 内置大语言模型(VLM): 使机器人摄像头能够快速进行常识性视觉推理。
- 电池: 机器人躯干内的2.25千瓦时定制电池组提供超过50%的能量。
- CPU/GPU: 提供比上一代多3倍的计算和AI推理能力。
其他动态 ✦ 1.阿里发布通义发布支持语音输入的模型Qwen2-Audio,该模型能够 分析音频信息,包括语音、声音、音乐等,并配有文本说明。 https://qwenlm.github.io/blog/qwen2-audio/
2.阿里推出Qwen2-Math系列的LLM,专注于提高解决数学问题的能 力。模型包括Qwen2-Math-Instruct-1.5B/7B/72B,其中72B在数学测试中超过了GPT-4o和Claude 3.5。 https://qwenlm.github.io/blog/qwen2-math/
3.谷歌的Gemini 1.5 Flash也降价了。输入成本下降了78%,输出成本 下降了71%。1.5Flash现在所有人都可以微调。 https://developers.googleblog.com/en/gemini-15-flash-updates-google-ai-studio-gemini-api/
4.Mistral发布了La Plateforme。支持用自己的数据对已有的Mistral模 型进行微调。另外还有Agents平台,支持对模型进行详细调整构建Agents。 https://mistral.ai/news/build-tweak-repeat/
5. Comfyui上周主要更新内容有提供Hunyuan DiT和FLUX的支持,第四个稳定版本发布,新的TypeScript前端将推出,引入更强大的核心执行引擎,允许实现for循环等高级功能。 https://blog.comfy.org/august-2024-flux-support-new-frontend-for-loops-and-more/
6.GPT-40 0806模型推出,输入Token便宜50%,输出Token便宜 33%。还支持了结构化输出,另外支持16K的输出长度。 https://x.com/OpenAIDevs/status/1820987573793386527
7.Groq宣布获得6.4亿美元的D轮融资,目前估值为28亿美元。此轮 融资由BlackRock Private Equity Partners管理的基金和账户领投。 https://wow.groq.com/news_press/groq-raises-640m-to-meet-soaring-demand-for-fast-ai-inference/
8.Cursor Al 宣布获从a16z、Thrive等公司获得了6,000万美元的A轮 融资,估值达到4亿美元。 https://techcrunch.com/2024/08/09/anysphere-a-github-copilot-rival-has-raised-60m-series-a-at-400m-valuation-from-a16z-thrive-sources-say
9.John Schulman是OpenAl的联合创始人之一,他已经离开该公司加入了竞争对手AI初创公司Anthropic。Greg Brockman也在推上宣布自己开始休假。据The Information报道,ChatGPT的产品负责人Peter Deng也即将离职。 https://x.com/johnschulman2/status/1820610863499509855 https://x.com/gdb/status/1820644694264791459
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。 >/ 作者:歸藏 >/ 投稿或爆料,请联系邮箱:[email protected]