「多模态」智谱再次上桌,glm-4.5V 开源
GLM-4.5V 现已发布 多模态,支持图像、视频输入 (成绩如图) 在「开源多模态」赛道中 42 个榜单,41 个 sota MoE 架构,106B总参数,12B激活 以 MIT 形式开源 API 输入2元/输出6元(百万tokens) 速度:60-80 tokens/s --- 基模 GLM-4.5-Air 延续 GLM-4.1V 路线 视觉编码器+MLP适配器+语言解码器 用了三维旋转位置编码(3D-RoPE) 预训练→SFT→RL三段训练 - SFT 引入显式思维链 - RL 阶段结合 RLVR & RLHF - 优化了 STEM、多模态、Agent 任务 --- GitHub: https://github.com/zai-org/GLM-V Hugging Face: https://huggingface.co/collections/zai-org/glm-45v 魔搭社区: https://modelscope.cn/collections/GLM-45V --- 网页应用 在 www.z.ai,直接使用 GLM-4.5V API 在 BigModel.cn 可领 2000 万资源包 日常调用(百万tokens):输入2元,输出6元 --- 最后:坐等 355B 版本的多模态