Z Tech|对话Lecun和谢赛宁爱徒,00后OpenAI奖学金博士Peter Tong:揭秘多模态大模型的革命突破
Cambrian-1:以视觉为核心探索多模态大语言模型
设计并评估了20多种视觉编码器
提出了新的视觉基准测试CV-Bench 引入了动态空间感知连接器SVA(Spatial Vision Aggregator ),高效集成视觉特征和语言模型 提供了高质量的开放式视觉Instruction Tuning数据集
MetaMorph:LLM的“视觉超进化”
200k数据+指令微调,让语言模型直接输出连续视觉Token 使用VPiT预测多模态Token 在生成视觉Token之前隐式执行推理步骤