影眸,是干啥的?
影眸,是干啥的?
名字听过很多次,愣不知道干啥的
这是个很神奇的存在:
• 奇绩、蓝驰、红杉这样的 VC 投了,字节、美团这样的大厂也投了 • 论文发了一沓又一沓,也拿到了图形学顶会 SIGGRAPH 的最佳论文 • 在海外,很多 3D 设计师天天磕着重金(吐槽:很贵)在用
但你要问,这帮人具体是干嘛的?
哈哈哈哈哈哈哈,不知道 

前段时间去了趟上海,在模力社区见到了影眸(Hyper3D.AI)的 CEO 吴迪 和 CTO 张启煊
在和他们聊了一个晚上,又读了几万字的有关材料,于是就有了本文这篇“非官方说明书”,希望能把这家公司,一次性给讲清楚
影眸是谁
简单来说,这是一个做 3D 生成的团队,为了方便记忆,先上三个标签:
• 产品标准:生产级方案 • 技术选择:反共识赌徒 • 背后的人:清醒的天才
口说无凭,先看东西
为了解释什么叫“生产级”,看看他们最近刚上的 BANG 功能,非常有意思:
看完这个,我们再往下聊
产品标准:生产级方案
影眸的核心产品叫 Hyper3D.AI(底层模型叫 Rodin)
它的存在,是为了解决一个核心问题:
很多 AI 生成的 3D 模型,都很好看,但结构混乱
艺术家拿到手,发现是三角面混杂、拓扑混乱、UV 也没展好,这种模型在工业流程里被称为“脏数据”,根本没法做绑定(Rigging)和动画,美术师还得照着它重做一遍
于是,有一个词就变的特别重要:Production-Ready(生产就绪)
意思很简单,AI 生成的东西,必须符合工业标准(三角面&四边面、合理的布线、PBR 材质),能让艺术家直接上手干活
为了实现这个目标,他们做了几件很具体的事
第一件,让模型能被拆开:BANG(分件)功能
一个 AI 生成的完整“铁疙瘩”,美术师是无法精修的
BANG 功能,是基于物理理解的拆解,把一个完整的模型,按其物理结构,自动拆分成独立的、可编辑的“零件”
然后,就可以进行更精细化模型建构,分部件精调优化,特别适用于高精度模型要求,比如游戏、影视、工业设计制作等领域
就像是把一个图片,拆成了一组 .psd 里的图层
“你点一下分件,我们先给你一张‘蓝图’预览,不满意可以换一种拆法”
“确定后,模型‘啪’一下就炸开了,你还能选中其中一个零件,让它再炸一次”
- 启煊 影眸CTO
Bang 这里, AI 需要解决一个很大的技术难点:理解物体的内部结构,比如车轮轴承是怎么连接的
在 Bang 之后,他们前两天又上了一个更离谱的功能,叫做“部分重做”。咋理解呢,就是...你可以调整边框到想要重做的部分,就可以进行部分重新建模
第二件,让模型更“听话”:3D ControlNet
为了让生成结果不“放飞自我”
他们研发了 3D 版的 ControlNet
设计师可以通过画框(Bounding Box)、给点云(Point Cloud)、甚至涂体素(Voxel)的方式,预先设定好模型的大致形态、尺寸和位置
然后,他们还针对不同场景,提供了不同模式:
Zero 模式:专为移动端优化,低面数但质量不错,是行业唯一
Focal 模式:高精度,满足影视级需求
Speedy 模式:快速预览,帮设计师迭代
Default 模式:平衡细节和表面平滑度
第三件,让工具融入工作流:全平台插件
这也是我觉得他们最“鸡贼”(褒义)的地方
他们没有试图把用户绑架到自己的网页上
而是把 Hyper3D.AI 的所有功能,打包塞进了一个深度集成的插件里
目前,这套插件已经覆盖了 Blender、Unity、Unreal Engine、Maya 等主流 3D 软件,甚至包括 ComfyUI 这种节点式工作流
通过一个“画中画”浮窗,直接调用 AI 的全部能力
这里得说一下,这些功能并非阉割版
“我们几个核心创始人都亲自用 Blender,自己剪视频、做渲染” “所以我们知道做这件事会遇到哪些困难,知道怎么用才方便”
这解释了为什么他们的产品,总是在一些细节上让专业用户觉得“对味”
最后,谁在买单
首先我得说....这东西贵的离谱,还特么一堆人在买,有个哥们直接开了 7 个 1200刀/月的账号...
然后我细细了解了下,影眸目前的落地场景,集中在两个极端
一种是超大规模的 UGC 游戏平台
某个 5 亿玩家的大型在线游戏,就是在用他们的模型生成游戏道具
另一个是实体制造与 3D 打印
用户生成完模型,直接就能打成实体玩具,内部结构是合理的
技术选择:反共识赌徒
理解了他们现在做什么,下一个问题是:
为什么影眸对“Production-Ready”这件事,如此执着,甚至有点“轴”
答案在他们的过去
故事一:一切始于一个“球”
影眸的故事,始于一个巨大的、布满灯珠和摄像头的球形设备:穹顶光场(Dome Light Stage),或者...称之为「那个很大的球」
这是他们创业的第一个项目,为 3A 游戏和电影提供微米级精度数字人扫描的服务,给很多明星、网红(比如 Tim)都提供过服务
这里的核心技术叫“光度立体法”(Photometric Stereo),设备会在 短时间内投射几十种不同的光照模式,捕捉皮肤在不同光线下的微小起伏(法线信息)
但这个业务商业上很苦,是辛苦的项目制
技术再牛,客户用不了,就是零
他们花了整整一年时间,才把扫描出的数据格式、坐标轴、接口,一点点对齐到影视行业的标准生产管线里,他们比谁都清楚,材质(Material)、几何(Geometry)和光照(Lighting)是如何解耦的
这段经历,把“生产就绪”这个理念,焊进了团队的 DNA
故事二:公司的生死存亡之战
这个“血泪教训”,甚至在后来救了公司一命
时间来到 2023 年,影眸当时正处在最低谷
一轮美元融资协议都签完了,甚至连庆祝的饭都吃了两顿,结果因为地缘政治原因,LP(出资人)临时撤资
钱没了
公司账上只剩几个月的粮草,Founder 们集体降薪,裁员三分之一
就在这个节骨眼上,他们必须为 3D 生成选择一条技术路线
当时的主流是2D 升维,2D to 3D,也就是先用 AI 生成一堆图片,再通过多视角算法“猜”出 3D 模型
这条路见效快,Demo 漂亮,投资人喜欢,所有竞品都在跑,但影眸没有跟风
正是因为有过“穹顶光场”的三维重建经验,他们深刻理解“2D转3D”这条路的致命缺陷:
这种做法,本质上是摄影测量,在信息收集的过程中把三维信息降维到了二维,在还原信息的过程中一定会伴随着信息丢失,会导致生成的模型产生大量的噪声
于是到了最后,就需要花费更多的人力修复,才能让素材接入到后期流程
于是,在账上只够一次训练机会的情况下
他们反向押注了当时无人看好的3D 原生(Native 3D)路线
放弃图片中转,直接构建了一个 3D 原生大模型架构(CLAY),让 AI 直接学习三维数据的几何结构
“就一次训练机会,训不出来就没了”
他们赌赢了
7 个月后,Rodin 上线,它是当时唯一能生成干净的三角&四边面网格的模型
于是,影眸活了下来(Rodin ARR 飙得很快,但他们...不让我说具体数字),也有了今天的技术壁垒
背后的人:清醒的天才
产品和技术的背后,是人
影眸的团队气质,可以通过另一个故事来理解:一个被主动杀死的“爆款”
2021 年,他们曾做过一个叫 WAND 的 AI 二次元画板 App
这东西,比 Midjourney 还早,所用的技术,是基于他们自己实验室的SofGAN,相关成果也发表在了图形学顶会 ACM ToG(ACM Transactions on Graphics) 上,
WAND 这东西上线两周,用户便破了 160 万,冲到 App Store 榜首,在中国和日本都拿了第一。但也就在产品最火的时候,他们选择停掉
理由是... GAN 技术路线有明显天花板,无法实现真正的“万物生成”和“语义理解”
你没看错,就因为这么个原因,他们放掉了一个百万用户的产品(甚至连商业化都没去做,只被动的收入了几千块的广告费)
太特么牛逼了...对于这些天才来说,似乎,取得世俗意义上的成功是里所应然的,把精力投入真正看中的事情上,才是值得去做的
最后
从二次元画布,到物理的“球”,再到今天专注的工具...经历了这么多,很难想象:特喵的创始团队,还特么博士在读,淦!
聊到最后,我问 CEO 吴迪
“现在最重要的事是什么”
他想了想,说
“还在考虑”
你特么...
还有个事,我得吐槽
写这篇文章的时候,我想找他们要份融资用的材料参考一下
结果他们两手一摊:
“没有,我们当时连 PPT 都没有”
这特么....什么草台班子,居然还这么多人追着投,淦!