你能看腿识鸟吗?这正是我们在研究的难题
引子
1. 笑话一则:看腿识鸟人
有一个大学的一门生物课上,教授在讲授各种鸟类的知识,有个学生本就聪明,上课且认真,笔记记了一大本不说,还从图书馆中查阅了很多有关鸟类的详细信息,应付考试可谓是充分有余了。然而考试那天,当这个学生走进考场打开试卷时,不禁目瞪口呆:试题倒是很简单,画了各种鸟的腿,让你填写鸟的名字,而课堂上讲的其他内容以及他在图书馆准备的那些详细资料,统统没有。这个学生沮丧气愤之余,扔下试卷转身就往教室外走去。此时,教授叫住了他,问:你叫什么名字?这个学生倒也不含糊,把裤腿一撸,反问教授:你看看我是谁?
看腿识鸟人
2. 滴血认亲
“滴血认亲”是古装电影电视剧中的常客,大多情节往往表现的是私生子女与“陈世美”父亲在一场官司中相会,父不认,子难诉,官欲究,案要决,此时,滴血认亲就上场了。一般的场景是打一碗清水,分别割破父子手指,将血滴入水中,如果两滴血能融到一起,那就说明他们是父子,不融则无关系。当然,现在大家都知道这种方法很不准,因为血能不能融取决于血型,而与血缘无关;但是,我们可以看到,走到这一步时,人类对血缘的认识已经进了很大一步,至少不是简单地比较相貌。
3. 一根毛发
警察在破获一起凶杀案时,发现凶手是个老手,现场没有留下任何指纹,死者的指缝中也没有留下凶手的任何线索,就连现场都被凶手用水冲刷了多次,干干净净。一筹莫展之时,一名警察却发现了一根不起眼的毛发混迹在一个角落,显然不是死者的。于是,警察带着这根头发来到技术检验科,经过DNA分析,查阅DNA数据库,很快就找到了凶手。即使凶手再狡猾,再有经验,百密一疏,在有了DNA检测技术之后,哪怕是一粒皮屑,都能让凶手即刻现身。
人体毛发分析
上面故事其实都涉及到一个重要问题——成像中的目标识别。
熟悉目标识别的学者其实很容易发现,“看腿识鸟”、“貌似”和“滴血认亲”的故事都发生过,甚至现在还在继续发生,却从来没有发现做过“基因诊断”的,这显然说明我们在目标识别的问题上还依然处在初级阶段。比如,我们在识别飞机时,主要依靠的还是飞机的形状,辨别真伪多是依靠光谱……
可是,识别飞机依靠形状也就是“貌似”时,那就意味着飞机必须要占很多像素才行,这就是说飞机离得比较近的时候才好使,那么,再远一点呢?如果远到只剩下一个像素甚至是亚像素时,还有办法识别吗?当然,从上面的故事中,朴素的结论就是当目标识别发展到“基因诊断”阶段时,就有可能识别一个像素或者亚像素。
而这个“基因诊断”阶段到底是什么特征,从成像的角度上看该如何来提供“基因”,这就是本文要探讨的问题。
不同角度下飞机的红外辐射图像
特征,乃目标识别之依据也!
识别是个古老的问题,不仅人类需要,而且动物也需要,它的本质问题是需要一定的知识积累,建立起特征数据库,识别时进行特征比对,当特征达到一定概率时,往往就认为是完成了识别任务。识别往往是生存的需要,部落里的原始人判断一个陌生人是敌是友,往往靠着观察和行为,当然也会用狗这样对气味敏感的动物依靠气味识别。养过狼狗的人经常会有这样的经验:当一个离开家很久的家人离家至少几百米距离时,狗会依据走路声音和气味判别家人回来。
目标识别
成像系统中的目标识别主要还是依据目标的形状信息,而且是目标细节越丰富,识别率越高,典型如人脸识别,已经从特殊行业普及到了门禁、手机和支付系统了,甚至戴眼镜、戴口罩都不影响识别。
但是我们可以看到,人脸识别多适用于近距离工作,主要原因是人脸必须要占据足够多的像素数(也就是分辨率)才能达到提取形状特征的要求,远距离就很难,除非焦距很长。当然,人脸识别也会面临着“照片解锁”、“仿真面具”等挑战,此时就必须要考虑上手段了,比如部分高端手机的ToF(time of flight)三维成像。
3D人脸识别
在军事应用中,目标距离往往以公里甚至上百、上千公里来计,尽管成像系统拥有长焦距,但目标依然只能是百像素左右的形式才能够有一定的形状信息提供给识别系统,因为应用场景比较特殊,目标有限情况下,对于识别目标还能应付。但是,对于假目标、敌我目标和伪装等形式,识别概率就会严重下降,甚至会因为失去了形状信息而无能为力。
此时面对的其实就是典型的维度下降场景,那么,在识别原理没有颠覆性的进化时,我们应对的手段似乎只有一条,那就是“升维”。
时间序列点目标识别
于是,科学家就想出了光谱识别的办法来应对识别难的问题。从理论上来讲,这种方法当然有效,因为光谱一直被誉为物质的指纹,有了指纹,还怕破不了案?但是,在实际应用过程中却出现了不少问题,原因是“指纹”信息采集不够完整,我在之前的“按偏了的指纹”一文中有详细介绍,简单总结就是:
(1)因为分光的问题光谱能量探测信噪比降低,直接导致作用距离下降;
(2)成像光谱仪通用性强,很少考虑专用特征光谱的选择问题,导致识别实际效果并不好;
(3)目标特性物理多维度建模方法尚不能满足当前的识别需求。
飞机尾流的光谱特征
当然,我们还可以从偏振入手考虑这些问题,因为偏振也是目标的典型特征啊。但偏振也同样面临着光谱识别的问题。
我们把上面这些问题归纳一下,你会发现这不就是光场问题吗?
计算成像一直强调多维光场问题,显然,强度、光谱和偏振都是光场信息的表征,再加上空间(也就是形状、距离等)和时间(时域变化特征也是目标识别的一种手段)信息,这些都是目标识别的基本元素。
强度、彩色与偏振光谱成像对比
于是乎,我们可以认为光场函数 L(x,y,z,θ,ф,λ,P,t) 中的每一个物理量都是目标识别的特征量,这些量的不同组合就构成了不同的识别方法。
在“百闻不如一见”、“图像识别靠形状”的执念中,以及似乎“只有看到轮廓、甚至细节才能识别目标”的巨大惯性中,当失去了形状时,就开始举手投降了,甚至连“滴血认亲”都没做,更压根没有“DNA的基因检测”,如何不说是悲哀呢?
冷静思考一下,在光场函数这么多变量下,仅仅丢掉了,依然还有那么多元素,怎么就不能识别呢?
当然,原因也很简单,因为传统的成像基本上就是仅仅用到了空间的强度分布,最多加上了时间,没有高维度的光场信息,自然是“巧妇难为无米之炊”,思维也就局限在了低维度。此时,我们再次呼唤“升维”与“成像范式”,具体可以参考我之前写的文章。
识别的维度与基因
既然说光场函数L(x,y,z,θ,ф,λ,P,t) 的每一个物理量都可以作为目标识别的特征量,自然是特征量的组合维度越高,识别率就越高了。可是,这些特征量该怎么组合,如何优化,用最小的代价获取最大的收益,也就是怎么用最少的物理量完成识别的目的。
正如上文所述,常规的成像识别主要还是依据形状这样的空间信息完成,这非常符合人类“眼见为实”的“处世”准则,毕竟人类是靠着容颜来相互辨识的,打眼一看,就知道谁是谁,而不会像狗那样嗅来嗅去靠着气味辨认。但“未见其人便闻其声”之事也实属常见,《红楼梦》中对王熙凤初见林黛玉时的场景就有类似的描述,那也就是说声音也可以作为辨识特征,只是它是关于时间的一维信号而已,从维度上来看,其辨识度上也远没有“容颜”容易,毕竟“打眼一看”获得的二维信号比一维的声音信号信息量丰富了很多。当然,我们还可以依靠指纹、虹膜,甚至用DNA做识别,其特征在识别算法上则更为“显著”,准确率更高,但这些特征对获取要求很高,而且需要近距离,甚至还要侵入式采集,配合度要求很高,我们不做讨论,因为,这里关心的是远距离、甚至是超远距离。
《红楼梦》剧照
既然是远距离,成像问题实则变成了探测问题,也就是偌大的一个目标变成了图像中的一个点,没有了形状,没有了细节,甚至没有距离信息(z),画面上只能看到几个点,也就是说一只蚊子、一只鸟闯入视野都会造成干扰,那么,如何判断哪个点是目标,哪个点是干扰物,甚至要判断出那个点到底具体为何物:导弹还是飞机?敌机还是我方战机?
远距离动态弱小目标检测
怎么办?我们捋一捋思路:所谓的一个点其实是目标的强度信息,这主要是探测发现目标时利用的典型特征,而且几乎是唯一的特征。
这就有点类似前面的“看腿识鸟”,甚至是只看到了一只鸟脚趾,要识别它,确实难度不小。
之所以难以识别,原因其实只有一个:维度太低!于是,我们就有了思路,那就是升维。
在这个光场函数 L(x,y,z,θ,ф,λ,P,t) 中,常用的识别元素多是强度的空间分布,如果是彩色图像,还会加上RGB的三色光谱,写出来也就是 L(x,y,λRGB) ,显然光谱、偏振和时间的信息还没有更好利用。如果没有了空间信息,我们再把光谱、偏振和时间信息补充进来,这时候的光场函数就可以写成 L(λ,P,t) 。显然,从数学上看这个光场的形式,从参数上与上一个公式比并不吃亏,甚至还占有一定的优势,理论上,这些参数做识别也不会有问题,只是对我们有些陌生罢了。
光场升维
其实,这也很容易理解,“直观”这个词就能给出很好的解释,那就是看起来更直截了当——人类依靠视觉获得信息超过80%以上。比如,人类最擅长的是用“长得像”去猜测某个人是不是哪个名人的私生子女,这种手段最大特点是容易蛊惑人心,迎合吃瓜群众的心理,毕竟他们大多数内心揣着的是“最好是”的恶意。当然,这种做法误伤率很高,因为其出发点和依据的因素都经不起推敲。再如人脸识别流行的年代,尽管算法的识别率已经很高了,但拿打印照片和戴仿制人脸面具还是经常能骗过算法。而人一旦到了陌生的领域,那种“求生”的欲望马上占据了最高优先级,“保命”成了大多数人的选择;于是,我们就看到跟风研究的人群占据了大多数,而敢于开拓新领域的往往成了特立独行的极少数。
仿制人脸破解人脸识别算法
于是乎,我们就很容易想到:光场中每个分量都是识别“基因”的一份子,多个分量的有机组合是构成识别的基石,而且,理论上,更多的分量会带来更高的识别率。
这句话读起来没毛病,做起来却不容易。原因是现在的光电成像技术主要还是依赖于强度探测,而且是其他主要物理量也要从强度量反演。
这也就是说,光电成像探测中,在同一时间、同一空间内,我们只能得到强度这一个量,如果还要想得到相位、偏振、光谱这样的信息,必须得牺牲时间或者空间记录下来相应的强度值,然后换算成相应的物理量才行。
这是因为光电探测的基本原理是光电效应,而光电效应最大的特点是:只要光的频率满足条件,不管三七二十一,无论相位、偏振等等,一概降维为强度,于是相位、偏振、光谱等信息只能依靠记录下来的强度按规律解译了,这无疑给成像探测造成了很大的麻烦。
而这种麻烦的解决,只能依靠新的成像范式来解决,于是,我们得继续面对“升维”的问题。
升维,再谈范式设计问题
我们这篇文章讨论的是点目标的识别问题,前提是只有一个像素点,目标的空间分布直接降维成0,这个点最多有个强度信息,而这个有限的强度信息居然常常被我们拿来区分它是目标还是背景,贡献不小呢。但这个目标到底是飞机还是导弹,还是蚊虫在飞、树叶在飘,却是个巨大的难题,毕竟,还没有人做过呢!而且,我们知道,单纯地依靠这个目标点那点可怜的强度信息压根不可能做识别。那该怎么办?
改。
怎么改?答曰:升维!
怎么升?答曰:最大公约数法。
具体怎么做?答曰:先满足最基本需求,然后优化设计,具体要看任务需求。
当然,以上是基本思路。为了讲清楚这个问题,我们可以先看一个例子。在红外探测远距离目标时,经常会发现视场中有两个甚至多个目标特性显著的亮点,因为是演习,事先知道只有一个目标,显然这里有假目标,那么该怎么判别呢?工程人员采用了把红外分成四个以上的波段做多光谱探测,根据预先知道的目标特性信息,假目标很容易被剔除。你看,就是这么简单。
多波段红外光谱检测
可是,既然这么简单,为何没有广泛推广应用呢?甚至几乎在已有的装备中难觅其踪,为何?
其实在讲上面的那个例子时,一个很重要的信息没有提,那就是用了多光谱之后作用距离明显下降了,也就是原先还能看到目标,现在看不到了,而为了能判别真假目标,必须得凑近了才行。于是,很多人就不愿意了,代价太大!你想想,如果凑得太近的话,可能你就会被干下来了!这个问题的解决方法我们放在后面再讲。
不同作用距离下的红外成像信噪比
抛开作用距离不讲,我们仅仅从这一个最简单的例子看出,简单粗暴地用了几个谱段,有时能展现出一定的效果。当然要解决更复杂的问题,必须要采取更复杂的方法,简单的几个谱段肯定不能满足需求,而且采用多少个光谱几乎无人能说清楚,毕竟不同的目标光谱特征不一样。能不能再考虑升维呢?
当然可以,毕竟我们才仅仅使用了一个光谱维λ而已,而偏振P 这个物理量有着它更高层级的物理内涵,把它用起来肯定会带来更强的识别能力,这一点从偏振医学成像的应用就能看出,在图像中加上偏振这个维度后,癌细胞的识别率大幅提升。
而且,还有一个维度时间t 更是识别中不可忽略的重要因素,而且获取时间维的代价要比光谱和偏振要小得多,因为图像获取本身就是带时间标签的。如果你认为t 仅仅是为了能量积累,那就大错特错了,因为目标与背景的强度I、光谱λ和偏振P在时间维度上的概率分布大不同,那也就意味着也许我们只用有限的十几、最多几十帧数据就能统计出这个点目标的概率分布曲线,从而判断出它是不是目标,而这有限的几十帧也许往往只是零点几秒即可完成。
基于超表面的全参量成像系统示意图
如此说来,点目标识别升维的数学表示形式可以是λ、P 和t 的任一组合,即L(λ,P) 、L(λ,t) 、L(P,t) 和L(λ,P,t) 。如果从维度上看,当然是L(λ,P,t) 识别目标的能力更强,而其付出的代价也必然最大。在之前我写过偏振成像和光谱成像的内容,方法也很多,也写过偏振多光谱成像的方法,但是能够应对点目标识别的方法却是一大挑战,毕竟谁也不想以牺牲作用距离为代价来换取点目标的识别,因为如果作用距离下降的情况下,或许单纯的能量探测手段就已经能看到目标的形状了。
应对挑战
科学精神的本质是质疑,科学家刻骨子里的倔强就是挑战不可能,也就是没苦找苦吃的那种。
其实这里的挑战主要有两个:其一是能量,其二是范式。
首先,我们来看能量的问题。这个问题最致命,很难回答,毕竟它属于“既要又要还要”的那种,完全不符合热力学第一定律。但在“既又还”的时代,很多要求就是这么提的,当然,实际的需求也摆在那里,更不能说人家违反常识。那么要解决这个问题,必须要围绕着能量来考虑。
于是,第一种想法就会提出:提升探测器的灵敏度。是啊,提升探测器灵敏度肯定能补偿偏振和光谱探测带来的能量损失,可是再一想,不对,因为灵敏度提升之后,作用距离也同步提升了啊。那第二种方法可能就是新旧体制结合起来,也就是在原先的设备上再加一套偏振/光谱探测装备,答案显然而知。
那么第三条路在哪里?当然是计算成像,而且,这条路不仅考虑了能量的问题,而且也兼顾了范式设计的问题,其大致途径有两条:
一条是把偏振、光谱各个分量想办法集合起来,提升探测到的总强度;这当然要从物理模型上考虑其合成的依据,而且噪声问题怎么解决亦非易事。其在范式设计上可以考虑光谱/偏振编码的方式,优点是方法简单、代价很低,缺点是能量损失较多,编码固定。
另一条途径是研制具备全色、光谱和偏振功能的新型探测器,目前,这方面的方案也不少,至少我的团队也参与了一种宏像素的方案设计;其优点是引入了全色像素,保障探测距离不会降低,而且整个系统设计也变得简单多了,无需分光等复杂光学系统;其缺点是空间分辨率会下降,而且多光谱一旦设计好了就无法再改变,适用范围也会打折。
二维计算型光电探测器的潜在研究方向
我一直在关注新型光场操控技术的发展,也许在不久的将来,科学家能设计出可编程光谱滤片,有了这样的器件,多光谱成像将变得强大无比,随应用切换光谱的模式将会很大程度上取代高光谱相机。
新型光场操控技术:光子筛选元全息图
当然,在没有可编程光谱滤片这种神器加持的情况下,我们还有一条路可走,那就是AI的助力。
AI助力
其实AI在点目标识别问题上主要可以发挥两个作用:
一是低信噪比信号处理,主要解决能量不足导致探测距离缩短的问题;
二是离散少信号的全域恢复问题,主要解决多光谱谱段固定曲线匹配困难的问题;
而现在很多的研究表明:在有数据集的支持下,有限几个谱段就能恢复出很高光谱分辨率曲线,极大拓展光谱的应用范围。这条AI之路最终一定是通向专用芯片设计的,而且极有可能会集成在探测器芯片上。让我一同期待AI在这一领域的全新应用吧。
AI助力点目标识别
作者简介
邵晓鹏,教授,中国科学院西安光学精密机械研究所副所长,历任西安电子科技大学物理与光电工程学院执行院长、光电工程学院院长。
相萌,副教授,西安电子科技大学光电工程学院计算成像研究所。主要从事计算成像在空间遥感、工业检测、生物医学的应用研究。
刘金鹏,准聘副教授,现工作于西安电子科技大学光电工程学院计算成像研究所。主要研究方向为计算图像处理、全息成像。
吴腾飞,中国科学院西安光学精密机械研究所,副研究员,博士生导师。国家级青年人才。
席特立,副教授,博导。西安电子科技大学计算成像研究所副主任,陕西省光学学会副秘书长,光学工程学会计算成像专委会青年委员,《光子学报》青年编委。
魏士杰,博士,中国科学院西安光学精密机械研究所特别研究助理。研究方向为光学系统极简化成像,多维光场计算成像等。