
但世界之所以缤纷多彩,是因为在这些巨头之外,有一些不遵从传统,力求创造不同,注重设计和功能,着眼于明日的公司存在。
它们有着非主流的商业模式,设计、技术与产品能提供独特的用户价值,和足够的社交谈资。重点是,它们没有大公司的包袱,敢于不顾一切的进步。它们,是「多样性公司」。
多样性,是开放世界的关键。爱范儿相信,只有真正关注和理解多样性公司才能比更多人更早地看见未来。在同名栏目中,爱范儿将以专访的形式,与你一同见证这些多样性公司,如何重塑未来,定义新常态。
本文为「多样性公司」栏目的第 14 篇。
1983 年,威廉·吉布森用一个比喻撕开真实世界与虚拟世界的藩篱,他在《神经浪游者》的开头写道「港口上空的天色犹如空白电视屏幕」,而今天,我们正在用触觉传感器做同样的事——让虚拟世界直接伸手触摸真实世界。
一目科技是一家专注于具身智能触觉感知的硬科技企业,贯通感知、操作与部署,让机器人拥有可开发的灵巧操作能力,在真实世界可靠运行、持续进化。他们推出的视光学超薄仿生触觉传感器 SENTRA T0 厚度已迭代至 3 毫米以下,是全球最薄可量产的仿生视触觉传感器,破解了灵巧手「装不下」的行业难题。
我们和一目科技创始人 & CEO 李智强博士聊了聊为什么机器人需要触觉感知能力,触觉能力为什么如此重要,获得它为什么这么难,以及一目科技是怎么用「光」来搞定机器人触觉的。

智驾永远不希望有接触,但做机器人的价值在于接触这个世界

A:所有生命智能的开始,都是源于感知,然后再有小脑和大脑。生命智能起源于 5.25 亿年前的寒武纪大爆发,其中很重要的起点,就是三叶虫长了第一只「眼睛」,或者说是「眼睛」也不那么精确,可以说是开始有了感光的细胞和感光的器官。
我们最底层的事儿,就是把「光」给芯片化,应用在 AI 领域,推动 AI 的发展。
从寒武纪大爆发,到人工智能的拐点,一目科技希望成为 AGI 的第一只眼睛。

A:表面看上去跨度挺大,但我们自己看来,技术底座是连续的,不是跳跃式的。
一目科技开始起步的时候,所有的能力都是围绕着「光」,把「光」的一些技术做成芯片,光芯片和 AI 结合应用在不同的领域,这个和我之前博士期间的课题是有强相关性的。当时我在卡内基梅隆大学的博士课题就是做一颗光芯片,应用在环境监测和分子分析等领域,结合了一些 AI 算法和模型,形成了我们技术认知的起点。
2015 年创立一目科技之后的第一个应用场景是做分子光谱仪,把光芯片用在光谱分析这个领域。
光这个技术呢,回过头来看,确实是一个非常非常性感的技术,可以应用在很多领域,用在通讯上,就是光模块;用在计算上,就是光计算。
我们用光来检测形变,用形变来反算受力、反馈,后来延伸到机器人触觉能力,切入到了光触觉领域。可以看到我们底层的基座能力是延续的,七八成是一致的,但是在中间要补强 AI 强相关的能力,还要对材料学有更多的研究。

A:这是个好问题,首先我们要思考下Physical AI 的本质到底是什么,其实就是跟人类一样的「手感」。
不是让机器人在屏幕里更像人,是让它在真实世界里像人一样把手伸出去、把活干成。评判标准变了——不是「答得对不对」,是「抓不抓得住」。
按这个标准去看:类人不是某一项类人,是所有模态都得类人。
机器人的视觉已经很接近人了,摄像头加大模型,认东西比人还快;语言更不用说了。而触觉恰恰是最原始的那个模态——人还没睁眼就会摸了,可对机器来说它才刚起步。所以机器人看得见这个杯子,却不知道用了多大力、会不会滑。
所以你也能理解,为什么行业里有不同路线。智驾背景的人天然想到 VLA 和世界模型,做硬件的天然先想本体架构。不是谁对谁错,是大家习惯从自己熟悉的经验出发。
那对于我们来说,我们的第一条产品线源自我们之前就在做的光和感知,这是自己的延续性。
另外,我们也从第一性原理思考过具身智能本身的卡点和问题,我一直认为,它和传统 AI 有相似性,但也有非常大的不同。
很多人跟我说,做汽车的智驾和做机器人很接近。我觉得有些地方是类似的,但它们有非常大的一个差异。
智驾永远不希望有接触,接触了就是发生了碰撞,汽车的智驾是它不太想跟这个世界发生物理关系。
但机器人真正的价值,就在于它和世界发生了接触。
所以原来智驾的那些技术范式,放在机器人面对的物理世界,是完全不足的,甚至底层逻辑都不一样。
这是我们在行业起步看到的问题,那我就想,真正的物理 AI ,它的迭代和演进到底是什么样的过程?从第一性原理来说,人大脑的能力都是训练和学习出来的, AI 大模型的语料,文字,视频,音频这些都早已在互联网上准备就绪了,所以 AI 大模型很容易学。
但是今天来看,具身智能机器人需要的物理世界数据是不够的,那么相应模型怎么着都不可能有很好的语料,也就不会真正迭代到智能的那一天。
这就是我们的出发点,具身智能最大瓶颈是数据,数据往前推,最大的难点是采集数据。
采集这些准确数据的最重要的入口,就是感知。人的五感里,只有触觉是完全没有电子化的,这是具身智能机器人真正跟物理世界发生关系的重大卡点。
我们也想到人类学习的能力,刚生下的小 baby,一开始听觉和视觉是比较弱的,没有训练出来相应的能力。但是人类生下来就有非常好的触觉能力,小 baby 会咬东西、到处摸东西,所以你可以理解机器人现在需要的就是去把世界上的各种东西摸一遍、咬一遍,感受这个物理世界。

A:孔子说眼见为实,后来又说目犹不可信。两千多年后,我们给的答案是:
目犹不可信时,让触觉来做裁判。
里面有几个逻辑,我们可以探讨一下,第一个就是「眼见为实」这句话。我觉得人类最牛的感知能力还是视觉,说实话这还是高智能动物获取信息最广泛、信息量最大的方式。不过视觉它可能有误判,同时视觉在操作的时候可能也有阻挡,有各种问题。
我们大脑对于视觉的计算频率是非常低的,如果眼睛看到一个东西,因为信息量太大了,大脑理解的过程是很慢的,感知端最高大概是 100Hz 左右,大脑处理端比这个还更慢,大概也就 3Hz 到 5Hz。
这就是为什么触觉在这里的表现很重要,以及为什么「眼见为实」还不够。
我们看一些论文,人在抓握一个玻璃杯时,松开再重新抓住这个过程,大概是要在 80ms 以下启动纠正,不然玻璃杯真就掉下去摔碎了,这个链路需要是非常快的。
80ms 的时间也分好几个东西,首先就是感知段,触觉感知的话是 10ms 到 20ms,要在这个时间完成感知,还有 30ms 到 40ms,大脑和小脑做完决策下发电信号到肌肉,指挥肌肉收缩,到肌肉完成收缩,重新抓住杯子还需要 20ms 到 30ms。
所以这里给到感知端的时间只有 10ms 左右,靠眼睛靠视觉是完全不够时间做这个事情的,同时在决策端 30ms 也不够,人根据视觉做一次决策可能需要一两百毫秒。
从这个例子里的各个环节来看,触觉是人类在和物理世界交互里最重要的信号之一,也是最快速响应的信号。
另外我想再解释一下,在操作层面,触觉并不是视觉的补充了,而可能是最重要的信号,因为它会形成小闭环。

AI 应该仿生,光触觉是最接近人类的触觉方案
Q5:过去几年机器人视觉能力进步非常快,但触觉的发展明显更慢。你认为今天机器人最典型的「无触觉后遗症」是什么?有没有哪些任务,人看起来觉得很简单,但机器人只靠视觉几乎永远做不好?
A:有个成语叫「无能为力」,我觉得比较能形容「无触觉后遗症」,最典型的就是看得见、干不成——机器人能准确认出这是什么、在哪儿,真一伸手就出问题:要么捏碎,要么打滑,要么装歪。
你看大家都在训练各种模型,VLA,World Model 等等,如果这些模型没有触觉,带着机器人真的下场去干活就会出各种问题,事实上也出了各种问题。
模型的泛化性肯定不够,准确率和成功率就非常非常低,很多 VLA 模型可能训练好了,但最终实现的时候,就只有五六成的成功率,这是非常差的表现。这就是因为没有触觉反馈,其他模态没办法做到想要的泛化效果和准确率。
我说一个具体的发现,我之前对汽车制造行业的理解是自动化程度非常高,各种机械臂,各种自动化的生产线,但我们去年接触一些全球头部的汽车生产大厂,其实不是那回事,大概就只有两个车间自动化程度很高,一个是喷涂车间,另一个是焊接车间,几乎是无人的。
但是到了总装车间,全是人,插拔装配线束啊,座椅啊,捋一些那种胶条儿啊,一些细小接插件啊,都是人类靠手去做。
当时对我的触动还是蛮大的,我一直以为汽车的工业自动化已经很高了,很普及了。后来我们意识到,这些东西都是缺了最后的那一点手感,缺了小模型能力,也就是机器人的小脑能力,导致机器人没法像人去完成有点复杂的装配工作。

第一类是有些东西,视觉具有欺骗性,比如石核桃和真核桃,看上去一样,但放手一拿,从重量,触感,实心不实心就能感知到它们的不同。
第二类是操作的东西非常柔性,我们对柔性的定义是它一般的形变规律是非线性,本身是非刚体的,无法特别准确地被规则代码预测的东西。比如汽车上的一些胶条,没有力控和触觉,机器人是完全装不了的。
第三类其实是说很多场景需要一种很微妙的手感,就像老师傅的手艺活儿,很难传承下去,就是因为老师傅自己练出来的手感。有个经典的例子,就是拿配得不太好的钥匙开门,需要一个非常特定的角度,一个固定的巧劲儿才能开锁。这个过程也是需要触觉感知才能感知,不然机器人把钥匙插进去一转就把钥匙转断了。
这个微妙的手感,无法用语言去描述、用视觉去观察,只能靠触觉反馈试探——这就是我们要把难以描述的、很精巧的手感,把它数字化、蒸馏出来,变成可以复制的模型能力,变成带触觉的物理 AI 能力。

Q6:一目为什么选择用「光」「视觉」去测量「触觉」?在压阻、压电等等路线之外,视触觉到底解决了什么其他路线解决不了的问题?
A:你相信光吗?哈哈哈哈哈
大家现在都喜欢称视触觉,其实一目科技的路线,我们喜欢叫它「光触觉」,而不是「视触觉」。本质上我们是用光来探测形变,而不是直接给物体拍照再进行判断。
如果我们泛泛地讲,人的触觉在这几个维度上收集信息。
一是形貌学,我摸到的这个东西是光滑的,还是粗糙的,形态是什么样的,软的还是硬的。
二是力学,我按压之后会得到什么样的力反馈,这个力会不会变化,力的变化核心就是震动,震动的本质也是力在变化。
三是温度,温度也是人触觉的重要部分,我们为什么能感受到玻璃,金属和橡胶等等材质的变化,核心就是把这几维的信息叠加在一起,有一个模型判断,哦,玻璃摸起来光滑坚硬又冰凉,橡胶摸起来阻力有点大,有点软,不太凉等等。
做机器人触觉核心就是感受这几个事儿,具体是看这几件事用什么样的方法。
我还是觉得 AI 应该更仿生,更像人类。

人的皮肤是一种柔软材质,皮肤接触到物体之后,就会产生形变,皮肤下面一个节点会有四种触觉受体,它们扮演不同角色,有的分析高频,有的分析低频,有的分析软硬等等。
我们的第一性原理决定了我们的传感器也应该是基于一种柔性材质发生形变,然后传感器接收到了这些信号,这是光触觉这条路线最不一样的,他是和真实的物理世界发生了直接的接触,产生了形变。
形变带来了几个信息,一个就是形貌学的,可以在微米级的精度探测整个物体,我就可以知道它是粗糙的还是光滑的,粗糙的话,它的颗粒度大概是什么样的?甚至在我滑动之后,还能感觉它是不是柔顺的。
第二是力学层面的,我们知道我们所用材质的杨氏模量,杨氏模量其实就是材质弹性和力的转化之间的一个个参数嘛,那我按压之后,它有形变,同时显性的物理公式,就可以转换成力的分布和变化。
所以我想说的是,光触觉的工作机理,和人的触觉是最像的,采集到的数据也跟人是最近的。
用光这种形式做检测巧妙的点是,光本身的分辨率非常高,稳定性和一致性非常好,因为我们已经有很多很好的光学芯片和光学器件被发明出来了,所以我们可以用非常好,低成本的方案去解决光探测形变这么一个事儿。
前面是从原理上讲,我们再看性能指标。
评价一个触觉传感器好不好,其实很简单,就是看它的性能指标是不是类人。人的指尖触觉是非常密的,大概 3000 个点,每个点有 4 种不同的触觉受体,也就是说有大概 1.2 万个受体点在做触觉的感知。其他的压阻或者电容触觉方案,基本上只能做到 10-100 个点,跟人的差距非常大。而我们的光触觉方案,做到了在指尖大小的面积上布置24万个点。
还有就是对力的感知精度,我们的光触觉方案可以做到 5mN 左右,再加上分辨率有 24 万个点,可以做很好的纹理检测。这些精度和特性,也是其他方案很难做到的。
还有一个重要的点,其实在机器人操作的过程中,尤其是手的抓握,最重要的不是正向的力,而是侧向的力,比如说握着滑动的杯子,保证不掉下去抓得稳的核心,是感受侧向的摩擦力,其他的几个技术方案感受不到这种力。

Q7:光触觉有一个非常明显的工程矛盾:形变材料越软,感知通常越灵敏,但耐久性越差;越薄越适合机器人手指,制造和光学设计却越困难。你们内部有没有一个类似「不可能三角」的指标体系?为了真正商业化,主动牺牲过什么?
A:我举个例子,干物流里做搬运的重体力活,如果我手上长满了茧子,的确牺牲了一点灵敏度,但增加了耐用性和刚性,活干得其实也挺好。
回到这个问题,「不可能三角」确实存在,但是我们得把那个三角形尽量往外推,就是一方面要做平衡,一方面从底层看能不能把三角形的外延扩大。
我定义的三角第一个角是软,软本身是杨氏模量的一种体现。为什么要软呢,因为人的皮肤是非常柔软的,我们希望找到一种材料,跟人的皮肤更接近。这样的话,一方面是更仿生,探测能力和人更接近,另一方面是具体到性能参数,材料越软,对形态变化也会更灵敏。
另外一个角是回弹能力要强,一旦撤掉了力,我们希望它马上能够回到它原来的形状位置。
第三个角是耐用性。
最早的时候我们找了很多材料,确实就像你说的,想凑齐不可能三角,找平衡做取舍,最后发现,这玩意儿没法平衡,很多材料的耐用性太差了,按压 1 万次,2 万次就坏了,没法实际使用。
我们就问自己,怎么解决这个问题?
那就自研嘛,从底层开始做设计,不仅仅是改配方,改配方其实就是买来别人的东西,调一调比例,这个没法解决本质问题,反而是要从分子层面去分析我们到底要用什么样的东西,怎么去聚合这种硅基高分子材料。
柔软这种特性是和分子里的长链相关,链的长度和特性决定了柔软性和回弹力,我们要设计的是这个。
耐用性的话,除了使用过程中的损伤,就是材料本身的老化,老化的核心其实是分子间的断裂,断裂了就没法恢复。所以我们再寻找一些有趣,有价值的官能团加入,让断裂发生的难度增加,还有一种可能性就是,我们也看到一些特别有意思的新型自修复性材料。
总结一句话就是我们在分子单体上做了很多研究,去做这种聚合物,把「不可能三角」的三个角先往外推,不要每个点都很弱,首先就解决了柔软度,我们现在材料的杨氏模量和人手指的皮肤非常非常接近了,只硬百分之小几十,一些竞品一般是硬个十多倍。
另外两个角,我们现在基本上也能 cover 住,再根据具体场景在工程化上做选择,有的场景需要灵敏操作,穿针引线这种,材料可以软一点,牺牲一点力矩的范围。

A:我们的一个理念是在性能上跟人接近,或者超越一点就行。分辨率不需要那么高,24 万点的分辨率比人的高太多了。
还有一点就是决定成功率的不是某一个参数,是场景。
如果真要放弃一个参数的话,可能就是分辨率,做到万点级别,就足以应对大部分场景。
至于其他性能指标,我觉得挺难减配的,就说 8ms 的响应速度吧,前面也说了,慢到 20ms 30ms 的话,后续链路的计算反应时间就会被压缩,很难做到感知决策动作的闭环,这个要尽量保障的。
比如说 5mN 里的感知精度,要看具体场景,做搬运做物流分拣不需要这么灵敏,但要是绣花的话,就需要机器人触觉特别灵敏了。

A:我先定义一下什么叫「可商用」,什么叫「实验室可用」,这个问题说清楚了,才能知道鸿沟在哪里。
实验室可用一般来说是不追求复用的,只需要找到那一次的高光就够了,我们做实验很多时候是做 100 次成功 1 次,就可以发论文了。它对耐用性,一致性要求没那么高,只追求单一的性能参数。
商用其实是另一个极端,商用追求的是平均下来,最低的要求能迈过门槛,比如寿命和稳定性,还有一致性,不可能用几次就坏了,也不可能把实验室做 100 次成功 3 次的概率放到商用品上。
还有就是商用需要的量也比较大,实验室手搓一个出来就可以发论文,商用的触觉传感器至少也是 10 万套以上的级别。
所以说,商用和实验室的鸿沟是巨大的,大家追求的方向不一样,这也是为什么光触觉传感器到今天很难量产的原因,大部分从业者还停留在实验室阶段,没法跨越寿命,稳定性,一致性,长期使用下的漂移控制,以及大规模量产之间不同批次的差异控制等等挑战。
我们希望明年能够实现百万颗的出货量,也是铺垫了好几年,才累积出这样的能力。

Q10:似乎整个具身领域都在思考怎么解决数据和数据采集的问题,通过视觉来采集人类动作给机器人模仿学习还好,采集人类触觉数据的传感器会阻隔人和物体之间的触觉,缺乏触觉又影响人类操作,进而导致采集的触觉数据失真。一目科技怎么解决这个看起来无解的问题?
A:其实不光是触觉数据采集,整个机器人的数据采集成本都会比较高,不像传统的大语言模型,可以用互联网数据,这是一个没法回避的问题。
触觉本身在机器人素材里的成本占比也没有那么高,但采集的质量怎么样?就像你说的,问题确实存在,带了手套去采集触觉数据,人类的触觉就会被严重影响,和平时的手感不一样,你要采的东西,偏偏被采集这个动作破坏了。我完全同意你说的,这个事情还没有最优解。
但有几种方式可以去做得更好。
第一就是尽量让触觉本身的影响减小,数据采集的传感器做得更柔性更轻薄更接近人类皮肤,对人类触觉感知的阻断更弱一点。
第二也是我们在寻找的新方式,只通过指尖覆盖触觉传感器,然后人手的轨迹通过其他的模式去捕捉,比如肌电信号,异构的视觉传感器来捕捉。
还有个事儿,我们观察到一个现象,就是预训练在触觉里面的作用,未必是最有用的。因为我们也在思考,人是怎么学的,大语言模型更像人读书,学知识,就是预训练为主,熟读唐诗三百首,不会作诗也会吟,先背了再说,然后会涌现出自己的见解。
人对于动作能力,物理操作能力的训练是不一样的,这个范式还没有人提到,我们可能是最先提到的,就是人学习打网球踢足球这些东西,看书学习的部分能占多少?其实不太多,就是预训练的部分很少。
打网球踢足球其实大量时间在后训练,自己练习,强化学习,挥拍的动作练几百遍,感受击球瞬间的感觉。
所以类比就是机器人的真机强化学习应该会占非常大的比例,预训练的比例会很少。
我想说的是,哪怕我们在真实世界中没有采集到那么多那么好的触觉数据,但触觉会被用到后训练里面去,用到真机强化学习的环境里面去,这需要做非常多的自我校正。在触觉数据采集成本过高,以及准确性还有与人类触觉拟合度比较弱的情况,后训练是更有用更有价值的一部分。

除了用人和真机去采集,还不如在一些环境里把仿真能力建立起来,可能它跟人真实的触觉数据还更接近一些。

A:对,完全认同,触觉目前还缺它的「Type-C」 接口标准。
触觉本身有几个问题,硬件收敛比较晚,行业标准化是缺失的,但它确实又非常重要。我认为触觉应该是跨传感器,跨公司,跨品牌的标准化,最终都能收敛到一个标准体系里说数据的采集和数据的使用。
这事儿还远远没有完成,我们发现硬件端真正成熟量产的挺少的,品牌更少,更不要提数据量和格式了。
我们希望用 Open 的方式,更开放的方式,而不是靠 authority,权威的方式去做,靠权威很难去推动,大家都有自己的想法,我们自己的下阶段工作就是在 OpenTouch (一个低成本、高保真的机器人触觉感知与数据集采集系统)里把 TouchNet (一个开源触觉数据集项目)建立起来,把触觉数据采集、标注、存储、评测和使用的统一标准建立起来。
大家可以在这种开源数据集上各显神通,找到归一的方法,找到最好的标准模式,逐渐形成行业标准。

Q12:「大脑负责推理和思考,小脑负责感知和动作控制,身体负责具体执行」的具身智能比喻中,不少具身从业者都认为现在是身体比较成熟,但小脑不够灵活,大脑尤其愚钝的状况,一目科技怎么看这种比喻和现状,是不是和行业主流认知有所不同?
A:大方向的话,我们的认知是一致的,就是硬件本体是比较成熟的。唯一的不同想法在于手,我们认为手这块还没熟练。
小脑这块也有不太大的差别想法,也是和手相关。目前大家说的小脑还是偏下半身的小脑,跑跑跳跳,舞蹈武术这些。手部动作,尤其是手指动作,没有真正跟物体操作这个层面挂钩。可以认为现在的小脑更像智能驾驶,从 A 点到 B 点做一些动作,但不去改变物理形态和物理环境,真正能改变环境和物体的小脑能力还是缺的。
就是现在的小脑还指挥不了机器人做成熟的柔性装配,绣花织这些手艺活。
大脑确实就是更弱了,整个的空间理解判断能力,计划能力是非常弱的。核心还是说要有实际场景的数据,触觉,力反馈来支撑操作型的小脑,然后操作型的小脑反馈到大脑的模型训练里面去。李飞飞在做的 spatial intelligence,空间智能,其实就是大脑对抓握这种空间里的各种几何形态,物理形态的理解力更强。
Q13:消费者和媒体都很想知道一个事件节点,类似于 2007 年的「iPhone 时刻」或者 2022 年的「 ChatGPT 时刻」来证明一个产品,一个技术,开启一个时代。对于机器人触觉,你觉得这个「时刻」应该由什么事件定义?是百万台机器人装上触觉传感器,是机器人第一次稳定完成过去只能由人完成的精细操作,还是出现一套真正成熟的触觉基础模型?
A:我们想想 iPhone 时刻是什么?
不是卖了多少台,也不是 iOS 多成熟,是有人第一次拿手一划,心里感叹「对了!就是这个!」。
在这个「时刻」来临之前,可能是大家已经做了非常多的努力和工作,就像 iPhone 是 2007 年发布的,但之前的 iPod,还有芯片,屏幕,触控交互,底层系统架构积累了很多年,然后才有「iPhone 时刻」。
早期版本的 ChatGPT 也可以回答一些问题,但是没有人味儿,现在的 ChatGPT 对话你就感觉很丝滑,像和真人沟通一样。
具身智能出现类似的时刻,肯定是一个令人会「Wow」一声的产品,这个东西出来之后,会让消费者觉得完成度非常高,从硬件到软件,不是一个需要调校和用户适应的产品。
这个时刻是一个瞬间,但我们为了这个瞬间在做很多外部看不到的努力,从实验室到产线,再走到大众的面前,我们崇尚真理、追求完美。
所谓时刻,就是圈里的人熬了很久,圈外的人一抬头,发现世界已经变了。

A:很多产品为什么你觉得它笨,不成熟,没有达到 iPhone 时刻,因为它实际上都还是工业半成品。
iPhone 出来之前,也有很多智能手机,侧滑的,用轨迹球的,用笔戳的,你总会感觉它们不完整,不完整的点是因为人还是一种挺感性的动物,不会看到一个工业半成品就兴奋起来,但是会感觉有距离感,不亲切的感觉。现在机器人的状态,我觉得更像早期的那些还带着物理键盘的智能手机,比如说黑莓。
黑莓为什么能卖这么多?因为它解决了一些商务人士的痛点。为什么又卖不了更多?因为它没有跨越工业品到用户体验卓越产品之间的鸿沟,它其实还是个办公工具。
机器人的 iPhone 时刻,肯定不是以一个工业品的状态出现,它还是要考虑很多人文的东西,体验的东西,其中有一点就是你说的,它还是要温柔的,拥有理解人的交互,而不只是说它只是个工具。
工具这种东西很难成为非常伟大的产品,无法成就某某时刻。而「关怀」和「感触」可以。触觉和力反馈,正是机器人形成人文关怀和与人类交互里面最重要的手段。