封面

研路炼钢 | 复盘六个获奖项目后,我终于明白:平台愿景为什么打不过一条证据链

比赛结束后,我和一位队友把获奖展板重新看了一遍。最初得出的结论很粗暴:有实物,大于无实物。再往下拆,我发现真正拉开差距的不是那块硬件,而是它背后那条能被看见、被测量、被追问的证据链。

先说明边界:这篇文章只依据现场展板、演示和个人记录复盘,不代表官方评审结论。涉及个人的信息均已脱敏,对评分动机等无法验证的内容也不作事实判断。为保护参赛者信息,正文配图使用脱敏重绘。


01|我一开始只看见了“有实物”

从实物走向可验证证据

我们学校是第一次做这种跨学院合作,校内是三选一。现场有长期参赛的学校,选拔强度大约是六选一;也有学校八支队伍来了四支。有人已经在这个赛道积累了十余年,我们则刚把第一套合作流程跑通。

从结果看,获奖作品里确实有不少硬件、传感器、穿戴设备和真实部署图。于是我很容易把它归因为:有实物的项目更占优势。

但这个结论只对了一半。

实物本身不会自动产生创新。它真正提供的是一种“信任压缩”:评委在几分钟里能看到输入从哪里来、算法处理了什么、输出怎么测、最后放到哪里用。纯软件当然也能做到,只是必须用更扎实的实验和真实数据,把缺少的可见性补回来。

至于现场不同评委的提问风格和打分差异,我赛后也有过主观猜测。但没有完整评分明细,就不能把偏好甚至关系当成主要解释。比起猜人,拆作品更有用。


02|一等奖最强的不是论文数量,而是闭环

从痛点到场景的证据链

一等奖项目 RadarCare 做的是非接触式生命体征监测。它的切入点非常具体:ECG 贴片可能刺激皮肤,穿戴设备容易忘戴,摄像头又带来隐私压力,而老人需要长期监测。

现场材料里能同时看到雷达硬件、信号处理流程、误差表、App、床边部署图,以及与贴片、穿戴设备和摄像头的直接比较。评委不需要先相信一个宏大愿景,只需要顺着展板回答四个问题:

  • 为什么必须用这个传感器?
  • 核心算法处理了什么信号?
  • 误差和对照结果怎么样?
  • 谁会在什么地方使用?

它当然也有局限。仅凭现场展示,我看不出样本规模和医疗验证是否足够。但在所有作品里,它把“痛点、技术、数据、场景”接得最完整。团队的论文积累是加分项,真正让成果站住的仍是可验证闭环。


03|二等奖把算法放进了行动链路

算法输出必须进入真实行动链路

HopeGuard 把普通心理应用的“等用户主动求助”,改成“系统主动发现风险”。手机、健康平台和穿戴数据先进入 Data Agent,Risk Agent 计算风险,Intervention Agent 再根据等级做安全确认、提醒或资源连接。多模态模型不是孤零零地做一次情绪识别,而是进入了“采集、判断、干预、反馈”的链路。

另一项城市轨道作品同时服务乘客和运营方:VideoMAE、Transformer、Cross-Attention、RT-DETR 等模型负责识别暴力、跌倒、滞留、拥挤和逆行,Conv-GCN 提前预测客流;乘客端负责查询与导航,管理端负责告警和调度。

模型名称很多并不等于先进。两项作品真正做对的是:每个模型后面都有一个动作。 风险分数会触发干预,拥挤预测会影响调度,异常识别会进入告警。算法没有停在识别结果上。


04|三等奖赢在“把一个问题切小”

把问题切小并把价值做深

三个三等奖项目也给了我同一种感觉。

医路通围绕就医前的一条路径展开:用户不会描述症状、不知道挂什么科,也不知道是否紧急。文字、语音、图片或穿戴数据进入系统后,输出症状整理、风险分级、科室建议和医院信息。

AcuGuide 只解决“普通人找不准穴位”这件事。它用 MediaPipe 找人体关键点,再做个体尺寸校正、Kalman 滤波和局部解剖特征定位,最后在 AR 画面中给出位置和置信等级。

金粹华章面向非遗金银细工,把数字收藏卡、工艺展示、AR 学习和 3D 内容串成一条可探索、可收集、可传播的体验。

它们都不是无边界的平台,但三分钟内都能回答:我解决哪个具体问题,核心技术在哪里,用户最后得到什么。


05|再看 LinkAble:不是创意不够,而是证据不够

平台愿景与真实证据之间的距离

LinkAble 的方向并不差。它面向视障、听障、老年人和临时困难者,设计了“AI 先处理,真人志愿者兜底”的帮助链路。首页、AI 对话、转人工、志愿者匹配、通话、评价和求助记录已经能形成完整演示;高对比度、文字缩放、语义标签等无障碍设计也不是贴在页面上的口号。

问题在于,我们把很多环节做全了,却没有把一个环节做成不可替代的核心。

比赛版优先保证 Demo 闭环,AI、匹配、通话、SOS 等关键路径仍有不少本地回退或模拟状态。页面和状态机很完整,但缺少稳定的对照实验、真实运行指标和试点结果。站在开发者视角,这叫工作量大;站在评委视角,它更像多个成熟技术的服务编排。

所以我现在对 LinkAble 的判断是:不是创意不如别人,而是平台愿景大于真实证据。 获奖项目普遍把一个问题做深,我们则把很多问题做全。前者容易形成技术钉子,后者容易变成功能清单。


06|评分不是功能相加,而更像证据相乘

项目可信度由痛点、技术、实测和场景共同决定

这次评分里,创新性占 40%,技术与应用、未来发展、展示各占 20%。如果核心创新说不清,后面再完整,也很难把最高权重补回来。

我现在更愿意把项目可信度写成一个乘法:

项目可信度 ≈ 痛点清晰度 × 核心技术辨识度 × 实测强度 × 场景真实性

任何一项接近零,整条链就会塌。硬件之所以常显得有优势,是因为它天然把痛点、输入和部署场景摆在桌面上,并不是因为评委只喜欢“有东西可以摸”。纯软件项目如果有真实用户、稳定基线、可复现实验和明确决策输出,同样可以建立很强的证据链。


07|下一版不该继续堆页面

LinkAble 从平台愿景走向真实证据的路线

如果再做一版 LinkAble,我会先砍功能,再补三层证据。

第一,把调度机制算法化。 明确需求类型、志愿者技能、距离、响应时间、历史完成率和可用时段等特征,给出正式的匹配评分,并与随机匹配、先到先得等简单基线比较。

第二,完成三组对照实验。 匹配策略比较响应延迟、成功率和重试次数;AI 单独处理与 AI 加真人兜底比较解决率、转人工率和平均处理时间;默认交互与无障碍适配比较任务完成率、错误率和中途退出率。

第三,做一个小而真实的试点。 范围可以小,但参与者、任务、同意流程、数据口径和失败案例必须真实记录。宁可公开一个有限结论,也不要用十个模拟页面暗示系统已经成熟。

海报和三分钟答辩也要跟着重做:只讲一个人、一个任务、一个核心算法、一组对照结果和一个真实场景。页面墙放到附录,证据放到正中间。


08|第一次参赛,真正该留下的是组织资产

把比赛经验沉淀成下一届可复用的流程

我们和一所长期参赛学校的差距,不只在某个模型,也在组织经验。对方一位老师就能带队,因为选题、材料、海报、演示和答辩已经形成了传承;我们第一次跨学院合作,每个环节都在临场摸索。

下一届最该留下的不是一句“继续努力”,而是一套可复用资产:历届项目数据库、评分拆解、海报模板、三分钟脚本、演示验收清单、评委问题库,以及技术与设计老师都能接手的交接文档。比赛经验只有被写进流程,才不会每年从零开始。


写在最后

可验证的证据大于只能描述的愿景

这次复盘让我修正了最初那个粗暴结论。

不是“有实物大于无实物”,而是可验证的东西大于只能被描述的东西。实物只是最直接的一种证据,真正让评委相信你的,是从痛点到技术、从技术到数据、从数据到场景没有断点。

LinkAble 下一步最需要的也不是再加一个 Agent、再补一个页面,而是把最核心的匹配与兜底机制做深:算法化、做对照、跑试点、讲清楚。

先做深,再做全。比赛如此,研究和产品也是如此。


研路炼钢,记录一个计算机研究生的真实成长。