各位来宾、各位同仁,大家好! 知识和技能是人类文明的两个轮子,获得知识和技能是教育的两大基本任务。但长期以来,这两个轮子一个大一个小,关于知识的教学和测评已经相当成熟,但技能的教学特别是技能的测评明显落后。其表现是: 第一,技能测评主观性很强,客观性不足。同样的技能操作,不同评委、不同时段、不同情绪状态,可能给出不同结论。疲劳效应、顺序效应、刻板印象,都会影响评价。 第二,技能的测评基本上是一对一的,难以大规模实施,成本太高,致使技能教学常常放弃测评环节。 第三,技能的测评过程难以复现。测评往往“看过就过”,关键动作稍纵即逝,缺乏可回放、可核对的证据链。 在生成式人工智能诞生之前这一困境几乎无法化解。大模型和智能体技术为解决这一问题提供了前所未有的可能。我们与上海人工智能实验室联合开发了智能化技能测评系统(Intelligent Assessment for Skills,IAS),从根本上解决了这一问题。 其技术路径如下: 第一步:把复杂技能拆解成若干部分,把真实过程“记下来”。把复杂的技能拆成一个个能单独完成的小任务;再请行业专家为每个小任务定出清晰、可操作的评分标准。通过智能眼镜全面准确地采集数据,系统完整记录学生的实操视频、操作路径、每一步的时间顺序,为评分奠定可信的基础。 第二步:对照标准“找证据”,给出能回溯的结果。大模型不只是“看一眼动作”,而是把画面、操作顺序、动作轨迹等多种信息综合在一起,逐项分析:对照标准生成可回放、可核对的数据链条。智能体不仅能给出分数,而且能具体指出错误环节和薄弱点。 第三步:自我学习,自我进化。智能测评具备“自学习”能力,把每一次测评的记录、专家的打分和行业经验沉淀成知识库;通过知识库进行自我学习和自我进化。越用越聪明、越评越可靠。 在此基础上,我们与OECD合作,面向PISA-VET,研发了三个职业领域的智能化测评工具——汽修、护理和酒店。目前,该工具与人类评审的一致性达到了80%-90%。AI赋能技能测评从笼统的主观判断走向了精确客观报告。 今年年底前,我们计划在OECD的3个参与项目国家,进行跨国、跨文化的数据采集与模型校准,并同步完成采集设备的定制研发——让算法不仅“跑得通”,更能在真实国际场景“立得住”。 各位嘉宾,我想要进一步指出的是,智能化技能测评不仅解决了技能测评高成本、低效率的问题,而且为提高技能研究和技能教学水平开辟了广阔前景。因为通过智能化技能测评,发现: 第一,既有的技能测量标准不统一、不精细,存在明显的主观性。要获得更加准确和精细的数据,需要更加科学地制定标准,更加明确地分解任务、更加精细给出量化指标。 第二,既有的技能测评重点不突出。AI能够捕捉到肉眼难以量化的细微操作,比如力度、轨迹、时间分配的精准度。过去依赖整体印象的评分表,可能遗漏了真正关键的技能维度,人类需要重新定义什么才是“优秀”。 第三,专家人机协同能力亟需提高。面对AI给出的“不同答案”,评委不能简单地排斥或盲从,而是要学会解读AI的判断逻辑,与之对话,共同进化。这要求未来的技能专家不仅精通专业,还要具备AI素养,学会用AI的反馈来反思和校正自己的评分误差。 这样,课程能否对准岗位能力,训练能否对准薄弱环节,认证能否对准国际标准——这些问题,将越来越依赖高质量的技能证据,而不是依赖少数评委的临场印象。我们的智能化技能测评系统,正在成为连接教学、评价、研究与政策的关键基础设施。当测评形成稳定执行、精准研判、持续进化的闭环,教育改革就有了真正的抓手。 我们相信,随着我们与OECD的合作深化,当智能化技能测评走向全球,它带来的不只是技术进步,而是一种新的质量文化——用可控执行保障公平,用证据溯源保障可信,用持续进化保障质量,使全球职业人的职业技能得到更好更快的提升。 谢谢大家。 来源:华东师范大学教育学部 微信公众号