-
专利 -
商标 -
版权 -
商业秘密 -
反不正当竞争 -
植物新品种 -
地理标志 -
集成电路布图设计 -
技术合同 -
传统文化
律师动态
更多 >>知产速递
更多 >>审判动态
更多 >>案例聚焦
更多 >>法官视点
更多 >>裁判文书
更多 >>【引言】
“人工智能+”行动旨在促进人工智能与各行业各领域广泛深度融合,创造新业态、新模式,极大地推动了人工智能的多场景应用,对应专利申请的技术方案也多体现为应用场景和算法模型的深度融合。人工智能专利的创新集中点之一为模型训练方法,本文通过一件“改进模型训练方法以解决特定场景下技术问题”的案例,以案说法,诠释人工智能模型训练类专利的创造性判断规则。
【案情简介】
涉案专利名称为“基于音频生成动态图像的方法、装置、设备及存储介质”(专利号:ZL202410022841.6),涉及用人工智能技术生成数字人。经审理,国家知识产权局作出第584244号无效宣告请求审查决定,维持专利权有效。
数字人是通过计算机图形学、计算机视觉和语音交互及人工智能生成内容(AIGC)等技术,进行形象、声音、动作等模拟训练后,借助真人或计算驱动、在多模态输出设备呈现的虚拟人物。数字人属于“人工智能+”的重要落地应用,可广泛应用于政务服务、电商直播、教育医疗等领域。常规的数字人生成技术需要大量高质量的视频数据训练深度学习网络,训练周期长、训练成本高。涉案专利说明书记载,其提供了一种解决方案,能够基于目标人物的单张图片和一段音频得到目标人物的数字人以降低模型训练成本、缩短训练周期。具体方法为用户输入作为参考图像的目标人物单张图片以及参考音频,将参考图像输入至训练后的生成网络模型得到多个预测图像。基于各预测图像与参考图像之间的区别确定目标头部动作特征和目标表情系数特征。基于上述特征对训练后的生成网络模型进行调整,得到目标生成网络模型。基于参考音频、参考图像和目标生成网络模型,对待处理图像进行处理,得到目标动态图像。其中待处理图像与参考图像中的图像对象相同,目标动态图像中的目标区域会根据参考音频进行变化,使得待处理图像中目标人物的面部表情能够根据参考音频变化,生成的数字人更贴合目标人物。
证据1公开了一种利用单张图像和输入音频生成逼真同步视频的SadTalker模型。该模型先基于单镜3D人脸重建子模型从原始图像中提取表情系数和头部姿态系数,然后利用ExpNet和PoseVAE子模型对表情系数和头部姿态系数进行处理,分别生成逼真的3DMM运动系数,最后通过3D感知的面部渲染生成说话的头部视频。SadTalker模型采用现有数据集进行训练,训练完成后即可实现基于单张输入图像和输入音频生成人物说话的动态图像。
证据2公开了一种基于CNN的单图像3D人脸重建方法,其使用的R-Net回归模型从输入图像中获得包括表情系数和姿态系数的五个系数,然后基于上述系数进行3D人脸重建与图像渲染。关于R-Net模型的训练过程具体为基于给定的训练图像生成重建图像,然后基于改进的混合损失函数评估重建图像和训练图像的区别,并进行反向传播调整R-Net回归模型的参数,最终获得一个能精准还原2D图像中人物的3D人脸 R-Net模型。
请求人主张涉案专利的方案相对于证据1结合证据2不具备创造性。请求人认为证据1中的单镜3D人脸重建子模型相当于涉案专利的训练后的生成网络模型,SadTalker模型整体相当于涉案专利的目标生成网络模型;证据2公开的基于参考图像和重建图像的混合损失函数进行反向传播来训练3D人脸重建模型,给出了生成预测图像以及基于重建图像与预测图像的区别调整模型的启示。
专利权人认为:涉案专利的发明点在于模型微调的过程,调整训练后的生成网络模型后才得到目标生成网络模型,而证据1的 SadTalker模型通过多个子模型组合完成数字人的生成,无法割裂其中的子模型来公开涉案专利的两个模型,且证据1不涉及模型微调过程。证据2的表情系数与姿态系数均是由 R-Net回归模型基于输入的图像直接生成的,而非基于输入图像与预测图像得到的。
本案的争议焦点在于:证据1的SadTalker模型及其子模型是否公开涉案专利的两个模型,以及证据2的方案是否给出技术启示。
【创造性判断】
合议组认为,涉及人工智能应用的技术方案通常包括模型设计、模型训练、模型应用三个阶段,应站位本领域技术人员从人工智能模型的处理目的、处理对象、处理结果、结果使用等方面准确判断人工智能模型所处阶段。
当人工智能专利技术方案与最接近现有技术的区别在于其采用不同的模型训练方法,如果其他现有技术未公开技术方案所采取的模型训练方法,亦未给出使用上述训练方法解决特定技术问题的启示,且该训练方法的改进带来了诸如模型输出结果更精确或模型训练成本更低的有益技术效果,则技术方案相对于现有技术整体具备创造性。反之,如果模型训练方法的不同仅在于常用训练方法的选择或简单要素的调整(如现有优化器的替换)或直接拼合(如损失函数的简单叠加),未体现模型训练改进对解决应用领域的特定技术问题的技术贡献,并且其技术效果也是可以预期的,则通常情况下,这种训练方法的不同不会带来创造性。
具体到本案,在进行创造性判断之前,需要结合人工智能生成数字人的技术背景对涉案专利和现有技术的方案进行理解。人工智能应用的上述三个阶段中每个阶段的模型架构基本是相同的,但是模型的处理目的、处理对象、处理结果以及处理结果的使用均不相同。模型设计阶段创建模型架构,并不处理数据;模型训练阶段处理样本数据集,基于输出结果调整模型参数以获得符合需求的模型;模型应用阶段则是接收用户输入并产生模型输出。利用上述判断因素可以明确涉案专利“训练后的生成网络模型”的处理目的是个性化调整模型参数以使得最终输出人物更贴合目标人物,其处理对象是用户输入的参考图像,处理结果为目标头部动作特征和目标表情系数特征,将处理结果输出给“训练后的生成网络模型”以调整其参数,从而最终得到目标生成网络。可见“训练后的生成网络模型”为得到最终目标生成网络模型的中间阶段,其依然处于模型训练阶段。“目标生成网络模型”的处理目的是输出数字人,处理对象为待处理图像和参考音频,处理结果为目标人物的数字人,可见其处于模型应用阶段。
而证据1的 SadTalker模型是一个针对所有用户的通用模型,其利用样本集对模型训练,模型训练完成之后即可以对任一用户的人脸图像进行处理。根据模型的三个阶段的判断因素,可以确定证据1的单镜3D人脸重建子模型是 SadTalker模型的一部分,其输出的参数不是用于对 SadTalker模型进行微调。涉案专利是在模型初步训练后的模型基础上,又利用目标人物的参考图像对模型进行了微调,最后的目标生成网络模型相当于是针对该目标对象“定制”一个生成网络模型,其最终的待处理图像是该目标对象的另一个图像。
因此,涉案专利与证据1的实质区别在于:两者模型训练方法不同,以及据此获得的目标生成网络模型及其处理对象不同。基于该区别可以确定涉案专利实际解决的技术问题是,使生成的数字人更贴合待处理图像中对象,同时降低训练成本。
证据2公开了一种采用 R-Net模型进行3D人脸重建方法,该模型获得的表情和姿态系数用于3D人脸重建;R-Net模型训练过程是为了生成效果较好的3D人脸。证据2中R-Net模型仅对图像进行处理,与涉案专利中用于融合图像和音频特征生成动态视频的目标生成网络模型的功能和结构差异较大,且其模型训练过程也是一次完成,后续直接使用训练后的模型进行任意用户照片的3D人脸重建,训练过程也并不涉及模型的微调。而涉案专利采用目标人物的参考图像是用于个性化调整模型参数。证据2与证据1中的单镜3D人脸重建子模型功能相同,可以作为证据1的3D人脸重建子模型的替换,但是并不能给出对证据1中的 SadTalker模型在训练过程中进行个性化定制调整的启示。因此本领域技术人员不能从现有技术证据中获得启示,并显而易见地得到涉案专利的技术方案。涉案专利针对数字人行业特点,通过改进模型训练方法获得了模型成本低以及生成效果更贴合用户的技术效果,故涉案专利权利要求1相对于上述现有技术的结合具备创造性。
【案件启示】
2026年施行的新修改的《专利审查指南》进一步明晰了人工智能领域专利申请的创造性审查规则,在第二部分第九章第6.2节新增案例18和案例19以诠释创造性判断时对应用场景和处理对象等因素异同的考量,也指出创造性判断时要考虑模型训练过程中对训练方式的调整和改变。本案的审查决定细化了《专利审查指南》关于人工智能模型专利的创造性判断路径,给出了针对“改进模型训练方法以解决特定场景下技术问题”的创造性判断思路,对同类案件的审查具有参考指引作用。




首页

评论