树人视角SHUREN NEWS

AI训练数据与模型参数能否算“数据资产”?——数据资产与技术资产的法理分野、类型化辨析与规范路径

2026-09-24 14:43:19 166

关键词:AI训练数据、模型参数、数据资产、技术资产

引言:

在大模型产业的商业实践中,企业投入巨额算力、人力采集、清洗、标注训练语料,最终训练产出的模型权重参数构成企业的核心商业资产。在投融资、并购、破产清算、质押融资场景下,交易各方普遍提出疑问:AI训练数据集、模型参数是否属于法律意义上的数据资产?还是仅作为软件、算法归入无形资产/技术资产?会计上能够入表,是否等同于民事法律上享有完整可转让的数据财产权益?《中共中央 国务院关于构建数据基础制度更好发挥数据要素作用的意见》(下称“数据二十条”)、财政部《企业数据资源相关会计处理暂行规定》(财会〔2023〕11号)(下称《暂行规定》)确立了数据资源资产化的基础框架,但并未直接回答训练数据、模型参数应当归属于数据资产,还是技术资产、知识产权资产。

从司法实践看,涉AI数据权益纠纷已经进入审判视野,插画师诉TrikAI侵权案、多起企业数据不正当竞争案件,均涉及AI训练数据的权益边界;多地数据交易所、数据知识产权登记试点,已经将AI数据集、模型参数纳入登记范围。但法律定性的分歧直接影响资产确权、估值、交易、强制执行。如果混淆数据资产与技术资产,将模型参数简单归入数据资产,或者将训练数据直接等同于普通知识产权,会造成权利基础错配,埋下合同无效、资产处置不能、权属争议的法律风险。

《民法典》第127条规定:“法律对数据、网络虚拟财产的保护有规定的,依照其规定。”该条款确立数据作为新型财产权益的原则性保护规则,但并未创设数据所有权。数据二十条创造性提出数据资源持有权、数据加工使用权、数据产品经营权三权分置制度,区分原始数据权益与加工后的数据产品权益。财政部《暂行规定》明确企业合法持有或控制、预期带来经济利益的数据资源,满足条件可确认为无形资产或存货;同时财政部明确:会计确认不等于民事确权,会计入表解决财务计量问题,不能直接创设民事财产所有权。这是理解AI资产定性的基础前提。

本文从法理层面厘清数据资产与技术资产的边界,对原始训练数据、清洗标注数据集、模型架构、模型参数进行辨析,剖析当前实务中价值评估、司法处置、强制执行的现实困境,最终提出分类确权、差异化处置的法律方案,为AI企业数据资产入表、数据质押、作价出资、争议解决提供法律参考。

图片

一、数据资产与技术资产的法理分野

(一)数据资产的法律内核

图片《数据安全法》第三条规定:“本法所称数据,是指任何以电子或者其他方式对信息的记录。”因此,数据资产的核心是承载信息的记录本身。数据资产的权利特征是数据具有非排他性、可复制、非消耗性。数据资产保护的核心是数据上的信息权益,而非载体本身。

(二)技术资产的法律内核

技术资产(无形资产项下的软件、算法、技术秘密、专利)保护的是表达、方案、技术构思、代码逻辑,而非单纯信息记录。技术资产的权利边界遵循知识产权规则:《著作权法》保护计算机软件源代码、目标代码;《反不正当竞争法》保护未公开的算法、模型架构作为商业秘密;如果算法方案满足专利授权条件,还可以受《专利法》保护。
 

(三)二者核心法理区分标准图片

1.保护客体不同:数据资产保护的是信息记录;技术资产保护智力成果、技术方案、代码表达。

 

2.权利来源不同:数据资产权益来源于数据采集、加工、合规处理行为,依托数据三权分置框架;技术资产来源于创作、研发行为,依托著作权、商业秘密、专利等知识产权法定权利。

 

3.受限制规则不同:数据资产主要受《数据安全法》《个人信息保护法》等规则约束;技术资产主要受知识产权法等规则约束。

 

4.复制与流转后果不同:数据复制不会损耗原数据,但必须遵守数据合规义务;软件/代码复制直接落入著作权复制权控制范围。

 

5.救济路径不同:侵害数据资产,可主张数据权益、不正当竞争;侵害技术资产,优先适用著作权、商业秘密、专利侵权救济。

 

二、从训练数据到模型参数的层级界定

我们将AI要素分层,逐层判断其是否属于数据资产:

(一)第一层:原始训练数据

图片原始训练数据,包括爬取的网页文本、图片、个人信息、作品、公共数据。

 

1.原始个人信息:不能直接认定为企业的数据资产。个人信息的人格权益归属于自然人,企业仅能依法取得加工使用权,不能取得所有权。即使企业采集存储,仅在取得同意、脱敏等合规前提下享有有限使用权,不能自由转让、作价出资。只有完成匿名化处理,无法识别特定自然人,才能脱离个人信息属性,具备数据资产基础。

 

2.受著作权保护的原始作品(图片、文字):原始著作权归创作者。企业仅在满足著作权许可或合理使用前提下,获得训练使用的权利,原始作品本身不属于企业的数据资产。企业仅拥有使用该作品用于模型训练的许可,不享有作品本身的财产权。

 

3.政务/公共原始数据:所有权归国家,企业可依法获取加工使用权,原始公共数据本身不属于企业资产。

(二)第二层:经加工、清洗、标注后的训练数据集(语料库)

企业对原始数据进行去重、脱敏、匿名化、清洗、标注、结构化聚合,形成独立数据集。该加工数据集,在满足合规前提下,属于典型的数据资产。依据:数据二十条,加工者享有数据产品经营权;财政部《暂行规定》,企业加工形成的数据资源,符合资产确认条件,会计上可计入无形资产。法律限制:数据集内若仍包含未脱敏个人信息、未经授权版权作品,即使投入大量加工成本,依然存在合规瑕疵,不能作为有效数据资产进行交易、质押。司法实践中,若数据集侵犯他人著作权、个人信息,该资产存在权利瑕疵,处置价值会归零甚至产生侵权赔偿责任。
 

(三)第三层:模型架构、训练代码、算法逻辑

图片模型架构、训练代码属于计算机软件,属于技术资产(知识产权资产),不属于数据资产。代码是指令序列,属于《计算机软件保护条例》保护的计算机程序,受著作权保护;未公开的模型架构、算法方案,可以构成商业秘密。其保护对象是程序表达与技术方案,不是信息记录,因此笔者认为应当归入技术资产。

 

(四)第四层:模型参数(权重参数)——争议最大的混合客体

模型参数是模型训练完成后存储在文件中的海量数值集合,系训练数据经算法运算后生成的结果。从载体形态观察,参数属于电子记录的数值集合,形式上符合《数据安全法》项下“数据”的定义,根据《浙江省人工智能领域数据知识产权登记申请指引(2025)》,浙江人工智能数据知识产权登记试点亦已将模型参数纳入登记范围;但其价值并非来源于参数本身承载的原始信息,而是源自训练算法、算力投入与训练数据共同形成的智能推理能力,脱离算法架构的参数无法独立实现模型功能。据此可得出定性结论:模型参数兼具数据载体属性与技术智力成果属性,属于以数据形态承载的技术成果,不能简单直接等同于普通数据集类的数据资产。

 

在权利保护的实务层面,企业一般将模型参数作为商业秘密予以保护,针对未经许可复制、盗取模型参数的行为,司法实践多通过侵犯商业秘密、不正当竞争的路径提供救济,而非单纯依据数据权益侵权规则进行保护。

 

在实务层面,笔者认为可以大致遵循以下区分要点:单独的模型参数文件在载体层面属于数据,在功能层面依附算法技术,属于技术成果;完整大模型产品(架构代码+参数+推理接口)整体属于软件/技术资产。

 

综上,笔者认为,训练数据集属于数据资产范畴;模型架构、算法代码属于技术资产;模型权重参数属于混合客体,不能简单归为单一类别。

图片

三、实务困境:价值评估与处置路径的冲突

图片(一)确权困境:多重权益叠加,权利边界模糊

AI训练数据集往往多层权益叠加:同一份数据集同时包含个人信息、著作权作品、公共数据、企业自有数据。企业投入成本加工,但无法取得完整所有权,仅享有加工使用权、产品经营权。传统资产处置、质押、破产财产处置,都以清晰财产所有权为基础,而数据三权分置下,权利是有限的、可分的。模型参数的权利边界更模糊:参数由训练数据、算法、算力共同产出,多方主体可能主张权益。一旦发生并购、破产,如何分割模型参数权益,现行民事诉讼、强制执行规则缺少配套程序。
 

(二)价值评估困境:传统评估方法失灵

从资产评估视角看,针对AI模型参数主要存在成本法、收益法、市场法三类估值路径,但各方法均存在固有局限:成本法仅归集历史采集、清洗、标注、算力投入,不能体现模型商业获利能力,且数据集存在合规瑕疵时其价值可能归零;收益法依托未来商业化现金流折现,但受AI技术快速迭代、模型快速贬值影响,未来收益预测主观性较强;市场法则受制于大模型多为非公开、定制化交易,缺乏可参照的公允可比案例。财政部《暂行规定》仅规范会计入账事宜,并未配套出台专门的法定资产评估准则,评估机构就AI模型参数开展估值时,评估假设选择空间较大,相应评估结论往往难以获得司法机关、金融机构的采信。
 

(三)资产处置与强制执行困境图片

1.可复制性带来控制难题:传统资产执行,查封扣押即可控制;数据、模型参数极易复制。即便法院查封服务器,被执行人可以私下拷贝转移参数,执行法院很难实现排他控制。

 

2.处置变现路径缺失:司法拍卖平台缺少AI模型、数据集的成熟交易渠道;数据交易场所交易规则尚在试点,司法拍卖的法律效力、登记效力尚未被司法统一认可。

 

3.合规附随义务无法剥离:处置数据集、模型,受让方必须承接数据合规义务。如果原始训练数据存在个人信息、版权瑕疵,资产转让后侵权责任可能延续,导致受让方不愿意收购。

图片

四、规范路径:分类确权与差异化处置机制

图片
(一)分类确权:建立分层权利清单

1.加工训练数据集(合规脱敏、去版权风险):确权为数据资产,适用数据三权分置,办理数据知识产权/数据要素登记,明确数据产品经营权。可用于入表、作价出资、数据质押。

 

2.原始未脱敏数据集:不得确认为可转让数据资产,仅可在内部限定范围享有加工使用权,禁止对外转让、质押。

 

3.模型架构、训练代码:归入技术资产(软件著作权/商业秘密),按知识产权规则确权、登记。

 

4.模型权重参数:混合客体单独登记,登记时区分两项权益:一是作为电子数据的持有权益;二是依附算法的技术成果权益。登记文件中载明权利限制、许可范围、禁止逆向工程等约束。
 

(二)差异化交易与处置规则

1.数据资产(合规数据集):适用数据要素交易规则,在数据交易所登记交易,转让的是数据产品经营权,合同中明确数据合规承诺、瑕疵担保、数据安全义务。

 

2.模型参数资产:转让应当采用许可模式为主、整体转让为辅。完整转让模型参数,必须同步转让配套算法代码,合同约定禁止拷贝、逆向提取、二次训练等限制条款,配套技术锁、访问控制等技术保障。

 

3.强制执行场景:区分资产类型。数据集处置前置开展数据合规尽调;模型参数处置优先采用独占许可、收益分成模式,而非简单拍卖拷贝副本。法院执行文书应当明确禁止未经许可复制模型参数。
 

(三)配套法律保障建议

图片1.交易合同层面:在AI资产转让/质押合同中,设置权利瑕疵担保、合规承诺、侵权责任隔离、技术控制条款;区分“数据资产部分”与“技术资产部分”,分别约定对价。

 

2.登记层面:依托地方数据知识产权登记、数据要素登记,将数据集、模型参数办理登记,登记凭证作为权属初步证据,提升在诉讼、质押中的证明效力。登记事项应当载明权利限制、数据来源、合规审查结论。

 

3.争议解决层面:发生权属纠纷,区分诉由。单纯数据集窃取,主张数据权益、不正当竞争;盗取模型参数、算法代码,优先主张侵犯商业秘密、著作权侵权。
 

结语

数据资产与技术资产的法理边界,是AI企业资产化的基石。AI训练数据、模型参数不能一概而论认定为数据资产,必须分层识别。笔者认为:合规加工后的训练数据集属于数据资产;模型架构代码属于技术资产;模型参数是承载于数据载体之上的技术成果,属于混合客体。面对确权难、评估难、处置难的现实困境,企业在资产入表、投融资、并购、破产处置时,应当先行分层确权、开展数据合规尽调,区分数据权益与知识产权权益,设置差异化交易与风控条款,预留风险隔离机制,从而防范权属争议、合规处罚、估值失真带来的法律损失。