编者按:随着数据要素市场化配置改革持续深化,制度构建、价值释放与治理协同的关键议题备受关注。人民网·人民数据对话专家学者、地方政府相关负责人、企业代表,共同探讨数据要素高质量发展新路径。
本期嘉宾:秦磊 对外经济贸易大学统计学院教授、博士生导师
人民数据:数据要素顶层设计逐渐完善,但产业层面仍存在观望现象,不少企业不敢、不愿深度开展数据开发利用。您认为推动企业深度参与需要在哪些方面做出调整?
秦磊:第一,在授权、加工、交付、使用、再开发和退出等环节建立标准合同与负面清单,使企业事前知道合规边界。第二,完善登记存证、质量评价、合规审查、可信数据空间和使用审计,把数据从“复制后难以控制”变为“可用不可见、用途可限定、过程可追溯”。第三,把政策重心从供给侧的“上架多少产品”适度转向需求侧的“解决多少真实问题”,以工业、金融、医疗、商贸等高频场景形成稳定采购和持续付费。第四,培育评估、审计、经纪、合规与争议解决服务,降低企业尤其是中小企业一次交易的固定成本。
更关键的是,政策评价不能只看入表金额、挂牌数量和“首单”数量,而要看复购率、实际调用量、交易后增收降本和风险事件率。只有一笔交易做到来源有据、授权清晰、质量可验、收益可算、责任可追,企业才会从“试试看”转向持续投入。换句话说,数据从仓库走向市场,缺的是一条可重复、可审计、可问责的价值闭环。
人民数据:数据要素红利当前更多向大型平台、头部科技企业集中,大量中小企业很难参与数据增值收益分配。政策工具设计上如何平衡,推动中小企业共享红利?
秦磊:建立分层分类的权益与开放规则。对个人信息、商业秘密和核心数据严格保护;对具有公共性、行业共性或由多方共同形成的基础数据,则通过授权运营、标准接口、数据可携带和互操作等机制,防止平台通过接口封闭、自我优待或歧视性定价排斥中小企业。开放不等于免费,更不等于交出原始库,完全可以按用途、期限、调用量和安全等级收费。
建设行业可信数据空间、联合数据池和数据合作社,让中小企业借助隐私计算、联邦学习实现“数据不出域、价值可共享”,并用数据券、算力券、首用补贴和风险补偿降低首次用数成本。与其普遍压低数据价格,不如精准降低中小企业进入市场的固定成本。
收益分配要转向“谁创造可验证的增量价值,谁获得相应回报”。可依据数据质量、更新频率、模型性能提升、实际调用和最终业务收益,建立动态分成与可核验的贡献记录。对头部平台要强化事前竞争规则与审计,防止搭售、排他协议和算法歧视。政策成效也不能只看开放数据集数量,而要看中小企业是否真正调用、是否产生订单、是否提高生产率。最终目标不是“平均分数据”,而是形成既允许创新者获得合理回报、又保持市场可进入、收益可分享的生态。
当然,也有一些小企业通过非正规渠道爬取、收集数据的现象,保障大型平台、头部科技企业数据权益也是一个很重要的方面。
人民数据:当前多地已落地一批数据资产质押融资案例,但多数仍停留在示范层面。在您看来,我们距离数据资产真正成为银行认可的“常规押品”,还有多远?
秦磊:“样板间多、商品房少”,根本原因是现在不少所谓“数据资产质押”案例中,银行真正看重的仍是企业信用或外部增信;数据资产更多只是增信线索,而非可独立处置的押品。银行认可一项抵押物,不是看评估报告写了多少钱,而是看违约后能否依法控制、快速处置并稳定回收。数据恰好在这三点上存在短板:它可复制,难以像设备那样唯一交付;价值依赖特定客户、算法、合同和持续更新,脱离原企业后可能骤降;处置还可能受到个人信息、商业秘密、授权期限和用途限制。再加上重复质押、质量失真和二级市场不足,银行很难估计违约损失。
还需要澄清的是,数据资源“入表”并不自动产生可质押性。会计确认解决的是在特定条件下如何反映成本和披露信息,质押融资解决的是担保权能否设立、顺位是否清楚以及能否执行,两者不是同一套问题。要让业务常态化,需要形成“登记—估值—监测—处置”的完整链条:建立统一或可互认的登记公示规则,明确权利边界、重复担保与优先顺位;基于真实合同、调用量、付费率和现金流开展动态估值;引入持续审计、受控账户和反欺诈机制;培育能承接数据产品、运营权或未来收益权的处置市场,并积累违约与回收数据。
人民数据:您如何看待词元计量这一新探索给数据资产估值、收益分配带来的机遇与挑战?
秦磊:我把词元看作人工智能服务的“电表”,而不是数据资产价值的“万能尺”。它的重要性在于把模型调用这一原本难以观察的过程,转换为连续、细颗粒度的经营数据。企业可以据此核算任务成本、使用强度、产品毛利和服务容量;数据资产估值可以从一次性的成本法,进一步转向基于真实调用、续费和现金流的收益法;收益分配也有机会把数据提供、模型训练、算力供给和场景运营放在同一条可计量链条上。对轻资产人工智能企业而言,经过核验的词元记录还可帮助金融机构观察客户活跃度和业务增长,缓解传统抵押物不足造成的信息不对称。
但需要防止把“调用得多”等同于“价值更高”。词元只是技术消耗量,不直接代表模型输出质量、任务难度、用户付费意愿和企业还款能力。如果授信只看消耗量,可能把持续烧钱误判成持续经营;如果收益分配只按词元规模,又可能低估高质量数据、原创内容和行业知识的贡献。
因此,我建议建立三道约束:一是统一词元计量、计费、结算和审计口径,至少区分“生成、调用、计费、付费、结算”五类,并保留模型版本和使用场景;二是从“原始词元数”升级为“有效词元指标”,把任务完成率、时延、能耗、客户留存和实际收入纳入质量调整;三是对词元流水建立独立核验、反刷量、隐私保护和分级披露机制,用于授信时,应与合同、应收账款、客户集中度和现金流交叉验证。词元计量最大的贡献,是为人工智能经济提供新的观察语言和结算基础;它应成为估值模型中的高频变量,而不应被包装成脱离场景、可以单独升值的“新资产”。(来源:人民数据公众号)
4001102288 欢迎批评指正
All Rights Reserved 新浪公司 版权所有