过去几年,大模型训练数据的核心任务,是帮助模型理解语言、学习知识并遵循指令。问答对、指令数据、偏好数据等常见数据形态,本质上都围绕一个核心展开:输入什么,模型应该输出什么。
但随着AI应用从“对话”进一步走向“任务执行”,这套数据逻辑正在发生变化。
智能体(Agent)面对的并不是一个等待回答的问题,而是一项需要真正完成的任务。它需要理解用户目标,拆解任务步骤,选择合适的工具并完成调用,根据环境反馈调整后续动作,并在出现异常时进行处理,最终交付一个可验证的结果。
国家数据局2026年6月发布的《关于推进行业高质量数据集建设行动的实施方案》,已经将复杂任务规划、长程推理、人机交互、决策执行等数据集建设纳入重点,并明确提出加快相关数据集建设,赋能智能体等新型智能应用形态。
从新宇智慧长期参与语言服务和AI数据项目的经验来看,这不是简单地给原有训练数据增加几个字段,而是训练数据的底层逻辑正在变化:模型过去主要学习“如何回答”,现在还需要学习“如何完成一项任务”。
而“如何完成任务”,最终需要通过数据把完整的行动过程记录下来。
数据形态正在从“答案”走向“轨迹”
在传统语言模型训练中,一条数据可能是一组用户问题和标准答案。
但对于智能体而言,仅仅保留最终答案远远不够。
以一个“查询订单并修改收货地址”的客服任务为例,真正有训练价值的内容可能包括:模型如何识别用户意图,先调用什么工具,传递哪些参数,工具返回结果后如何判断,信息缺失时如何补充,以及遇到调用失败后是否能够采取正确的恢复路径。
这类数据实际上记录的是一条完整的任务轨迹。
从目标理解、任务规划,到工具调用、环境反馈、下一步决策,再到最终结果,整个过程都可能成为训练、微调或者评测的重要数据。
国家数据局发布的相关方案,也已经从数据形态层面明确提出,除文本、代码、图像、音频、视频等传统多模态数据外,还需要加强复杂任务规划、长程推理、人机交互、决策执行等数据集建设。
对于数据服务企业而言,这意味着数据生产的重点发生了变化。
过去,我们更多是在判断一段内容“是什么”;现在,还需要进一步判断一项操作“为什么这样做”“下一步应该做什么”。
这也是智能体数据与传统数据标注之间最本质的差异之一。
真正困难的,是把“正确行动”定义清楚
智能体数据之所以难,并不只是因为一条数据变长了。
更重要的是,数据质量的判断标准发生了变化。
传统文本标注通常可以围绕语义、意图、答案准确性等指标建立规则。到了智能体场景,一条轨迹即使最终完成了任务,也不意味着它就是一条高质量数据。
它可能调用了错误的工具后又绕回来,也可能进行了大量没有必要的操作;甚至有些轨迹最终结果看似正确,但中间步骤已经触及了业务规则或者安全边界。
因此,智能体数据至少需要同时考虑任务结果、执行路径、效率和安全等维度。
更重要的是,这些判断很难脱离具体业务。
金融智能体处理一项账户操作,需要理解业务规则和权限边界;医疗场景中的智能体需要理解专业术语以及不同操作的风险程度;工业场景涉及设备控制时,则需要进一步考虑实际工作流程和操作规范。
这也是我们在新宇智慧开展AI数据服务时持续强调的一点:高质量数据的生产,本质上越来越依赖语言理解、技术能力与行业知识的结合。
新宇智慧深耕语言服务20余年,积累了覆盖200余种语言、40多个国家和地区的语言资源与各大垂直领域的项目经验。随着AI应用不断深入,我们也将原有的语言能力延伸到AI数据服务,在数据采集、清洗、处理、标注、数据集建设和质量管理等环节中,将语言专业能力与AI数据生产结合起来。
对于智能体而言,这种能力尤其重要。因为它面对的很多问题,本质上都发生在语言、工具与业务三者的交叉位置。
人机协同正在改变数据生产方式
另一个明显变化,是数据生产本身正在变得更加智能化。
国家数据局披露,截至2026年第一季度,全国已建成高质量数据集超过11.6万个,总体量超过960PB,日均Token调用量突破140万亿。随着数据规模持续扩大,仅依靠传统人工方式完成全部数据生产,效率与质量之间的平衡会越来越难。
对此,《实施方案》提出推动数据标注从“以人为主”向“人机协同、专家深度参与”的模式转变,并进一步提出“模型预标注+人工校准”“人工标注+模型检验”等模式。
从实际项目来看,人机协同的价值并不是简单地“减少人工”。
真正有价值的是重新划分机器与人的工作边界。
对于格式检查、重复性处理、初步分类等标准化任务,可以通过模型和自动化工具提升效率;而涉及复杂语义判断、业务规则、工具调用路径和安全边界的样本,则需要经验丰富的专业人员进行审核和校准。
在我们的AI数据服务实践中,我们也采用类似的分层思路:通过技术手段提升数据处理效率,同时由专业团队对关键样本进行深度审核,将自动化能力和人工经验放在各自更适合的位置。
国家数据局将数据标注向专业化、智能化方向升级,并明确提出专家深度参与指令微调、强化学习等阶段的数据生产,本质上也说明了一点:数据标注正在从单纯的规模生产,逐渐走向知识密集和技术密集。
多语言智能体让问题再复杂一层
对于需要服务海外用户的AI产品来说,智能体数据还面临一个更加现实的问题:语言差异并不会因为底层模型是同一个,就自然消失。
同一个客服任务,在不同语言市场可能有不同的表达习惯。用户对订单、退款、地址修改等需求的描述方式可能完全不同,甚至同一表达在不同业务环境下对应的处理路径也可能存在差异。
因此,多语言智能体的数据生产不能简单理解为“把中文数据翻译成英文、日文或德文”。
语言表达需要准确,意图判断需要一致,业务流程需要对应,工具调用逻辑也需要保持合理。与此同时,真实业务数据往往涉及用户个人信息、交易信息和内部业务数据,采集、清洗、脱敏、存储及使用过程中的安全要求也不能被忽略。
这也是语言服务经验进入AI数据生产之后,一个非常直接的价值所在。
在长期服务全球化客户的过程中,新宇智慧在多语言数据采集与处理方面积累了成熟的项目经验,同时建立了覆盖文本、语音、图像、视频等多模态数据的处理能力。针对不同项目需求,我们可以围绕数据采集、清洗、OCR/ASR、结构化处理、标注与质量审核等环节进行体系化交付,并结合信息安全管理体系和私有化部署要求开展相关项目。
对于多语言AI应用来说,语言能力并不是数据生产流程中的一个附加环节。
语言本身就是数据质量的一部分,而数据质量最终会反映到模型执行任务的结果上。
从“做数据”到“做可用的数据”
我们观察到,AI数据服务正在经历一次很明显的升级。
过去,企业关注的是有没有足够多的数据;现在,更需要关注这些数据能不能真正服务于模型训练和实际业务。
国家数据局提出,到2028年底,将建成一批覆盖重点领域、经过应用验证的行业高质量数据集,并推动形成“场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值”的循环。
这也是为什么,今天的数据服务已经很难单独用“采集”“标注”几个词来概括。
对于一个正在进入真实业务场景的智能体来说,它需要的数据不仅要覆盖不同类型的用户表达,还要覆盖不同任务路径、工具调用、异常情况和业务规则;对于全球化应用,还需要进一步处理多语言、多文化环境下的数据差异。
在新宇智慧看来,这正是AI数据服务未来需要持续解决的问题。
依托20余年的语言服务经验和不断完善的AI数据能力,我们希望提供的不只是经过处理的数据,而是真正能够进入模型训练、评测和业务应用体系的数据资产。
当AI从“会聊天”进一步走向“会办事”,训练数据也必须从记录一个答案,走向记录一次完整的任务。
模型最终学会什么,很大程度上取决于我们究竟给它留下了什么样的“行动经验”。

