长周期 Agentic AI 数据集
面向多步骤推理、工具调用、API 操作和环境交互,构建可用于下一代智能体训练与评估的长任务轨迹数据。
面向企业 AI 团队和前沿模型研发项目,提供从数据规格设计、样本试点、规模化标注到质量验证的一体化支持。覆盖 Agentic AI、SFT/RLHF/CoT、多模态模型,以及自动驾驶、机器人、3D 点云等 Physical AI 数据场景。
CORE DATA OFFERINGS
从 LLM、VLM、Agentic AI 到自动驾驶、机器人和 3D 物理空间数据,孔明围绕训练目标反推数据规格,并组织可验证、可交付的数据生产流程。
为大语言模型、视觉语言模型和多模态模型构建训练、微调与评估数据,覆盖智能体轨迹、推理链、偏好数据、安全评测和专业领域 SFT。
面向多步骤推理、工具调用、API 操作和环境交互,构建可用于下一代智能体训练与评估的长任务轨迹数据。
覆盖数学、代码、逻辑题、复杂检索等场景,设计可让模型学习逐步推理过程的高质量思维链数据。
由金融、医疗、法律、IT 等领域专家设计高质量 prompt/response 数据,提升模型指令跟随与专业场景表现。
对模型输出进行偏好评估、排序和标注,为 DPO 与 RLHF 训练提供稳定的人类反馈数据。
支持图像描述、VQA、语音转写、视频分割等跨模态数据构建,服务 VLM、语音模型和多模态模型训练。
围绕越狱攻击、对抗提示、幻觉输出和边界场景进行测试,帮助验证模型安全性与护栏能力。
为需要理解和行动于现实世界的模型准备高维数据,包括 LiDAR 点云、传感器融合、HD Map、机器人轨迹、无人机和基础设施数据。
提供 3D bounding box、空间语义分割、连续帧追踪等点云标注能力,并可通过全球合作伙伴承接大规模项目。
构建工业和服务机器人所需的机械臂轨迹、关节角、触觉与视觉传感器组合数据,用于动作学习和控制模型训练。
整合 RGB 摄像头、LiDAR、Radar 等同步数据,生成驾驶场景、行人、障碍物和道路环境的高精度 ground truth。
对车道线、标志、信号灯、路缘和交叉口结构进行高精度向量标注,支持定位、感知和路径规划。
对 3D 数字孪生或仿真环境生成的 Synthetic Data 进行质量检查,并与真实世界数据组成混合数据集。
面向航拍影像和基础设施点云,提供缺陷检测、建筑与设备 3D mesh 标注,以及老化监测数据集构建。
不只交付标注数据,也帮助企业定义数据结构、设计标注指南、转换格式,并建立可长期迭代的质量管理流程。
从模型目标、训练方式和评估指标出发,明确需要采集、清洗、标注和交付的数据结构。
支持线上或线下会议,对标注规则、样本边界、质量标准和试点范围进行细化。
将企业内部数据整理为 JSON、JSONL、Parquet、COCO、YOLO、KITTI 等训练流程可用格式。
在 NDA、权限控制和安全操作流程下,支持高敏感数据的清洗、标注与交付管理。
WHY KONG MING
通过具备自动驾驶、3D 空间数据和大容量标注经验的合作伙伴网络,覆盖从小批量试点到大规模生产的数据需求。
在人工标注之外引入自动质量筛查,并由具备领域经验的专家复核,减少错误、歧义和不一致标注。
可面向医疗、金融、法律、代码等高专业门槛场景,也可配合 VPC、专用终端或现场作业等安全要求。
WORKFLOW
确认目标模型、使用场景、数据规模、质量门槛和交付时间。
先制作少量样本,校准标注指南、边界案例和验收标准。
组建合适团队和流程,进入批量标注、清洗和结构化生产。
通过 AI 筛查、人工复核、抽检和返修机制控制最终质量。
按指定格式交付,并支持后续数据扩展、版本更新和问题回收。
FAQ
可以。我们可根据项目需要安排线上会议,也可在日本国内进行线下沟通,帮助明确数据规格和标注指南。
可以。孔明会结合具备相关经验的合作伙伴网络,由我们统一需求、质量管理和交付窗口,承接大规模或高复杂度项目。
常见格式包括 JSON、JSONL、Parquet、COCO、YOLO、KITTI、ROS bag、PCD 等,也可以根据贵司训练流程定制格式。
可以。我们会根据项目要求安排相应领域的专家参与数据设计、标注、审核或质量复核。
可以。对于敏感数据,可根据要求采用受控访问、专用设备、VPC 或现场作业等方式执行。
可以。我们可以从模型目标、现有数据、评估方法和预算范围出发,一起定义试点方案。
GET IN TOUCH
如果数据规格还没有完全确定,也可以先告诉我们目标模型、应用场景、已有数据和计划时间。我们会在 1-3 个工作日内联系您。