GC / AI TRAINER耿冲乐
铸智

以人的判断,磨砺智能之锋。

SYSTEM READYHUMAN JUDGMENT × MODEL ALIGNMENT
01 / PROFILE

AI TRAINER · EMOTIONAL MODEL EVALUATION

让主观的情感表达,成为可判断、可复核、可迭代的模型标准。

我专注于情感类生成模型与多模态数据质量。擅长将“情绪是否自然、人物是否稳定”等模糊需求拆解为 Rubric、问题标签和边界案例,再通过盲评、一致性校准与 Badcase 分析,为模型选型和迭代提供可靠依据。

当前状态
随时入职
工作地点
待定
学历
本科
专业方向
情感类模型评测 · 多模态数据质量
02 / CAPABILITIES

CORE PROTOCOLS

情感评测,不止是“看起来像”。

从主观情绪判断到稳定量表,兼顾多模态数据、质量控制、错误归因和工具效率。

01

情感视频模型评测

围绕情感指令遵循、情绪强度、人物一致性、动作连续性、画面质量与真实感开展多维评测。

02

Rubric 与规则校准

把主观感受拆成可打分、可复核的标准,通过试标、背靠背评测与边界案例持续统一尺度。

03

Badcase 分析

对情绪表达偏差、主体漂移、动作异常和画面失真进行分类、归因与沉淀,推动规则和模型迭代。

04

多模态数据处理

具备图片、文本与视频项目经验,熟悉 Caption 描述、标签分类、训练数据筛选和视频样本评测。

05

质量控制

覆盖试标、正式标注、质检验收、争议样本处理与抽检复盘,用数据追踪一致性和交付质量。

06

工具化提效

通过 Vibe Coding 搭建同屏评测平台、分辨率检测工具和图片采集插件,减少重复操作与人工误差。

03 / CASE STUDIES

FIELD RECORDS

把判断落到标准与结果。

重点展示情感视频模型评测,以及多模态训练数据的规则设计、质量控制和工具实践。

CASE 01

重点案例 · 情感视频生成模型评测

把“情绪是否准确”转化为可执行标准

围绕 1,440 条视频样本,将业务需求拆解为指令遵循、人物主体一致性、人体运动连续稳定性、画面质量与真实感等维度,并按情感类型、强度和人物场景构建分层评测集。通过 Vibe Coding 搭建轻量级标注平台,将视频、提示词、多维评分与问题标记整合至同一页面,并加入评分标准、问题标签、自动保存和结果汇总功能;减少页面切换与重复填写,使人效由 3 条/小时提升至 4 条/小时,提升约 33.3%。
CASE 02

多模态质量控制 · 人物图片

50 万级人物图片筛选与质检

将模糊的图片筛选需求转化为分类、交付和验收标准,通过自动校验、风险分级抽检和低质图片前置过滤提高数据一致性。标注准确率由 70% 提升至 95%;一次通过率提升 25 个百分点;返工率下降 20%。
CASE 03

训练数据生产 · Caption 与标签

服装图片 Caption 结构化与采集提效

负责标签体系拆解、规范制定、边界案例补充和 BPO 答疑,推动自由描述向结构化字段输出,并开发网页图片批量采集插件。插件单次可采集 100–300 张图片,单图处理由 1–2 分钟缩短至 5–10 秒;结构化方案指标为项目预估,非已验收成果。
04 / EVALUATION PORTFOLIO

EMOTIONAL VIDEO EVALUATION

评测作品集

十二个约 5 秒的个人概念作品,按单主体、交互连续性与多人复杂剧情分为三个难度页面。

05 / WORKFLOW

TRAINING SEQUENCE

从模糊问题到稳定标准。

  1. 01

    需求解析

    定义目标、受众与失败成本

  2. 02

    标准设计

    建立评分维度与边界规则

  3. 03

    样本构建

    覆盖典型、困难与对抗场景

  4. 04

    一致性检查

    校准判断并追踪分歧来源

  5. 05

    错误分析

    聚类问题并定位根因

  6. 06

    迭代验证

    复测改进并沉淀可复用规范

FIELD NOTES / INSIGHTS

FIELD NOTES

训练与评测观察。

01

如何把情感表达拆成可执行的评测维度

02

主观评测如何通过 Rubric 与盲评提高一致性

03

从视频 Badcase 中定位模型问题