增量预训练后Loss不下降、微调后模型只会回答训练样本中的问题、蒸馏数据包含教师模型的错误、科学计算模型盐度损失异常波动——这些是NLP大模型训练中最常见也最棘手的问题。华为云《盘古大模型最佳实践》系统总结了增量预训练、微调、蒸馏、科学计算四类训练场景的实操经验,为模型调优提供了可复用的方法论。
增量预训练——让模型学习领域知识
训练参数与Loss曲线解读
金融场景增量预训练使用CCI3.0-HQ、FineWeb Edu、IndustryCorpus2数据集,配比1:6。训练参数:热身比例0.01、数据批量大小32、学习率0.000005、训练轮数1。正常Loss曲线应随迭代步数增加呈下降趋势直至稳定。
核心评价思想是“收益有多大,代价有多高”——对比训练前后模型在领域评测集上的性能提升,以及通用能力是否发生遗忘。若领域能力未达预期,需检查数据质量、增加领域数据比例;若通用能力下降严重,需增加通用指令数据比例。
核心评价思想是“收益有多大,代价有多高”——对比训练前后模型在领域评测集上的性能提升,以及通用能力是否发生遗忘。若领域能力未达预期,需检查数据质量、增加领域数据比例;若通用能力下降严重,需增加通用指令数据比例。
典型问题与解决方案
训练过程中Loss偶尔出现突刺——同时监控grad norm数值,若同步跳变说明数据质量较差,需再次精细加工。训练Loss逐步降到0——训练轮数过多产生过拟合,应减少训练轮次(通常1-2轮即可)。Loss迟迟不下降或隐约上升——学习率过大,建议减小学习率重新训练。Loss波动较大——检查Batch Size设置,适当增加使训练更平稳。
微调训练——提升特定任务能力
训练参数与过拟合/欠拟合诊断
催收意图识别微调使用31万条通用+8万条行业数据,配比1:4。训练参数:热身比例0.01、序列长度32768、数据批量大小8、学习率0.00002、训练轮数3。
微调后模型回答重复某句话——检查话题重复度控制/温度/核采样参数设置,适当增大参数值;检查训练数据是否存在文本重复;检查训练轮次或学习率是否过高导致过拟合。回答出现乱码——检查数据是否包含异常字符,检查训练轮次或学习率,适当降低推理温度或核采样。回答异常中断——检查最大Token限制,增加该参数值;检查数据是否包含异常截断。只能回答训练样本中的问题——过拟合,降低训练轮次或学习率。
微调后模型回答重复某句话——检查话题重复度控制/温度/核采样参数设置,适当增大参数值;检查训练数据是否存在文本重复;检查训练轮次或学习率是否过高导致过拟合。回答出现乱码——检查数据是否包含异常字符,检查训练轮次或学习率,适当降低推理温度或核采样。回答异常中断——检查最大Token限制,增加该参数值;检查数据是否包含异常截断。只能回答训练样本中的问题——过拟合,降低训练轮次或学习率。
微调数据质量优化
一份高质量数据应具备:数据与目标任务一致、无异常样本(空数据、重复、水印、异常字符)、数据多样性。情感分类场景典型低质量数据包含与目标任务不一致的样本或Prompt不固定。文案创作场景典型低质量数据多样性差。优化方案:数据过滤(去空、去重、字符串过滤、PPL困惑度过滤)、数据转换(同义词替换、语法结构修改)、基于大模型的数据泛化、人工标注。
模型蒸馏——能力迁移到小模型
蒸馏流程与数据质量
催收意图识别需要识别6种意图:咨询、投诉、表扬、建议、催复、投诉撤销。使用DeepSeek-R1-32K作为教师模型,对500条场景数据进行蒸馏,配比1500条通用+1500条金融指令数据。学生模型Pangu-NLP-N1-Reasoner-128K全量微调,训练轮数1、学习率0.00002。
教师模型的缺陷会被学到——蒸馏数据需进行清洗和校准。真实场景性能要求与模型规模不匹配——需聚焦小场景针对性优化。过拟合问题——进行多次蒸馏采样增加数据多样性。
教师模型的缺陷会被学到——蒸馏数据需进行清洗和校准。真实场景性能要求与模型规模不匹配——需聚焦小场景针对性优化。过拟合问题——进行多次蒸馏采样增加数据多样性。
科学计算大模型微调
数据预处理与参数优化
区域海洋要素模型可预报15层深海层(0m至500m)的海温、海盐、海流经向/纬向速率和海表高度,时间分辨率24h,水平分辨率1/12°。微调使用Hycom再分析数据,要求包含5个表面层特征和15个深海层特征。
数据预处理优化案例:盐度(S)变量存在数据缺失与数据块偏移,导致训练损失异常、波动大且不收敛。通过统计学方法(四分位距、Z-score、样本分布)和可视化方法排查异常值并删除后,盐度损失恢复正常收敛。训练参数优化建议:学习率过高导致损失波动甚至梯度爆炸,使用学习率衰减策略;学习率过低导致下降缓慢,使用学习率预热方法。
数据预处理优化案例:盐度(S)变量存在数据缺失与数据块偏移,导致训练损失异常、波动大且不收敛。通过统计学方法(四分位距、Z-score、样本分布)和可视化方法排查异常值并删除后,盐度损失恢复正常收敛。训练参数优化建议:学习率过高导致损失波动甚至梯度爆炸,使用学习率衰减策略;学习率过低导致下降缓慢,使用学习率预热方法。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共54套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-31
大模型
186页
84张图表
0731-84720580
商务合作:really158d
微信扫码登录
手机快捷登录
账号登录