求知 文章 文库 Lib 视频 iPerson 课程 认证 咨询 工具 讲座 Model Center 汽车系统工程   模型库  
会员   
 
 
 
  开班计划 | 认证培训 | 技术学院 | 管理学院 | 嵌入式学院 | 机械 | 军工学院 | 定向培养 | 专家指导 | 角色培养  
 电话 English
成功案例   品质保证
成功案例
厦门软件 具身智能技术架构与
西门子研 AI智能体开发技术
某知名自 基于AI大模型开发
某医药企 大模型技术原理及基
中国电信 大模型核心技术RA
中国船舶 AI大模型辅助软件
某公募基 金融领域的AI大模

相关课程  
开源大模型推理、训练与部署
深度学习、目标识别强化学习
(知识图谱+图数据库)*大模型
人工智能.机器学习& PyTorch
人工智能+Python+大数据
深度学习入门与实战
知识图谱建模与应用
 
全部课程 >人工智能  
大模型微调、性能测试与能力评估
37 次浏览  2 次
徐老师
Red hat AI Infra 实施专家
 
时间地点:北京、上海、 深圳 根据报名开班
课程费用:5000元/人
报公开课  
企业内训:可以根据企业需求,定制内训,详见 内训学习手册


认证方式:
培训前了解能力模型。
培训后进行能力评测:
  • 在线考试
  • 能力分析,给出学习建议
  • 合格者颁发证书,作为职业技能资格证明


    课程简介:

           本课程系统讲解大模型从微调到部署再到评估的完整技术栈。通过理论讲解与实战演练相结合,学员将掌握参数高效微调(PEFT)技术原理与实践,能够使用LLaMA Factory完成模型微调全流程;理解大模型性能测试的核心指标体系,掌握性能压测与监控方法;构建多层次的能力评估体系,包括自动化基准测试、LLM-as-Judge主观评测等方法。课程内容紧贴企业实际需求,帮助学员快速具备大模型工程化落地能力。
     
    培训收益:

    • 熟练使用LLaMA Factory完成大模型微调全流程(数据准备、训练、监控、导出)
    • 能够使用vLLM等工具进行性能压测,建立监控告警体系
    • 掌握LLM评估方法,构建企业级多层评估体系
    培训对象:

    AI工程师、运维工程师、测试工程师、技术负责人
    学员基础:

    具备Linux/Python基础,有大模型使用经验者优先
    课程安排:2天
    主题 课程安排
    一、大模型微调深度实战
    1. 为什么需要微调 •  通用大模型vs专业场景需求
    •  微调的核心价值:注入领域知识、适应任务格式、降低推理成本
    2. 微调方法概览 •  全参数微调 vs 参数高效微调(PEFT)
    •  PEFT技术优势:显存效率、训练速度、灵活性
    3. LoRA技术详解 •  核心原理:W' = W + BA(低秩分解)
    •  关键优势:参数量减少100-1000倍
    4. LLaMA Factory实战 •  WebUI方式微调
    •  命令行方式微调
    •  数据准备(Alpaca格式)
    •  训练监控
    •  模型合并与导出
    •  推理测试与API部署
    5. 微调最佳实践 •  数据质量要求
    •  超参数调优建议
    •  评估与迭代策略
    二、大模型性能测试
    为什么需要性能测试 •  生产环境部署前的必要验证
    •  核心目标:验证SLA、找出瓶颈、规划资源
    2. 核心性能指标 •  吞吐量(TPS):每秒处理token数
    •  TTFT:首token延迟(目标<500ms)
    •  TPOT:每token生成时间(目标<50ms)
    •  端到端延迟
    •  资源利用率(GPU显存、利用率)
    3. 性能测试工具 •  vLLM内置benchmark
    •  自定义压测脚本
    4. vLLM基准测试实战 •  吞吐量测试配置
    •  结果分析与解读
    5. 性能监控体系 •  系统级监控:nvidia-smi、dcgm-exporter
    •  应用级监控:Prometheus + Grafana
    •  告警配置策略
    三、大模型能力评估体系
    1. 为什么需要能力评估 •  量化模型能力,指导选型
    •  验证微调效果
    •  评估挑战:维度多样、标准难统一、测试集污染
    2. 评估维度 •  基础能力:语言理解、知识问答、推理
    •  专业能力:代码生成、数学计算、领域知识
    •  指令遵循:格式要求、多轮对话连贯性
    3. 主流基准测试 •  综合能力:MMLU、C-Eval、AGIEval
    •  推理能力:GSM8K、BBH
    •  代码能力:HumanEval、MBPP
    4. 评估框架介绍 •  OpenCompass:一站式评测平台
    •  lm-evaluation-harness:开源社区标准
    •  Eval-Scope:阿里评测框架
    5. 微调后专项验证 •  构建任务特定测试集
    •  评估指标设计
    •  回归测试与A/B对比
    6. LLM-as-Judge •  概念与优势
    •  评估方法:单点评分、成对比较、参考答案对比
    •  偏见缓解策略
    7. 企业LLM评测三层架构 •  Layer 1:自动化Benchmark(成本低、速度快)
    •  Layer 2:LLM-as-Judge(成本中、质量良好)
    •  Layer 3:人工评估(成本高、质量可靠)
       
    37 次浏览  2 次
    其他人还看了课程
    AI大模型辅助工程师编写高质量代码  5399 次浏览
    AI助力企业职能部门 效率提升  1668 次浏览
    AI前沿发展与行业应用最佳实践  2394 次浏览
    大数据分析、AI算法与可视化技术应用实战  8692 次浏览
    开源大模型本地化(RAG + Agent)落地实战  2555 次浏览
    机器学习原理与实战  2742 次浏览
    机器人软件开发技术  8908 次浏览
    定制内训


    最新活动计划
    知识图谱、本体论、RAG与大模型 8-22[在线]
    企业架构方法与实践 8-27[深圳]
    FDE(前沿部署工程师)实践指南 9-8[北京]
    AI智能体开发技术实践 9-17[厦门]
    UAF架构体系与实践 9-22[北京]
    MBSE(基于模型的系统工程)9-29[北京]