唐山网站建设北京高端网站建设

惠商(湖北)网络传媒有限公司 2026/09/09 17:47:36

目录

文章目录

  • 目录
  • Scaling Laws 第一定律
  • 大模型训练全流程
    • 预训练阶段(Pre-Training)
    • 微调阶段(Fine-Tuning)
    • 提示工程阶段(Prompting)

Scaling Laws 第一定律

OpenAI 在 2020 年的论文中提出了 Scaling Laws(扩展定律),证明了 LLM 的性能(以交叉熵损失衡量)遵循一定的数学幂律关系(Power-law)。即:大预言模型的 Loss(损失函数)值与模型参数量(N)、训练数据量(D)、计算资源量(C)这 3 者之间存在着稳定且可预测的数学关系。

  • L:损失函数,收到 N、D、C 的影响。
  • α、β、γ:常数系数,α≈0.076、β≈0.095、γ≈0.05,实际值因任务不同略有调整。

    如上图所示:
  1. 模型参数量(N):模型的总参数规模越大,损失越低。例如:将参数量从 1 亿增至 10 亿,损失下降幅度超过线性增长预期。
  2. 计算资源量(C):训练所用的浮点运算量(FLOPs)与损失呈反向幂律关系,即:更多的计算资源可显著提升模型效果。
  3. 训练数据量(D):在 C 和 N 固定时,增加 D 可以缓解过度拟合,但存在边际递减效应。如下图所示,当 C 固定时,需要找到一个最低点的 D。

所以,大模型训练需要关注 3 要素的平衡扩展。若仅扩大其中一项而其他两项受限,将导致收益显著降低。例如,若模型参数增加 8 倍,训练数据需至少增加 5 倍才能避免过拟合。

简而言之,Scaling Laws 证明了随着 N、D、C 的增加,LLM 的性能会持续改善,而且在相当长的发展阶段内没有明显的天花板效应。也因此 Scaling Law 为 AI 行业发展提供了关键的底层逻辑支撑 ——规模优先于算法:在 Scaling Law 之前,AI 研究普遍专注在算法创新(如层数、注意力头数、宽度与深度比例)。Scaling Law 之后,通过简单地扩大模型的参数规模,就可以持续获得性能提升。这解释了为什么从 GPT-3 到 GPT-4,模型的参数规模一直在扩大。先扩大规模,再进行算法改进和优化才是正确的路径。

当前已知最大的模型是 GPT-4(万亿级),而 OpenAI 员工透露 GPT-5 的参数量是 GPT-4 的 10 倍。

大模型训练全流程

阶段数据驱动训练成本训练效果
1. 预训练阶段依赖海量无标注数据,万亿级数据量。成本最高,千卡万卡。博而不精。
2. 微调阶段依赖高质量标注数据,百万~千万级数据量。成本中等,十卡百卡。精而专用。
3. 提示词阶段依赖提示词和上下文数据,百~千级数据量。零算力成本。高效应用。

预训练阶段(Pre-Training)

Random Model(随机模型):模型的初始状态,所有权重参数都是随机赋值的,不具备任何语言理解或生成能力。

Pre-Training Data(预训练数据):海量、多样化的无标注文本数据,规模通常达到万亿 tokens 级别(如 GPT-3 训练数据约 45TB 文本),涵盖书籍、网页、论文、新闻等,确保模型接触到广泛的语言现象和知识。通过这些数据,模型能自动捕捉语法、语义、逻辑关系和世界常识。数据来源包括 Common Crawl(互联网网页爬取数据)和社交媒体数据(如微博、推特等)。

Pre-Trained Model(预训练模型):通过 “自监督学习” 从海量数据中经过预训练后得到的基础模型(如 GPT、Llama、BERT),具备通用语言理解和生成能力,但不理解特定私域知识和不擅长特定任务。是后续所有优化的基础,是大模型能力的 “源头”。

微调阶段(Fine-Tuning)

In-Domain Data(领域数据/指令数据):小规模、高质量的标注数据,规模通常为百万-千万 tokens 级别,但标注成本高,需人工设计或筛选。分为两类:

  1. 领域数据:特定场景的数据(如医疗文献、法律条款);
  2. 指令数据:人类撰写的 “指令-响应” 或 “问题-答案” 对。

Fine-Tuned Model(微调后模型):使用 In-Domain Data 对基础模型的部分参数进行 “定制” 后的最终模型,以优化特定任务性能(如客服、代码生成等)。常见的微调方式有:

  • SFT(Supervised Fine-Tuning,有监督微调):直接用指令数据训练,让模型学会理解和执行任务。
  • RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习):先让人类对模型输出打分,训练一个 “奖励模型”,再用强化学习(如 PPO 算法)让模型优化输出,使其更符合人类偏好。

提示工程阶段(Prompting)

在不修改模型参数的前提下,通过 Prompting 或 In-Context Learning 引导模型输出所需结果:

  • In-Context Learning(上下文学习):在输入中加入少量 few-shot examples,让模型通过模仿示例完成任务,无需训练。
  • Prompting(提示工程):通过精心设计的 Prompt,引导模型生成特定格式或内容的输出。
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈,一经查实,立即删除!

济宁网站建设网站建设课程

CosyVoice3:从上传音频到生成语音的完整技术解析在短视频创作、有声读物制作和智能客服系统日益普及的今天,如何快速、自然地生成“像人”的语音,已成为内容

2026/06/30 10:52:52

建设网站教程长安网站建设

转自微信号:牛逼的IT英伟达最新发布的NVL576正交架构,不仅标志着其在超大规模节点设计上的一次重大革新,也引发了与国内如海光、阿里等同类架构的对比讨论。本

2026/06/30 10:52:22

建设网站教程淮安网站建设

Stressapptest压力测试工具:全面掌握系统稳定性检测实战指南【免费下载链接】stressapptestStressful Application Test - userspac

2026/06/30 14:01:08

网站建设学习福田网站建设

企业网站后台管理系统富文本编辑器Word/公众号内容导入功能集成方案需求分析与技术评估作为吉林某国企项目负责人,我们近期需要对现有企业网站后台管理系统的文章发布模块进行功能升级ÿ

2026/06/30 14:03:08

南宁网站建设顺德网站建设

构建专属声音库:利用GLM-TTS批量生成功能打造个性化语音资产在短视频、有声书和虚拟人内容爆发式增长的今天,一个独特且一致的声音,可能就是品牌认知的关键。你

2026/06/30 11:26:25

网站建设规划书免费企业网站建设

目录一、引言:alltoall—— 分布式深度学习的通信 “咽喉”二、测试环境与指标定义三、节点数维度:从 2 到 24 节点的带宽衰减规律3.1 2 节点:带宽性能的 “基准天花板”3.2 4 节点

2026/06/30 12:43:03

巩义网站建设网站建设全包

多语言翻译服务质量保障:通信无国界的基石在全球化浪潮席卷各行各业的今天,企业跨国协作、科研机构联合攻关、用户跨语言社交已成常态。然而,语言鸿沟依然是信息流通的

2026/06/30 13:46:37

永州网站建设大庆网站建设

ESP32-CAM图像传输实战:从零搭建实时视频流系统你有没有想过,用一块不到30元的开发板,就能做出一个能连Wi-Fi、拍视频、远程查看的摄像头࿱

2026/06/30 12:26:01

上海网站建设招商网站建设

第一章:Excel集成Dify后内存飙升?初探现象与根源近期多位用户反馈,在将 Excel 与 Dify 平台进行数据对接后,系统内存占用急剧上

2026/06/30 12:44:32

东营网站建设海淀网站建设

3种场景下的ComfyUI Docker部署终极指南【免费下载链接】comfyuiComfyUI docker images for use in GPU cloud and local enviro

2026/06/30 11:44:27