🔥
LLMPath
炼模之路
学习路径
训练场
挑战
进度
设计方案
🔍
⌘K
⚡ 0 XP
LP
🧪 训练模拟器
调整参数,实时观察训练效果 — 无需 GPU,浏览器里就能「炼丹」。
阶段 04 · 预训练
💾 保存记录
🔥 预训练
🎯 微调 SFT
⚖️ 对齐 RLHF
📊 评估
🚀 部署量化
⚙️ 训练配置
数据集
Wiki-zh
Wiki-zh(高质量 · 12M)
Code-mix(代码 · 8M)
Noisy-web(含噪声 · 15M)
Tiny-demo(小样本 · 0.5M)
模型规模
gpt-tiny · 15M
gpt-mini · 124M
gpt-medium · 355M
gpt-large · 774M
学习率
0.0010
5e-5
过低 ← → 过高
0.08
批大小
32
训练轮数
5
🔥 开始训练
↺ 恢复默认
🎯 预设实验
✅ 稳定收敛
💥 LR过高
🐢 LR过低
📈 小Batch
🚀 大Batch
最终 Loss
—
↓ 越低越好
准确率
—
↑ 越高越好
训练步数
—
steps
预计耗时
—
仿真
📉 Loss 曲线
loss
📈 准确率
acc
💡
调整参数并点击「开始训练」。
🖥️ 训练日志
stdout
🎯 SFT 配置
数据质量
高质量(人工标注)
中等(半自动)
低质量(自动生成)
LoRA 微调
全参数微调
LoRA (r=8)
LoRA (r=16)
学习率
2e-5
训练轮数
3
🎯 开始微调
指令跟随分
—
↑ 目标 ≥75%
最终 Loss
—
↓ 越低越好
可训练参数
—
/ 总量
过拟合风险
—
评估
📉 SFT Loss
📈 指令跟随得分
💬 模型输出对比
💡
调整参数开始 SFT 微调实验。
⚖️ RLHF 配置
对齐方法
DPO(直接偏好优化)
PPO(策略梯度)
β 参数(DPO)
0.10
激进(小β)
保守(大β)
偏好数据质量
高质量(专家标注)
中等
低质量(噪声大)
训练步数
500
⚖️ 开始对齐
安全得分
—
↑ 目标 ≥85%
有用性得分
—
↑ 目标 ≥70%
奖励分数
—
RM score
对齐税
—
能力损失
🛡️ 安全得分曲线
🤝 有用性得分曲线
💡
调整参数开始对齐实验。β 越小模型变化越大,安全性提升越多,但可能过度拒绝。
📊 评估配置
模型版本
Base(预训练)
SFT(指令微调)
RLHF(对齐后)
评估基准
MMLU(知识)
HumanEval(代码)
GSM8K(数学)
C-Eval(中文)
Safety(安全)
📊 运行评测
📋 评测报告
选择模型版本和评测基准,点击「运行评测」查看结果。
🚀 部署配置
模型规模
7B 参数
13B 参数
70B 参数
量化方案
FP16(无量化)
INT8(8-bit)
INT4(4-bit)
GGUF Q5_K_M
并发 Batch Size
4
最大输出 Token
512
🚀 部署模型
📤 你的模型 Space
模型大小
—
GB
推理延迟
—
ms/token
精度保留
—
%
吞吐量
—
tokens/s
📦 方案对比
💡 部署建议
💡
选择量化方案,查看模型大小和推理性能的权衡。