⚙️ 训练配置

5e-5过低 ← → 过高0.08

🎯 预设实验

最终 Loss
↓ 越低越好
准确率
↑ 越高越好
训练步数
steps
预计耗时
仿真
📉 Loss 曲线loss
📈 准确率acc
💡
调整参数并点击「开始训练」。

🖥️ 训练日志

stdout

🎯 SFT 配置

指令跟随分
↑ 目标 ≥75%
最终 Loss
↓ 越低越好
可训练参数
/ 总量
过拟合风险
评估
📉 SFT Loss
📈 指令跟随得分

💬 模型输出对比

💡
调整参数开始 SFT 微调实验。

⚖️ RLHF 配置

激进(小β)保守(大β)
安全得分
↑ 目标 ≥85%
有用性得分
↑ 目标 ≥70%
奖励分数
RM score
对齐税
能力损失
🛡️ 安全得分曲线
🤝 有用性得分曲线
💡
调整参数开始对齐实验。β 越小模型变化越大,安全性提升越多,但可能过度拒绝。

📊 评估配置

📋 评测报告

选择模型版本和评测基准,点击「运行评测」查看结果。

🚀 部署配置

模型大小
GB
推理延迟
ms/token
精度保留
%
吞吐量
tokens/s

📦 方案对比

💡 部署建议

💡
选择量化方案,查看模型大小和推理性能的权衡。