基于规则的配置生成
通过规则而不是手动反复试错来创建训练配置。网站说明 Soup 会为你写入任务、量化、学习率和 epoch 设置,并且还能自动检测优化器、调度器、目标模块和 batch size 等其他细节。
Soup CLI 是一款用于在自有硬件上训练和运行 LLM 的命令行工具。该网站将其定位为一体化的后训练栈,涵盖数据检查、配置生成、监督式与偏好式微调、评估门控,以及通过单一界面完成导出或服务工作流。
它最独特的能力是 layer streaming:当模型无法完全驻留在 VRAM 中时,Soup 可以将冻结的基础模型保留在 CPU RAM 或 NVMe 上,并一次将一个解码器层流式载入 GPU。文档将其描述为一种可在 4 GB 笔记本 GPU 上微调 Llama-3.1-8B 等模型的方法,同时支持 SFT、DPO、ORPO、SimPO 和 KTO 等方法。
通过规则而不是手动反复试错来创建训练配置。网站说明 Soup 会为你写入任务、量化、学习率和 epoch 设置,并且还能自动检测优化器、调度器、目标模块和 batch size 等其他细节。
先进行轻量安装,再只添加你需要的堆栈。核心包不包含 PyTorch,而额外组件覆盖训练、服务、评估、数据工具、MLX、DeepSpeed、Liger、TensorRT、ONNX 以及相关工作流。
当模型过大、无法放入 VRAM 时,可从 RAM 或 NVMe 流式载入冻结的基础模型。文档中的 BETA 模式会将基础模型重写为按层分片,并通过专用 CUDA 流一次将一层复制到预分配的 VRAM 缓冲区中。
在流式基础模型上支持监督式微调和偏好训练工作流。来源中明确提到 SFT、DPO、ORPO、SimPO 和 KTO,并指出 DPO 可以复用流式基础模型作为参考模型,而无需加载第二份完整副本。
在训练前添加数据检查,并在训练过程中对保存进行门控。网站描述了数据医生、语义去重、主题映射、canary 检查、回放,以及与权重关联的 SHIP 或 DON'T-SHIP 判定。
将其他工具中的现有配置迁移过来。Soup 展示了从 LLaMA-Factory、Axolotl 和 Unsloth 一键转换为 Soup YAML 的路径。
在 VRAM 有限的机器上使用 Soup 来准备并微调 LLM。文档中的 layer streaming 模式适用于冻结的基础模型无法完全驻留在 GPU 上的情况。
在偏好优化工作流中使用相同的基础流式路径,例如 DPO、ORPO、SimPO 和 KTO。文档特别指出 DPO 可以复用流式基础模型作为参考模型,而无需第二份完整权重副本。
在训练前使用数据工具发现可能浪费运行的问题,包括重复或低多样性行、提示/模板问题、记忆化检查以及旧任务回放。
当你已经有来自其他工具的配置,并希望将它们迁移到 Soup YAML 时使用 Soup。网站展示了从 LLaMA-Factory、Axolotl 和 Unsloth 的迁移路径。
当你想决定某个 checkpoint 是否应该发布,然后再将其交给下游服务或部署工作流时,使用门控和导出路径。
Soup CLI 使用 pip 安装。文档将安装拆分为用于 CLI 和数据工具的轻量核心包,以及用于训练、服务、UI、评估、数据和其他后端的额外组件。对于训练,文档示例为 `pip install "soup-cli[train]"`。
是的。文档说明核心安装不包含 PyTorch,而训练栈仅在安装 `[train]` 额外组件时才会加入。这样就可以在不安装完整训练依赖的情况下使用 `soup init`、数据工具和检查命令。
Layer streaming 是一种可选的 BETA 模式,适用于无法完全驻留在 VRAM 中的模型。文档说明它会将冻结的基础模型保留在 CPU RAM 或 NVMe 中,并一次流式载入一个解码器层到 VRAM,但其速度比驻留式训练更慢,且 embedding 和 logits 张量仍会保留驻留。
文档和发布说明表明,Soup 可以在流式基础模型上运行监督式微调以及包括 DPO、ORPO、SimPO 和 KTO 在内的偏好方法。发布说明还提到可通过 `lora.r 0` 支持全量微调,以及一个 DeepSpeed ZeRO-3 CPU offload 预设。
安装文档列出了 Python 3.10 到 3.12,并建议使用兼容 CUDA 的 GPU。Apple Silicon 可通过 MLX 额外组件支持,而 CPU 或 MPS 则被描述为某些工作流下的实验性选项。
AakarDev AI 帮助团队在一个仪表板中管理 AI provider 访问、项目级设置、日志和分析,支持 BYOK 工作流,并涵盖 OpenAI、Google Gemini、Anthropic、Groq、Mistral AI 和 Perplexity AI。
CreateOS Sandbox 是基于 Firecracker 微型虚拟机的隔离计算环境,用于运行代码和 agent 工作负载,支持私有网络、SDK、CLI 和 MCP 程序化控制。
Trigger.dev chat agent 是面向开发者的持久化 AI 聊天后端,支持有状态对话在刷新、崩溃和长轮次中持续运行,并与 AI SDK `useChat` 流程无缝连接,运行于托管基础设施,单轮无超时。
Arduino VENTUNO Q 是面向 AI 和机器人应用的边缘 AI 计算机,单板集成 AI 推理与确定性控制,并支持 Arduino App Lab。
ByteAsk 是面向 C 和 C++ 的终端优先 AI 编码 agent,可直接编辑仓库,并在展示 diff 前用真实编译器、调试器、sanitizers 和测试验证修改。提供免费版与付费方案。
Codex Plugins 将可复用技能、应用集成和 MCP 服务器打包为工作流,可在 Codex 应用中安装或通过 Codex CLI 使用,帮助扩展连接服务任务、复用指令和团队共享流程。