llama.cpp
面向本地设备的大语言模型推理项目,覆盖 CPU、GPU 与多种量化格式。
记录近期关注的开源 AI 项目,内容仅作个人学习与资料整理使用。
面向本地设备的大语言模型推理项目,覆盖 CPU、GPU 与多种量化格式。
用于高吞吐量语言模型推理与部署,核心思路是 PagedAttention。
本地运行和管理大语言模型的轻量工具,适合快速学习与实验。
可自托管的本地模型 Web 界面,支持连接多种模型后端。
节点式图像生成工作流工具,便于理解和组合扩散模型流程。
面向 LLM 应用编排的开源框架,包含提示词、检索与工具调用等模块。