基于 Flask Web 框架与 llama.cpp 推理引擎构建的本地 AI 智能对话助手 基于 Flask Web 框架与 llama.cpp 推理引擎构建的本地 AI 智能对话助手智能助手采用 Qwen3.5-2B GGUF 量化模型,通过 llama-cpp-python 实现纯 CPU 环境下的大语言模型推理,无需依赖云端服务即可完成文本生成、多轮对话等任务。系统以 Flask 提供 Web 服务接口,实现模型加载、会话管理和参数配置,并结合 waitress 提升运行稳定性。通过 llama.cpp 高效推理框架降低资源占用,使大模型能够在个人电脑和离线环境中运行。支持上下文管理、推理参数调整、人设与回复逻辑设定以及输出内容优化,可过滤模型思考过程,仅保留最终结果。同时支持 PyInstaller 打包部署,实现模型与应用一体化运行,为构建轻量化、本地化人工智能大模型助手应用提供了一种可行方案。界面效果系统采用现代化聊天式 UI 设计,支持用户与本地大语言模型进行实时对话交互,提供接近云端 AI 助手的使用体验。智能对话助手界面效果功能介绍该项目展示了从 量化大模型加载、本地推理服务构建、Web A