解锁InternVL3_5-4B-HF思考模式R1系统提示词开启视觉深度推理【免费下载链接】InternVL3_5-4B-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B-HFInternVL3_5-4B-HF 是 OpenGVLab 开源的轻量级多模态大模型视觉 语言支持图像问答、数学推理、OCR 与长文档理解。本文手把手教你用官方推荐的R1 系统提示词为它开启「思考模式」Thinking Mode让模型像推理型 LLM 一样逐步分析显著提升视觉深度推理的准确率 一句话结论模型本身默认不带思考能力把系统提示词换成官方的 R1 System Prompt思考模式就自动生效零额外训练成本。一、InternVL3_5-4B-HF 是什么4.7B 参数能做什么InternVL3.5 系列采用经典的「ViT 视觉编码器 → MLP 投影 → LLM」架构。以本项目为例config.json中可以看到关键配置组成模块说明视觉编码器 InternViT-300M0.3B 参数支持动态高分辨率切块小图省 token、大图看细节语言模型 Qwen3-4B4.4B 参数负责理解与生成视觉 token 压缩每个图像块经 pixel shuffle 压缩为 256 个 tokenimage_seq_length: 256也就是说整个模型约4.7B 总参数单张消费级显卡即可部署却能完成图表分析、公式识别、多图对比、GUI 交互等任务是「小参数、大推理」的典型代表。仓库内核心文件速览README.md官方说明文档含训练管线与评测结果config.json模型结构配置上面表格的数据来源added_tokens.json新增特殊词表think/endthink标签正是思考模式的开关符号chat_template.jinja对话模板定义了多模态消息如何拼装examples/image1.jpg官方示例图片可直接拿来做推理演示二、思考模式原理R1 系统提示词如何引导逐步推理↑ 仓库自带的示例图 examples/image1.jpg一张非常适合用来做视觉推理测试的小熊猫照片普通模式下模型看到图片会「直接回答」而开启思考模式后它会被要求先用think…endthink标签输出一段完整的分析过程再给出最终答案 官方在 SFT 阶段特意混入了「Thinking 模式」的多模态推理数据由 DeepSeek-R1 采样出的详细推理链因此模型天生具备长思考能力只欠一句「口令」——那就是R1 系统提示词。这个提示词的核心就三句话摘自README.md官方文档先对问题进行多角度、分步骤的详细分析并把思考过程包裹在think标签内思考结束后换行给出简洁直接的答案最终答案要独立完整不依赖思考段落。原理类似「让模型先打草稿再交卷」——草稿思考链把复杂问题拆解成逻辑步骤并校验中间结论答案自然更可靠这就是**测试时扩展Test-Time Scaling**中的Deep Thinking策略。三、一键开启步骤3 步配置 Thinking 模式第 1 步获取模型文件git clone https://gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B-HF同时确认环境版本transformers4.52.1建议直接 4.55与generation_config.json中标注的版本一致。第 2 步加载模型与标准 HF 模型完全一致from transformers import AutoTokenizer, AutoModelForImageTextToText model AutoModelForImageTextToText.from_pretrained( OpenGVLab/InternVL3_5-4B-HF, torch_dtypebfloat16, trust_remote_codeTrue, ).eval().cuda()第 3 步注入 R1 系统提示词开启思考 R1_SYSTEM_PROMPT You are an AI assistant that rigorously follows this response protocol: 1. First, conduct a detailed analysis of the question. Consider different angles, potential solutions, and reason through the problem step-by-step. Enclose this entire thinking process within and tags. 2. After the thinking section, provide a clear, concise, and direct answer to the users question. Separate the answer from the think section with a newline. Ensure that the thinking process is thorough but remains focused on the query. The final answer should be standalone and not reference the thinking section. .strip() messages [ {role: system, content: [{type: text, text: R1_SYSTEM_PROMPT}]}, {role: user, content: [{type: image, image: examples/image1.jpg}, {type: text, text: 图中是什么动物请推理它的栖息环境。}]}, ]把system角色内容设为 R1 提示词这就是全部操作——不需要改模型、不需要换权重下一轮对话即自动进入深度推理状态。四、最佳实践采样参数与常见坑位⚙️ 官方明确推荐开启思考模式时设置do_sampleTruetemperature0.6用于抑制长思考链容易出现的「无意义重复」。常见现象原因与对策回答里出现think…endthink原样标签正常现象前端可解析后折叠显示答案在endthink之后思考内容反复循环、原地打转贪心解码greedy导致按上文改为采样temperature0.6简单图片描述也触发超长思考属于正常行为对纯感知类任务可不用 R1 提示词直接用默认对话模式更快想进一步提升数学/几何题准确率用Parallel Thinking采样 N 条回答用 VisualPRM 评审模型挑出最优BoN 策略 选型提示如果你拿不准用哪个权重版本选不带任何后缀的最终版CPT SFT CascadeRL 完整训练管线本项目即完整训练后的 MPO 对齐版本base_model 见config.json中base_model: InternVL3_5-4B-MPO。五、进阶玩法从「深思考」到「并行思考」InternVL3.5 的测试时扩展包含两个维度都可直接叠加使用Deep Thinking深度即本文的 R1 思考模式通过逐步推理 自我校验提升单条回答质量Parallel Thinking广度对同一问题采样多条候选推理链再用VisualPRM过程评审模型打分择优适合竞赛级数学视觉题。对于 4B 这种轻量模型建议先开思考模式 temperature0.6跑通基线再按需叠加 BoN避免显存和时延翻倍。六、常见问题 FAQQ1必须用 HuggingFace 格式-HF 后缀才能开思考模式吗不是。思考模式由系统提示词触发与权重格式无关-HF 格式只是完全兼容官方 transformers API如本文代码开箱即用更省心。Q2思考模式会让回答变慢很多吗会。思考链会增加输出 token复杂题可能多 1~3 倍长度但换来的是可解释的推理过程和更高的推理题得分——感知类任务建议关闭、推理类任务建议开启。Q3支持中文提问吗支持。该系列为多语言模型README.mdfront-matter 标注multilingualR1 提示词用英文书写即可用户侧用中文正常对话。Q4视频也支持深度推理吗支持。chat_template.jinja中已内置video模态占位配合video_preprocessor_config.json与示例视频examples/red-panda.mp4可把视频理解问题同样交给思考模式处理。小结InternVL3_5-4B-HF 用 4.7B 的参数把「看图 深度推理」装进了单卡显卡而R1 系统提示词就是那个零成本的「推理开关」。换上它、设好temperature0.6你就能在自己的机器上体验接近旗舰级的视觉思考能力 【免费下载链接】InternVL3_5-4B-HF项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-4B-HF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考