尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

什么是JEV-27B-VL?10分钟搞懂System 1秒级判断+System 2深度思考的双系统决策模型

什么是JEV-27B-VL?10分钟搞懂System 1秒级判断+System 2深度思考的双系统决策模型 什么是JEV-27B-VL10分钟搞懂System 1秒级判断System 2深度思考的双系统决策模型【免费下载链接】JEV-27B-VL项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VLJEV-27B-VL 是一款开源的多模态双系统决策模型System 1 单次前向传播即可完成秒级判断为每个选项输出校准概率System 2 则由同一个 27B 模型逐步深度思考处理难题。它基于 Qwen3.8-27B 底座带视觉能力一条命令即可用 vLLM 本地部署。一个模型两套大脑JEV-27B-VL 架构速览传统大模型只有一种回答方式要么快但糙要么慢但细。JEV-27B-VL 借鉴了人类认知科学的双系统理论把两种能力装进同一个模型里系统接口你得到什么典型耗时System 1直觉判断POST /v1/decide是/否、2~256 选 1、0~5 打分每个选项一个校准概率文本图片都能判约 0.1 秒System 2深度思考/v1/chat/completions完整的 Qwen3.8-27B 输出可选逐步推理支持看图数秒关键点在于System 1 不是一个小模型而是同一个 27B 模型挂上一个轻量 LoRA 适配器 决策头见 adapter_vllm/ 目录。所以它秒级出决策的同时底层知识和视觉理解能力与 System 2 完全一致支持 256K 上下文。System 1 秒级判断一次前向传播给出校准概率System 1 解决的不是聊天而是决策。它只支持三种标准题型kind字段noul是/否返回[false, true]两个概率例如判断一张图是否展示食物choice多选一一次给出 2~256 个选项各返回一个概率150 个选项的意图分类也能一次问完score打分0~5 分制评分。为什么说它的概率可信因为在公开测试集上它的期望校准误差只有 0.0009见 calibration.json 里的逐类温度与 adapter_vllm/decision_head.json 里的偏置参数——模型说83% 把握实际就有大约 83% 对。这意味着你可以直接设定业务阈值概率高就自动执行概率低就升级给 System 2 或人工而不只是取概率最大的那个选项。System 2 深度思考置信度不够时自动转人工这是双系统最实用的地方——按需思考System 1 先答置信度 ≥ 0.70 就直接采纳中位耗时 0.1 秒置信度 0.70 的问题升级给 System 2让它看图、逐步推理。效果GSM8k、AQUA-RAT 等四个数学/常识基准70% 的问题 0.11 秒答完整体准确率从纯 System 1的 0.792 提升到0.892无限接近每题都深度思考的 0.917但速度快了几个数量级。实战应用从机械臂控制到 AI 评委JEV-27B-VL 的看图出概率能力在多个真实场景里打过硬仗机械臂与电脑操作实时控制循环每一帧摄像头画面或截图进来System 1 输出下一步动作的概率分布单次决策约 240ms机械臂抓取放置MuJoCo 仿真20 个随机场景中完成75%JEV 家族最佳真实浏览器操作60 个多步任务完成95%平均 0.26 秒/次点击。过程录屏在 videos/ 目录机械臂、浏览器购物Super Mario、魔方、俄罗斯方块等游戏控制同样每一步都只是一次 System 1 决策约 46~300ms。逐回合数据见 reports/demos/。零样本短视频推荐一张封面解决冷启动TikTok 类信息流要判断这个用户会不会看这条新视频。JEV-27B-VL 只看用户最近看过的 5 张封面 1 张候选封面一次前向传播给出观看概率——不需要任何点击日志、不需要训练在 MicroLens 真实平台上它 AUC0.727与从 59,045 名用户行为中学出来的协同过滤0.728打平Top-5 命中率反而更高59% vs 49%。新视频上传的第一秒就能被推荐——这是协同过滤做不到的。AI 评委多模态评委与 Agent 评委大模型训练、Agent 评测都需要裁判。System 1 把哪个答案更好变成一次判断多模态评委VL-RewardBench1247 组人工校验对78.3%总体准确率超过榜单上全部 26 个模型含 GPT-4o 的 65.8%2494 次判断单卡仅用 163 秒Agent 评委Plan-RewardBenchACL 2026判断工具型 Agent 两条轨迹哪条更好73.2%宏平均准确率位居论文榜单第一GPT-5 为 68.5%Agent 任务验收AgentRewardBench1302 条专家标注轨迹在同一召回率下精确率高于官方榜单全部 16 个评委。文本决策新闻推荐、幻觉拦截、搜索重排没有图片的任务它同样能秒判新闻推荐 AUC0.642超过在数据上训练过的 LightGBM幻觉拦截把System 2 答题的 71% 准确率提升到96.4%只答它信任的那一半搜索重排 nDCG10 达 0.858。快速上手两条命令本地部署vLLM 推理硬件要求单张 80GB 以上显存的 GPU。hf download autotrust/JEV-27B-VL --local-dir JEV-27B-VL bash JEV-27B-VL/serve.shserve.sh 会启动标准 vLLM OpenAI 服务并额外挂上POST /v1/decide接口由 serve_decide.py 实现。启动后System 1curl localhost:8000/v1/decide传{kind, state, question, options}state 里可混入图片System 2直接调/v1/chat/completions模型名autotrust/JEV-27B-VL。⚠️ 一个必知的坑serve.sh 固定了--max-num-seqs 8。超过 8 条并发序列时该多模态模型的 LoRA 路径会返回错误的 System 1 概率——这个参数不能省。仓库目录结构速查与配置文件说明路径说明README.md模型卡片完整基准、快速开始、提示词写作指南serve.sh / serve_decide.py一键启动脚本与推理服务源码adapter_vllm/System 1 的 LoRA 权重与 decision_head.json选项 token、偏置calibration.json各题型校准温度保证概率可信config.json底座 Qwen3.8-27B 架构64 层、256K 上下文、视觉塔reports/demos/机械臂、电脑操作的逐回合实验数据videos/游戏与机械臂决策演示视频blog/JEV-27B-VL.md官方发布博客含全部实验细节总结为什么值得关注 JEV-27B-VL一句话概括JEV-27B-VL 把决策从聊天里拆了出来。System 1 用约 0.1 秒给出可设阈值的校准概率System 2 兜底深度推理两者共用一个 27B 底座还附带视觉能力——机械臂 240ms 一步、推荐系统零冷启动、AI 评委超越 GPT-4o。权重开放Apache-2.0见 LICENSE两条命令就能跑起来是目前决策模型 双系统方向里完成度最高的开源方案之一。【免费下载链接】JEV-27B-VL项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表