
聊天潜台词:帮你判断怎么回复
“你今天是不是又忘了我跟你说过什么?”
Jev:她真的在问你记不记得吗?不是 93%。真实意图:想确认你在不在乎她 72%。危险等级 9 / 10。最佳动作:搜索聊天记录 91%、装死 4%……
最后一步:“危机是否解除?Yes 94%。建议动作:立即停止模型调用,不要画蛇添足。”😂 只能当娱乐,不能替代真正的沟通。
单选是 / 否
最近 Jev 很火,我也用它做了个小工具:小vi 灵感雷达,一个把 Jev 装进 X 信息流的 Chrome 插件。刷 X 的时候,它帮我判断哪条帖子值得花时间看、哪条能拿来做选题。
玩了一圈,想跟大家分享一下:它到底是做啥的,别人都拿它做了些什么,普通人又可以怎么玩。
↑ 这是我给 Jev 设计的评分档位 😆
欢迎大家二创、共创

每天刷到很多 AI 信息,真正难的是判断:这条值得我花时间看吗?能不能拿来实测、做成内容?
我做了一个 Chrome 插件,把 Jev 装进 X 信息流:AI 先给初评,我再用反馈告诉它什么才是“对我有用”。

适合谁:需要跟踪 AI 产品、找实测素材、积累选题的内容创作者和运营同学
电脑端 Chrome 插件,手机端无法安装。点击下载安装包(v1.0.17,6.4MB),也可以直接发给「豆包工作」或者 AI 工具帮忙安装。
解压安装包,Chrome 打开 chrome://extensions,开启“开发者模式”,点“加载已解压的扩展程序”,选择包含 manifest.json 的 x-ai-radar 文件夹。
扩展图标 →“设置”,填自己的 TypeSafe API Key,模型保留默认 jev-latest;选兴趣方向,开启“自动分析可见帖子”,点“保存并测试连接”。每人用自己的 Key 和额度,无需共享密钥。
打开或刷新 X,插件先显示“初评”分数。点“反馈 n / 20”或扩展里的“20 条校准 · 分析记录”,进入选题快选库。
累计 20 条不同内容后,查看偏好摘要并点“确认应用”;之后遇到不准的判断仍可继续纠正。
左边挑帖子 → 中间看原文和 AI 判断依据 → 右边给自己的判断。
不必迎合 AI 的分数,也要给“不感兴趣”的内容反馈,才能划清偏好边界。
分别回答两个问题:阅读上,你会跳过、扫一眼、仔细看,还是优先读/必看?选题上,你会跳过、先收藏、做实测,还是想做/马上做?可补选原因和一句说明,点击“保存反馈,下一条”。

Jev 根据帖子文字、兴趣方向等,对相关性、新信息、信息密度、可操作性、受众价值、吸引力、可实测性等维度作判断;插件再按固定权重合成阅读分和选题分。
0–100 分是选题参考,不是事实真实性、爆款成功率,也不是 Jev 的校准概率。

日常使用:刷 X → 看初评 → 有价值就收藏 → 判断不准就反馈 → 定期回选题库挑选可实测、可展开的内容。
当前范围:只支持 X/Twitter,尚不支持小红书;读取网页正文和引用文字,不靠截图,暂不分析图片、视频内容或链接内页。平台明确标记的广告跳过自动评分;写评论、回复时隐藏浮层。

2026 年 9 月 15 日,TypeSafe 正式推出 Jev,并把它定义为首个 System One Model (《思考,快与慢》里的 System One,主打快速做判断)。
和 ChatGPT 这类大模型不同,Jev 不跟你聊天,也不写小作文。Jev 是“只会做选择题的 AI”,它只负责快速判断:更像哪一个、程度有多高,或者“是”的概率有多大。
“帮我分析这篇文章为什么不吸引人,并重写一个更好的版本。”
“这篇文章的钩子强不强?流失风险高不高?下一步该走哪条路?”
所以它不是来取代大模型的,更像是大模型旁边先帮忙做快速判断的工具:
💡 我们未来自己开发小工具之前,可以思考:如果是判断类、分流的,可以先交给性价比高的 Jev,再用大模型做进一步的分析 🧐

从最多 255 个选项里选,需要你来列选项,Jev 判断哪一个最像,并给出每个选项的概率。

在一个刻度上给分。

给出一个“是”的概率。

我的灵感雷达用的就是打分:拉 → NPC → 人上人 → 顶 → 夯。截图可以点开放大。
Jev 看完一封邮件,不只会判断“是不是诈骗”,还会给出一个概率,比如:“80% 可能是诈骗。”
但它报出一个 80%,我们就能相信吗?得看实际结果。
举个例子:挑出 100 封被它评为“80% 可能是诈骗”的邮件,再逐封核实。如果大约 80 封真是诈骗,说明这批判断里的“80%”和实际情况比较吻合;如果只有 50 封是,它就把把握说大了。
这就叫“概率校准”:报出来的数字,要和长期实际表现对得上。只看一封邮件,验证不了这件事。
这个数字有什么用?做邮件工具时,你可以据此安排下一步:
后面的诈骗邮件案例就用了这个思路:先让 Jev 快速筛一遍,判断拿不准的,再交给另一个模型复核。门槛设多高,要看实际测试结果和出错的代价,不能看到“95%”就默认可以自动执行。
TypeSafe 把训练方法叫 RLCD,目标是让这些概率更可信。想了解原理,可以看 CEO 最新演讲。
用到自己的场景前,先拿实际样本测一测:它说有几成把握,到底能不能兑现。
标签是这个案例主要用到的题型:单选、打分、是 / 否

“你今天是不是又忘了我跟你说过什么?”
Jev:她真的在问你记不记得吗?不是 93%。真实意图:想确认你在不在乎她 72%。危险等级 9 / 10。最佳动作:搜索聊天记录 91%、装死 4%……
最后一步:“危机是否解除?Yes 94%。建议动作:立即停止模型调用,不要画蛇添足。”😂 只能当娱乐,不能替代真正的沟通。
单选是 / 否
Browser Use 的 Gregor Zunic 把网页里的可点击元素整理成动态选项,让 Jev 每一步只决定“点哪个、滚动还是结束”;需要输入文字时才调用小语言模型。Google Flights 任务约 7 秒完成。
Jev 像导航员负责决定下一步,Agent 的 Computer Use 像手负责真的去点、去填。
单选
来源:Gregor Zunic 的浏览器演示 | 项目代码
Faadil Shaik 没让 Jev 直接看游戏画面,而是读取模拟器里的位置、速度、敌人和地形,再从左、右、跳跃等有限动作中选一个。作者随后补充,早期版本成功率大约只有四分之一,所以它更像一个直观的技术 Demo,而不是成熟游戏智能。
单选

这个案例把 Jev 用在公关监测的高并发判断层:系统读取当天早上的 384 条新闻,并同时判断哪些新闻与 15 个品牌相关、值得跟进,再把候选故事交给后续流程寻找记者和传播机会。
Jev 在链路里的角色:不负责撰写完整公关稿,而是并行完成“相关吗、值得追吗、适合哪个品牌”等有限判断。
是 / 否单选
用户直接说“换件黑裙子”等自然语言指令;系统把语音转录、当前穿搭状态和个人衣柜候选一起交给 Jev,由 Jev 快速判断下一件应该选择什么,再由图像换装模块更新画面。
商业价值:把虚拟试穿从点选式工具变成可连续对话的购物体验,可延伸到电商导购、品牌衣橱、线下门店镜和个性化搭配。
单选
系统把近 200 个国家作为候选项。用户输入“说法语的国家”“内陆国”“参加过二战的国家”等中文问题,Jev 会对每个国家逐一做“是 / 否”判断,给出符合条件的概率(所以不受单选最多 255 个选项的限制),并把结果直接高亮在地图上。
是 / 否
Demo 作者把 600 多个选题放进同一个候选池,再用“与大公司相关”“与 OpenAI 相关”“与中国相关”等自然语言条件快速筛选。Jev 对每个选题逐条做“是 / 否”判断,负责缩小范围和排序,人或大模型再从高概率候选中决定真正值得采用的选题。
是 / 否
程序员改完代码,可以把改动交给 Jev 快速检查:有没有不小心把密码写进代码、有没有危险的数据库操作、会不会误删测试。它一次检查多个常见风险点,并标出“有多怀疑这里有问题”。
这就像交作业前先让同桌帮忙检查错别字,但同桌不能替你交卷,最后是否提交,仍然由人决定。
是 / 否

有人测试了 100 封邮件:一半正常、一半诈骗。Jev 在 1.42 秒内分完全部邮件,并给每个判断附上置信度;置信度低于 95% 的 31 封,再交给大模型 Kimi K3 仔细看。整套流程判对 96 封,总成本约 0.07 美元,其中 Jev 只花了约 0.003 美元。
单选
开会最常见的问题是:大家还在发散,没人收束;问题聊清楚了,却没人记录;或者表面同意了,其实还有分歧。这个案例让 Jev 每隔一段发言就判断一次:现在是在头脑风暴,还是已经在做决定?问题解决了吗?大家真的达成一致了吗?
它不是会议裁判,更像一个不插话的会议观察员。
单选是 / 否
浏览 X 时,插件实时判断每条帖子:这是有信息量的内容,还是故意引战、骗点击、广告?再用不同图案直观显示等级,低质量内容直接隐藏,不用人一条条手动屏蔽。
同理,之前看到有人开发过刷小红书的信息流屏蔽器,可以屏蔽搜索结果里不相关的部分,避免分散注意力。
🙌 这个功能,我也做了一个同款小插件,就是开头的灵感雷达。
打分
Box 的演示里,Jev 会读一份事故报告,然后判断两件事:这件事会不会影响客户?严重程度高不高?判断完后,系统把文件放进“需要升级处理 / 继续观察 / 等待审查”等不同文件夹,同时打上对应标签。
豆包工作或飞书自动化可以负责移动文件、打标签、建待办。特别适合文件很多、分类规则明确、但人工整理很耗时的场景。
是 / 否打分
Jev 只负责判断,不负责执行,更不会替你承担后果。真的要点网页、填表单、发消息、动文件,需要豆包工作这类工具配合;而涉及钱、合同、客户承诺和个人隐私的动作,一定要停下来让人确认。

它的 Launch Video 快速在 X 上走红,是营销公司 Doomers 精心策划的一次发布,叙事故事和传播方式值得了解。
据 Doomers 复盘,发布帖浏览量约 3950 万,在他们追踪的 699 个产品发布案例中排名第四,甚至超过了 Anthropic 的 Claude Fable 5.1 产品发布。24 小时内等待名单注册超过 15 万。
它先用创始人的 OpenAI 履历做背书,再宣布聊天模型不适合真正自动化,最后用速度、价格和产品形态把 Jev 塑造成新范式。
Diogo 先说自己参与创建 ChatGPT 和 RLHF,建立“我有资格指出旧范式问题”的权威。
把 RLHF(用人类偏好来训练 AI)与迎合偏好、过度自信、不可靠绑定起来:会聊天,不等于能自动执行。
不说 Jev 是“更快的小模型”,而是创造 System One Model 这个新品类,配上新架构、新采样器、RLCD 三件套,把产品升级包装成范式切换。
同屏对比中,Jev 快速完成大量结构化判断,语言模型仍在逐字生成。观众不需要理解 benchmark,也能感受到“等待”的差异。
输出概率决策而非文字、快近 200 倍、便宜 400 多倍(官网首页数据为 193.6 倍、444.6 倍)。宏大技术史负责制造想象力,简单数字负责被记住和转述。
“如果你喜欢等待,请勿使用 Jev”,把开发者痛点变成笑话;“Ask your developer”改写自“Ask your doctor”。“prod, not god”“too cheap to meter”都是可直接截图、引用和二创的句子。

内容有争议性:让人停下来、截图和争论。Jev 本身很难用一句功能描述让大众兴奋,但它极适合被做成观点冲突:聊天 vs. 自动化、文字 vs. 决策、串行 vs. 并行、God vs. Prod。
分发策略:对不同类型博主的选择,让正确的人在同一小时看到;把画面送到最可能参与争论的人群中。
产品入口:增加 Waiting List、OpenRouter 等平台使用,把热度变成注册和使用。
点开可以放大看
第一句话先抛出“ChatGPT 与 RLHF 的共同创造者”这张可信度牌,再问“为什么超人类聊天模型还没有带来 AGI”。
整个行业都在卷“更会思考、更会写”,TypeSafe 反过来说:我们的模型不会聊天,也不会写一个字。
视频接近 3 分钟。Doomers 称,超过 2 分钟的 launch video,其中位表现是 30 秒以下视频的两倍。
发布后将公告 seed 给 80–100 个工程师、创始人、builder 和创作者账号,之后的全球扩散才主要依靠自然传播。
“快近 200 倍、便宜 400 多倍、输出免费、响应 70–500ms”,加上 OpenAI/Meta 履历和 4000 万美元融资,再借 Vercel、Cloudflare、LangChain 和社区 Demo 扩散。
同时承接 waitlist、公司与创始人账号关注,并借 Vercel AI Gateway 等入口降低试用门槛。
普通人不需要先理解模型原理
数据安全提醒:TypeSafe 是外部第三方服务,贴进去的内容会发送到它的服务器。测试时请只用公开内容(公开帖子、新闻)或自己编的示例;不要上传公司内部聊天记录、客户反馈、用户数据、内部文档或未公开的业务信息。
通过审核后,账号会获得 5 美元体验额度(以控制台实际显示为准)。输入约 0.042 美元/百万 token、输出免费,足够测试大量轻量判断。
贴一段公开内容,提前写好几个答案选项,比如“需要回复/仅同步/有风险”。觉得结果靠谱,再生成 API Key,接进自己的脚本、表格或 Agent 工作流。

控制台里有个 Playground,贴一段文字、写好问题和选项,点运行就能看到每个选项的概率。可以先在这里试试看。

用 Claude Code、Codex 这类编程 Agent,把需求用大白话讲清楚,它来写代码、调接口。TypeSafe 官方还出了插件(typesafe-ai/skills),装上之后 Agent 更懂怎么调 Jev。

浏览器插件、小网页,把判断嵌进你每天刷信息、看反馈的地方。
整个过程分四步,每一步都是直接跟 AI 说人话。
我每天在 X 上刷很多 AI 相关的帖子,想找能拿来做选题的内容。 帮我把“这条帖子值不值得看、适不适合做选题”拆成几个可以打分的维度, 每个维度写清楚什么情况算高分、什么情况算低分。 评分档位用:夯、顶、人上人、NPC、拉。
聊完我定下了两道题:值得花时间看吗?适合做选题吗?再加上新信息、信息密度、可操作性、受众价值、选题吸引力、可实测性、讨论价值这几个维度。
帮我做一个网页,叫“小vi 灵感雷达”。 左边是待判断的帖子列表;中间展示帖子内容和 Jev 的判断结果, 两道题各给一个档位(夯/顶/人上人/NPC/拉),可以展开看每个维度的分数; 右边让我自己也选一次档位,可以写一句理由。 用 typesafe-sdk 调用 Jev,API Key 从环境变量读取,不要写进代码里。 只有我点“让 Jev 判断这条”时才发请求。
再做一个 Chrome 插件:我正常刷 X 时,把我看过的帖子正文收集下来, 回到网页后出现在“我的 X 记录”里。只收集公开帖子的文字,不收集图片和私信。
我已经给 20 条帖子打了档位。帮我统计 Jev 和我一致的比例, 列出分歧最大的几条。再挑最多 6 条有代表性的反馈作为参考样本, 以后判断新帖子时一起发给 Jev,让它更接近我的口味。
小经验:Agent 写出来的第一版往往能跑但不好用,别怕反复跟它说“这里不对,改成……”。不断碰撞想法 💡
用了一段时间发现,Jev 判得准不准,很大程度取决于题出得好不好。官方文档里也反复强调这几点:
| ❌ 容易翻车的写法 | 问题在哪 | ✅ 改一改 |
|---|---|---|
| 重要 / 不重要 | 标准太模糊,“重要”对谁都不一样 | 今天必须处理(涉及投诉、线上事故)/ 本周处理 / 仅存档 |
| Bug / 体验问题 / 功能建议 | 边界重叠,“按钮不好点”算哪个? | 每个选项写一句定义:Bug=功能不按预期工作;体验问题=能用但难用;建议=想要新功能 |
| 正面 / 负面 | 没有兜底,中性内容只能硬选 | 正面 / 负面 / 中性 / 无法判断 |
| 相关且值得跟进吗? | 一道题问了两件事 | 拆成两道是/否题:相关吗?值得跟进吗? |
| 打 1–5 分 | 每一档没定义,模型只能猜 | 每档配一句话,比如我的:夯=必看,顶=优先读,人上人=仔细看,NPC=扫一眼,拉=跳过 |
可以直接套这个模板:
问题:这条用户反馈应该交给哪个团队? 选项: - 退换货:尺码不对、商品损坏、想换货(不包括:物流延迟) - 物流:没收到、配送慢、包裹丢失 - 账单:扣费、发票、支付失败 - 其他:以上都不符合
我一开始也这么想。量小的时候确实可以,而且大模型还能顺便告诉你理由。但真用到每天几百几千条,差别就出来了:
| 让大模型只回答 A/B/C | Jev | |
|---|---|---|
| 速度 | 逐字生成,量大了要排队 | 70–500ms,一次还能问好几道题(官方数据) |
| 成本 | 按输入和输出计费,全量跑很贵 | 输出免费,输入约 0.042 美元/百万 token |
| 把握度 | 它说“我很确定”不一定可信 | 每个选项都有概率,而且是校准过的 |
| 稳定性 | 同一条内容问两次,答案可能不一样 | 相似的输入给出相似的结果(官方说法) |
| 给理由 | 能,还能展开分析 | 不能,只给判断 |
“把握度”这一点最容易被忽略。经过 RLHF 训练的聊天模型,概率往往会变得没那么准,OpenAI 在 GPT-4 技术报告里就放过一张对比图。模型说得再笃定,你也很难拿它来设自动执行的门槛。
所以我的用法是:量小、需要理由,用豆包;量大、要快、要按把握度自动分流,用 Jev。两个还能搭着用:Jev 先筛一遍,拿不准的再交给大模型,就像前面那个诈骗邮件的案例。
写到这里有点像安利文了,也说说我看到的另一面:
技术上完全能做:几秒筛完几百份。但我觉得这恰恰是最不该直接交给它的事:
更稳妥的做法:只让它做“硬条件核对”,只辅助、不淘汰;被判“不合适”的简历,一定要有人再看一遍。
玩完 Jev,我最大的几个感受:
以前让 AI 把每条评论、每封邮件、每条帖子都看一遍,太贵也太慢;现在可以“全量判断”。很多过去不划算的产品,可能会重新变得可行。
它不一定是一个聊天框,而是藏在产品里的一个个小判断,官方管它叫“智能 if 语句”。
快的负责判断和分流,强的负责思考和生成,人负责定规则和兜底。以后搭 Agent,可能更像在组一支小队伍。
定义好选项和标准,本质上是把自己的经验和判断标准写清楚。这件事不需要会写代码,但很需要懂业务。