Pangram 发布 Pangram 4,用于人类与 AI 混合写作
这家位于布鲁克林的公司还开放了图像检测器预览,而其作者身份分数现已触达 Substack 读者。
By Ryan Merket · Published
Primary source: Pangram on X
Why it matters
Pangram Labs is turning AI detection from a school utility into publishing infrastructure, where model errors can directly affect trust, reputation and revenue.

Pangram Labs 联合创始人 Max Spero 和 Bradley Emi 于 2026 年 7 月 29 日发布了 Pangram 4,将检测器从二元判断扩展为对完全生成、AI 辅助和人机混合写作进行分类。
这两位布鲁克林的创始人在 在 X 上的一条五帖线程 中宣布了该模型,同时发布了 Pangram Image 的公开研究预览,该检测器用于识别合成视觉内容并在屏幕截图或照片中高亮显示 AI 生成的区域。两个产品都可以通过 Pangram Labs 的网页仪表板使用,而对图像 API 的访问仍然仅限邀请。
Spero 和 Emi 在 Stanford 的新生宿舍相识,之后两人均获得人工智能硕士学位。Spero 曾在 Google、Two Sigma 和 Yelp 担任机器学习职位,之后在 Nuro 领导用于自动驾驶车辆的主动学习工作。Emi 在 Absci 领导深度学习研究,并曾参与 Tesla Autopilot 的核心计算机视觉团队。他们共同的押注是,随着生成模型进入日常写作,作者身份检测可以成为学校、出版商和在线平台的基础设施。
Pangram 4 moves from document scores to provenance segments
Pangram 4 的规模比 Pangram 3.3 大超过六倍,并采用了 mixture-of-experts 架构,详见 Pangram Labs 的 技术报告。该模型对每个片段分配三种来源标签之一:Human、AI-Assisted 或 AI-Generated。它在重叠的 512 令牌窗口中分析较长文档,并对令牌级预测进行平滑处理,以估算文档内部作者身份变化的位置。
这种分段旨在针对早期检测器的一个实际弱点。由人工段落、生成段落和经过轻微编辑的文本拼接而成的文档可能会产生误导性的单一评分。Pangram 4 则试图在一次处理过程中区分这些类别,包括使用 Grammarly、Apple Intelligence 或 Google 的 Gemini 在 Google Docs 中润色过的写作。
Pangram Labs 表示,该模型在包含 200 万份商业许可的 2022 年之前的人类文档的内部测试集上记录了 0.0041% 的误报率。在另一个由 26 个模型生成的 519,993 个样本的基准测试上,Pangram Labs 报告的漏报率为 0.3396%,而在同一数据集上 Pangram 3 的漏报率为 1.99%。Pangram Labs 还表示,Pangram 4 在处理通过 13 款商业 humanizer 工具处理的文本时,识别出 AI 参与的比例为 98.83%。
这些数据来自 Pangram Labs 自行评估。方法论和已知限制记录在公开的 模型卡 中,但新模型尚未接受在学校、出版商或雇主使用其输出来判断个人作品时更为重要的独立测试。
先前的一项 University of Chicago 的研究审计 将 Pangram 与 OriginalityAI、GPTZero 以及一个开源的 RoBERTa 基线进行了比较。研究人员发现,早期的 Pangram 检测器在他们包含 1,992 段的语料库中对中长段落的错误率几乎为零,并且在对抗 StealthGPT humanizer 时表现更好。该研究支持 Pangram Labs 先前的方法;但并未对 Pangram 4 的新基准声明进行独立验证。
Image detection broadens the provenance bet
Pangram Image 扫描与包括 GPT Image、Gemini、Midjourney、FLUX 和 Grok Imagine 在内的系统相关的输出。Pangram Labs 表示,该模型还可以检测来自若干 AI 视频生成器的帧,并生成热图以在混合图像中显示合成区域。
Pangram Labs 报告称,在一次包含五个商业检测器的内部比较中,准确率为 99.5%。基础测试包含 1,130 张图像,其中包括 500 张已知的人类图像以及来自五个图像模型的生成输出,另有 Midjourney 的样本。根据 Pangram Labs 的说法,在经过压缩和重置大小以模拟现实世界共享的增强版本上,Pangram Image 的准确率为 99.03%。在另一项对来自 ReLAION 的 10,000 张 2022 年之前图像的测试中,声称的误报率为 0.16%。
该预览有明显限制。它不处理小于 512 × 512 像素的图像,Pangram Labs 表示 deepfakes 和换脸仍在其当前范围之外。小幅编辑也可能导致图像被标注为完全由 AI 生成,因为一些生成工具在更改一个元素时会重新生成整个帧。
The release follows Pangram Labs into Substack
在 Substack 本月开始使用 Pangram Labs 之后,这一时机带来了更高的风险。Substack 的 AI 透明度工具 允许读者扫描自 7 月 21 日或之后发布的符合条件的文章、笔记、评论和回复。创作者可以添加说明其工作方式的声明、报告错误或在单个内容上禁用检测。
该分发将 Pangram Labs 的输出置于作者与付费读者之间的关系之中,也放大了每一个错误。Spero 曾表示,检测器结果应当作为开始更广泛调查的起点,而不是定案。《The Atlantic》报道称,Spero 确认 Pangram 曾错误标注过 Vanity Fair 文章的部分内容,说明基准性能与对个别判断的适用性仍是不同的问题。
Pangram Labs 在 2025 年 6 月宣布获得 398 万美元的 pre-seed 和 seed 融资。该轮融资 包括由 ScOp Venture Capital 领投的种子轮,Script Capital、Cadenza 和天使投资者参与;早期的 pre-seed 由 Haystack VC 领投。
新模型也改变了开发者的经济模型。Pangram 4 API 扫描的定价为每 100 个单词 0.05 美元,而 Pangram 3 的定价为每 1,000 个单词 0.05 美元。Pangram Labs 计划于 2026 年 9 月 30 日退役 Pangram 3,给予客户两个月时间来测试 Pangram 4 在长文档上更细化分类是否值得更高的费用。