{
  "version": "2026-09-24.7",
  "checkedAt": "2026-09-24",
  "regions": [
    {
      "id": "models",
      "name": "模型",
      "x": 17,
      "y": 24,
      "mx": 18,
      "my": 21,
      "evidence": [
        "anthropic-rd",
        "metr-horizon",
        "opus-55",
        "gemini-tts"
      ],
      "assessment": {
        "label": "长任务，仍需监督",
        "title": "从逐句回答，走向有监督的任务委托",
        "path": [
          "回答问题",
          "监督下执行",
          "稳定委托"
        ],
        "current": 1,
        "summary": "前沿样本已经能承担一段任务的执行，而不仅是回答问题。当前更接近“人设目标、AI 推进、人监督验收”，可靠性仍决定可委托的边界。",
        "change": "关注点从答得好不好，转向任务能走多远、什么时候需要人接手。Anthropic 的研发测量提供了实际工作样本；METR 提醒我们，任务跨度必须连同成功率一起看。",
        "bottleneck": "长流程中的错误会累积。有限测试环境的成功，还需要经过真实工具、上下文和验收标准的检验。",
        "watch": "跟踪在固定验收标准下，任务完成率、人工接管次数与总成本是否同步改善。",
        "limit": "这是基于已核对资料的阶段推论。能力依任务和环境而异，不把实验室案例视为行业普遍状态。"
      }
    },
    {
      "id": "applications",
      "name": "应用",
      "x": 65,
      "y": 36,
      "mx": 44,
      "my": 43,
      "evidence": [
        "agent-native",
        "cua",
        "linear-ci",
        "posthog"
      ],
      "assessment": {
        "label": "从回答到交付",
        "title": "应用开始接住工作，验收成为关键",
        "path": [
          "给出建议",
          "参与交付",
          "结果可验收"
        ],
        "current": 1,
        "summary": "前沿应用开始读写共享状态、操作软件，并产出可审阅的改动。阶段变化是从“告诉你怎么做”，走向“参与把它做完”。",
        "change": "agent-native 把界面和 Agent 接到共用动作上；Cua 提供计算机操作能力；PostHog 展示从数据发现到改动建议。人和 AI 的交接点开始进入产品设计。",
        "bottleneck": "局部执行变快后，测试、权限确认与人工复核可能成为瓶颈。Linear 的 CI 改造提示：生成速度不等于完整交付速度。",
        "watch": "看一项真实任务从提出到验收的总耗时、返工率和接管成本，而不只看生成了多少内容。",
        "limit": "产品演示和项目说明尚不能证明跨软件的稳定闭环，本站未独立复现这些项目的整体效果。"
      }
    },
    {
      "id": "organization",
      "name": "组织变革",
      "x": 19,
      "y": 70,
      "mx": 19,
      "my": 66,
      "evidence": [
        "wti-2026",
        "anthropic-rd",
        "linear-ci"
      ],
      "assessment": {
        "label": "分工正在重写",
        "title": "从个人提效，走向重写团队的交接",
        "path": [
          "个人试用",
          "流程重组",
          "责任可追溯"
        ],
        "current": 1,
        "summary": "先行团队已开始重排流程；更广泛的组织仍在补管理和协作条件。这一阶段的差异，不只是“有没有用 AI”，而是谁定义工作、谁验收、谁承担结果。",
        "change": "微软的调查呈现了个人使用与组织准备之间的错位；Anthropic 的监督机制和 Linear 的 CI 调整则展示了流程层面的具体改变。",
        "bottleneck": "旧的交接、权限和绩效规则可能抵消局部提速。如果没有结果负责人，Agent 越多也可能带来更多协调。",
        "watch": "观察端到端周期和返工是否下降，以及团队能否追溯每次交付的决策、验收与责任。",
        "limit": "这是调查与先行案例共同支持的观察，不能断言多数企业已经完成重组；行业与团队差异很大。"
      }
    },
    {
      "id": "opc",
      "name": "个人 OPC",
      "x": 67,
      "y": 80,
      "mx": 46,
      "my": 85,
      "evidence": [
        "paperclip-governance",
        "stripe-solo"
      ],
      "assessment": {
        "label": "从产品到经营",
        "title": "一个人能做更多，接下来要证明能经营",
        "path": [
          "做出产品",
          "经营试验",
          "持续收入"
        ],
        "current": 1,
        "summary": "个人可以借助 AI 把研发、内容和部分运营组织起来，正在尝试以一人统筹多种工作的方式经营。当前要验证的，是这些产出能否接到持续的客户与收入。",
        "change": "Paperclip 这类工具把多个 Agent 放进目标、预算和审批流程；Stripe 的单创始人数据同时提醒：创办更容易，经营结果依然分化。",
        "bottleneck": "获客、留存、成本与责任仍需要闭环。做出一款产品、跑通一个自动流程，都不能单独证明公司成立得住。",
        "watch": "继续看复购、持续收入、扣除模型与运营费用后的收益，以及经营者必须介入的时间。",
        "limit": "这里的 OPC 是个人统筹 AI 参与经营。Stripe 的单创始人样本并非严格零雇员公司，也没有证明无人经营或普遍盈利。"
      }
    }
  ],
  "signals": [
    {
      "id": "gemini-tts",
      "region": "models",
      "label": "Gemini 3.8 TTS",
      "title": "语音生成走向逐句控制",
      "kind": "官方发布",
      "publishedAt": "2026-09-23",
      "observedAt": "2026-09-24",
      "source": "https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/",
      "summary": "Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS，介绍了自然语言设计声音、逐句控制表达等能力。",
      "question": "表达更可控之后，编辑、授权与结果验收的流程要怎样跟上？",
      "limit": "能力来自官方说明，本站尚未实测；部分接入仍分阶段开放。",
      "heat": {
        "level": 3,
        "reason": "表达控制能力的近期发布，补充具体任务的变化。"
      }
    },
    {
      "id": "opus-55",
      "region": "models",
      "label": "Claude Opus 5.5",
      "title": "把任务效率放进模型比较",
      "kind": "官方发布",
      "publishedAt": "2026-09-22",
      "observedAt": "2026-09-24",
      "source": "https://www.anthropic.com/claude-opus-5-5",
      "summary": "Anthropic 发布 Opus 5.5，强调编码、长任务与专业工作，并将完成任务的效率作为改进方向。",
      "question": "评估模型时，能否把完整任务的用时、重试与人工复核一起计算？",
      "limit": "这是发布方的能力主张，不能直接视为本站任务上的收益。",
      "heat": {
        "level": 4,
        "reason": "任务效率的产品更新，为能力进入工作提供相邻信号。"
      }
    },
    {
      "id": "agent-native",
      "region": "applications",
      "label": "agent-native",
      "title": "你改过的内容，AI 能接着做吗？",
      "kind": "项目观察",
      "publishedAt": null,
      "observedAt": "2026-09-24",
      "source": "https://github.com/BuilderIO/agent-native",
      "summary": "项目说明将 UI 与 Agent 接到同一组动作，共用校验、权限和实现，并共享业务数据与界面状态。",
      "question": "你在界面里改过的内容，AI 能否接着处理？它做过的改动，人又能否看清并接回？",
      "limit": "项目说明不等于效果验证，尚未在本站完成对照实验。",
      "article": "/thinking/",
      "heat": {
        "level": 5,
        "reason": "共享动作与状态直接改变人和AI的工作交接，是应用域的本期主线。"
      }
    },
    {
      "id": "cua",
      "region": "applications",
      "label": "Cua",
      "title": "从教你操作，到替你操作",
      "kind": "项目观察",
      "publishedAt": null,
      "observedAt": "2026-09-24",
      "source": "https://github.com/trycua/cua",
      "summary": "Cua 提供计算机操作驱动、隔离执行环境和用于训练、评估的工具。",
      "question": "AI 开始替人操作软件之后，中途出错时能否停住、确认状态，再把任务交回给人？",
      "limit": "工具集合来自项目说明，尚未在本站复现其效果。",
      "heat": {
        "level": 4,
        "reason": "计算机操作让任务进入执行，与应用主线直接相关。"
      }
    },
    {
      "id": "linear-ci",
      "region": "applications",
      "label": "Linear",
      "title": "代码写快了，为什么还在等？",
      "kind": "工程记录",
      "publishedAt": "2026-09-21",
      "observedAt": "2026-09-24",
      "source": "https://linear.app/now/ci-bottleneck-reworked",
      "summary": "Linear 描述 AI 编码加速后 CI 的等待问题，以及基础设施、关键路径、重复准备与测试执行方面的改进。",
      "question": "只看生成速度，会漏掉测试与人工复核的等待。整项工作的交付时间，究竟缩短了吗？",
      "limit": "这是外部团队的工程经验，本站没有复现其性能收益。",
      "heat": {
        "level": 3,
        "reason": "编码提速后的等待暴露交付瓶颈，是相邻实践信号。"
      }
    },
    {
      "id": "posthog",
      "region": "applications",
      "label": "PostHog",
      "title": "看完数据，下一步怎么改？",
      "kind": "产品观察",
      "publishedAt": null,
      "observedAt": "2026-09-23",
      "source": "https://posthog.com/",
      "summary": "PostHog 官网展示从产品数据发现问题、形成改进建议和待审查变更的流程。",
      "question": "从发现问题到形成改动，中间哪些步骤可以交给 AI，哪些决定要留给人？",
      "limit": "官网演示注明样例数据，不能视为真实业务效果证明。",
      "heat": {
        "level": 2,
        "reason": "从数据到改动的产品样例，作为应用路径的外围观察。"
      }
    },
    {
      "id": "anthropic-rd",
      "region": "models",
      "label": "Anthropic · 研发自动化测量",
      "title": "AI 已在监督下主导一部分研发",
      "kind": "实验室自报 · 2026年8月样本",
      "publishedAt": null,
      "observedAt": "2026-09-24",
      "source": "https://www.anthropic.com/institute/measuring-pace-of-ai-development",
      "summary": "Anthropic 自报：2026年8月，Claude 在人类监督下主导了其26%的 AI 研发工作；所测量的工作子类中，没有任何一类达到完全自主。",
      "question": "能接手更多步骤之后，怎样识别需要人介入的决定？",
      "limit": "单一实验室的内部测量，部分评分来自模型。不是全行业自动化率，也不是无人监督研发的证明。",
      "heat": {
        "level": 5,
        "reason": "把能力推进落实到实际研发任务与监督机制，是模型域的本期主线。"
      }
    },
    {
      "id": "metr-horizon",
      "region": "models",
      "label": "METR · 任务跨度",
      "title": "任务变长，成功率仍是条件",
      "kind": "研究测量 · 页面更新2026-05-08",
      "publishedAt": null,
      "observedAt": "2026-09-24",
      "source": "https://metr.org/time-horizons/",
      "summary": "METR 按人类专家完成任务的工时，测量 AI 在给定成功率下能处理的任务难度。样本主要是有明确验收标准的软件、机器学习和安全任务。",
      "question": "如果把成功率门槛提高，仍能放心交给 AI 的任务有多长？",
      "limit": "时间跨度不是 AI 可无人值守运行的时长，不能外推到所有工作。页面标注更新为5月8日；本次核对不代表9月有新测量。",
      "heat": {
        "level": 1,
        "reason": "任务跨度与可靠性提供判断边界，作为延伸研究。"
      }
    },
    {
      "id": "wti-2026",
      "region": "organization",
      "label": "Microsoft · Work Trend Index 2026",
      "title": "个人用起来了，组织未必接得住",
      "kind": "调查报告",
      "publishedAt": "2026-05-05",
      "observedAt": "2026-09-24",
      "source": "https://www.microsoft.com/en-us/worklab/work-trend-index/agents-human-agency-and-the-opportunity-for-every-organization",
      "summary": "微软调查10个市场的20,000名 AI 使用者。其准备度框架中，约五分之一落在个人能力与组织准备相互支持的区域；报告关注流程、管理支持、质量标准与激励的变化。",
      "question": "团队是否重写了交接、验收与责任，还是只多买了工具？",
      "limit": "准备度来自问卷自报，不是生产绩效或因果实验；样本是 AI 使用者，不代表全部企业。5月报告与近期案例需分开理解。",
      "heat": {
        "level": 5,
        "reason": "个人使用与组织准备的错位，作为组织域的主线问题。"
      }
    },
    {
      "id": "paperclip-governance",
      "region": "opc",
      "label": "Paperclip · Agent 治理",
      "title": "一个人开始有了调度团队的工具",
      "kind": "产品能力说明",
      "publishedAt": null,
      "observedAt": "2026-09-24",
      "source": "https://paperclip.ing/product/governance/",
      "summary": "Paperclip 将 Agent 工作放进目标、计划审批、预算和运行记录中，提供暂停及人工决策入口。它展示了个人组织多个 Agent 的控制方式。",
      "question": "一个经营者能否少做重复执行，同时看清交付、成本与责任？",
      "limit": "这是官方产品能力描述，本站未复现全部功能。工具存在不等于一人公司已有稳定客户、利润或自主经营结果。",
      "heat": {
        "level": 5,
        "reason": "个人开始统筹多个Agent的目标、预算与审批，是OPC域的本期主线。"
      }
    },
    {
      "id": "stripe-solo",
      "region": "opc",
      "label": "Stripe Atlas · 单创始人研究",
      "title": "更容易开公司，收入仍在分化",
      "kind": "平台样本研究",
      "publishedAt": "2026-05-28",
      "observedAt": "2026-09-24",
      "source": "https://stripe.com/blog/top-solo-founder-traits",
      "summary": "Stripe 报告：截至5月28日，2026年第二季度 Atlas 新设 C-corp 中63%没有联合创始人。其2025年单创始人样本的初始半年收入，中位数同比下降23%，头部十分位上升19%。",
      "question": "产品做出来以后，能否持续获客、留住客户，并覆盖真实成本？",
      "limit": "单创始人不等于始终没有员工。数据只覆盖该平台样本，收入不等于利润；不能据此证明 AI 导致增长，也不能证明一人公司普遍成功。",
      "heat": {
        "level": 2,
        "reason": "经营结果的分化，为OPC主线提供对照边界。"
      }
    }
  ],
  "connections": [
    {
      "to": "applications",
      "kind": "input",
      "from": "models"
    },
    {
      "to": "organization",
      "kind": "workflow",
      "from": "models"
    },
    {
      "to": "organization",
      "kind": "workflow",
      "from": "applications"
    },
    {
      "to": "opc",
      "kind": "workflow",
      "from": "applications"
    },
    {
      "to": "opc",
      "kind": "workflow",
      "from": "organization"
    }
  ]
}