Codex 从入门到精通
从零开始掌握 OpenAI Codex——AI 编程工程 Agent。14 章覆盖认识 Codex、四种入口安装、核心功能(自动化/插件/Skill/MCP/Git/记忆)、标准工作流、实战案例和第三方模型接入。
长期以来,自媒体选题往往是很多人创作的痛点!
选自己擅长的,可能没有热度。
简单的去看创作中心的热词?发出去后发现一点用没有?
这个怎么破?
实际上自媒体选题,并不是简单的看外部的热度,还是要根据你自己创作能力,习惯,以及整体的选题等等,建立一套可量化的模型更为重要!
所以看完这篇思路+末尾直接拿走的提示词,可以有效选题。
我们从证据资格、有效样本量、贝叶斯后验,到文风适配、组合排期与历史校准:把‘今天发什么’变成一套能复跑、能拒绝、能接受现实检验的决策流程。
从公域信号到可执行排期:一套保留证据、不确定性和人工门槛的自媒体选题模型。

做自媒体的人,通常不缺题。
热榜每天在变,同行每天在发,AI 一次可以生成几十个标题。真正困难的是另一件事:面对一堆看起来都能写的方向,怎么判断哪个值得投入,哪个应该先补证据,哪个只适合小成本试一下,哪个现在就该放弃。
这不是灵感问题,而是一个典型的“不确定条件下的资源分配问题”。
创作者的时间、账号信用、素材能力和发布窗口都有限。一个选题真正要比较的,也不只是热度,而是需求、证据、账号适配、读者价值、制作成本、内容风险和与近期文章的重复程度。
我把自己的茶内容自动化流程“茶话题雷达”重新拆了一遍,再让 Codex 把这些判断写成字段、公式、门槛和复盘规则。它现在仍然不预测爆款。它做的是更现实的事:在证据有限时,给每个选题一个可解释的优先级,并明确下一步应该发布、验证、探索还是暂缓。
先把结论说在前面:一套有效的选题模型,不应该只给总分。它至少要同时输出机会、置信度、风险、模型分歧和决策状态,而且必须允许“这轮没有可发选题”。
选题从候选线索开始,依次经过证据资格、统计估计、多目标效用、组合排期与结果校准。

TOPIC MODEL先定义“好选题”,否则公式没有目标
很多选题模型的第一步,是给热度、评论和搜索量分配权重。问题是,在给权重以前,系统还没有回答一件最重要的事:对这个账号来说,什么叫好选题?
不同内容的目标并不相同。科普文章可能更看重收藏和搜索寿命,观点文章可能更看重分享和有效讨论,商品内容可能更看重咨询或成交。如果把点击、完播、收藏、涨粉和销售全部揉成一个“爆款分”,任何一次局部上涨都可能被误解成全面成功。
所以模型先确定一个主要目标,再把其他结果放进护栏。比如一篇公众号判断文,主要目标可以是合格阅读后的分享或有效评论;标题点击、取关、投诉、事实错误和过度承诺分别记录,不能互相抵消。
本文所说的“选题优先级”,指的是:在当前证据、账号目标和资源约束下,这个选题比其他候选更值得进入下一步。它不是平台推荐算法的权重,也不是播放量、成交量或爆款概率。
定义清楚以后,数学模型才有对象。
TOPIC MODEL第一道门不是评分,而是数据资格
选题模型最容易犯的错,不是公式太简单,而是把不该进入公式的数据也算了进去。
搜索结果里可能混着只命中关键词却没有真实问题的内容;一条帖子下面可能有上百条重复跟随评论;平台标题可能被采集器拼成“用户提问”;历史样本没有发布时间,却和今天的数据拿到同样权重。
如果不先处理这些问题,模型只是把脏数据加工成一个更像真的数字。
茶话题雷达先把每条证据保存成最小可回指单元:平台、内容 ID、父帖 ID、作者、发布时间、原文、链接、来源类型、问题指纹和采集时间。随后才判断它能否进入分析。
真实公开内容、真实评论和后台导出可以进入证据层;标题合成的问题、跨茶错配、无法回指的旧样本和只有搜索词命中的内容,只能留在审计层。涉及真假、农残、香精、健康、产区和点名商家的题,还要额外保留事实边界。
这个设计看起来不够“智能”,却是整套模型里最重要的一步。
因为模型首先要学会拒绝证据。
TOPIC MODEL一条证据到底值多少,要拆成四个乘数
通过资格门的证据,也不能全部等权。
我会给每条证据计算一个基础权重:
wₑ = q_source × d_time × r_direct × u_independence
q_source 是来源质量。平台后台的真实用户问题、公开评论、登录态采集、搜索页快照和历史降级样本,拥有不同的可核验程度。
d_time 是时效权重,可以使用半衰期:
d_time = 2^(-age / h)
当前茶话题雷达把 45 天作为常用半衰期,但这不是自然常数。短期热点可以用 14 天或 30 天,常青问题可以用 90 天。关键是先按题型锁定,再开始计算,不能看到结果以后临时改参数。
r_direct 表示这条材料与问题的直接程度。消费者原话“茉莉花茶这么香是不是加了香精”,比一条只讨论“茶叶香气”的内容更直接。
u_independence 用来处理重复。来自同一个父帖、同一个作者或同一段复制文本的样本,不能被当成许多次独立发现。
加权以后,还要计算有效样本量:
n_eff = (Σwₑ)² / Σ(wₑ²)
这个公式常用于估计加权以后真正还剩多少信息量。十条几乎都来自同一个高权重来源的证据,n_eff 可能远小于 10;来源较均衡、权重不极端的十条证据,有效样本量才更接近十条。英国竞争与市场管理局的调查指南也使用这一 Kish 近似来说明加权会降低有效样本量。CMA Survey Good Practice
这里还有一个边界:n_eff 不能自动解决内容之间的真实相关性。所以系统必须先按父帖、作者和近重复文本分组,再计算它。公式不能代替去重。
证据权重由来源、时效、直接性和独立性共同决定;样本数量还要折算成有效样本量。

TOPIC MODEL跨平台热度不能直接相加,要先放回各自坐标系
抖音的播放、小红书的收藏、B站的投币和知乎的回答数,不是同一个量纲。把绝对数字直接相加,大平台会天然占优,一条偶然爆掉的内容也会替整个主题制造虚高。
更稳妥的做法,是先在每个平台、相近时间窗和相近内容类型内部做标准化。
第一步用 log(1+x) 压缩长尾,避免一个百万播放把其他样本全部挤到零附近。
第二步不用均值和标准差,而是使用中位数与 MAD(中位数绝对偏差)计算稳健 z 分数:
z = [log(1+x) - median] / [1.4826 × MAD + ε]
再把 z 截断在 [-3, 3],映射到 0—1。NIST 的统计手册指出,当数据存在长尾和极端值时,MAD 通常比标准差更稳健。NIST:Measures of Scale
第三步才合并平台。合并时除了看强度,还可以计算平台分布熵:
H = -Σ pₖ ln(pₖ) / ln(K)
pₖ 是某个问题在第 k 个平台上的证据权重占比。证据全部集中在一个平台时,H 接近 0;多个平台分布均衡时,H 接近 1。
这不是说跨平台一定更好,而是把“一个平台内很热”和“多个平台反复出现”分开。前者适合做平台内热点,后者更像稳定的用户问题。
不同平台先在各自坐标系内做稳健标准化,再合并相对强度与跨平台覆盖。

TOPIC MODEL小样本不能只看比例,要看后验分布
选题早期经常只有很少的评论。一个问题在 3 条样本里出现 2 次,看起来是 66.7%;另一个问题在 100 条样本里出现 55 次,只有 55%。如果只按比例排序,前者会赢,但这个结论非常不稳。
对“直接疑问占审计样本的比例”,可以使用 Beta-Binomial 模型:
θᵢ ~ Beta(α₀ + xᵢ, β₀ + nᵢ - xᵢ)
xᵢ 是去重后的直接问题实例,nᵢ 是在同一采样规则下审计过的相关评论机会。没有稳定历史数据时,可以从一个较弱的先验开始;有了同类题目的长期数据,再使用同账号、同平台、同采样方式的历史基线。
Beta 先验与二项观测结合后仍得到 Beta 后验,这是一个可以直接计算的共轭模型。Penn State:Bayesian Estimation of a Binomial Parameter
实际排期时,我不会只拿后验均值,而会看 10% 分位数。它可以理解为一个保守下界:即使真实需求没有均值看起来那么好,这个题还剩多少把握。
小样本会因为分布很宽而被压低,证据逐渐增加后,保守下界才会靠近均值。
但必须写清楚:通过关键词搜到的评论是条件样本,不是随机抽取的消费者民调。这个模型只能比较同一采样方案下的问题强弱,不能宣布“有多少消费者都在关心”。
小样本高比例拥有更宽的不确定区间,排期使用保守下界而不是只看均值。

TOPIC MODEL机会分不应该再是简单相加,而是多目标效用
完成证据处理以后,才进入真正的选题评分。
一个通用的自媒体选题,可以拆成七个 0—1 特征:
早期可以先给出一组政策权重,例如需求 24%、读者价值 20%、账号适配 18%、动量和可制作性各 12%、新颖度 8%、经营承接 6%。这些权重表达的是账号当前选择,不是平台秘密算法,也不是统计事实。
与简单加权平均相比,我更倾向使用加权几何平均:
Uᵢ = exp[Σ aⱼ ln(ε + sᵢⱼ)]
它的特点是不能轻易用一个特别高的热度,补偿一个接近零的读者价值或账号适配。一个题再热,如果没有证据可写、与账号长期内容完全无关,它的基础效用仍会明显下降。
这更接近真实创作:好选题不是某个指标特别高,而是几个必要条件同时过线。
七维效用使用加权几何平均,避免单一热度补偿接近零的读者价值或账号适配

TOPIC MODEL更科学的关键,不是公式更长,而是让不确定性进入结果
七个特征并不都同样可靠。
需求强度可以来自 Beta 后验;平台动量可以对当前样本做 bootstrap 重采样;账号适配和读者价值来自明确量表时,也应该保存多次评分的分歧,而不是只留下一个模型随口给出的 82 分。
Codex 可以为每个候选运行 2,000 次 Monte Carlo 模拟。每次从各特征的后验分布或经验分布里抽一个值,再计算一次多目标效用。最后得到的不是一个点,而是一条可能分布。
排序使用这条分布的 P10,而不是平均值:
保守优先级 = 100 × P10(Uᵢ) - 15Rᵢ - 8Kᵢ - 10Gᵢ
R 是事实、合规与账号信用风险,K 是制作成本,G 是不同评审对账号适配的分歧,三者都缩放到 0—1。
这里的 15、8、10 仍然只是初始政策系数。它们的好处不是“科学”,而是把代价放到了台面上。真正的科学性来自三点:输入口径固定、结果保留不确定性、参数以后接受真实结果检验。
与此同时,系统继续单独输出证据置信度:
C = 30%来源质量 + 20%时效 + 25%有效样本量 + 15%跨平台覆盖 + 10%字段完整度
C 不再粗暴乘进所有分数,而是决定选题处于“可发、待验证还是探索”的哪一条路,并影响模拟分布的宽度。
重复抽样得到效用分布,最终排序使用P10并显式扣除风险、成本和模型分歧

TOPIC MODELGrok Bot、Codex 和 Gemini,应该分别站在哪一层
模型多,不等于把同一件事重复做三遍。
我最新的恋山公众号流程,更适合把三者拆成不同职责。
Grok Bot 负责公域情报和候选题。它学习的不是口头禅,也不是某篇文章的句子,而是账号的内容 DNA:主题家族、受众问题、常用论证结构、内容形态、证据密度、商业承接方式、素材可制作性和历史表现分位。它每天可以给出 3—5 个结构化方向,同时附上来源、评论问题样本和被淘汰候选。
这一步只生产选题,不写正式稿。
Codex 负责证据权限和数学层。它去重、计算有效样本量、生成后验分布、补采缺口、运行 Monte Carlo、做风险检查,再把候选分成主选题、验证题、探索题和暂缓题。
Gemini 的合理位置不是回头再搜一遍热点,而是对已经进入 Top-K 的候选做“能否写成这个账号的文章”的复核。恋山公众号的专用 Gem 可以只收到短包:题目、选题家族、事实边界、允许使用的商品或经历、缺口。它判断这个题是否能形成自然的观点、证据和转折,随后才进入成文。
如果要把 Gemini 的判断也量化,可以让 Grok Bot 按内容 DNA、Gemini 按表达可行性,在同一张锚定量表上独立打分。两者差异超过 0.25 时,不直接求平均,而是进入人工复核。模型分歧本身就是信息。
这一层要特别克制。当前已能确认的是职责分工;Gemini 参与选题适配评分,仍应当作为待验证扩展,而不是写成已经稳定运行的自动闭环。保护语料也不应该在模型之间来回搬运。
Grok Bot负责公域线索,Codex负责证据与计算,Gemini负责Top-K表达适配,人负责最终取舍与发布。

TOPIC MODEL分数算完以后,系统还要决定“下一步做什么”
一个选题模型只输出 Top 10,仍然不够。
因为高分背后可能是四种完全不同的状态:
茶话题雷达当前对公开数据主选题使用一组清楚的硬门槛:具体茶、具体疑问,至少 2 条去重直接疑问、2 个独立父帖、2 个平台和 3 条独立内容。
这些阈值不是宇宙真理,但它们让“能不能发”不再由总分偷偷决定。如果一个高热度题只有一条真实疑问,它最多进入探索或验证,不会因为播放量大就被公式抬成主选题。
机会与置信度决定下一步路径;硬门槛失败不能由高总分抵消。

TOPIC MODEL周计划不能按分数从高到低抄六条
即使每个候选都算对了,直接取前六名仍可能得到六个非常相似的题:同一种茶、同一种真假问题、同一种内容结构。
这时可以把 MMR(Maximal Marginal Relevance)用于周排期重排:
MMR(i) = λ × Priority(i) - (1-λ) × max Similarity(i, 已选题)
MMR 原本用于在相关性与新颖性之间做重排,可以减少结果冗余。Carbonell & Goldstein, SIGIR 1998
在内容排期里,λ 可以先取 0.75:仍以优先级为主,但相似度过高的题会被向后推。再加上明确约束,例如同一“茶类 + 问题轴”一周最多两条、至少保留一个探索位、高风险事实题不能连续发布,系统才会得到真正可用的组合,而不是排行榜截图。
茶话题雷达原来的 40% 主选题、30% 验证题、20% 探索题、10% 时效题,可以继续作为初始排期策略,但不应该被当成固定真理。当轮没有高置信题时,宁可空出位置,也不能把低置信题升级填满。
周计划在单题优先级之外加入相似度惩罚,避免连续内容挤在同一问题轴。

TOPIC MODEL探索题不是随便试,可以用后验分配试错预算
创作者不能永远只做已经被证明安全的题,否则账号会越来越窄。
对不同主题家族,可以维护一组简单的 Beta 后验。每发布一条内容,就按事先定义的主要目标记录成功或失败,同时检查取关、投诉、事实纠错和转化质量等护栏。
然后用 Thompson Sampling 为探索位抽样:历史表现稳定的家族更容易被选中,不确定但潜力较大的新家族仍有机会获得测试位。这类方法的核心,就是在利用已有认知和购买新信息之间做序贯平衡。Russo 等:A Tutorial on Thompson Sampling
这里的“成功”必须先定义。例如同平台、同账号、同内容类型下,主要指标超过过去 90 天的第 60 百分位,且没有触发护栏,记为一次成功。这个阈值仍是初始规则,可以调整,但不能发完以后为了让结果好看再改。
一次内容只更新后验,不证明因果。
探索位按后验不确定性分配,发布结果只更新认知,不被解释成一次性因果证明。

TOPIC MODEL模型什么时候才有资格谈“预测”
在没有本账号发布结果以前,所有权重都只是结构化判断。
至少积累 30—50 条统一字段的已发布内容以后,才开始比较发布前特征与真实结果。样本更少时可以做方向性复盘,但不要训练复杂模型,也不要输出精确成功概率。
复盘时要按时间切分。前一段数据用于估计参数,后一段数据用于验证,不能拿同一批内容一边调权重,一边证明模型有效。
如果模型开始输出“成功概率”,还要画校准曲线:预测在 60% 附近的题,长期是否真的大约有六成达到事先定义的成功标准。Brier Score 可以用来衡量概率预测与二元结果之间的平方误差,越低越好。Evaluating Probability Forecasts
权重只有在连续两个验证窗口都改善主要指标,同时没有恶化护栏时,才进入正式版本。否则回退到上一版,并保留失败记录。
这一步把模型从“看起来合理”,推进到“接受现实检验”。
模型只有通过时间切分验证、校准曲线和护栏检查,才有资格把分数解释成概率。

TOPIC MODEL如果你也想做,可以从八步最小版本开始
第一步,建候选表。至少保存 topic_id、具体对象、具体问题、平台、原文、source_url、parent_id、author_id、published_at、evidence_at、direct_question、risk_tag。
第二步,写数据资格。哪些能进入分析,哪些只留在审计层,哪些必须人工复核。
第三步,统一平台内指标。先做 log(1+x),再按同平台、同类型、同时间窗使用中位数和 MAD 标准化。
第四步,给证据加权并计算 n_eff。先处理父帖、作者与近重复文本,再谈有效样本量。
第五步,为直接问题建立 Beta 后验。只在采样方式一致的候选之间比较,并同时保存均值、P10 和样本量。
第六步,建立七维效用量表。每一维都写清定义、来源、缺失处理、0/0.5/1 的锚点和谁负责复核。
第七步,让 Codex 运行模拟并分配状态。输出机会、置信度、P10 优先级、风险、成本、模型分歧、证据缺口和下一步动作。
第八步,用 MMR 生成周组合,用真实发布结果更新主题家族后验,并按月做时间切分验证。
如果暂时不会写代码,也可以先用表格完成前六步,再让 Codex 读取 CSV 计算。真正重要的不是技术栈,而是所有定义都能被复跑,所有数字都能回到原始证据。

第一版可以从CSV和Codex开始;先让定义可复跑,再逐步追求预测性能。
TOPIC MODEL它比常见的提示词型 Skill 多出来什么
很多公开的内容 Skill 已经会提醒模型搜索、引用、分析受众和生成标题。这些能力有价值,但从“会执行一段说明”到“能承担选题决策”,中间还差几层。
第一是数据合同。每条证据必须有身份、时间、来源和去重关系。
第二是不确定性。系统保存后验、有效样本量和分歧,不把 82 分伪装成事实。
第三是拒绝权。证据不足时可以输出 0 个主选题,而不是为了完成任务凑满十条。
第四是组合决策。它不只选单个高分题,还考虑一周内容之间的重复、风险和探索预算。
第五是可校准。每个参数都有版本,后续结果可以证明它有用,也可以证明它错了。
所以更准确的比较不是“这套 Skill 更会写”,而是它从提示词升级成了一套有数据资格、统计估计、失败语义、人工门槛和历史校准的决策系统。
TOPIC MODEL真正搭起来,要把数学模型放进五个文件
如果你准备照着做,我建议不要先写一个几千字的超级提示词,然后期待 AI 每次都记住所有规则。
更稳的办法,是先建一个项目文件夹,把模型拆成五个长期保存的文件。
这五个文件把一次性的 AI 对话,变成了可以复跑的项目。
第一次使用时,把过去 30—90 天能合法获得的候选证据放进 evidence.csv,再让 Codex 检查字段、去重、计算和生成选题报告。先看被拒绝的题为什么被拒绝,再看排在前面的题。因为一套模型是否可靠,不只体现在它选中了什么,也体现在它能不能清楚解释为什么暂时不选。
选题发布以后,把真实结果写回 outcomes.csv。下一轮模型读取的是“上次判断 + 后来发生了什么”,而不是只读取新的热搜。这样才会逐渐形成账号自己的先验。
模型也要分阶段使用。
复杂,不等于科学。能留下版本、接受反证、在数据不足时拒绝下结论,才更接近科学。
TOPIC MODEL最后:AI 真正该替创作者管理的是不确定性
自媒体选题不会因为有了数学模型,就变成一道有标准答案的题。
平台会变,用户会变,账号本身也会变。数学能做的,是让这些变化不再隐藏在一句“我感觉这个题不错”里。
把事实和判断分开,把均值和不确定性分开,把热度和账号适配分开,把单题排序和周组合分开,把模型建议和人工发布分开。
当这些边界都被写进流程以后,Codex 才不只是帮人多生成一些标题。它开始替创作者保存证据、暴露风险、计算代价,并在信息不足时主动停下来。
这套系统最后给出的,不是一个神奇的爆款答案。
它给出的是一条更可靠的创作路径。
TOPIC MODEL最后,给你一份可以直接交给 Codex 的提示词
使用时,把下面的方括号内容换成自己的项目路径、平台和内容类型。如果你还没有 CSV,也可以先把已有链接、评论和选题记录放进一个文件夹,让 Codex 先生成字段模板。
你现在不是文案生成器,而是我的“自媒体选题决策系统构建者”。 项目目录:[填写项目目录] 主要平台:[例如微信公众号 / 小红书 / 抖音 / 知乎] 内容领域:[填写垂直领域] 主要内容类型:[例如长文 / 图文 / 口播视频] 主要业务目标:[只能选一个,例如有效阅读、收藏、关注、咨询或成交] 护栏指标:[例如取关、负面反馈、事实风险、制作成本或商业透支] 你的任务是读取项目目录中的候选题、原帖、评论、历史发布结果和已有配置,建立一套可复跑、可解释、允许拒绝输出的选题模型。先完成证据审计和计算,不要直接写文章,也不要为了凑数量生成候选题。 一、先检查输入 1. 检查是否存在 evidence.csv、feature_dictionary.yaml、model_config.yaml、topic_scores.csv、outcomes.csv。 2. 如果文件不存在,创建模板和字段说明,但不得伪造数据。 3. evidence.csv 至少包含:topic_id、topic_object、user_question、platform、source_text、source_url、parent_id、author_id、published_at、evidence_at、engagement、direct_question、risk_tag。 4. outcomes.csv 至少包含:topic_id、published_at、platform、content_type、primary_metric、guardrail_metrics、success_label、model_version。 5. 发现关键字段缺失时,输出 missing-inputs.md,说明缺什么、影响哪一步、最小补充方法。关键证据不足时允许输出 0 个主选题。 二、处理证据 1. 按父帖、作者和语义近重复关系去重或聚类,不能把同一事件的转载当成多份独立证据。 2. 为每条证据计算: w_e = q_source × d_time × r_direct × u_independence 3. q_source 表示来源质量;d_time 使用半衰期衰减 2^(-age/h);r_direct 表示是否直接回答用户问题;u_independence 表示独立性。 4. 计算有效样本量: n_eff = (sum w)^2 / sum(w^2) 5. 同一个主题存在多个平台时,先在同平台、同内容类型、同时间窗内对互动量做 log(1+x),再使用 median 和 MAD 做稳健标准化。不要直接相加不同平台的原始点赞、评论或播放量。 三、估计需求而不是只数评论 1. 对直接疑问比例使用 Beta-Binomial 模型。默认使用 Beta(1,1) 弱先验;如果项目已有经过验证的先验,优先读取配置。 2. 保存后验均值、P10 保守下界和样本量。排期优先使用 P10,不只看均值。 3. 明确说明:搜索条件下的公开样本不是全体消费者民调,模型输出是选题优先级,不是爆款概率。 四、建立七维效用 为每个候选题计算 0—1 的七维分数,并逐项保存评分依据: D 需求强度、M 时效动量、V 读者价值、A 账号适配、F 可证与可制作、N 新颖度、B 经营承接。 如果没有本账号历史校准数据,先使用示例权重: D=0.24,M=0.12,V=0.20,A=0.18,F=0.12,N=0.08,B=0.06。 使用加权几何平均: U_i = exp[sum(a_j × ln(eps + s_ij))] 不要用简单加法掩盖接近零的读者价值、账号适配或可制作性。所有 LLM 主观评分必须同时给出理由、证据和不确定区间,不能把文风适配写成客观事实。 五、让不确定性进入排序 1. 为存在不确定性的输入建立合理分布,运行至少 2000 次 Monte Carlo 抽样。 2. 保存 U 的均值、中位数和 P10。 3. 计算保守优先级: Priority_i = 100 × P10(U_i) - 15R_i - 8K_i - 10G_i 4. R 是事实、合规、争议和品牌风险;K 是制作成本;G 是不同模型或人工判断之间的分歧。三者都归一化到 0—1。 5. 如果使用 Grok、Codex、Gemini 分工:Grok 只提供公域候选和内容 DNA;Codex 负责证据审计、计算和状态分配;Gemini 只对 Top-K 候选做表达适配复核或成文。不要向外部模型发送受保护的逐字语料。 六、分配动作,而不是只给总分 将候选题分为:主选题、验证题、探索题、暂缓题。 主选题必须同时满足数据资格、风险门槛和最低证据要求。证据不足但潜力较高的题进入验证题,并列出下一步要补的来源或问题。新颖但不确定的题进入探索题。硬门槛失败的题进入暂缓题,高总分不能抵消硬门槛。 生成周计划时,使用 MMR 做多样性重排: MMR = lambda × Priority - (1-lambda) × max_similarity 默认 lambda=0.75,并限制同一主题家族、同一问题轴和同一内容形式的重复数量。 七、输出文件 请生成: 1. topic-scores.csv:全部候选及完整中间量; 2. selected-topics.md:主选题、验证题、探索题和暂缓题; 3. evidence-gaps.md:每个候选缺少的证据及最小补采动作; 4. weekly-plan.md:经过 MMR 重排的周计划、选择理由和备选题; 5. model-report.md:本次数据范围、公式、参数版本、假设、限制、拒绝原因和相对上一版的变化; 6. model_config.yaml:可复用的参数与版本记录。 八、使用真实结果校准 1. 如果 outcomes.csv 少于 30 条统一口径记录,不训练复杂预测模型,不输出精确成功概率。 2. 样本达到要求后,按时间切分训练段和验证段,禁止用同一批数据一边调参一边证明有效。 3. 如果输出概率,报告校准曲线和 Brier Score,并同时检查主要指标和护栏。 4. 新参数只有在连续两个验证窗口改善主要指标且没有恶化护栏时,才升级为正式版本;否则回退并保留失败记录。 现在先扫描项目目录,列出已找到的文件、可计算字段、关键缺口和执行顺序。确认数据足够后再运行模型;不确定的地方要显式标记,不得自行补造事实、链接、指标或历史结果。
编者提示一:这篇内容对普通读者最直接的用法,是把它当作一次可以照着跑的 AI 工作流示范。建议先挑文中提到的一款工具(如 ChatGPT、Claude、Grok Bot 或对应的开源模型),把作者演示的输入、配置和调用步骤在自己的写作、编程或日常办公任务上小规模复现一遍,再评估生成结果与投入时间的性价比。
编者提示二:如果你正在用 AI 提升效率或探索第二收入,读这篇时建议带着三个问题:作者具体输入了什么材料、做了哪些设置与测试、最终输出了什么可交付的成果。把这三点套用到自己的场景,能快速判断这套方法是否值得迁移。
本文收录于以下专题:
作者:伯岩(@yvchengshanren)
原文地址:
从零开始掌握 OpenAI Codex——AI 编程工程 Agent。14 章覆盖认识 Codex、四种入口安装、核心功能(自动化/插件/Skill/MCP/Git/记忆)、标准工作流、实战案例和第三方模型接入。
暂无评论,快来抢沙发~