一键让codex建数学模型帮助自媒体选题,很好用!末尾提示词直接拿走用

星海拾光AI 前沿📡 觉醒AI2026-09-21669 阅读💛 105 收藏

长期以来,自媒体选题往往是很多人创作的痛点!

选自己擅长的,可能没有热度。

简单的去看创作中心的热词?发出去后发现一点用没有?

这个怎么破?

实际上自媒体选题,并不是简单的看外部的热度,还是要根据你自己创作能力,习惯,以及整体的选题等等,建立一套可量化的模型更为重要!

所以看完这篇思路+末尾直接拿走的提示词,可以有效选题。

我们从证据资格、有效样本量、贝叶斯后验,到文风适配、组合排期与历史校准:把‘今天发什么’变成一套能复跑、能拒绝、能接受现实检验的决策流程。

从公域信号到可执行排期:一套保留证据、不确定性和人工门槛的自媒体选题模型。

图片

做自媒体的人,通常不缺题。

热榜每天在变,同行每天在发,AI 一次可以生成几十个标题。真正困难的是另一件事:面对一堆看起来都能写的方向,怎么判断哪个值得投入,哪个应该先补证据,哪个只适合小成本试一下,哪个现在就该放弃。

这不是灵感问题,而是一个典型的“不确定条件下的资源分配问题”。

创作者的时间、账号信用、素材能力和发布窗口都有限。一个选题真正要比较的,也不只是热度,而是需求、证据、账号适配、读者价值、制作成本、内容风险和与近期文章的重复程度。

我把自己的茶内容自动化流程“茶话题雷达”重新拆了一遍,再让 Codex 把这些判断写成字段、公式、门槛和复盘规则。它现在仍然不预测爆款。它做的是更现实的事:在证据有限时,给每个选题一个可解释的优先级,并明确下一步应该发布、验证、探索还是暂缓。

先把结论说在前面:一套有效的选题模型,不应该只给总分。它至少要同时输出机会、置信度、风险、模型分歧和决策状态,而且必须允许“这轮没有可发选题”。

选题从候选线索开始,依次经过证据资格、统计估计、多目标效用、组合排期与结果校准。

图片

TOPIC MODEL先定义“好选题”,否则公式没有目标

很多选题模型的第一步,是给热度、评论和搜索量分配权重。问题是,在给权重以前,系统还没有回答一件最重要的事:对这个账号来说,什么叫好选题?

不同内容的目标并不相同。科普文章可能更看重收藏和搜索寿命,观点文章可能更看重分享和有效讨论,商品内容可能更看重咨询或成交。如果把点击、完播、收藏、涨粉和销售全部揉成一个“爆款分”,任何一次局部上涨都可能被误解成全面成功。

所以模型先确定一个主要目标,再把其他结果放进护栏。比如一篇公众号判断文,主要目标可以是合格阅读后的分享或有效评论;标题点击、取关、投诉、事实错误和过度承诺分别记录,不能互相抵消。

本文所说的“选题优先级”,指的是:在当前证据、账号目标和资源约束下,这个选题比其他候选更值得进入下一步。它不是平台推荐算法的权重,也不是播放量、成交量或爆款概率。

定义清楚以后,数学模型才有对象。

TOPIC MODEL第一道门不是评分,而是数据资格

选题模型最容易犯的错,不是公式太简单,而是把不该进入公式的数据也算了进去。

搜索结果里可能混着只命中关键词却没有真实问题的内容;一条帖子下面可能有上百条重复跟随评论;平台标题可能被采集器拼成“用户提问”;历史样本没有发布时间,却和今天的数据拿到同样权重。

如果不先处理这些问题,模型只是把脏数据加工成一个更像真的数字。

茶话题雷达先把每条证据保存成最小可回指单元:平台、内容 ID、父帖 ID、作者、发布时间、原文、链接、来源类型、问题指纹和采集时间。随后才判断它能否进入分析。

真实公开内容、真实评论和后台导出可以进入证据层;标题合成的问题、跨茶错配、无法回指的旧样本和只有搜索词命中的内容,只能留在审计层。涉及真假、农残、香精、健康、产区和点名商家的题,还要额外保留事实边界。

这个设计看起来不够“智能”,却是整套模型里最重要的一步。

因为模型首先要学会拒绝证据。

TOPIC MODEL一条证据到底值多少,要拆成四个乘数

通过资格门的证据,也不能全部等权。

我会给每条证据计算一个基础权重:

wₑ = q_source × d_time × r_direct × u_independence

q_source 是来源质量。平台后台的真实用户问题、公开评论、登录态采集、搜索页快照和历史降级样本,拥有不同的可核验程度。

d_time 是时效权重,可以使用半衰期:

d_time = 2^(-age / h)

当前茶话题雷达把 45 天作为常用半衰期,但这不是自然常数。短期热点可以用 14 天或 30 天,常青问题可以用 90 天。关键是先按题型锁定,再开始计算,不能看到结果以后临时改参数。

r_direct 表示这条材料与问题的直接程度。消费者原话“茉莉花茶这么香是不是加了香精”,比一条只讨论“茶叶香气”的内容更直接。

u_independence 用来处理重复。来自同一个父帖、同一个作者或同一段复制文本的样本,不能被当成许多次独立发现。

加权以后,还要计算有效样本量:

n_eff = (Σwₑ)² / Σ(wₑ²)

这个公式常用于估计加权以后真正还剩多少信息量。十条几乎都来自同一个高权重来源的证据,n_eff 可能远小于 10;来源较均衡、权重不极端的十条证据,有效样本量才更接近十条。英国竞争与市场管理局的调查指南也使用这一 Kish 近似来说明加权会降低有效样本量。CMA Survey Good Practice

这里还有一个边界:n_eff 不能自动解决内容之间的真实相关性。所以系统必须先按父帖、作者和近重复文本分组,再计算它。公式不能代替去重。

证据权重由来源、时效、直接性和独立性共同决定;样本数量还要折算成有效样本量。

图片

TOPIC MODEL跨平台热度不能直接相加,要先放回各自坐标系

抖音的播放、小红书的收藏、B站的投币和知乎的回答数,不是同一个量纲。把绝对数字直接相加,大平台会天然占优,一条偶然爆掉的内容也会替整个主题制造虚高。

更稳妥的做法,是先在每个平台、相近时间窗和相近内容类型内部做标准化。

第一步用 log(1+x) 压缩长尾,避免一个百万播放把其他样本全部挤到零附近。

第二步不用均值和标准差,而是使用中位数与 MAD(中位数绝对偏差)计算稳健 z 分数:

z = [log(1+x) - median] / [1.4826 × MAD + ε]

再把 z 截断在 [-3, 3],映射到 0—1。NIST 的统计手册指出,当数据存在长尾和极端值时,MAD 通常比标准差更稳健。NIST:Measures of Scale

第三步才合并平台。合并时除了看强度,还可以计算平台分布熵:

H = -Σ pₖ ln(pₖ) / ln(K)

pₖ 是某个问题在第 k 个平台上的证据权重占比。证据全部集中在一个平台时,H 接近 0;多个平台分布均衡时,H 接近 1。

这不是说跨平台一定更好,而是把“一个平台内很热”和“多个平台反复出现”分开。前者适合做平台内热点,后者更像稳定的用户问题。

不同平台先在各自坐标系内做稳健标准化,再合并相对强度与跨平台覆盖。

图片

TOPIC MODEL小样本不能只看比例,要看后验分布

选题早期经常只有很少的评论。一个问题在 3 条样本里出现 2 次,看起来是 66.7%;另一个问题在 100 条样本里出现 55 次,只有 55%。如果只按比例排序,前者会赢,但这个结论非常不稳。

对“直接疑问占审计样本的比例”,可以使用 Beta-Binomial 模型:

θᵢ ~ Beta(α₀ + xᵢ, β₀ + nᵢ - xᵢ)

xᵢ 是去重后的直接问题实例,nᵢ 是在同一采样规则下审计过的相关评论机会。没有稳定历史数据时,可以从一个较弱的先验开始;有了同类题目的长期数据,再使用同账号、同平台、同采样方式的历史基线。

Beta 先验与二项观测结合后仍得到 Beta 后验,这是一个可以直接计算的共轭模型。Penn State:Bayesian Estimation of a Binomial Parameter

实际排期时,我不会只拿后验均值,而会看 10% 分位数。它可以理解为一个保守下界:即使真实需求没有均值看起来那么好,这个题还剩多少把握。

小样本会因为分布很宽而被压低,证据逐渐增加后,保守下界才会靠近均值。

但必须写清楚:通过关键词搜到的评论是条件样本,不是随机抽取的消费者民调。这个模型只能比较同一采样方案下的问题强弱,不能宣布“有多少消费者都在关心”。

小样本高比例拥有更宽的不确定区间,排期使用保守下界而不是只看均值。

图片

TOPIC MODEL机会分不应该再是简单相加,而是多目标效用

完成证据处理以后,才进入真正的选题评分。

一个通用的自媒体选题,可以拆成七个 0—1 特征:

  • D:需求强度。真实问题、后台搜索或用户反馈是否反复出现。
  • M:时效动量。相对本平台基线,它是否正在形成短期窗口。
  • V:读者价值。看完以后能否完成一个判断、辨别或行动。
  • A:账号适配。它是否属于账号长期讨论的内容 DNA,而不是只碰到一个热点词。
  • F:可证与可制作性。是否有足够事实、案例、画面和时间把它做好。
  • N:新颖度。与账号近 90 天内容是否过于重复。
  • B:经营承接。它是否能自然连接账号的产品、服务或长期主题。

早期可以先给出一组政策权重,例如需求 24%、读者价值 20%、账号适配 18%、动量和可制作性各 12%、新颖度 8%、经营承接 6%。这些权重表达的是账号当前选择,不是平台秘密算法,也不是统计事实。

与简单加权平均相比,我更倾向使用加权几何平均:

Uᵢ = exp[Σ aⱼ ln(ε + sᵢⱼ)]

它的特点是不能轻易用一个特别高的热度,补偿一个接近零的读者价值或账号适配。一个题再热,如果没有证据可写、与账号长期内容完全无关,它的基础效用仍会明显下降。

这更接近真实创作:好选题不是某个指标特别高,而是几个必要条件同时过线。

七维效用使用加权几何平均,避免单一热度补偿接近零的读者价值或账号适配

图片

TOPIC MODEL更科学的关键,不是公式更长,而是让不确定性进入结果

七个特征并不都同样可靠。

需求强度可以来自 Beta 后验;平台动量可以对当前样本做 bootstrap 重采样;账号适配和读者价值来自明确量表时,也应该保存多次评分的分歧,而不是只留下一个模型随口给出的 82 分。

Codex 可以为每个候选运行 2,000 次 Monte Carlo 模拟。每次从各特征的后验分布或经验分布里抽一个值,再计算一次多目标效用。最后得到的不是一个点,而是一条可能分布。

排序使用这条分布的 P10,而不是平均值:

保守优先级 = 100 × P10(Uᵢ) - 15Rᵢ - 8Kᵢ - 10Gᵢ

R 是事实、合规与账号信用风险,K 是制作成本,G 是不同评审对账号适配的分歧,三者都缩放到 0—1。

这里的 15、8、10 仍然只是初始政策系数。它们的好处不是“科学”,而是把代价放到了台面上。真正的科学性来自三点:输入口径固定、结果保留不确定性、参数以后接受真实结果检验。

与此同时,系统继续单独输出证据置信度:

C = 30%来源质量 + 20%时效 + 25%有效样本量   + 15%跨平台覆盖 + 10%字段完整度

C 不再粗暴乘进所有分数,而是决定选题处于“可发、待验证还是探索”的哪一条路,并影响模拟分布的宽度。

重复抽样得到效用分布,最终排序使用P10并显式扣除风险、成本和模型分歧

图片

TOPIC MODELGrok Bot、Codex 和 Gemini,应该分别站在哪一层

模型多,不等于把同一件事重复做三遍。

我最新的恋山公众号流程,更适合把三者拆成不同职责。

Grok Bot 负责公域情报和候选题。它学习的不是口头禅,也不是某篇文章的句子,而是账号的内容 DNA:主题家族、受众问题、常用论证结构、内容形态、证据密度、商业承接方式、素材可制作性和历史表现分位。它每天可以给出 3—5 个结构化方向,同时附上来源、评论问题样本和被淘汰候选。

这一步只生产选题,不写正式稿。

Codex 负责证据权限和数学层。它去重、计算有效样本量、生成后验分布、补采缺口、运行 Monte Carlo、做风险检查,再把候选分成主选题、验证题、探索题和暂缓题。

Gemini 的合理位置不是回头再搜一遍热点,而是对已经进入 Top-K 的候选做“能否写成这个账号的文章”的复核。恋山公众号的专用 Gem 可以只收到短包:题目、选题家族、事实边界、允许使用的商品或经历、缺口。它判断这个题是否能形成自然的观点、证据和转折,随后才进入成文。

如果要把 Gemini 的判断也量化,可以让 Grok Bot 按内容 DNA、Gemini 按表达可行性,在同一张锚定量表上独立打分。两者差异超过 0.25 时,不直接求平均,而是进入人工复核。模型分歧本身就是信息。

这一层要特别克制。当前已能确认的是职责分工;Gemini 参与选题适配评分,仍应当作为待验证扩展,而不是写成已经稳定运行的自动闭环。保护语料也不应该在模型之间来回搬运。

Grok Bot负责公域线索,Codex负责证据与计算,Gemini负责Top-K表达适配,人负责最终取舍与发布。

图片

TOPIC MODEL分数算完以后,系统还要决定“下一步做什么”

一个选题模型只输出 Top 10,仍然不够。

因为高分背后可能是四种完全不同的状态:

  • 主选题:保守优先级高,证据置信度过线,硬门槛与风险检查通过,进入人工终审。
  • 验证题:期望效用高,但有效样本量、跨平台证据或后台信号不足,下一步是补证。
  • 探索题:只有真实单点线索,值得用低成本内容测试,但不能包装成普遍需求。
  • 暂缓题:数据资格、事实风险、账号适配或制作条件失败,先不占用排期。

茶话题雷达当前对公开数据主选题使用一组清楚的硬门槛:具体茶、具体疑问,至少 2 条去重直接疑问、2 个独立父帖、2 个平台和 3 条独立内容。

这些阈值不是宇宙真理,但它们让“能不能发”不再由总分偷偷决定。如果一个高热度题只有一条真实疑问,它最多进入探索或验证,不会因为播放量大就被公式抬成主选题。

机会与置信度决定下一步路径;硬门槛失败不能由高总分抵消。

图片

TOPIC MODEL周计划不能按分数从高到低抄六条

即使每个候选都算对了,直接取前六名仍可能得到六个非常相似的题:同一种茶、同一种真假问题、同一种内容结构。

这时可以把 MMR(Maximal Marginal Relevance)用于周排期重排:

MMR(i) = λ × Priority(i)        - (1-λ) × max Similarity(i, 已选题)

MMR 原本用于在相关性与新颖性之间做重排,可以减少结果冗余。Carbonell & Goldstein, SIGIR 1998

在内容排期里,λ 可以先取 0.75:仍以优先级为主,但相似度过高的题会被向后推。再加上明确约束,例如同一“茶类 + 问题轴”一周最多两条、至少保留一个探索位、高风险事实题不能连续发布,系统才会得到真正可用的组合,而不是排行榜截图。

茶话题雷达原来的 40% 主选题、30% 验证题、20% 探索题、10% 时效题,可以继续作为初始排期策略,但不应该被当成固定真理。当轮没有高置信题时,宁可空出位置,也不能把低置信题升级填满。

周计划在单题优先级之外加入相似度惩罚,避免连续内容挤在同一问题轴。

图片

TOPIC MODEL探索题不是随便试,可以用后验分配试错预算

创作者不能永远只做已经被证明安全的题,否则账号会越来越窄。

对不同主题家族,可以维护一组简单的 Beta 后验。每发布一条内容,就按事先定义的主要目标记录成功或失败,同时检查取关、投诉、事实纠错和转化质量等护栏。

然后用 Thompson Sampling 为探索位抽样:历史表现稳定的家族更容易被选中,不确定但潜力较大的新家族仍有机会获得测试位。这类方法的核心,就是在利用已有认知和购买新信息之间做序贯平衡。Russo 等:A Tutorial on Thompson Sampling

这里的“成功”必须先定义。例如同平台、同账号、同内容类型下,主要指标超过过去 90 天的第 60 百分位,且没有触发护栏,记为一次成功。这个阈值仍是初始规则,可以调整,但不能发完以后为了让结果好看再改。

一次内容只更新后验,不证明因果。

探索位按后验不确定性分配,发布结果只更新认知,不被解释成一次性因果证明。

图片

TOPIC MODEL模型什么时候才有资格谈“预测”

在没有本账号发布结果以前,所有权重都只是结构化判断。

至少积累 30—50 条统一字段的已发布内容以后,才开始比较发布前特征与真实结果。样本更少时可以做方向性复盘,但不要训练复杂模型,也不要输出精确成功概率。

复盘时要按时间切分。前一段数据用于估计参数,后一段数据用于验证,不能拿同一批内容一边调权重,一边证明模型有效。

如果模型开始输出“成功概率”,还要画校准曲线:预测在 60% 附近的题,长期是否真的大约有六成达到事先定义的成功标准。Brier Score 可以用来衡量概率预测与二元结果之间的平方误差,越低越好。Evaluating Probability Forecasts

权重只有在连续两个验证窗口都改善主要指标,同时没有恶化护栏时,才进入正式版本。否则回退到上一版,并保留失败记录。

这一步把模型从“看起来合理”,推进到“接受现实检验”。

模型只有通过时间切分验证、校准曲线和护栏检查,才有资格把分数解释成概率。

图片

TOPIC MODEL如果你也想做,可以从八步最小版本开始

第一步,建候选表。至少保存 topic_id、具体对象、具体问题、平台、原文、source_url、parent_id、author_id、published_at、evidence_at、direct_question、risk_tag。

第二步,写数据资格。哪些能进入分析,哪些只留在审计层,哪些必须人工复核。

第三步,统一平台内指标。先做 log(1+x),再按同平台、同类型、同时间窗使用中位数和 MAD 标准化。

第四步,给证据加权并计算 n_eff。先处理父帖、作者与近重复文本,再谈有效样本量。

第五步,为直接问题建立 Beta 后验。只在采样方式一致的候选之间比较,并同时保存均值、P10 和样本量。

第六步,建立七维效用量表。每一维都写清定义、来源、缺失处理、0/0.5/1 的锚点和谁负责复核。

第七步,让 Codex 运行模拟并分配状态。输出机会、置信度、P10 优先级、风险、成本、模型分歧、证据缺口和下一步动作。

第八步,用 MMR 生成周组合,用真实发布结果更新主题家族后验,并按月做时间切分验证。

如果暂时不会写代码,也可以先用表格完成前六步,再让 Codex 读取 CSV 计算。真正重要的不是技术栈,而是所有定义都能被复跑,所有数字都能回到原始证据。

图片

第一版可以从CSV和Codex开始;先让定义可复跑,再逐步追求预测性能。

TOPIC MODEL它比常见的提示词型 Skill 多出来什么

很多公开的内容 Skill 已经会提醒模型搜索、引用、分析受众和生成标题。这些能力有价值,但从“会执行一段说明”到“能承担选题决策”,中间还差几层。

第一是数据合同。每条证据必须有身份、时间、来源和去重关系。

第二是不确定性。系统保存后验、有效样本量和分歧,不把 82 分伪装成事实。

第三是拒绝权。证据不足时可以输出 0 个主选题,而不是为了完成任务凑满十条。

第四是组合决策。它不只选单个高分题,还考虑一周内容之间的重复、风险和探索预算。

第五是可校准。每个参数都有版本,后续结果可以证明它有用,也可以证明它错了。

所以更准确的比较不是“这套 Skill 更会写”,而是它从提示词升级成了一套有数据资格、统计估计、失败语义、人工门槛和历史校准的决策系统。

TOPIC MODEL真正搭起来,要把数学模型放进五个文件

如果你准备照着做,我建议不要先写一个几千字的超级提示词,然后期待 AI 每次都记住所有规则。

更稳的办法,是先建一个项目文件夹,把模型拆成五个长期保存的文件。

  • evidence.csv:保存候选题和原始证据。每一行至少要有候选题、平台、原文、链接、作者、父帖、发布时间、采集时间、互动量、是否直接疑问和风险标签。
  • feature_dictionary.yaml:保存字段定义。写清每个指标是什么意思、从哪里来、缺失时怎么办,以及 0、0.5、1 分别代表什么。它解决的是“这次的 0.8 和下次的 0.8 是否还是一回事”。
  • model_config.yaml:保存半衰期、先验、七维权重、风险扣分、MMR 参数和版本号。以后每次改参数都新增版本,不覆盖旧值。
  • topic_scores.csv:保存每次运行结果。除了优先级,还要保留证据数量、n_eff、后验均值、P10、七维子分、风险、成本、分歧、状态、淘汰原因和建议动作。
  • outcomes.csv:保存发布后的真实结果。至少记录发布时间、平台、内容类型、主要指标、护栏指标、是否达到事先定义的成功标准,以及当时使用的模型版本。

这五个文件把一次性的 AI 对话,变成了可以复跑的项目。

第一次使用时,把过去 30—90 天能合法获得的候选证据放进 evidence.csv,再让 Codex 检查字段、去重、计算和生成选题报告。先看被拒绝的题为什么被拒绝,再看排在前面的题。因为一套模型是否可靠,不只体现在它选中了什么,也体现在它能不能清楚解释为什么暂时不选。

选题发布以后,把真实结果写回 outcomes.csv。下一轮模型读取的是“上次判断 + 后来发生了什么”,而不是只读取新的热搜。这样才会逐渐形成账号自己的先验。

模型也要分阶段使用。

  • 还没有 30 条统一口径的发布结果时,只运行证据门槛、稳健标准化、Beta 后验、保守排序和周组合,不输出所谓的爆款概率。
  • 有了 30—50 条以后,开始做时间切分验证和概率校准,但仍以简单、可解释的权重模型为主。
  • 数据继续增加以后,再比较逻辑回归或树模型是否真的改善验证集结果。如果复杂模型没有连续改善主要指标,或者恶化了护栏,就继续使用简单模型。

复杂,不等于科学。能留下版本、接受反证、在数据不足时拒绝下结论,才更接近科学。

TOPIC MODEL最后:AI 真正该替创作者管理的是不确定性

自媒体选题不会因为有了数学模型,就变成一道有标准答案的题。

平台会变,用户会变,账号本身也会变。数学能做的,是让这些变化不再隐藏在一句“我感觉这个题不错”里。

把事实和判断分开,把均值和不确定性分开,把热度和账号适配分开,把单题排序和周组合分开,把模型建议和人工发布分开。

当这些边界都被写进流程以后,Codex 才不只是帮人多生成一些标题。它开始替创作者保存证据、暴露风险、计算代价,并在信息不足时主动停下来。

这套系统最后给出的,不是一个神奇的爆款答案。

它给出的是一条更可靠的创作路径。

TOPIC MODEL最后,给你一份可以直接交给 Codex 的提示词

使用时,把下面的方括号内容换成自己的项目路径、平台和内容类型。如果你还没有 CSV,也可以先把已有链接、评论和选题记录放进一个文件夹,让 Codex 先生成字段模板。

你现在不是文案生成器,而是我的“自媒体选题决策系统构建者”。  项目目录:[填写项目目录] 主要平台:[例如微信公众号 / 小红书 / 抖音 / 知乎] 内容领域:[填写垂直领域] 主要内容类型:[例如长文 / 图文 / 口播视频] 主要业务目标:[只能选一个,例如有效阅读、收藏、关注、咨询或成交] 护栏指标:[例如取关、负面反馈、事实风险、制作成本或商业透支]  你的任务是读取项目目录中的候选题、原帖、评论、历史发布结果和已有配置,建立一套可复跑、可解释、允许拒绝输出的选题模型。先完成证据审计和计算,不要直接写文章,也不要为了凑数量生成候选题。  一、先检查输入  1. 检查是否存在 evidence.csv、feature_dictionary.yaml、model_config.yaml、topic_scores.csv、outcomes.csv。 2. 如果文件不存在,创建模板和字段说明,但不得伪造数据。 3. evidence.csv 至少包含:topic_id、topic_object、user_question、platform、source_text、source_url、parent_id、author_id、published_at、evidence_at、engagement、direct_question、risk_tag。 4. outcomes.csv 至少包含:topic_id、published_at、platform、content_type、primary_metric、guardrail_metrics、success_label、model_version。 5. 发现关键字段缺失时,输出 missing-inputs.md,说明缺什么、影响哪一步、最小补充方法。关键证据不足时允许输出 0 个主选题。  二、处理证据  1. 按父帖、作者和语义近重复关系去重或聚类,不能把同一事件的转载当成多份独立证据。 2. 为每条证据计算:    w_e = q_source × d_time × r_direct × u_independence 3. q_source 表示来源质量;d_time 使用半衰期衰减 2^(-age/h);r_direct 表示是否直接回答用户问题;u_independence 表示独立性。 4. 计算有效样本量:    n_eff = (sum w)^2 / sum(w^2) 5. 同一个主题存在多个平台时,先在同平台、同内容类型、同时间窗内对互动量做 log(1+x),再使用 median 和 MAD 做稳健标准化。不要直接相加不同平台的原始点赞、评论或播放量。  三、估计需求而不是只数评论  1. 对直接疑问比例使用 Beta-Binomial 模型。默认使用 Beta(1,1) 弱先验;如果项目已有经过验证的先验,优先读取配置。 2. 保存后验均值、P10 保守下界和样本量。排期优先使用 P10,不只看均值。 3. 明确说明:搜索条件下的公开样本不是全体消费者民调,模型输出是选题优先级,不是爆款概率。  四、建立七维效用  为每个候选题计算 0—1 的七维分数,并逐项保存评分依据: D 需求强度、M 时效动量、V 读者价值、A 账号适配、F 可证与可制作、N 新颖度、B 经营承接。  如果没有本账号历史校准数据,先使用示例权重: D=0.24,M=0.12,V=0.20,A=0.18,F=0.12,N=0.08,B=0.06。  使用加权几何平均: U_i = exp[sum(a_j × ln(eps + s_ij))]  不要用简单加法掩盖接近零的读者价值、账号适配或可制作性。所有 LLM 主观评分必须同时给出理由、证据和不确定区间,不能把文风适配写成客观事实。  五、让不确定性进入排序  1. 为存在不确定性的输入建立合理分布,运行至少 2000 次 Monte Carlo 抽样。 2. 保存 U 的均值、中位数和 P10。 3. 计算保守优先级:    Priority_i = 100 × P10(U_i) - 15R_i - 8K_i - 10G_i 4. R 是事实、合规、争议和品牌风险;K 是制作成本;G 是不同模型或人工判断之间的分歧。三者都归一化到 0—1。 5. 如果使用 Grok、Codex、Gemini 分工:Grok 只提供公域候选和内容 DNA;Codex 负责证据审计、计算和状态分配;Gemini 只对 Top-K 候选做表达适配复核或成文。不要向外部模型发送受保护的逐字语料。  六、分配动作,而不是只给总分  将候选题分为:主选题、验证题、探索题、暂缓题。  主选题必须同时满足数据资格、风险门槛和最低证据要求。证据不足但潜力较高的题进入验证题,并列出下一步要补的来源或问题。新颖但不确定的题进入探索题。硬门槛失败的题进入暂缓题,高总分不能抵消硬门槛。  生成周计划时,使用 MMR 做多样性重排: MMR = lambda × Priority - (1-lambda) × max_similarity 默认 lambda=0.75,并限制同一主题家族、同一问题轴和同一内容形式的重复数量。  七、输出文件  请生成: 1. topic-scores.csv:全部候选及完整中间量; 2. selected-topics.md:主选题、验证题、探索题和暂缓题; 3. evidence-gaps.md:每个候选缺少的证据及最小补采动作; 4. weekly-plan.md:经过 MMR 重排的周计划、选择理由和备选题; 5. model-report.md:本次数据范围、公式、参数版本、假设、限制、拒绝原因和相对上一版的变化; 6. model_config.yaml:可复用的参数与版本记录。  八、使用真实结果校准  1. 如果 outcomes.csv 少于 30 条统一口径记录,不训练复杂预测模型,不输出精确成功概率。 2. 样本达到要求后,按时间切分训练段和验证段,禁止用同一批数据一边调参一边证明有效。 3. 如果输出概率,报告校准曲线和 Brier Score,并同时检查主要指标和护栏。 4. 新参数只有在连续两个验证窗口改善主要指标且没有恶化护栏时,才升级为正式版本;否则回退并保留失败记录。  现在先扫描项目目录,列出已找到的文件、可计算字段、关键缺口和执行顺序。确认数据足够后再运行模型;不确定的地方要显式标记,不得自行补造事实、链接、指标或历史结果。

编者提示一:这篇内容对普通读者最直接的用法,是把它当作一次可以照着跑的 AI 工作流示范。建议先挑文中提到的一款工具(如 ChatGPT、Claude、Grok Bot 或对应的开源模型),把作者演示的输入、配置和调用步骤在自己的写作、编程或日常办公任务上小规模复现一遍,再评估生成结果与投入时间的性价比。

编者提示二:如果你正在用 AI 提升效率或探索第二收入,读这篇时建议带着三个问题:作者具体输入了什么材料、做了哪些设置与测试、最终输出了什么可交付的成果。把这三点套用到自己的场景,能快速判断这套方法是否值得迁移。

所属专题

本文收录于以下专题:

  • Codex 从入门到精通

原文信息

作者:伯岩(@yvchengshanren)

原文地址:

所属专题

Codex 从入门到精通

从零开始掌握 OpenAI Codex——AI 编程工程 Agent。14 章覆盖认识 Codex、四种入口安装、核心功能(自动化/插件/Skill/MCP/Git/记忆)、标准工作流、实战案例和第三方模型接入。

文章评论(0

暂无评论,快来抢沙发~