
360智见 GEO
诊断报告模块
AI 搜索成了新的流量入口。我负责诊断报告模块,验证「监测—优化—报告」闭环在 B 端跑得通。
01 年生,北京工业大学土木工程硕士,本科毕业于聊城大学,两段学业都在专业前列。 研究生阶段做深度学习预测建模,以一作发表 SCI 一区 Top 期刊论文一篇。 也正是那段经历让我想换个位置——比起把模型调得更准,我更想解决「怎么让它真的被人用起来」, 所以转做了 AI 产品。
两段 AI 产品实习:
一个个人项目:
习惯先把指标口径讲清楚,再讲数字;能自己动手把原型跑起来。

不是工具清单,是四件能独立交付的事。
需求调研 → 优先级排序 → 方案设计 → 开发跟进 → 上线交付 → 迭代优化,跑过完整闭环。
RAG 知识库、Prompt 工程、Agent 与 Workflow 设计;结合业务做模型选型与效果对比,不凭感觉选模型。
Python / SQL 数据处理分析,能设计埋点、搭评测集,把「效果好不好」变成可复算的口径。
Claude Code / Dify / Figma Make / MCP:能自己把原型做出来给团队看,而不是只画图等排期。
点开任意一张卡片,看完整的背景、我的动作、和我对结果的判断。

AI 搜索成了新的流量入口。我负责诊断报告模块,验证「监测—优化—报告」闭环在 B 端跑得通。

结构设计师建模全靠鼠标点选。我把它做成一句话交互:Dify「1主+3子」Agent 架构。

从想法到线上产品全是我一个人做的:需求、架构、前后端、部署、兜底策略。
VMD-SSA-ATT-BiLSTM 混合模型,配 SHAP 可解释性分析与完整消融实验。
从工程与数据训练出来的习惯:先定标准,再谈结果。这套方法一路带进了 AI 产品。
高数、线代、概率统计、人工智能导论。第一次接触模型和数据,也是第一次发现自己更喜欢「解释结果」而不是只算出结果。
数值分析、数据分析、模式识别与机器学习、人工智能原理、工程项目管理。用 VMD-SSA-ATT-BiLSTM 做预测建模,配 SHAP 与消融实验,发表顶刊一篇。
竞品分析与用户访谈定切入点,Dify 搭「1主+3子」Agent 架构,3 个候选模型在 40 条测试集上三维度对比选型,建 badcase 归因闭环。
从 0 搭诊断报告模块:模型选型、RAG 配置、结构化输出规则、三指标定义,并用 40 个长尾词 × 6 个 AI 平台验证优化前后效果。
没有团队、没有排期,从需求到部署一个人做完。这个项目让我明白:产品经理会动手,沟通成本会低一个量级。
面试聊完项目,总还得聊聊人。
assets/photos/,命名 01.jpg ~ 08.jpg,刷新页面自动替换(顺序对应上面八格)。生成提示词见文件夹里的「照片提示词.md」。
求职意向:AI 产品经理 · 2026 应届,一周内到岗。
AI 搜索成为新入口后,企业需要在 AI 推荐结果里拿到合规、可量化、可归因的曝光。我负责其中的诊断报告模块——把「你在 AI 搜索里表现如何、差在哪、该怎么改」变成一份能交付给客户的报告。
2025 年下半年起,AI 搜索逐渐成为用户获取信息的主要入口,生成式引擎优化(GEO)成了企业新的流量增长点。用户越来越习惯直接问 AI「这类产品哪家质量好」,而不是打开搜索引擎翻十页——AI 只会说出它采信的那几家,没被采信的企业等于在这个入口彻底消失。
但客户想做这件事的时候,卡在三个很具体的地方:
诊断报告模块要解决的就是这三件事:把「你现在什么样、差在哪、明天该改什么」变成一份能直接交付给客户的报告。
这四步里我实际动手最多的是第 2、3 步:Agent 的模型选型与 RAG 配置、提示词的设计与迭代、以及报告输出规则的定义。第 1 步是配合产品团队做的,第 4 步的检测执行由系统完成,我负责定口径和读结果。
这部分是我觉得最值得讲的——每一条都是真踩过之后才加的规则。
三个指标 + 两类建议。指标定义先定,再谈提升,否则「涨了多少」没法复算。
客户最常直接执行的是建议部分:缺什么体裁、该投哪些信源,都带预估影响。整体形成闭环——评测诊断 → 缺口定位 → 策略建议 → 内容优化 → 再评测验证。
验证口径:随机选取 40 个长尾词,投放到 6 个 AI 平台,同一词表、同一时间窗口、同一批平台,优化前后各跑一次做对照(40 × 6 × 2 = 480 次检测)。内容上线至复采窗口 14 天。
下面是这个模块的界面演示稿,可以直接点——左侧导航切换平台各功能模块,页面里的按钮和分区都能操作。数据为试点客户口径示例。
演示稿在手机上不易操作,建议用电脑查看;也可以点右上角「新窗口打开」看全屏。
PKPM 里建模、布荷载、改模型全靠鼠标点选,效率低还容易出错。我要解决的核心问题是:把非结构化的一句话,稳定转换成建模与荷载参数。
PKPM 是国内结构设计师用得最多的软件之一。但在里面建模、布荷载、改模型,全靠鼠标一层层点选菜单——建一个 8 层框架结构,轴网、构件、层高要反复点几十次,改一个局部还得先在树状目录里翻到对应构件。
我先做竞品分析,调研广联达等国内建模产品的功能与定价;再通过用户访谈和问卷,归纳结构设计师的高频操作场景。最后锁定三件事作为 AI 切入点:
这三件事同时满足:发生频率高、操作步骤重复、输入本身可以用自然语言描述清楚。没有从最复杂的计算环节切,是因为计算涉及规范判定和责任归属,不是 AI 现阶段该碰的地方。
所以核心问题被定义成一句话:把非结构化的一句话,稳定转换成建模与荷载参数。
架构上拆成主 + 子而不是一个大 Agent:主 Agent 判断这句话属于哪类任务、抽取关键参数、缺参数时主动追问,再分派给对应子 Agent。
判断任务类型 → 抽取参数 → 缺参数主动追问 → 分派子 Agent。配套 RAG 知识库补齐领域术语与规范。
拆开的理由:三类任务的参数结构和校验规则差别很大,混在一个提示词里会互相干扰,也没法单独做回归测试。
这部分是我觉得最值得讲的——每一条都是真踩过之后才加的规则。
选取 3 个候选模型,在 40 条建筑建模测试集上评测,从三个维度对比后选定性价比最优的那个:
把准确率和成功率拆成两个指标,是因为它们坏在不同地方:抽错参数是理解问题,抽对了跑不完是执行链路问题,归因方式完全不同。
验证口径:构建真实业务场景测试集,统计四项指标。
下面是交互原型,可以直接点——左侧是构件树,右侧是属性面板,底部对话框可以看到「一句话建模」的完整交互过程。
这是桌面软件界面,手机上需要横向滑动;建议用电脑查看,或点右上角「新窗口打开」看全屏。
普通用户想要一个 3D 模型,得先学会一个专业软件。Lumode 把这件事压成一句话:输入描述,服务端出可编辑、可下载的模型。这个项目从需求到部署都是我一个人做的。
普通人想要一个 3D 模型,第一道门槛不是「想不出要什么」,而是「不会操作软件」。Blender 这类专业工具的学习曲线,把绝大多数有需求的人挡在门外。
市面上已有的文生 3D 工具,我用下来卡在三个地方:
所以我把产品目标压成两句话:零学习成本(浏览器里输入一句话,全程不接触本地建模软件)、结果可继续用(产出可编辑模型,能下载 .blend 带回自己的流程)。这个项目从需求、开发到部署都是我一个人做的。
核心架构决策是把 Blender 部署在服务端、通过 MCP 驱动。代价很直接:服务器成本和并发压力都归我;换来的是用户侧零安装。对「普通用户」这个目标人群,这个交换我认为是值的——装软件这一步会劝退的人,远比服务器账单更贵。
做的过程中我给自己定了两条铁律,它们后来救过我好几次:
前端绝不修改用户输入、也绝不美化后端产出。看到什么就是系统真实做出来的什么——否则我自己都没法判断模型到底行不行。
所有失败都落日志、可复现,不静默兜底掩盖问题。生成类产品的迭代速度,取决于你有多敢看自己的失败样本。
这一栏是这个项目对我价值最大的部分——它让我对「AI 产品的成本藏在工程细节里」有了非常具体的体感。四条都是真踩过之后才加的机制。
model 字段是不是真的那个模型。另外加一条硬性要求:生产接口必须国内可直连,不能依赖任何代理工具,否则上线即不可用。独立做项目最大的好处是每个取舍都得自己承担后果。三个我想清楚了才动手的:
需要先说清楚:这个项目我能验证的是工程可用性,不是商业效果。所以下面这几个数字都是可复核的部署与机制事实,不是用户数据。
服务端跑的是无界面 Blender,配了进程守护,崩溃和开机都能自动拉起,这一条我重启机器验证过。全链路从浏览器输入到拿到可下载的 .blend 文件是通的。

VMD-SSA-ATT-BiLSTM 混合模型,配 SHAP 可解释性分析与完整消融实验。放进作品集不是为了炫学术,而是因为我做 AI 产品的那套方法论就是从这儿来的。
盾构掘进会扰动周边土体,造成地表沉降。沉降一旦超出允许范围,就会损伤既有建筑,严重时引发工程事故。所以施工期间需要提前预测沉降趋势,把预警窗口留出来。
机器学习已经被广泛用来做这件事,但我在梳理已有模型时发现它们卡在同一个地方:
于是我把目标定成两条:先降噪再建模,以及预测完要能归因——不可解释的高分,在真实施工决策里没人敢用。
四个模块不是把时髦方法堆在一起,每一层都对应上面某一个具体痛点:
这一栏是这篇论文对我后来做产品影响最大的部分——每一条都是「怎么证明这个东西真的有用」的方法问题,不是模型技巧。
先说清楚是怎么验的,再看数字——这是我在产品工作里一直保留的习惯。
相比其他四个模型,VSA-BiLSTM 在误差类指标上全面下降、拟合类指标上全面上升(下面是均值的改善区间):
其中一个对照最能说明问题:VSA-BiLSTM 的 RMSE 比单独的 BiLSTM 低 32.7%——同样的主干网络,差距全部来自 VMD 降噪和 SSA 寻优这两层,这就把「提升是哪来的」回答清楚了。稳健性方面,泰勒图显示标准差比其他模型低 6.39–30.66%、相关系数高 6.67–31.91%、中心化均方根差低 28–64.7%,且 1000 次重采样后仍保持低 RMSE、高 R²。
完整方法、公式推导、消融实验与 SHAP 分析图都在原文里。发表于 Tunnelling and Underground Space Technology(Elsevier,第 168 卷,2026 年,文章号 107216),我是第一作者。