跳转到主内容
趣航编程网 - 趣学编程,启航技术之路!

ClawBot怎么做数据统计分析哪些问题被问得最多?

应启用日志分析、聚类流水线、SQL追踪、大模型归纳及网络诊断五种方法:一、解析JSONL日志提取提问文本并词频统计;二、用OpenClaw聚类识别语义意图;三、通过SQL连接器实时多维分析;四、调用千问3.5-9B归纳高频问题类别;五、用Clawdbot捕获协议异常流量以过滤无效提问。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜如果您正在使用ClawBot作为AI代理接入微信等消息平台,但希望了解用户最常咨询的业务问题类型,从而优化知识库或调整应答策略,则可能是由于原始对话日志未结构化、缺乏关键词聚合能力或未启用统计插件所致。以下是实现该目标的多种方法:

一、启用内置对话日志分析模块

ClawBot默认将所有进站消息与响应记录至~/.weclaw/weclaw.log,该日志为结构化JSONL格式,每行一条完整会话记录,包含timestamp、from_user、message_text、response_text等字段,可直接用于高频问题提取。

1、确认日志文件存在且可读:ls -lh ~/.weclaw/weclaw.log 2、提取最近7天内全部用户提问文本(排除系统消息与空内容):grep '"message_text":' ~/.weclaw/weclaw.log | jq -r '.message_text | select(length > 5)' | head -n 10000 > questions.txt 3、执行中文分词与词频统计(需安装jieba):python3 -c "import jieba; from collections import Counter; c=Counter(); [c.update(jieba.cut(l.strip())) for l in open('questions.txt')]; [print(k,v) for k,v in c.most_common(20) if len(k)>2 and k not in ['的','了','和','是']]"

二、部署OpenClaw数据清洗与聚类流水线

OpenClaw提供data-analyzer技能包,支持对原始对话文本进行去噪、实体归一化与语义聚类,能自动识别“查余额”“改密码”“重置登录”等意图类别,而非仅依赖字面词频,避免同义不同形导致的统计偏差。

1、安装分析技能:clawhub install data-analyzer 2、准备对话样本集:从weclaw.log中导出含message_text字段的CSV,字段名设为text,保存为dialogues.csv

3、运行聚类任务:

openclaw exec --skill data-analyzer --input dialogues.csv --method cluster --k 8 --output top_questions.json 4、查看聚类结果中各簇中心句及成员数量:jq '.clusters[] | {center: .center_sentence, count: .size, sample: .sample_messages[0]}' top_questions.json

三、配置SQL连接器实现实时问题追踪

通过clawbot-sql-connector将每条用户提问持久化写入数据库,配合时间分区与全文索引,可支撑按日/周/业务线多维下钻分析,并支持LIKE模糊匹配与正则提取特定问题模式(如含“什么时候”“几点”“多久”的时效类问题)。

1、在config.yaml中启用to_database开关并配置MySQL连接参数OpenClaw开源的自托管AI智能体助手,曾用名Clawdbot、Moltbot下载2、确保数据库中已存在question_log表,含id、timestamp、user_id、raw_text、intent_label、is_faq_match字段3、执行高频问题SQL查询:SELECT SUBSTRING_INDEX(raw_text, ' ', 10) AS prefix, COUNT(*) AS freq FROM question_log WHERE timestamp >= DATE_SUB(NOW(), INTERVAL 7 DAY) GROUP BY prefix ORDER BY freq DESC LIMIT 15

四、调用千问3.5-9B模型进行意图归纳总结

当原始问题表述高度分散(如“我钱没了”“账户余额显示为0”“为什么扣了我500”),传统词频统计难以归并,此时可借助本地部署的千问3.5-9B模型,对Top 100问题样本进行自然语言归纳,输出标准化问题类别及典型示例。

1、启动OpenClaw网关并绑定千问模型:openclaw gateway --model qwen 3-9b --port 18789 2、构造归纳提示词并提交API请求:curl -X POST http://localhost:18789/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"qwen3-9b","messages":[{"role":"user","content":"以下是一组用户提问,请归纳出5个最高频的问题类别,每个类别给出名称、定义和2个原始样例。提问列表:[\"怎么修改手机号\",\"手机号换号了怎么更新\",\"换绑手机要几步\",\"新号码怎么绑定\",\"如何更换预留号码\"]"}]}'3、解析返回JSON中的choices[0].message.content字段,提取结构化归纳结果

五、使用Clawdbot网络诊断工具捕获微信协议层问题分布

部分“被问最多”的问题实为客户端异常触发,例如微信端因iLink协议握手失败反复发送“你好”“在吗”“?”等试探消息,此类无效流量若未过滤将严重干扰真实问题统计。Clawdbot网络诊断工具可抓取并标记协议异常会话,供后续清洗。

1、启用TCP流捕获:clawdbot network capture --filter "tcp port 8080 and host $(hostname -I | awk '{print $1}')" --duration 300 2、分析握手失败会话特征:clawdbot network analyze --report handshake-failures --log clawdbot.pcap 3、生成需剔除的用户ID列表:clawdbot network export --type failed-handshake-users > blocked_users.txt

相关文章