传统话语研究依赖手动采集和人工编码,效率低下、难以保证系统性,团队协作缺少统一框架。
四大核心模块,支撑话语研究的完整生命周期
整合 RSS、NewsAPI、GDELT 和搜索引擎四大数据源,覆盖 BBC、Guardian、NYT、WSJ、Economist、Reuters 六家主流媒体。智能去重、时间过滤、付费墙检测。
基于大语言模型的预读分析流水线,自动提取摘要、情感倾向、话语框架、关键术语、叙事结构。为编码者提供结构化参考。
支持任务分配、单人编码、双人编码等多种工作模式。内置 Cohen's Kappa 系数计算,实时评估编码者间一致性。
框架分布饼图、时间线图、媒体热力图等可视化分析。内置词频统计、N-gram 分析、搭配分析、KWIC 检索、文体统计,满足话语研究量化需求。
从架构到细节,为学术严谨性提供技术保障
Readability, JSON-LD, Firecrawl, Jina AI, Archive.today 逐级回退,确保正文提取成功率
RSS 源连续失败 5 次自动跳过,防止无效请求,保障系统稳定性
时间过滤 + URL 标准化 + SHA-256 去重,三阶段校验确保数据质量
数据访问层抽象,Client 注入实现跨环境复用,隔离厂商锁定风险
OutSight 专为话语研究者打造,从语料采集到统计分析,提供完整的工具链支持。