数据集 特点 信号
模型数据集(model) 大多是分数形式  
基本面数据   1. PE(市盈率) = eps/close
2. PS(市销率) = close*sharesout/revenue
3. cashflow/price
4. cashflow/sales
5. margin, pretax margin, operating margin
6. enterprise value
7. long term debt/operating income
风险数据   1. 用risk factor做neutralize
2. 用risk-return 代替returns
3.
量价数据 完整, 所有市场都有 1. 交易量激增(volume spike)
2. -returns
社交媒体数据 更新频率高
有时效性: 尽量不要超过1季度
 
期权数据集(Options)   1. IV_call, IV_put配对
分析师数据
很多是vector数据
更新频率低
有很多异常值
1. 预测和当前值的差异
2. 预测值随时间变化
3. 分析师修订模型数据
宏观数据(Macro)    
other数据   1. group分类数据
2. 用matrix 特征数据自己制作group
期权数据   1. O/S volume ratio=期权未平仓量/volume
  • risk, analyst, model里和基本面, 量价类似字段可以用
exceed pair     operator
突变的部分 data mean_data
group_mean(.,ts_mean(cap,21))
ts_regression(rettype=0)
ts_regression(rettype=2)
ir mean stddev  
数据去风险相关/
实际数据和市场认知偏离
data risk  
  positive data negative data  
时间 long-term data short-term data  
  current data delay data  
  estimate data
- 分析师预测
- 模型预测
actural data  
  pv
- returns
- close
data  
影响因子 data part_data  
correlation pair     operator
  pv news  
  pv pv  

模型

  • 资本定价模型(CAMP):
    • return预测
    • actural data: returns
    • mean data: group_mean(returns, ts_mean(cap, 21)
  • 戈登增长率(Gordon Growth Model): 假设股息以恒定增长率永久增长 -> 只适用于稳定、成熟且股息增长可预测的公司
    • 股价预测 pair(量价)
    • actural data: ts_mean(close,21)
    • model data: $\frac{D(预期下一年度股息)}{r(预期回报率)-g(估算的股息增长率)}$
      • r : 可以由CAPM(资本定价模型) 优化
        • $r=R_f + beta\cdot(R_m-R_f)$ $R_m$ 是原始预期市场回报率 $R_f$ 是无风险利率(可以忽略)
      • g: 由 $g=b\cdot ROE$ 留存率和股本回报率计算
      • D: 可以由 $D(t=1)=D(t=0)\cdot (1+g)$ 当前股息(dividend), 和估算的股息增长率计算
  • PEG比率: 默认增长率恒定,适用于盈利可预测的行业(如消费、科技),但对周期性行业需调整预期
    • actural data: $PE(市盈率)=\frac{close}{eps(每股收益)}$
    • model data: $G=\frac{E(t=1)-E(t=0)}{E(t=0)}$ 预期盈利增长率, 预期下一年盈利对本年盈利的returns
  • 杜邦分析(DuPont Analysis Framework):
    • 影响因子
    • actural data: ProfitMargin(利润率)= 净利润 / 销售额
    • model data: ROE=净利润/股东权益