| 数据集 | 特点 | 信号 |
|---|---|---|
| 模型数据集(model) | 大多是分数形式 | |
| 基本面数据 | 1. PE(市盈率) = eps/close2. PS(市销率) = close*sharesout/revenue3. cashflow/price 4. cashflow/sales 5. margin, pretax margin, operating margin 6. enterprise value 7. long term debt/operating income |
|
| 风险数据 | 1. 用risk factor做neutralize 2. 用risk-return 代替returns 3. |
|
| 量价数据 | 完整, 所有市场都有 | 1. 交易量激增(volume spike) 2. -returns |
| 社交媒体数据 | 更新频率高 有时效性: 尽量不要超过1季度 |
|
| 期权数据集(Options) | 1. IV_call, IV_put配对 | |
| 分析师数据 |
很多是vector数据 更新频率低 有很多异常值 |
1. 预测和当前值的差异 2. 预测值随时间变化 3. 分析师修订模型数据 |
| 宏观数据(Macro) | ||
| other数据 | 1. group分类数据 2. 用matrix 特征数据自己制作group |
|
| 期权数据 | 1. O/S volume ratio=期权未平仓量/volume |
- risk, analyst, model里和基本面, 量价类似字段可以用
| exceed pair | operator | ||
|---|---|---|---|
| 突变的部分 | data | mean_datagroup_mean(.,ts_mean(cap,21)) |
ts_regression(rettype=0) ts_regression(rettype=2) |
| ir | mean | stddev | |
| 数据去风险相关/ 实际数据和市场认知偏离 |
data | risk | |
| positive data | negative data | ||
| 时间 | long-term data | short-term data | |
| current data | delay data | ||
| estimate data - 分析师预测 - 模型预测 |
actural data | ||
| pv - returns - close |
data | ||
| 影响因子 | data | part_data |
| correlation pair | operator | ||
|---|---|---|---|
| pv | news | ||
| pv | pv |
模型
- 资本定价模型(CAMP):
- return预测
- actural data: returns
- mean data: group_mean(returns, ts_mean(cap, 21)
- 戈登增长率(Gordon Growth Model): 假设股息以恒定增长率永久增长 -> 只适用于稳定、成熟且股息增长可预测的公司
- 股价预测 pair(量价)
- actural data:
ts_mean(close,21) - model data: $\frac{D(预期下一年度股息)}{r(预期回报率)-g(估算的股息增长率)}$
- r : 可以由CAPM(资本定价模型) 优化
- $r=R_f + beta\cdot(R_m-R_f)$ $R_m$ 是原始预期市场回报率 $R_f$ 是无风险利率(可以忽略)
- g: 由 $g=b\cdot ROE$ 留存率和股本回报率计算
- D: 可以由 $D(t=1)=D(t=0)\cdot (1+g)$ 当前股息(dividend), 和估算的股息增长率计算
- r : 可以由CAPM(资本定价模型) 优化
- PEG比率: 默认增长率恒定,适用于盈利可预测的行业(如消费、科技),但对周期性行业需调整预期
- actural data: $PE(市盈率)=\frac{close}{eps(每股收益)}$
- model data: $G=\frac{E(t=1)-E(t=0)}{E(t=0)}$ 预期盈利增长率, 预期下一年盈利对本年盈利的returns
- 杜邦分析(DuPont Analysis Framework):
- 影响因子
- actural data: ProfitMargin(利润率)= 净利润 / 销售额
- model data: ROE=净利润/股东权益