Chapter 12
選択バイアス:観測に入る歪みの分解
12.1 問題設定
第I部の枠組みを実企業に適用しようとすると、 比較の出発点に系統的な歪みが入り込む。この歪みは単一の「バイアス」ではなく、 性質の異なる少なくとも八種の問題の混合である。以下ではそれを分解し、 対処可能なものと原理的に不可能なものを区別する。
12.2 生存条件づけ:枠組みの循環
観測可能な企業とは、制約(4.3)を破らなかった経路の実現値である。 倒産時刻を とすると、我々が観測するのは
| (12.1) |
であって ではない。そして を決めているのは、まさに推定対象である である。 構造は図12.1のとおりである。
は と外生的衝撃 の共通の帰結、すなわち合流点である。 合流点で条件づけると、本来独立な二つの原因の間に相関が生じる(Berkson のパラドックス)。
12.2.1 歪みの向きは条件づけの対象で反転する
これは実務上重要な区別である。
生存で条件づける場合。 生存企業のうち、不利な を持ちながら存続した企業は が良好だった企業である。 したがって生存サンプルでは の劣位が の優位で相殺されて見え、 構造の効果は過小推定される。 であることの不利は、 存続企業のみを見ていると実際より小さく見える。
成功(有名さ)で条件づける場合。 こちらは事情が異なる。成功企業のみを収集すると、 同じ を持ちながら失敗した企業が標本から完全に消えるため、対照群が存在しない。 過小推定ではなくそもそも推定が不可能であり、 と を分離する情報が標本内に存在しない。
両者を同一の「生存バイアス」として扱うと、この差が見えなくなる。
12.3 開示選択:調べたい軸との相関
上場・開示は無作為な選択ではない。式(5.6)より、 の企業は が存在せず成長を自己金融できるため、 外部資本市場に出る必要が原理的に薄い。 逆に が大きく正の企業は外部資本を要し、上場に押し出されやすい。
すなわち選択確率が、まさに推定対象の関数になっている。 選択確率 は の増加関数となる傾向を持つ。 したがって上場企業データベースで観測される の分布は、母集団の分布から系統的に、 かつ予測可能な方向にずれている。
12.4 年齢:バイアスではなく定義域の問題
設立初日の企業と数年経過した企業を比較できないという問題は、性質が異なる。 式(5.1)は定常状態を仮定して導かれており、 ではゼロ除算となって定義されない。
したがってこれはバイアスではなく枠組みの適用範囲の問題である。 対処法も異なる。バイアスなら補正するが、定義域の問題であれば宣言するしかない。 具体的には次のいずれかを取る。
- (1)
- が安定した領域に対象を限定し、閾値を明示する。
- (2)
- 過渡状態を別の変数系で明示的にモデル化する。
- (3)
- 分析単位を企業から に下げ、 ごとの成熟度で判定する(第12.10.3節)。
補正係数を導入して定常状態の式を無理に適用することは、最も避けるべき対処である。
12.5 年齢・時点・コホートの識別不能性
企業を観測したとき、三つの時間が同時に効いている。設立年をコホート 、 観測年を 、年齢を とすると(本節は Age–Period–Cohort 文献の記法に従う。 は本節に限りこの意味であり、本稿の他の用法とは無関係である)、
| (12.2) |
が恒等的に成立する。式(12.2)により三変数は線形従属であり、 三つの効果を同時に識別することは、外生的な制約を追加しない限り不可能である。 これは Age–Period–Cohort 問題として人口学および疫学で長く議論されてきたが、 一般的な解決は存在しない。
したがって「ある年代のある業種の が良好なのは、 によるのか、若さによるのか、 当時の金融環境によるのか」という問いには、データのみでは答えられない。 いずれかの効果をゼロと置くなどの識別仮定を明示し、 結論がその仮定にどれだけ依存するかを示すほかない。
12.6 事後的物語化
成功した企業の の記述それ自体が汚染されている。 構造は成功を説明するように語り直されるため、 という説明変数の測定にバイアスが入る。 これは従属変数側の補正では除去できない。
第I部で述べたとおり、 の多くは設計の産物ではなく業態の性質として生じ、 事後に金融的機能が認識されたものである。 一次資料(当時の開示、契約書、報道)と回顧的記述を区別することが最低限の対処になる。
12.7 単位の取り違え:行が指す対象と値が指す対象
前節までは標本の選択に関する歪みであった。 取得の段階には別種の失敗がある。
一行が指す対象と、その行の値が指す対象は、一致するとは限らない。 公表される一覧が下位の単位で行を立てながら、 数値は上位の単位で報告されている場合、 値は同じ上位単位に属する全ての行に複製される。 この一覧をそのまま観測とみなせば、 下位の単位を多く持つ対象がその数だけ重複して効く。
欠損は出力から検出できるが、この取り違えは検出できない。 値が揃っているため収集後の点検を通過する。 第15.3.5.0節にこれが結論を反転させた例を記録する。
対処は一つしかない。 値が報告されている単位を確認し、その単位で名寄せする。 名寄せは前処理ではなく、結論を決める手続きである。
12.8 変数の選択:欠落は無作為でない
以上は標本と同定に関する歪みであった。 どの変数が観測できるかについても同型の問題が生じる。
理論的関心の高い領域ほど測定が難しい、という相関がありうる。 制度が集中的に介入した分野は、当局がそこに問題があると判断した証拠であり、 理論の関心も同じ場所に向かう。ところが介入を要するほど取引形態が不安定な分野では、 まさにその不安定さのために集計値から必要な量を算出できないことがある (注15.3)。
データの欠落を無作為と扱えば、最も知りたい領域が系統的に標本から抜ける。 本章の他の節が扱うのは標本の選択であるが、これは変数の選択であり、 標本側の補正では対処できない。 欠落がどの領域に集中しているかを記述するほかない。
12.9 観測フレームの実際
日本を対象とする場合の規模感を示す。
| 母集団 | 規模 | 出典・注 |
| 企業数(中小企業庁ベース) | 約 360 万 | 経済センサスの再編加工。一次産業等を除く |
| 企業数(国税庁ベース) | 約 640 万 | 個人事業主約 379 万を含む |
| 上場企業 | 3,975 社 | 2026年8月27日時点 |
| 日常的に言及される企業 | 数百社 | 全体の の桁 |
上場企業は全体のおよそ 0.1%、有名企業は 0.01% 以下である。 「様々な企業」と述べるとき、どの母集団を指しているかが決定的に効く。
ただし網羅性は規模を保証しない。 全数のフレームが得られても、母集団自体が小さければ検定力は得られない。 第15.3.5.0節では、全数取得が可能でありながら 60–70者にとどまる母集団を扱う。 網羅性と規模は独立の要件であり、両方を確認しなければ調査の見込みは立たない。
12.10 対処方針
対処可能なものと不可能なものを分けて列挙する。
12.10.1 フレームを事前に宣言し、前向きに追跡する
「有名企業を集める」のではなく、「基準時点 に存在した特定業種の全事業者」を定義し、 そこから前方に追跡する。こうすると生存は隠れたフィルタではなく観測される従属変数になり、 第12.2節の合流点条件づけが回避される。
利用可能なフレームとして、日本では経済センサス、 帝国データバンクおよび東京商工リサーチのデータベースがある。 欧州では Orbis が非上場企業を広く含む。 米国は開示義務が緩いため非上場データが相対的に弱く、 この点では日欧のほうが条件が良い。
12.10.2 失敗側を明示的に収集する
倒産は官報および信用調査会社の集計によって観測可能である。 分母を構成できるならば、生存バイアスは推定可能な選択モデルに変わる。
12.10.3 分析単位を企業から に下げる
これが最も効果の大きい対処である。 第2章の定義より、 は契約レベルの対象であり、企業はその束である。 大規模企業は通常、 の符号すら異なる複数の を並行して運用している。 企業単位で を計算することは、これらを混合した平均を見ることに等しい。
分析単位を に下げることで、
- 年齢問題が部分的に解消される(成熟企業内の新しい を扱える)
- 観測数が増える
- 「企業」という制度的人工物の影響を減らせる
12.10.4 産業分類ではなく制約の形でグルーピングする
産業分類は特定時代の産業観を固定したものであり、国によっても定義が異なる。 第I部の枠組みが名指しした構造的特徴、すなわち
でグルーピングすれば、業種と時代をまたいだ比較が意味を持つ。 理論を構成した見返りはここにある。
12.10.5 除去できないものは符号を明示する
第12.5節の識別不能性と第12.6節の物語化は除去できない。 ただし方向を明示することはできる。 「この推定値は構造の効果を過小に見積もっている」 「この の記述は事後的合理化を含む可能性が高い」と述べれば、 結論の頑健性は判断可能になる。
12.10.6 有名企業の使用規則
以上より、次の規則を置く。
有名企業は例示に用い、推論には用いない。
構造の説明として個別企業を挙げることは許容される。 成功例の存在から構造の優位を結論することは許容されない。