# Computer Science Achievement and Writing Skills Predict Vibe Coding Proficiency
> [!abstract] 概要
> 多くのソフトウェア開発プラットフォームが現在、大規模言語モデル(LLM)駆動型プログラミング、いわゆる「バイブコーディング(vibe coding)」をサポートしている。これは、ソースコードを直接編集することなく、自然言語でプログラムを指定し、観察された振る舞いから反復的に改良することを可能にする手法である。その導入が加速する一方で、このワークフローにおける成功をどのスキルが最もよく予測するのかについては、ほとんど知られていない。我々は、コンピュータサイエンス(CS)の達成度、領域一般の認知スキル、文書コミュニケーション能力の測定、およびバイブコーディング評価を完了した高等教育段階の学生(N = 100)を対象とする事前登録済みの横断研究を報告する。タスクは8名の専門家による合意形成プロセスを通じて精選され、商業ツールを模倣しつつ統制された評価を可能にする特注のバイブコーディング環境で実施された。我々は、文章作成スキルとCS達成度の双方がバイブコーディング性能の有意な予測因子であり、領域一般の認知スキルを統制した後でもCS達成度が有意な予測因子であり続けることを見出した。本研究の結果は、将来のソフトウェア制作者を支援するために、プロンプト作成とCS基礎のどちらを強調すべきかを含め、ツール設計や教育カリキュラム設計に知見を与える可能性がある。
## 論文情報
- **表題**: Computer Science Achievement and Writing Skills Predict Vibe Coding Proficiency
- **著者**: [[Sverrir Thorgeirsson]]*、[[Theo B. Weidmann]]*、[[Zhendong Su]](* 共同筆頭著者)
- **所属**: [[ETH Zürich]](スイス連邦工科大学チューリッヒ校)
- **掲載**: Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13–17, 2026, Barcelona, Spain. ACM, New York, NY, USA, 17 pages.
- **DOI / arXiv**: https://doi.org/10.1145/3772318.3791666 / arXiv:2603.14133v1 [cs.HC]
- **事前登録**: AsPredicted https://aspredicted.org/wg3h-dx9m.pdf (付随資料: https://doi.org/10.6084/m9.figshare.29509628)
## 概要
本研究は、ソースコードを一切直接編集・閲覧せず、自然言語プロンプトの対話と生成されたプログラムの振る舞い観察のみを通じて反復開発を行う「純粋なバイブコーディング(vibe coding)」において、どのような人間側のスキルがタスク達成度を決定するかを検証した実証研究である。
![[fig01-study-overview.png]]
*Figure 1: 本研究の概要図。文章作成スキルとCS達成度が、領域一般の認知スキルを統制した上でバイブコーディング能力とどのように関連するかを検証する。参加者はサンプルアプリケーションを確認し、LLMベースのエージェントに向けたプロンプトを作成し、生成されたアプリケーションをテストしてさらなる改良を行った後、最終アプリケーションが人間の評価者によって採点された。*
大学生100名を対象とした厳密な統制実験(Figure 1)の結果、コンピュータサイエンス達成度(CS達成度: $r = 0.386, p < 0.001$)および文章作成能力(writing skills: $r = 0.290, p = 0.003$)の双方がバイブコーディング性能の有意な予測因子であることが示された。特にCS達成度は、IQテストに相当する領域一般の認知能力(ICAR16)を統計的に統制した後でも有意な予測力を維持した(偏相関 $r = 0.281, p = 0.005$)。
本研究の主な貢献は以下の3点である:
1. **バイブコーディングを駆動するスキルの実証的解明**: CS達成度と文章作成スキルが独立にバイブコーディング性能へ寄与し、CS達成度は文章作成スキルの約2倍の独自分散を説明することを解明した。
2. **GUI指向バイブコーディング習熟度の審査済み評価タスク群**: 8名の専門家によるDelphi法に基づく合意形成により、明確な採点ルーブリックを伴う3つのタスクを策定した。
3. **LLMネイティブソフトウェア作成の研究プラットフォーム**: 商業ツール(Replit、Cursor、Lovable、Bolt)の構成を踏襲しつつ、コードを完全に隠蔽して統制評価を可能にする特注プラットフォームを構築・提供した。
## 問題設定
大規模言語モデル(LLM)の台頭に伴い、コードを書かずに自然言語で意図を伝えて動くソフトウェアを作るワークフロー、すなわち[[Andrej Karpathy]]が命名した「バイブコーディング」が急速に普及している。ReplitやLovableなどの商用プラットフォームでは、利用者の多くが直接コードを記述しない形態での開発を行っている。
しかし、この新しい開発形態において人間側に求められる資質やスキルについては実証的な知見が不足していた。特に以下の2つの能力の重要性が議論されていた:
- **文章作成スキル(Written Communication Skills)**: 自然言語による意図の伝達が唯一のプログラミング手段となるため、曖昧性を排除し、構造化された論理的な要求を記述する文章能力が不可欠とされる。一方で、現代の学生や成人の読解・記述力低下傾向が懸念されている。
- **コンピュータサイエンス達成度(Computer Science Achievement)**: コードを見ない場合であっても、問題分解や制御フロー、状態管理といったアルゴリズム的・計算論的思考様式がLLMへの適切な指示に必要とされる。
さらに、これらのスキルが単に領域一般の推論能力(一般知能・認知能力)の反映にすぎないのか、それとも個別の独立した寄与を持つのかを切り分ける必要があった。本研究は以下の3つのリサーチクエスチョン(RQ)を事前登録した:
- **RQ1(タスク種別の特異性)**: 文脈を持たず詳細な個別機能指示が必要な無文脈タスク(decontextualized task)では、文脈豊富なタスク(複製・機能追加)よりも文章スキルの関連が強くなるか?
- **RQ2(全体的関連と一般知能からの独立性)**: 文章スキルはバイブコーディング性能と正の相関を持つか?また領域一般の認知スキルを統制した後も相関は残るか?
- **RQ3(相対的予測価値)**: バイブコーディング性能の予測において、文章スキルとCS達成度の独自分散の寄与はどのように比較されるか?
## 提案手法
本研究では、バイブコーディングを評価するための特注研究プラットフォームを設計・開発した。商用プラットフォーム(ChatGPT、Replit、Cursor、Lovable、Bolt)の設計を分析した結果、多くのツールが「左側にチャット画面、右側に実行プレビュー画面」という共通構造を持つことを確認した。
![[fig04-vibe-coding-ui.png]]
*Figure 4: 研究で使用されたツールのユーザーインターフェース。コードを一切露出させないバイブコーディングパラダイムに従っている。左側にチャットボックス、右側にアプリのプレビュー画面を備える。左サイドバーにはタスク記述と残り時間を示すタイマーが含まれる。*
本研究プラットフォーム(Figure 4)は、商用ツールを模倣しつつ、以下の統制機能を組み込んでいる:
1. **コードの完全隠蔽**: 参加者が生成コードを読んだり直接手動編集したりして従来のプログラミング作業に戻ることを防ぎ、「純粋なバイブコーディング」の構成概念を厳密に測定する。
2. **モデル出力のぼかし表示**: エージェントが作業中であることを示す進行状況ストリームを表示するが、コードの可読性を排除するために意図的にぼかし(blur)を施した。
3. **バックエンドモデル**: 複数のLLMの比較テストの結果、高品質かつ高速に応答した Anthropic Claude Sonnet 4 を採用した。
4. **差分更新機構**: 全コードの再生成ではなく変更箇所の diff を返す方式を採用し、応答レイテンシを短縮した。
5. **機能探索追跡機構**: サンプルアプリケーションの探索において、参加者が必須機能をすべて試したかどうかを自動検知し、バナーで通知した(Figure 5)。
![[fig05-feature-feedback.png]]
*Figure 5: サンプルアプリケーションの探索中、参加者に対して対話・操作した関連機能の数に関するフィードバックバナー(例: 0 out of 2 features discovered)が表示される。*
## 新規性
本研究の新規性は、これまで俗称やマーケティング用語として消費されがちだった「バイブコーディング」という概念に対し、HCI(ヒューマンコンピュータインタラクション)および教育工学の立場から初めて心理測定学的・実験的なアプローチを適用した点にある。
- 従来のプログラミング支援研究が「コード自動補完」や「コード検査・編集を含むチャット」を対象としていたのに対し、本研究はコードを一切見ない「no-code variant」に焦点を絞ることで、自然言語による仕様記述と振る舞い観察のみに基づく能力を独立して抽出した。
- 8名の専門家による2段階Delphi法により、学際性・真正性・非自明な複雑性・文化公平性を備えた標準タスクセットを策定した。
- 一般知能(ICAR16)を統制変数として導入し、CS知識や文章力が一般推論能力の見かけ上の相関ではないことを厳密に検証した。
- プロンプトの質的評価ルーブリックおよび語彙多様性(HD-D、MTLD)による客観指標を導入し、文章作成能力がプロンプト品質を介して性能に結びつく媒介構造を解明した。
## 実験設定
実験はスイス連邦工科大学チューリッヒ校(ETH Zürich)の意思決定科学研究所(DeSciL)の統制実験室で実施された。参加者募集要件は、CS導入コースの修了、プログラミングでのLLM利用経験、英語力C1レベル以上とした。100名の大学生(女性56名、男性44名、平均年齢25.0歳、工学系51名、自然科学系20名、人文社会系11名、その他18名)が参加し、一人あたり1時間45分のセッションを実施した(報酬55スイスフラン)。
事前に10名の学生による予備実験(Pilot Study)を行い、各テストの制限時間(SCS1: 25分、ICAR16: 12分、エッセイ: 20分)とプラットフォームの安定性を確認・確定した。
本実験では、順序効果を相殺するために被験者をグループAとグループBに無作為に割り当て、テストバッテリーとバイブコーディングタスクをカウンターバランス順序で実施した(Figure 6)。
```mermaid
flowchart TD
subgraph GroupA["グループ A"]
A1["属性調査 (2分)"] --> A2["テストバッテリー (57分)<br/>(ICAR16: 12分 / エッセイ: 20分 / SCS1: 25分)"] --> A3["バイブコーディングタスク (45分)<br/>(複製: 15分 / 機能追加: 15分 / 無文脈: 15分)"]
end
subgraph GroupB["グループ B"]
B1["属性調査 (2分)"] --> B2["バイブコーディングタスク (45分)<br/>(複製: 15分 / 機能追加: 15分 / 無文脈: 15分)"] --> B3["テストバッテリー (57分)<br/>(ICAR16: 12分 / エッセイ: 20分 / SCS1: 25分)"]
end
```
*Figure 6: 実験フローを示す図。参加者はグループAとグループBに無作為に分割された。テストバッテリーとバイブコーディングタスク内の各測定順序は参加者ごとにランダム化された。*
### 評価尺度
1. **コンピュータサイエンス達成度(CS Achievement)**:
言語非依存(擬似コード)の検証済み標準テスト SCS1 から選定された12問サブセット(制限時間25分)を使用。定義問題4問、コード追跡4問、コード補完4問で構成される(Figure 3右)。
2. **領域一般の認知能力(General Reasoning Skills)**:
パブリックドメインの認知能力尺度 ICAR から16問サブセット(ICAR16、制限時間12分)を使用。論理推論、文字系列、3次元回転、行列推論(Figure 3左)の各4問で構成される。
![[fig03-assessment-items.png]]
*Figure 3: 評価尺度 ICAR16(左: Question 12 行列推論問題)および SCS1(右: Question 9 ループ追跡問題)の出題例。*
3. **文書コミュニケーション能力(Written Communication Skills)**:
大学言語センターの専門指導員2名が作成した課題とルーブリック(Figure 2)を採用。大学で学んだ技術的概念を非専門家の成人に向けて300〜450語で説明するエッセイを執筆(制限時間20分)。
- **採点カテゴリ**: (1) 読者に対する全体的効果、(2) 段落構成、(3) 文構造、(4) 文間の接続・結束性、(5) 語彙・文法の正確性と多様性(各5段階評価、各カテゴリ20点満点、合計100点)。独立した評価者2名が盲検採点し、差が大きい場合は第3評価者が裁定した。
*Figure 2: 本研究で導入された文書コミュニケーションスキルの採点ルーブリック。各下位項目は1〜5点で評価され、各カテゴリ最大20点、合計最大100点満点となる。*
4. **バイブコーディングタスク**:
Delphi法により8名の専門家パネルが選定した2つの真正タスク(試験日程スケジューラ、週末食事プランナー)と、意図的に日常的意味付けを排した1つの無文脈タスク(decontextualized task)の計3タスク(各15分制限)。専門家パネルによる評価平均値と四分位範囲(IQR)は Table 1 の通り。
| タスク | 学際性 | 真正性 | 難易度・挑戦性 | 目的の明瞭さ | 文化公平性 |
| :--- | :---: | :---: | :---: | :---: | :---: |
| Task 1: 試験スケジューラ* | 4.3 (1.0) | 4.4 (1.0) | 4.7 (0.5) | 4.3 (1.0) | 4.6 (1.0) |
| Task 2: 通貨計算機 | 4.3 (0.5) | 3.9 (2.0) | 3.7 (2.0) | 4.7 (0.5) | 4.4 (1.0) |
| Task 3: 食事プランナー* | 4.6 (0.5) | 4.1 (1.0) | 4.1 (1.5) | 4.6 (1.0) | 4.6 (1.0) |
| Task 4: 会議オーガナイザ | 4.3 (0.5) | 4.4 (1.0) | 3.7 (1.5) | 4.0 (1.5) | 4.6 (1.0) |
| Task 5: 部屋レイアウト構築 | 4.1 (0.5) | 3.3 (1.0) | 3.7 (1.5) | 3.9 (0.0) | 4.7 (0.5) |
| Task 6: 視線追跡アプリ | 3.7 (2.5) | 3.7 (2.0) | 3.7 (2.5) | 2.6 (2.0) | 3.7 (2.0) |
| Task 7: セレブリティ順位付け | 3.7 (1.0) | 3.3 (1.0) | 3.6 (1.0) | 4.6 (1.0) | 4.4 (1.0) |
| Task 8: コース登録基盤* | 4.4 (1.0) | 4.6 (1.0) | 4.3 (1.0) | 4.7 (0.5) | 4.9 (0.0) |
*Table 1: 5つの基準(学際性、真正性、挑戦性、目的の明瞭さ、文化公平性)に関する各提案タスクの専門家パネル平均評価と四分位範囲(括弧内)。研究に採用されたタスクにはアスタリスクを付記(Task 1とTask 8は類似していたため統合)。*
## 実験結果
測定された各尺度の記述統計を Table 2 に示す(全スコアは [0, 1] に正規化)。
| 測定尺度 | 平均値 (標準偏差) | 最小値–最大値 |
| :--- | :---: | :---: |
| SCS1 (CS達成度) | 0.53 (0.24) | 0.08–1.00 |
| ICAR16 (認知推論) | 0.56 (0.18) | 0.19–1.00 |
| 文章作成スキル | 0.72 (0.11) | 0.30–0.97 |
| バイブコーディングタスク(平均) | 0.45 (0.19) | 0.00–0.83 |
| - 複製タスク(Replication) | 0.46 (0.32) | 0.00–1.00 |
| - 機能追加タスク(Feature Addition) | 0.55 (0.23) | 0.00–1.00 |
| - 無文脈タスク(Decontextualized) | 0.34 (0.26) | 0.00–0.83 |
*Table 2: 各測定尺度の記述統計量(平均値、標準偏差 SD、最小値–最大値)。すべてのスコアは最大値を1として正規化。*
### 相関分析とリサーチクエスチョンの検証
主要尺度間のピアソン相関係数および認知能力を統制した偏相関係数を Table 3 に示す。
| 尺度 | CS達成度 | 認知推論能力 | 文章作成スキル |
| :--- | :---: | :---: | :---: |
| 認知推論 (Cog.) | 0.417 ($p < .001$) | - | - |
| 文章作成スキル (Writing) | 0.126 ($p = .213$) | 0.365 ($p < .001$) | - |
| バイブコーディング (Vibe) | 0.386 ($p < .001$) | 0.352 ($p < .001$) | 0.290 ($p = .003$) |
*(a) ピアソンの相関係数(ゼロ次相関)*
| 尺度 | CS達成度 | 文章作成スキル |
| :--- | :---: | :---: |
| 文章作成スキル (Writing) | -0.032 ($p = .757$) | - |
| バイブコーディング (Vibe) | 0.281 ($p = .005$) | 0.186 ($p = .066$) |
*(b) 認知推論能力(ICAR16)を統制した偏相関係数*
*Table 3: CS達成度、認知推論能力、文章作成スキル、バイブコーディング性能の相関行列。括弧内は両側p値。*
1. **RQ1(タスク種別特異性)**:
文章スキルと各タスク種別ごとの相関を算出した(Table 4)。事前の仮説(無文脈タスクで文章スキルの関連が強くなる)に反し、無文脈タスクとの相関($r = 0.239$)は機能追加タスクとの相関($r = 0.245$)よりもわずかに低く、仮説は棄却された。
| タスク種別 | 相関係数 $r$ | 両側 $p$ 値 |
| :--- | :---: | :---: |
| 文脈豊富タスク 1(複製タスク) | 0.154 | 0.126 |
| 文脈豊富タスク 2(機能追加タスク) | 0.245 | 0.014 |
| 無文脈タスク | 0.239 | 0.017 |
*Table 4: 各バイブコーディングタスク得点と文章作成スキルのピアソン相関係数。*
2. **RQ2(全体的関連と認知スキルの統制)**:
文章スキルとバイブコーディング平均性能には有意な正の相関が認められた($r = 0.290, p = 0.003, 95\% \text{ CI } [0.099, 0.460]$)。しかし、ICAR16を統制した偏相関分析では、$r = 0.186, p = 0.066$ となり統計的有意水準を下回った。一方、CS達成度は認知能力統制後も有意な正の関連を維持した(偏相関 $r = 0.281, p = 0.005$)。
3. **RQ3(相対的予測価値)**:
階層的最小二乗(OLS)回帰分析を実施した。
- CS達成度を先に入力($R^2 = 0.150$)した後に文章スキルを追加すると、$R^2$ は 0.208 へ増加した($\Delta R^2_{\text{write|CS}} = 0.059$)。
- 逆に文章スキルを先に入力($R^2 = 0.083$)した後にCS達成度を追加すると、$R^2$ は 0.208 へ増加した($\Delta R^2_{\text{CS|write}} = 0.125$)。
- CS達成度は文章スキルの約2倍の独自分散を寄与していた。最終統合モデルにおける標準化係数は、CS達成度が $\beta = 0.356$ ($p < 0.001$)、文章スキルが $\beta = 0.244$ ($p = 0.009$) であり、双方が独立した有意な予測因子であった。
### 探索的分析
- **事前のLLM利用頻度との負の相関**: 日常的なLLM使用頻度(自己申告)とバイブコーディング性能の間に、予想外の有意な負の相関が認められた($r = -0.258, p = 0.010$)。またLLM利用頻度は文章スキルとも負の相関を示した($r = -0.282, p = 0.005$)。CS達成度や認知能力との間には有意な相関は見られなかった。
- **プロンプト品質と語彙多様性による媒介分析**:
参加者のプロンプトを専門家がルーブリックで盲検採点した結果、プロンプト品質はエッセイ評価($r = 0.353, p < 0.001$)およびバイブコーディング性能($r = 0.479, p < 0.001$)と強く相関した。また、プロンプトの語彙多様性指標(HD-DおよびMTLD)もタスク性能と有意に正相関した(Table 5)。
| 語彙多様性指標 | エッセイスコア | エッセイ語彙多様性 | バイブコーディング性能 |
| :--- | :---: | :---: | :---: |
| HD-D(プロンプト) | 0.206 ($p = .0399$) | 0.208 ($p = .0379$) | 0.310 ($p = .0017$) |
| MTLD(プロンプト) | 0.248 ($p = .0129$) | 0.258 ($p = .0095$) | 0.343 ($p = .0005$) |
*Table 5: プロンプト関連指標(HD-D, MTLD)と各成果変数間のピアソン相関 $r$。*
ブートストラップ媒介分析(10,000回リサンプリング)の結果、文章スキルからバイブコーディング性能への総合効果($c = 0.29, p = 0.003$)は、プロンプト品質を投入すると直接効果が非有意となった($c' = 0.14, p = 0.145$)。間接効果は 0.152(95% CI [0.061, 0.279])であり、全効果の約52%がプロンプト品質によって媒介されていた。
## 考察
本研究の知見は、「コードを書かないAI時代にはプログラミング教育は不要になり文章力やプロンプト術だけで十分になる」という言説に重要な再検討を迫るものである。
1. **なぜコードを見ないのにCS達成度が最大の予測因子となるのか**:
被験者はコードを閲覧・編集できず、モデル出力もぼかされていたため、CS専攻者が構文やAPI知識で有利になる余地はなかった。それにもかかわらずCS達成度が強く寄与した理由として、CS教育を通じて培われる「問題分解(problem decomposition)」、「計算論的思考」、「状態と制御フローのメンタルモデル」が、自然言語による仕様定義やエラー発生時の論理的トラブルシューティングを支えていると考えられる。
2. **文章作成スキルの本質とプロンプト品質**:
文章スキルが高い参加者は、曖昧性のない指示、論理的段落構成、適切な語彙選択を通じて高品質なプロンプトを作成し、それがモデルの挙動精度を高めていた。
3. **LLM使用頻度の負の相関が示唆するもの**:
頻繁にLLMを利用する学習者が文章作成や自己表現をLLMに依存することでスキルが低下している可能性、あるいは文章作成に困難を抱える学習者がLLMをより頻繁に利用している可能性が考えられる。
## 強み / 弱点・課題
### 強み
- **事前登録された統制実験デザイン**: AsPredictedに事前登録された計画に基づき、十分な検出力を持つサンプルサイズ(N=100)で厳密に検証した。
- **純粋なバイブコーディングの概念的分離**: コード露出を排除した独自プラットフォームにより、従来のコーディング能力の混入を防いだ。
- **一般認知推論能力の統制**: ICAR16を用いることで、観察されたスキルの効果が一般知能による交絡ではないことを立証した。
- **Delphi法によるタスクセットと客観的ルーブリック**: 8名の専門家による合意形成を経て作られたタスクと多角的な評価指標(人間採点+語彙多様性)を備える。
### 弱点・課題
- **GUI指向タスクへの限定**: 評価タスクが主に小規模なWeb GUIアプリケーションに限定されており、大規模データ解析や複雑なアルゴリズムタスクへの一般化には追加検証が必要である。
- **ハイブリッド環境への未対応**: 実際の商用環境ではコードの直接編集が可能な場合が多く、コード編集とプロンプティングの選択的戦略(mixed-mode)におけるスキルの役割は本研究のスコープ外である。
- **制限時間による影響**: 各タスク15分という時間制限があり、時間不足により完成直前で終了した被験者が存在した。
- **対象母集団の制約**: 参加者が大学生に限定されており、実務のプロソフトウェアエンジニアや非技術系シチズンデベロッパーにそのまま適用できるかは今後の課題である。