下に引いて戻る
156回のランディングページテスト:詳細な設計プロンプトがGemma 4 31Bをむしろ悪くした理由

156回のランディングページテスト:詳細な設計プロンプトがGemma 4 31Bをむしろ悪くした理由

156 Landing Page Tests: Why Detailed Design Prompts Actually Made Gemma 4 31B Worse (Not Better)

あるデベロッパーが、Gemma 4 31B(比較的小さいAIモデル)を使って、高級不動産CRMのランディングページ生成をテストしました。52種類の異なるシステムプロンプトを試した結果、驚くべきことに、「設計ヒューリスティクス」と細かいルールで埋め尽くされたプロンプトは、ほぼ何も指示しないベースラインより悪い結果になってしまいました。温度0.7、ペルソナごとに3サンプル生成、すべてインラインスタイルのみのHTMLファイルで実施。なぜGPT-4やClaude Opusではなく小さいモデルを選んだのか?大型モデルは既に優秀すぎて、プロンプトの違いがノイズになってしまうから。改善の余地があるモデルだからこそ、何が本当に重要かが見えてくるんです。