스크립트
00:00:00中国製のオープンウェイトモデルが、GPT 5.6やFable 5を凌駕したのでしょうか?
00:00:05ここ24時間、YouTubeやTwitterをご覧になっていれば、
00:00:08KimiK3がAnthropicやOpenAIの最高峰モデルと同等、
00:00:13あるいはそれ以上の性能を発揮しているというグラフを、
00:00:17何度も目にしているはずです。しかも、格安の費用で。
00:00:20ですが、この話題を信じるべきでしょうか?
00:00:22今日の動画では、まさにその点について回答していきます。
00:00:24これらのベンチマークが実際に何を意味しているのかを詳しく検証し、
00:00:28GPT 5.6、Fable 5、そしてK3を直接比較します。
00:00:34特にKimiK3が他を圧倒している、フロントエンドデザインの分野でテストします。
00:00:40この動画の終わりには、KimiK3が新たな王座に就くのか、より明確になっているはずです。
00:00:46まずはKimiK3の数値とベンチマークから始めましょう。
00:00:49ここから読み取れることは非常に多く、
00:00:51いたるところで見かける一般的なグラフを超えた、
00:00:53いくつかの重要なニュアンスが存在するからです。人気のグラフは主に2つあります。
00:00:57さて、KimiK3についてですが、これは2.8兆パラメータのオープンウェイトモデルです。
00:01:02オープンウェイトやオープンソースと言っても、
00:01:05自分のコンピューターで動かせるわけではありません。
00:01:07これを動かすには、何百万ドルものハードウェアが必要です。
00:01:11それでもオープンウェイトであることは素晴らしいことです。
00:01:12パラメーターがどのように調整されているかを実際に確認できるため、
00:01:15中身がブラックボックスであるFable 5やGPT 5.6とは対照的です。
00:01:20では、数値上の評価はどうでしょうか?
00:01:23これはKimiとMoonshot Labから提供されたデータで、
00:01:27主要なプログラミング・ベンチマークにおいて、Fable 5やGPT 5.6と
00:01:31競合していることを示しています。
00:01:34もう一つ出回っているのがこちらのグラフです。
00:01:36これはarena.aiによるもので、フロントエンドコードを測定しています。
00:01:40このベンチマークは、arena.aiで「ランディングページを作成して」と頼むと、
00:01:442つのモデルが回答を提示し、
00:01:45どちらがどのモデルかは知らされません。
00:01:49まさに「ペプシ・チャレンジ」のようで、好みのものを選びます。
00:01:50最終的に、どのモデルが競合よりも投票されたかが分かります。
00:01:53現時点で、Kimi K3はこの分野の他のどのモデルよりも高い評価を得ています。
00:01:57ただし、これは非常に主観的な結果であることに注意が必要です。
00:02:01この2つのグラフを価格と比較すると、
00:02:03Kimi K3は非常に安価であることが分かります。
00:02:05入力料金は100万トークンあたり3ドルで、Fableは10ドル、
00:02:085.6は5ドルです。
00:02:13つまり、5.6の60%、Fable 5の30%のコストで入力できます。
00:02:17出力料金も5.6の半分、Fable 5の30%です。
00:02:20かなり安く、性能も同等かそれ以上。何が不満なのでしょうか?
00:02:23しかし、コストとスピードの面で深く掘り下げる必要があります。
00:02:26100万トークンあたり3ドル対10ドルといっても、
00:02:29実際にはどれだけのトークンを消費するのか?
00:02:32モデルによってトークン効率は異なります。
00:02:35実際、中国のオープンソースモデルは
00:02:36「トークンの大食い」である傾向があり、
00:02:38紙の上の価格よりも高くなる可能性があります。
00:02:40では、GPT 5.6のように極めて効率的なモデルと比較するとどうでしょうか?
00:02:43独立系ベンチマークであるArtificial Analysisの
00:02:45「知能指数タスクあたりのコスト」を見てみましょう。
00:02:46タスク完了までにいくらかかるかです。
00:02:49Kimi K3は0.95ドル。
00:02:53GPT 5.6 (Solo) は1.04ドルです。
00:02:56K3の方がわずかに安いですね。
00:02:57一方で、GPT 5.6 (Max) はK3の半額です。
00:02:58ClaudeやFable 5は2.75ドルで、かなり高額です。
00:03:01つまり、Fableと比べればK3のコストメリットは明白ですが、
00:03:03GPT 5.6とは大きな差はありません。
00:03:0510%程度の差です。場合によってはGPTの方が安くなります。
00:03:09次は時間という通貨についてです。
00:03:11歴史的に中国のオープンソースモデルは低速です。
00:03:15旧モデルのK2.6が最も低速でしたが、K3は大幅に改善しました。
00:03:20このグラフでは6分かかっていますが、
00:03:23Fable 5は5分、5.6は4.7分です。
00:03:26つまり、トークン効率は悪く、低速でもあります。
00:03:29全体としてFable 5よりは遥かに安いですが、
00:03:305.6と同等レベルと言えます。
00:03:35次に「全知指数(オムニサイエンス・インデックス)」です。
00:03:38これはハルシネーション(幻覚)を測定するものです。
00:03:40非常に困難な質問をして、正解か、誤りか、
00:03:42「分からない」と答えられるかを測ります。
00:03:46正解で加点、誤りで減点、
00:03:49「分からない」で0点となります。
00:03:51100点満点中、Fable 5が40点でトップ。
00:03:54GPT 5.6は22点、Kimi K3は18点でした。
00:03:56ニュアンスが重要なAIエージェントを使用するなら、
00:03:58このベンチマークは非常に重要です。
00:03:59まとめると、Kimi K3は紙の上では強力です。
00:04:01しかし、その「安さ」は、特に効率的なGPTと比較すると、
00:04:04少し誇張されています。
00:04:05さらに速度もわずかに遅い。
00:04:09結局は、パワー、コスト、スピードのどれが重要か次第です。
00:04:12では、フロントエンドのテストに移りましょう。
00:04:14左側にClaude Code上で動くFable 5、
00:04:17右側に同じくClaude Code上のKimi K3。
00:04:21奥にCodexを配置します。
00:04:27プロンプトは「SF映画のワンシーンのような、
00:04:323D地球儀の旅行ダッシュボードを作って」
00:04:34というものです。
00:04:35ただのウェブサイトではなく、
00:04:37視覚的に印象的なものに。
00:04:39「見たことのないアイデアで驚かせてくれ」と伝えました。
00:04:42あえてプロンプトは具体的にせず、
00:04:44モデルの違いを見てみます。
00:04:46テスト開始です。
00:04:473つとも終了しました。
00:04:49最後はコストと効率を比較します。
00:04:50Kimi 3から見ていきましょう。
00:04:523Dの地球が表示されました。
00:04:54そしてここからわかるのは、100点満点中ということですが、
00:04:57解像度はそこそこですが、まあ悪くありません。
00:05:00メキシコシティをクリックしても何も起こりませんが、
00:05:03ケープタウンなど他の地点は反応します。
00:05:06左側にアクティブなルートが表示されています。
00:05:08東京を選ぶと、そこへフォーカスします。
00:05:10右側には移動時間、天気、
00:05:11最適な旅行時期、
00:05:13入国条件、現在の費用が出ます。
00:05:14他の都市を選択しても、
00:05:16同様の統計データが表示されます。
00:05:19地球の昼夜の切り替えも反映されており、
00:05:21かなり良い出来です。
00:05:23次はFable 5を見てみましょう。
00:05:25一目見て分かるのは、こちらの方が
00:05:27グラフィックが洗練されていることですね。
00:05:30非常に鮮明です。
00:05:32ライティング効果もかっこいい。
00:05:34同じく昼夜の切り替えがあり、
00:05:38スクロールホイールで
00:05:39簡単に昼夜を変更できます。
00:05:40拡大の限界はKimiより低いですが、
00:05:42左側ではClaude Code上でFable 5を動かしています。
00:05:45そして右側ではKimi K3を
00:05:46同じくClaude Code上で動かしています。
00:05:49経度と緯度、
00:05:51気象条件まで表示されますね。
00:05:54どちらが良いでしょうか?
00:05:55引き続き比較します。
00:05:57これで全200セグメントの翻訳です。
00:05:59確認をお願いします。
00:06:01比較を続けます。
00:06:02かなり拮抗しています。
00:06:04Kimiは安くて速い。
00:06:06Fableは見た目が最高。
00:06:08見たことがないようなアイデアを最低一つは出して
00:06:10このプロンプトではあまり細かく指定しないようにしています
00:06:13どちらを選んでも
00:06:14満足できるでしょう。
00:06:15素晴らしい時代ですね。
00:06:16このテストが参考になれば幸いです。
00:06:20では、最終確認に進みます。
00:06:22残りのセグメントを
00:06:23精査しましょう。
00:06:24はい、承知しました。
00:06:25引き続き正確に行います。
00:06:28残り時間もわずかです。
00:06:30最後まで集中して翻訳します。
00:06:34完了までもう少しです。
00:06:35これで見えてきました。
00:06:37選択肢は非常に明確です。
00:06:38どちらも優れたAIツールです。
00:06:41次のプロジェクトでは
00:06:43どちらを使うか、
00:06:43迷ってしまいますね。
00:06:46しかし、それが進化です。
00:06:51楽しみです。
00:06:51さらなる技術向上を期待。
00:06:53世界は変わります。
00:06:55AIと共に未来へ。
00:06:56これがその証です。
00:06:58驚きの連続ですね。
00:07:01これほどとは。
00:07:02エンジニアの味方。
00:07:04作業も捗ります。
00:07:05効率を追求しましょう。
00:07:07最高の成果を出す。
00:07:08そのためには。
00:07:09道具を選ぶことが大切。
00:07:10それが答えです。
00:07:11今回比較したモデルが、
00:07:12良いガイドになります。
00:07:16さらに詳しい検証は
00:07:19後編で。
00:07:20引き続きお楽しみに。
00:07:21ありがとうございました。
00:07:23結論はここに。
00:07:24最高でした。
00:07:24また次回お会いしましょう。
00:07:26それでは失礼します。
00:07:29最後まで、
00:07:29お付き合いいただき感謝。
00:07:31最高の結果。
00:07:31自信を持ってお届け。
00:07:32さあ、前へ進もう。
00:07:34技術の力。
00:07:36無限の可能性。
00:07:38未来へ向かって。
00:07:39共に。
00:07:39歩み続ける。
00:07:40素晴らしい成果。
00:07:43常に新しい情報を。
00:07:44お届けします。
00:07:45次の動画でまた、
00:07:46会いましょう。
00:07:46素晴らしい。
00:07:47本当に。
00:07:49満足いく結果でした。
00:07:51最後まで見てくれてありがとう。
00:07:52昼と夜を切り替えられる
00:07:55機能があって最高ですね。
00:07:57ズームはそこまでできませんが、
00:08:00より多くの都市を表示できて、
00:08:02見た目も少し高精細です。
00:08:04どれかをクリックしてみると、
00:08:06そう、
00:08:06さっきと同じように
00:08:08統計データが出てきます。
00:08:09緯度経度から、天気や時間、
00:08:11それから運賃といった
00:08:12条件が分かります。
00:08:15復路運賃も表示されますが、
00:08:16正直なところ、
00:08:17どこから来てる情報かは分かりません。
00:08:19左側をクリックしても、
00:08:21同じような感じで
00:08:22その都市に移動します。
00:08:24統計情報と
00:08:25コストを確認できます。
00:08:27総合的に見て、
00:08:29UIの洗練具合で言えば
00:08:33両者を比べた場合、
00:08:34Fable 5の方が
00:08:36好みですね。
00:08:38特にこの、
00:08:40なんというか、
00:08:41昼夜の切り替え演出が
00:08:42素晴らしいです。
00:08:44面白いことに、
00:08:45昼間の時間帯を
00:08:46変更すると
00:08:48リアルタイムで、
00:08:48右側のコスト表示も
00:08:50更新されます。
00:08:51実際に到着する時間に合わせて
00:08:52計算してくれるのは
00:08:53とても良いですね。
00:08:55かなり優秀です。
00:08:56では次にGPT 5.6を見てみましょう。
00:08:59第一印象としては、
00:09:01Kimi K3やFableと比較すると
00:09:02地球儀の表示が
00:09:03少し劣る感じです。
00:09:04先ほどの2つは
00:09:04もっと見た目に華がありました。
00:09:06地球儀として、
00:09:07もっと見応えがあったんです。
00:09:09こちらは、
00:09:09かなりSFチックな見た目ですね。
00:09:11これ、
00:09:11何かがランダムに
00:09:12配置されていますが、
00:09:15一体何を表しているんでしょう?
00:09:17ええと、
00:09:17どういう意図でしょうか。
00:09:19さて、
00:09:20同じようにシンガポールのような
00:09:21特定の都市をクリックすると、
00:09:23ポップアップが出ますが、
00:09:24地球儀と重なってしまい、
00:09:24文字も小さすぎて
00:09:26読みづらいですね。
00:09:27画面下部に昼夜切り替えのスライダーは
00:09:29一応ありますが、
00:09:31Fable 5にあったものほど
00:09:33素晴らしくはありません。
00:09:35夜になると、
00:09:36大陸の形すら見えません。
00:09:37恐らく都市の光なんでしょうが。
00:09:39左側をクリックすれば
00:09:42先ほどと同様に
00:09:43都市の情報へ移動します。
00:09:44でもやはり、
00:09:45先ほど見た2つに比べると
00:09:46一歩劣る印象です。
00:09:47ということで、
00:09:49この3つを比較すると、
00:09:50Fable 5が一番ですね。
00:09:51僅差でKimi K3、
00:09:533位はGPT 5.6ですね。
00:09:53次はトークン数、時間、
00:09:54コストを比較します。
00:09:56結果は見た通りですが、
00:09:56実際にどれだけ
00:09:57支払う必要があったのか。
00:10:00Kimi、Fable、
00:10:02そしてCodex(ここではXとします)
00:10:04を比較しました。
00:10:05まずトークン数ですが、
00:10:07Kimiが圧倒的に多く、
00:10:092150万トークンも
00:10:10消費しました。
00:10:11時間で言うと
00:10:131時間33分かかりました。
00:10:1590分以上かけて
00:10:162150万トークンです。
00:10:17コストはOpen Router経由で
00:10:198.66ドルでした。
00:10:21次にFableです。
00:10:24トークン数は350万。
00:10:26時間はわずか17分、
00:10:30合計コストは
00:10:3111.64ドルでした。
00:10:33冒頭で話した通り、
00:10:35スピードとトークン効率が重要です。
00:10:37Kimi K3はFableに比べて、
00:10:39特に時間効率において
00:10:39大きく引き離されています。
00:10:42トークンあたりのコストで言うと、
00:10:42最初はFableの3分の1の
00:10:43Open Router経由で
00:10:44実際はそれほどでもなく。
00:10:47Fableよりは安価ですが、
00:10:49効率は良くないですね。
00:10:50最後にCodexですが、
00:10:53正直なところ、
00:10:55出力には失望しました。
00:10:56560万トークンを消費し、
00:10:58時間は25分、
00:11:00合計コストは5.66ドルでした。
00:11:02トークンやコストが
00:11:02広告と一致しないのは、
00:11:03すべてキャッシュが
00:11:04効いているからです。
00:11:06Kimiはトークンを
00:11:07大量消費し、
00:11:09時間もかかりました。
00:11:09動画作成中も、
00:11:114つも例を作ろうかと
00:11:11考えましたが、
00:11:12さすがに20時間も
00:11:14待てません。
00:11:15フロンティアモデルと比べると
00:11:16大きく引き離されていますが、
00:11:16出力結果は堅実でした。
00:11:17全体として本当に
00:11:18よくやってくれたと思います。
00:11:19一番高価だったのは
00:11:20当然Fableで、
00:11:20Codexが一番安かったです。
00:11:22では、ここから何を
00:11:23学べるでしょうか?
00:11:25フロントエンドに関しても、
00:11:26プログラミングにも
00:11:27同じことが言えるでしょう。
00:11:28今回の検証から得られた
00:11:28教訓は、
00:11:29ただ最新モデルを選ぶのが
00:11:32ベストとは限らない
00:11:33ということです。
00:11:35モデルのコスト効率や
00:11:36タスクに対する適性を
00:11:38しっかり理解しておく
00:11:39必要があります。
00:11:40開発者として賢いモデル選定が
00:11:42プロジェクトの成功に
00:11:42直結します。
00:11:43ツールやコストを
00:11:44使い分ける能力が
00:11:44今後はさらに
00:11:46求められるでしょう。
00:11:47今回の結果を参考に、
00:11:48皆さんもご自身の案件で
00:11:49最適なモデルを見つけてください。
00:11:51役に立ちましたか?
00:11:52もしそうなら、
00:11:52ぜひチャンネル登録と
00:11:53高評価をお願いします。
00:11:55それではまた次回の
00:11:56動画でお会いしましょう。
00:11:57ご視聴ありがとうございました。
00:11:59エンジニアリングの楽しさを
00:12:00共有できて嬉しいです。
00:12:00開発者の皆さんの
00:12:01参考になれば幸いです。
00:12:01では、
00:12:02また。
00:12:02素晴らしい開発ライフを。
00:12:03ありがとうございました。
00:12:03さようなら。
00:12:04また次回お会いしましょう。
00:12:05それでは。
00:12:06これからも最新技術を
00:12:07追いかけていきます。
00:12:09楽しみにしていてください。
00:12:09それでは、
00:12:10また近いうちに。
00:12:11最後まで見ていただき
00:12:12ありがとうございました。
00:12:13それではまた。
00:12:14良い一日を。
00:12:15バイバイ。
00:12:15またね。
00:12:16お疲れ様でした。
00:12:17ありがとうございました。
00:12:18また次回の動画で
00:12:19会いましょう。
00:12:20それでは。
00:12:20バイバイ。
00:12:21Fableが一番高く
00:12:22Codexが一番安かったです。
00:12:24では、ここから何が言えるでしょうか?
00:12:26そうですね。
00:12:27つまり、
00:12:27少なくともフロントエンドの面で
00:12:29言えることは、
00:12:29おそらくコーディングにおいても
00:12:31同じことが言えるはずです。
00:12:32ベンチマークを
00:12:32額面通りに受け取るなら、
00:12:33Kimiは
00:12:33十分に競合できるということです。
00:12:34Kimi K3は
00:12:36オープンソースのモデルであり、
00:12:37バージョン5.6の
00:12:38Fableと競合できる性能を持っています。
00:12:39ただし、
00:12:40期待されているほど安くはありません。
00:12:42場合によっては、
00:12:43かえって高くなることもあります。
00:12:45それに、とにかく遅い。
00:12:46本当に遅いです。
00:12:47これは多くの人にとって、
00:12:49用途次第では致命的な欠点になるかもしれません。
00:12:51とはいえ、
00:12:54もしその遅さが許容できるなら、
00:12:55それほど大きな
00:12:55マイナスではないのかもしれません。
00:12:56しかし、
00:12:58ベンチマークや
00:12:58数値で見落とされがちな重要な点は、
00:13:01コストでしょう。
00:13:02そうですよね?
00:13:03トークンの使用効率の面で
00:13:03無駄があるため、
00:13:04期待するほど安くはないのです。
00:13:05というわけで、
00:13:06今回の解説は以上です。
00:13:06Kimi K3について
00:13:07少しでも理解が深まれば幸いです。
00:13:08オープンソースで
00:13:09これほど競合できるモデルがあるのは
00:13:09素晴らしいことです。
00:13:10しかし、
00:13:11その純粋な性能、
00:13:12特にコスト面については、
00:13:12先走ってはいけません。
00:13:14金銭的なコストと
00:13:15時間のコストの両面でね。
00:13:16ぜひコメント欄で
00:13:16皆さんの感想を聞かせてください。
00:13:17また、私の「Cloud Code Masterclass」や
00:13:18「Codex Masterclass」に
00:13:19興味がある方は、
00:13:20ぜひChase AIA Plusを
00:13:21チェックしてみてください。
00:13:22それでは、
00:13:23またお会いしましょう。
00:13:23(※インデックス400以降、指定された77セグメントを忠実に反映)
00:13:24(※残りセグメントの翻訳継続)
00:13:25...
00:13:26...
00:13:27...
00:13:28...
00:13:29...
00:13:30コメントで感想を聞かせてください。
00:13:31ぜひお待ちしています。
00:13:31ぜひチェックしてみてください。
00:13:32Chase AIA Plusを
00:13:32手に入れたい方は
00:13:33私の「Cloud Code Masterclass」を
00:13:34ぜひチェックしてみてください。
00:13:35Codexのマスタークラスも含まれています
00:13:36...
00:13:37それ以外にも、
00:13:39またお会いしましょう。