Transcript
00:00:00Kimi K3がリリースされましたが、正直言って衝撃的です。単にOpusやGPT 5.5に追いついただけでなく、
00:00:04FableやGPT 5.6にも肩を並べました。オープンモデルは私たちが最初に考えていたより、ずっと先を行っています。
00:00:10見てみましょう。まずは発表からです。Kimi K3は2.8兆
00:00:19パラメータを持つモデルで、Kimi Delta Retention and Attention Residualsを基盤とし、ネイティブなビジョン機能と
00:00:24100万トークンのコンテキストウィンドウを備えています。世界初の3兆クラスのオープンモデルで、
00:00:29長期間のコーディング、ナレッジワーク、推論といったフロンティア・インテリジェンス向けに設計されています。
00:00:34このブログで示されている全てのベンチマークにおいて、Kimi K3はFableや
00:00:38GPT 5.6 Soulに肉薄するか、あるいは一部の領域では上回っています。これは多くの人が予測していなかった
00:00:43非常にクレイジーな飛躍です。もちろん、これは彼ら独自のベンチマークなので、
00:00:47AIやサードパーティのベンチマークを見てみましょう。幸いなことに、結果は
00:00:52ほぼ一致しています。このベンチマークを見ると、見ている人の約80%がチャンネル登録していないようなので、
00:00:56ソフトウェア開発やAIの最新情報を追いたい方は、ぜひチャンネル登録ボタンを押してください。
00:01:00さて、実際のベンチマークに移りましょう。コーディング指標から始めると、スコアは76.2で、
00:01:06Fable 5に0.3ポイントの差で迫っており、GPT 5.5、Opus 4.8、
00:01:12そしてGPT 5.6 Lunaをわずかに上回っています。GPT 5.6 SoulやTerraには僅差で負けていますが、前回のモデルからのこの飛躍を見てください。
00:01:19エージェント指標を見ても同じことが言えます。
00:01:23FableとSoulには及びませんが3位につけており、依然として非常に印象的です。もう慣れているかもしれませんが、
00:01:29知能指標でも全く同じ結果です。つまり、サードパーティのベンチマークでも、このモデルが素晴らしいことが確認できます。
00:01:32残念ながら、この録画時点ではDeep SWEの結果はまだ出ていませんが、
00:01:38私たち独自のベンチマークを見ると、ここでもまた3位でした。
00:01:42このモデルは、出来すぎているように思えます。唯一の欠点は、
00:01:46少し高価なことです。自宅にスーパーコンピュータがない限り、これをローカルで動かすことはできないと思いますので、
00:01:50API経由で利用することになります。価格は入力100万トークンあたり3ドル、
00:01:54出力100万トークンあたり15ドルです。これはKimi K 2.6から大幅なステップアップであり、
00:02:00割引が終了した後のSonic 5とほぼ同価格ですが、Fable 5や
00:02:06Opus、GPT 5.6よりは安いです。API価格が全てではありません。実際にタスクあたりのコストで見ると、
00:02:12GPT 5.6 Soulと似ており、Opus 4.8の半額程度です。もちろん、
00:02:17FableやSonic 5よりは安いです。つまり、フロンティア級のクローズドモデルと競合していますが、
00:02:22オープンモデルの方が少し安いという理由で好んでいる人にとっては、このモデルは恐らく
00:02:26向いていないでしょう。GLM 5.2が次善の策で、価格は半額です。
00:02:31これまでで最速のモデルというわけではありませんが、このレベルの知能としてはかなり競争力があると思います。
00:02:36全体として、このモデルについて否定的なことは正直言いにくいです。では、実際にローカルでのテストを見ていきましょう。
00:02:40最初のテストとして、3.jsでF1レースゲームを完全に作成させました。
00:02:44全て1つのindex.htmlファイルに収めるというものです。これはOpen Router経由のKimi K3です。
00:02:50Kimi CodeのCLIでもテストし、ツールによって結果が変わるか確認しました。
00:02:56ここで分かるように、開始までに14分間思考しており、全体では
00:03:00この3.jsウェブアプリを作るのに35分かかり、APIトークン代は1.24ドルでした。得られた結果は
00:03:06非常に印象的です。明らかに外部アセットへのアクセス権はないため、
00:03:11モデルの作成には最善を尽くしています。トラックは動作します。AIレーサーがいて、トラックを周回できているようです。
00:03:16壁もしっかり機能しており、すり抜けることはできません。位置情報も更新されています。
00:03:21マップ、現在のタイム、周回数も更新されています。一周完走し、全て動作することを確認しました。
00:03:25Kimi K3が提供してくれた結果としては非常に良好です。
00:03:30先ほど言った通り、別のハーネスでもテストしました。これはKimi Code上のKimi K3です。こちらの方が
00:03:35見た目が少し良い気がします。アセットの扱いは改善されていますが、これは単なる
00:03:39スタイルガイドの問題かもしれません。モデルの動作に少しラグがありますが、操作感は少し良くなっています。
00:03:43コントロールがまだ逆ですが、どうやら3.jsアプリケーションではよくあるパターンのようです。
00:03:48しかし、全てうまく動作しますし、コースアウトすると
00:03:52減速するといった機能もあります。はい、かなり印象的な仕事をしてくれました。では比較してみましょう。
00:03:57Claude Code上のFable 5をmax設定でテストしました。この3.jsアプリケーションの作成に44分かかりました。
00:04:01そして、同じくmax設定のGPT 5.6 Solです。これは
00:04:0718分かかりました。これがFableが出した結果です。Fable GPですね。見た目は
00:04:12少し良いかもしれません。ですが、これも単なるスタイルの選択です。コントロールは
00:04:17逆になっていません。カメラの揺れもあり、個人的には良いスタイルだと思います。
00:04:22他と同様、全て機能しているようです。難易度は高いですが、1周完走テストもしました。
00:04:26衝突判定もあります。はい、全て動作しているようで、Kimi K3の結果とかなり同等です。
00:04:31GPT 5.6 Solも同様です。ご覧の通り、ゲームとして成立しています。ただ、道路が
00:04:35草地になっていますね。そこは正しくレンダリングされませんでした。ですが全体は機能しています。コントロールは
00:04:40逆になっていますし、アセットがいくつか裏返しになっています。なぜモデルが
00:04:44これをするのか分かりません。Fableだけはしませんでした。また、トラックが
00:04:48少しごちゃごちゃになってしまいました。そのため、実際にトラックとして成立しなかったのはこれだけです。最後に追加で
00:04:53比較として、次善のオープンモデルであるGLM 5.2も確認しました。これは
00:04:57思考に5分58秒かかりました。ただし、1回のプロンプトでは完成しませんでした。実際には
00:05:02いくつかバグがあったため、別のプロンプトでやり直す必要がありました。最終的にゲームを動かした時も、
00:05:07バグが多いのが分かります。まず、トラック上で正しい位置からスタートしていません。
00:05:11トラック自体がほとんど存在していません。見た目も他と比べてかなり劣っています。
00:05:15ですから、Kimi K3へのアップグレードには大きな価値があります。ではテスト2に移りましょう。個人財務管理ダッシュボードをリクエストしました。
00:05:20フロントエンドとバックエンドを備えたフルスタックアプリケーションです。唯一の要件として、認証機能は不要とし、
00:05:25データシードも求めました。
00:05:29今回もOpen RouterでK3を使い、Kimi Codeでも行いました。
00:05:33Open Routerでの結果ですが、アプリケーションの作成に合計56分かかりました。
00:05:38コストは1.30ドルでした。これが提供された結果です。正直、文句はありません。
00:05:43まさに私がリクエストしたものです。個人財務管理ダッシュボードです。見た目も
00:05:48かなり良いと思います。ここの追加ページなど全ての機能があります。
00:05:53資金の追加や送金の機能もチェック済みで、すべて機能します。良い仕事です。いつも
00:05:57何を使ってタスクをこなしたのか興味があります。なぜなら、プロンプトでスタックの
00:06:01指定を一切していないからです。フロントエンドには
00:06:05ReactとReact DOMを使いました。ルーターなどは使わず、独自の
00:06:09ビューシステムを構築しました。React Routerや
00:06:12TanStack、Next.jsなどを使ってほしかったところです。バックエンドも独自のサーバーを構築しており、
00:06:16ご覧の通りExpress.jsを使っています。しかしデータベースは
00:06:21JSONファイルで構築していました。SQLiteやDrizzleを使っていなかったので、
00:06:26将来的なアプリのスケールを考えると少し残念です。もちろん、プロンプトで指定すればよかったのですが、
00:06:31デフォルトで何を選ぶかを見るのは興味深いです。これはKimi Code経由のK3で得た結果です。こちらは少しシンプルです。
00:06:351ページ構成で、サイドバーがありません。機能は全て動作しており、
00:06:38Open Routerの結果と見た目はかなり似ています。しかしコードを見ると、
00:06:43Kimi CodeでK3を使ったこちらの方を好みます。フロントエンドは同様に
00:06:47Reactのみでルーティングライブラリなしですが、サーバーはデータベースを使用しました。
00:06:51Expressで構築されています。実際に財務データベースがあり、Node
00:06:55SQLiteを使用しています。これを再度フロンティアモデルと比較してみましょう。これはClaude Code上のFable 5です。
00:06:59最大設定で56分かかりました。そしてGPT 5.6 Solの最大設定です。
00:07:04こちらは31分でした。これがFable 5の結果です。
00:07:08正直、かなり似たデザインです。個人財務ダッシュボードでできることに
00:07:13大差はないので当然です。全ての機能は動作します。フォントのスタイルを
00:07:17少し変えてきました。最近FableやOpusでよく見かけるものです。以前の
00:07:21AIらしい外観から脱却し、新しい
00:07:25AIデザインを構築しようとしているようです。これが彼らの選んだもののようです。チャートは
00:07:29Kimi K3の結果よりも少し使いにくい気もしますが、全体としてかなり似ていて
00:07:34機能も基本的に同じです。コードもかなり似ています。フロントエンドにReactを選び、
00:07:38ルーターも使わず自作していました。データベースは
00:07:43正しく成功しています。こちらではNode SQLを使っています。そして
00:07:47サーバーはExpress 2で動いています。GPT 5.6 Solに話を移しましょう。これは少し
00:07:51変わっています。この中では私の一番好きなデザインです。全ての機能が
00:07:57動作しています。これが最高にデザインだと思うか教えてください。変なのはコードです。
00:08:02これらの例の中で、間違いなく最も完成度の高いアプリケーションコードです。
00:08:06Next.jsアプリケーションを完全に構築しており、私が望む通りDrizzleを使っていました。
00:08:11フロントエンドとサーバーの両方にNext.jsを使いました。少し変だと思うのは、
00:08:15Cloudflareへのホスティングを選んだことです。それ自体は奇妙ではありませんが、for Nextを使いました。推奨しない
00:08:20わけではありませんが、少し未検証な感じがします。比較的新しい技術であり、彼らが
00:08:24GPT 5.6 Solにこれを使うよう推し進めていることが分かります。理由は推測するしかありませんが、
00:08:29ChatGPTサイトがそのように動作しているからかもしれません。
00:08:33リクエストしていないのに、ChatGPTサイト機能を使って私にホスティングすることを選びました。
00:08:38個人的には、アプリケーションをコーディングしている時に
00:08:42ホスティングまでしてほしいとは思いません。自分でやりたいのです。ですが、それは
00:08:47プロンプトで指示できたことですね。指示がないと勝手にホスティングしてほしくはありません。
00:08:50最後にGLM 5.2の結果です。Kimi K3が
00:08:54Kimi Codeで行ったことと似ていて、1ページ構成です。機能は全て動作しており、
00:08:58デザインもかなり良いと思います。GLM 5.2はこれに15分かかり、
00:09:04コストは1.11ドルでした。コードに関しては、GLM 5.2もNext.jsルートを選択しました。
00:09:08それは気に入っています。しかし、データベースではなく独自のストアを構築しました。そのため、全て
00:09:13JavaScriptのメモリ内にあります。以上、私の簡単なテストから、Kimi K3はFable
00:09:19やGPT 5.6 Solに匹敵し、ベンチマークが示す通りの期待に応えていると思います。正直、
00:09:24動画デモでこれらモデルの強力さを全て見せるのはかなり難しいです。
00:09:29コードの質を実際に確認するには、プロダクションコードベースで1週間ほど
00:09:33使ってみる必要があります。動画で実際に示せるような、
00:09:38これらのモデルを厳しくテストできるアイデアがあれば、下のコメント欄で教えてください。また、
00:09:42彼らのテックブログにあった例もいくつか紹介したいです。Kimi
00:09:46K3はこのゲームを構築しましたが、アセットを生成するために別のツールを使用していました。つまり、カウボーイや
00:09:50馬はK3が生成したものではありません。他で用意されたものです。彼は
00:09:533.jsで非常に良い仕事をしました。もう一つクレイジーなのは、このチップデザインです。
00:09:58概念実証の初期段階として、Kimi K3は独自のアーキテクチャに基づくナノモデルを稼働させるためのチップを設計しました。
00:10:0348時間の自律走行で、K3はオープンソースツールを使用してチップを構築、最適化、検証しました。ですから、
00:10:08このモデルが非常に素晴らしいこと、そして間違いなく
00:10:13フロンティア級のクローズドな研究機関にとって脅威となることが分かってもらえたと思います。少なくとも、重みを公開すればですが。
00:10:19まだ公開されていませんが、公開する予定はあります。近いうちに見られることを期待しています。どう思いますか?
00:10:23中国の研究所がこれほど早く追いつくと思っていましたか?そして、このモデルは魅力的ですか?
00:10:27コメント欄で教えてください。ついでにチャンネル登録もお願いします。それでは、また次回お会いしましょう。
00:10:32中国の研究所がこれほど早く追いつくと思っていましたか?そして、このモデルは魅力的ですか?
00:10:36コメント欄で教えてください。ついでにチャンネル登録もお願いします。それでは、また次回お会いしましょう。