Tencent、テキストから編集可能な3Dワールド向けのWorldClawを発表

そのエージェント・パイプラインは地形を計画し、地域アセットを構築し、Blenderでシーンを精緻化する。TencentのテストではNvidia H20 GPUを4基使用している。

By · Published

Primary source: Tencent Hunyuan on X

Why it matters

WorldClaw targets the expensive step between generating a convincing 3D image and delivering an editable scene that artists can revise, reuse and move into game production.

Tencent unveils WorldClaw for editable 3D worlds from text

Tencent Hunyuan (@TencentHunyuan)は8月11日にWorldClawを発表しました。これはエージェント駆動のワークフローで、テキストプロンプトを編集可能な地形と個別のテクスチャ付きアセットから構成される、大規模で探索可能な3D環境に変換します。

https://x.com/TencentHunyuan/status/2087068591296536755

poster=/api/storage/public-objects/tweet-videos/tencent-worldclaw-editable-3d-worlds-text-poster-31d4c31d.jpg|Xに投稿された@TencentHunyuanのビデオ

この違いはゲームやシミュレーション作業にとって重要です。TencentはWorldClawが生成されたカメラパスに制約されたビデオやGaussian splattingで表現されたシーンではなく、明示的な3Dジオメトリを生成すると述べています。出力はクリエイターが環境内を自由に移動し、オブジェクトの位置を変更し、アセットを既存の3D制作ツールへ持ち込めるよう設計されています。

TencentはシステムをXに投稿されたビデオで実演しました。8月5日に提出された研究論文は、Tencent Hunyuanの研究者Chunchao Guo、Jinpeng Li、Yang Li、Zilong Huangを著者として挙げています。GuoはTencent Hunyuanの3D作業を率いています。その取り組みは個々のオブジェクト生成から持続的な環境の組み立てへと拡大しています。

WorldClawがワールドを構築する方法

WorldClawはシーン作成を3つの段階に分割し、1つのモデルに単一のパスで全体の環境を生成させるのではありません。

まず、プランニングエージェントが自由形式のプロンプトを領域、地形、オブジェクト、マテリアル、ビジュアルスタイル、空間関係を含む構造化された仕様に変換します。このワークフローは、ユーザーが明示的に与えた制約を保持しつつ、構築に必要な詳細を埋めていきます。

次に地形エージェントがグローバルな基盤を生成します。セマンティックレイアウトマップを作成し、計画された世界を領域に分割し、山頂、砂丘、段丘、侵食などの特徴を表現するために地形オペレーターを用いて高さフィールドを構築します。マテリアル、岩、植生は各領域の意図された地形と生態に応じて配置されます。

WorldClawは詳細なオブジェクトを必要とする領域に追加の計算を割きます。選択された領域を2D画像としてレンダリングし、画像編集モデルを用いて計画されたコンテンツを追加し、挿入されたオブジェクトを個別の3Dメッシュとして再構築します。ワークフローは各オブジェクトの位置を復元し、それを地形上に配置し直します。

Blenderに接続されたエージェントは複数の視点から結果を検査します。オブジェクトのスケールや向きを調整し、不良なジオメトリを修復し、地形を滑らかにし、浮遊するオブジェクトや地面との過度な交差といった可視的欠陥に対処できます。これらのチェックはシーンがワークフローの基準を満たすか、あらかじめ設定された反復上限に達するまで実行されます。

その粗から細への設計がWorldClawの中心的な技術的賭けです。大規模な地形と地域構造は一度確立され、コストのかかるアセット生成と洗練は選択された場所に向けられます。シーンは一つの生成された視覚的アーティファクトに平坦化されるのではなく、管理可能なコンポーネントの集合体として残ります。

Tencentは複数のAIシステムからワークフローを組み立てた

WorldClawは複数のファンデーションモデルと従来の3Dソフトウェアを中心に構築されたオーケストレーションシステムです。論文によれば、Tencentの実験ではエージェントモデルにClaude Opus 4.8、画像生成にGPT-Image-2、セグメンテーションと再構築にSAM3とSAM3D、高品質なジオメトリとテクスチャにはHunyuan3Dを使用しました。

研究者たちはサーバー上のBlender 5.1.1で実験を実行し、Nvidia H20 GPUを4基搭載していました。大きなオブジェクトには2,048×2,048の物理ベースレンダリングテクスチャマップが与えられ、小さなアセットには1,024×1,024のマップが使われました。

これらの要件はWorldClawを軽量なリアルタイムジェネレータというよりは研究および制作向けのワークフローとして位置づけます。Tencentの論文は質的なデモンストレーションと比較を報告しており、生成時間やシーン品質の広範な定量ベンチマークは提示していません。

実演されたプロンプトは、熱帯の海賊拠点、部族集落を有する川峡谷、砂漠の戦場、未来的施設を含む雪山の谷を生成しました。WorldClawプロジェクトページの追加例には中世の集落、火山環境、宝石採掘場などが含まれます。

Tencentはアセットから環境へと3D戦略を拡大

WorldClawはTencentの以前のHunyuanWorldに関する研究を基に構築されています。同社は2025年にテキストや画像から探索可能な3Dシーンを生成するシステムとしてHunyuanWorld 1.0を公開しました。WorldClawはより大きな環境の離散的な部分を計画、生成、検査、編集する専門のエージェントに構築プロセスの多くを移譲します。

Tencentはまた2025年11月にHunyuan 3D creation engineを国際展開し、オブジェクト生成とワールド構築をゲーム、仮想現実、デジタルコンテンツ、eコマース、3Dプリント向けのツールとして位置づけました。WorldClawは、視覚的品質に加えて使用可能なトポロジー、アセットの分離、配置制御が重要となるシーン制作にこの戦略をより近づけます。

商業的な試金石は、このワークフローが生成されたコンセプトをプレイ可能なレベルに変えるために必要な手作業をどれだけ削減できるかにかかっています。WorldClawの編集可能な出力は、生成ワールドシステムにおける持続的な弱点に対処します:印象的なウォークスルーは改訂、再利用、実際のゲームパイプラインへの統合が難しいことがあります。Tencentのアプローチは各生成オブジェクトに従来のシーングラフ内の位置を与え、エージェントが終了した後もアーティストや開発者が編集を続けられるコンポーネントを残します。

Reader comments

Conversation for this story loads after sign-in.