Easy Dataset - 大規模言語モデル微調整データセット作成ツール
プロジェクト概要
Easy Dataset は、大規模言語モデル(LLM)の微調整データセット作成専用に設計されたプロフェッショナルなツールです。直感的なインターフェースを提供し、特定の分野のファイルをアップロード、コンテンツをインテリジェントに分割、質問を生成し、高品質なトレーニングデータを作成することで、モデルの微調整プロセスを簡単かつ効率的にします。
Easy Dataset を使用すると、あなたの専門知識を構造化されたデータセットに変換し、すべての OpenAI 形式の LLM API と互換性を持たせ、微調整プロセスをより便利かつ効率的にすることができます。
主要な機能
🧠 インテリジェントなドキュメント処理
- Markdown ファイルのアップロードをサポートし、意味のあるフラグメントに自動分割
- ドキュメント構造とコンテンツの階層をインテリジェントに識別
❓ インテリジェントな質問生成
- 各テキストフラグメントから関連する質問を自動的に抽出
- バッチ質問生成をサポートし、処理効率を向上
💬 回答生成
- LLM API を使用して、各質問に対して包括的な回答を生成
- カスタムシステムプロンプトをサポートして、モデルの応答を誘導
✏️ 柔軟な編集
- 処理プロセスのどの段階でも、質問、回答、データセットを編集可能
- 直感的なユーザーインターフェースを提供して、コンテンツを管理
📤 多様な形式でのエクスポート
- 複数のデータセット形式(Alpaca、ShareGPT)をサポート
- 複数のファイルタイプ(JSON、JSONL)をサポート
🔧 幅広いモデルサポート
- OpenAI 形式に従うすべての LLM API と互換性あり
- Ollama ローカルモデルのデプロイをサポート
👥 ユーザーフレンドリーなインターフェース
- 技術者および非技術者向けに設計された直感的な UI
- 完全な中国語と英語の国際化サポート
技術アーキテクチャ
技術スタック
- フロントエンドフレームワーク: Next.js 14.1.0
- UI ライブラリ: React 18.2.0
- コンポーネントライブラリ: Material UI 5.15.7
- データベース: ローカルファイルデータベース
- ライセンス: Apache License 2.0
プロジェクト構造
easy-dataset/
├── app/ # Next.js アプリケーションディレクトリ
│ ├── api/ # API ルート
│ │ ├── llm/ # LLM API 統合
│ │ │ ├── ollama/ # Ollama API 統合
│ │ │ └── openai/ # OpenAI API 統合
│ │ └── projects/ # プロジェクト管理 API
│ │ └── [projectId]/
│ │ ├── chunks/ # テキストチャンク操作
│ │ ├── datasets/ # データセット生成と管理
│ │ ├── questions/ # 質問管理
│ │ └── split/ # テキスト分割操作
│ └── projects/ # フロントエンドプロジェクトページ
│ └── [projectId]/
│ ├── datasets/ # データセット管理インターフェース
│ ├── questions/ # 質問管理インターフェース
│ ├── settings/ # プロジェクト設定インターフェース
│ └── text-split/ # テキスト処理インターフェース
├── components/ # React コンポーネント
│ ├── datasets/ # データセット関連コンポーネント
│ ├── home/ # ホームコンポーネント
│ ├── projects/ # プロジェクト管理コンポーネント
│ ├── questions/ # 質問管理コンポーネント
│ └── text-split/ # テキスト処理コンポーネント
├── lib/ # コアライブラリとツール
│ ├── db/ # データベース操作
│ ├── i18n/ # 国際化
│ ├── llm/ # LLM 統合
│ │ ├── common/ # LLM 共通ツール
│ │ ├── core/ # コア LLM クライアント
│ │ └── prompts/ # プロンプトテンプレート
│ └── text-splitter/ # テキスト分割ツール
├── locales/ # 国際化リソース
│ ├── en/ # 英語翻訳
│ └── zh-CN/ # 中国語翻訳
└── local-db/ # ローカルファイルデータベース
└── projects/ # プロジェクトデータストレージ
インストールとデプロイ
システム要件
- Node.js 18.x 以降
- pnpm(推奨)または npm
ローカル開発
- リポジトリのクローン:
git clone https://github.com/ConardLi/easy-dataset.git
cd easy-dataset
- 依存関係のインストール:
npm install
- 開発サーバーの起動:
npm run build
npm run start
Docker デプロイ
- リポジトリのクローン:
git clone https://github.com/ConardLi/easy-dataset.git
cd easy-dataset
- Docker イメージの構築:
docker build -t easy-dataset .
- コンテナの実行:
docker run -d -p 1717:1717 -v {YOUR_LOCAL_DB_PATH}:/app/local-db --name easy-dataset easy-dataset
注意:
{YOUR_LOCAL_DB_PATH}をローカルデータベースを保存する実際のパスに置き換えてください。
- アプリケーションへのアクセス:
ブラウザを開き、http://localhost:1717に移動します。
デスクトップアプリケーションのダウンロード
| Windows | MacOS | Linux |
|---|---|---|
| Setup.exe | Intel / M | AppImage |
使用フロー
1. プロジェクトの作成
- ホームページで「プロジェクトを作成」ボタンをクリック
- プロジェクト名と説明を入力
- 好みの LLM API 設定を構成
2. テキストのアップロードと分割
- 「テキスト分割」セクションで Markdown ファイルをアップロード
- 自動分割されたテキストフラグメントを確認
- 必要に応じて分割結果を調整
3. 質問の生成
- 「質問」セクションに移動
- 質問を生成するテキストフラグメントを選択
- 生成された質問を確認および編集
- タグツリーを使用して質問を整理
4. データセットの生成
- 「データセット」セクションに移動
- データセットに含める質問を選択
- 構成された LLM を使用して回答を生成
- 生成された回答を確認および編集
5. データセットのエクスポート
- データセットセクションで「エクスポート」ボタンをクリック
- 好みの形式(Alpaca または ShareGPT)を選択
- ファイル形式(JSON または JSONL)を選択
- 必要に応じてカスタムシステムプロンプトを追加
- データセットをエクスポート
特徴的な機能
インテリジェントなプロンプトシステム
プロジェクトには、さまざまな言語に対応したプロフェッショナルなプロンプトテンプレートが組み込まれています。
- 中国語の質問生成プロンプト
- 英語の質問生成プロンプト
- 中国語の回答生成プロンプト
- 英語の回答生成プロンプト
複数の LLM サポート
- OpenAI API をサポート
- Ollama ローカルデプロイをサポート
- すべての OpenAI 形式の API と互換性あり
柔軟なデータ形式
- Alpaca 形式:指示微調整に適用
- ShareGPT 形式:対話トレーニングに適用
- JSON/JSONL 出力形式の選択