このページでは

For AI agents: a documentation index is available at /docs/llms.txt. Append .md to any page URL for markdown, or send Accept: text/markdown.

スケール: 動的な行動サンプリングを使用してイベントボリュームを管理

スケールは、非常に大量のイベントに関連するコストを管理するのに役立ちます。

AmplitudeはScaleを活用することで、独自のコスト課題を抱える超大量ユーザー向けに動的な行動サンプリングを実現できます。 サンプリングを使用すると、分析の精度を損なうことなく、データコストを管理しやすく抑えることができます。

スケールは、非常に大量のデータを取り扱うお客様を対象とした有料アドオンです。Amplitudeはデフォルトではサンプリングを行いません。 Scaleがお客様の組織に適していると考えられる場合は、アカウントマネージャーにお問い合わせください。

サンプリングの仕組み

ユーザーレベルでは、AmplitudeアルゴリズムサンプリングフレームワークはユーザーIDに基づいてイベントをサンプリングします。

  • 追跡対象のユーザーの場合、Amplitudeはユーザーのイベントストリームと行動をすべて保持します。
  • ユーザーレベルのサンプリングは、不完全なデータを提供することがあるランダムなイベントレベルのサンプリングよりもデータの整合性を維持できます。

サンプリングを有効にすると、Amplitudeはメトリクスをアップサンプリングして、すべてのチャートと分析について非常に正確な推定値を提供します。

Amplitudeはイベントとユーザーを(100% / sampling rate)に相当するサンプリング係数で乗算します。

たとえば、サンプリングが10%の場合、Amplitudeは追跡されたイベントに10を掛けて算出し、実際のイベント量を推定します。これにより、Amplitudeユーザーはサンプリングレートを考慮することなくアナリティクスに集中できます。

各Amplitudeチャートには、それに適用されたサンプリングレートが表示されます。

プロジェクトの先月と今月の生イベントと、サンプリング後のイベント数を表示できます。 これにより、イベントボリュームへのリアルタイムアクセスが可能になります。

サンプリングは、PROPCOUNTの結果には適用されません。

サンプリングを設定する

サンプリング関連の変更を行うには、Amplitude組織の管理者である必要があります。

サンプリングを設定するには:

  1. 表示されるモーダルで、編集をクリックしてダイナミックサンプリングレートを設定します。

動的サンプリングレートは、Amplitudeがデータを照会する頻度を指定します。 たとえば、年間 5,000 万人のアクティブ ユーザーがあり、ダイナミック サンプリング レートを 10 % に設定した場合、クエリ対象データには年間 500 万人のアクティブ ユーザーが含まれています。 イベントコストは大幅に削減され、非常に正確な分析を生成するのに十分なデータが得られます。

  1. 必要に応じて、ユーザープロパティの含めるリストを設定します。

このリストは、サンプリングプロセスにおいて、重要かつ小規模な部分母集団のセーフリストとして機能します。これらの母集団のユーザーはサンプリング対象から除外され、常にデータに表示されます。 これらの母集団は、選択したユーザープロパティと値によって定義されます。

匿名ユーザー

Amplitudeはユニークユーザーの特定と追跡を優先していますが、インジェスチョン側のサンプリングは匿名ユーザーにとって不正確な結果をもたらす可能性があります。例えば、匿名ユーザーが新しいデバイスからイベントをトリガーした場合、Amplitudeはそのユーザーに新しいAmplitude IDを割り当て、その新しいIDに基づいてサンプルを生成します。 後でAmplitudeがこのユーザーが新しいデバイス上の以前のユーザーであると判断した場合、Amplitudeはペアリングされたイベントをユーザーの以前のAmplitude IDに遡及的にリンクすることはできません。 イベントサンプリングは取り込み時にAmplitude IDを使用するため、新しいデバイスでのユーザーの行動に依存する分析は不正確だったり歪んだりする可能性があります。

精度のベンチマーク

Amplitudeは、サンプリングされた結果の精度をパーセント誤差、または95%両側信頼区間における相対標準偏差を基準としてベンチマークします。これは標準誤差と真のサンプリングされていない結果の関数です。

膨大なデータ量(1,000万DAU以上)を抱えるお客様は、サンプリングレート5%で精度0.62%以内の結果を達成しています。Amplitudeはさらに、特定の分析でこれらの結果を得るために、DAUの10%のみを考慮すればよいと仮定しています。一般的に、カバレッジが高いほど精度が高くなります。

次の表は、さまざまなDAUボリュームについて、サンプリングレート全体で95%信頼区間での誤差率を示しています。

たとえば、1,000万人のユーザーで10%をサンプリングした場合、どのメトリックでも0.62%を超える誤差が見られることはほとんどありません。したがって、リテンション率が16%の場合、次のような違いが見られる可能性があります。

+/- 0.62% * 16% = +/- 0.1%

これは役に立ちましたか?