N Neurarch Architectures Models Checks Data Docs Open the app

Comparisons / Behavior Sequence Transformer vs SLi-Rec

Behavior Sequence Transformer vs SLi-Rec

Two sequential recommenders with different notions of time.

SLi-Rec has 65M fewer parameters than Behavior Sequence Transformer: 6 layers added, 5 removed, 10 changed.

Baseline

Behavior Sequence Transformer

Layers
16
Parameters
129M
Input
50
Output
1
Forward-passes
yes
Est. train cost
$0.083
Compared

SLi-Rec

Layers
18
Parameters
64M
Input
50
Output
1
Forward-passes
yes
Est. train cost
$0.063

The deltas

Every number is SLi-Rec relative to Behavior Sequence Transformer.

Parameters
-65M (-50.3%)
Layers
+2
Added
6
Removed
5
Changed
10
Unchanged
5

Which GPUs each one fits

Memory for the graph at the input shape both declare. A highlighted row is a card one of them fits and the other does not, which is the difference that decides a purchase.

GPUBehavior Sequence TransformerSLi-Rec
T4 16GBfitsfits
A100 40GBfitsfits
H100 80GBfitsfits

Layer by layer

Aligned in topological order. 5 of 26 rows are the same layer with the same parameters.

Hide all 26 rows
Behavior Sequence TransformerSLi-Rec
LayerParamsOutputLayerParamsOutput
1removedBehavior Seq (T items)
Input
50
2changed
shape
Target Item
Input
1User History (T items)
Input
50
3changed
shape
User Profile
Input
16Target Item
Input
1
4changed
embeddingDim
Item Embed
Embedding
64M50 × 64Item Embed
Embedding
32M50 × 32
5changed
embeddingDim
Target Embed
Embedding
64M1 × 64Target Embed
Embedding
32M1 × 32
6removedUser Tower
Linear
54432
7removedPos Encoding
Positional Encoding
50 × 64
8removed[seq; tgt]
Concatenate
51 × 64
9addedTime-LSTM (short)
Lstm
17K64
10changed
type, dModel, numHeads, dFf, numLayers, causal
Transformer Encoder
Transformer Block
51 × 64ASVD Attn (long)
Self Attention
50 × 32
11addedFlatten
Flatten
32
12sameto_channels
Permute
64 × 51to_channels
Permute
32 × 50
13addedTarget Proj
Linear
2.1K64
14sameMean Pool
Global Avg Pool1d
64Pool Long
Global Avg Pool1d
32
15addedLong Proj
Linear
2.1K64
16changed
numInputs
Concat all
Concatenate
96Concat [s; l; t]
Concatenate
192
17changed
inFeatures, outFeatures
MLP 1024
Linear
99K1024Fusion Gate σ(W·[s;l;t])
Linear
12K64
18changed
type
PReLU
Prelu
11024Gate σ
Sigmoid
64
19addedα·short + (1−α)·long
Add
64
20addedConcat [user, target]
Concatenate
128
21changed
inFeatures, outFeatures
MLP 512
Linear
525K512MLP 1
Linear
8.3K64
22samePReLU
Prelu
1512PReLU
Prelu
164
23removedMLP 256
Linear
131K256
24changed
inFeatures
CTR Head
Linear
2571Score Head
Linear
651
25sameSigmoid
Sigmoid
1Sigmoid
Sigmoid
1
26sameP(click)
Output
1P(click)
Output
1

What this is not

Take it further

Open either graph in the editor, change it, and check it again: Behavior Sequence Transformer · SLi-Rec

Compare any two models of your own, including anything on Hugging Face: the comparison tool.

Machine-readable: this page as markdown · the pair index · POST https://www.neurarch.com/api/v1/plan for a graph of your own.