SUBSEQ.BIO
DOCS-MMSEQS2

MMseqs2

Search, cluster, and build multiple-sequence alignments from FASTA inputs.

Overview

  • Creating A3M alignments for structure predictors.
  • Searching sequence collections for homologs.
  • Clustering related protein sequences.
  • Preparing sequence sets for downstream design or analysis.

Modes

ModeInput shapeWhen to use it
msa
Build MSA Default
Uses one selected file/source when file parameters are present. Generate a predictor-ready A3M multiple sequence alignment from one FASTA/FASTQ file.
search
Search Database
Uses one selected file/source when file parameters are present. Search sequences against a managed reference database and write a TSV hit table.
cluster
Cluster Sequences
Uses one selected file/source when file parameters are present. Cluster sequences from one FASTA/FASTQ file and write cluster outputs.
enrich_subseq_seqs
Add MSAs to SubSeq Seqs
Consumes a folder or output set; useful for batches and pipeline handoffs. Read SubSeq seq JSON files from a folder, compute shared MSAs for selected protein entities, and write enriched SubSeq seq outputs.

Canonical Job Configuration

These are the fields exposed by the default job configuration for mmseqs2. They are also returned by GET /api/v1/program/params?program=mmseqs2 and submitted as the params JSON object to POST /api/v1/job/submit.

ParameterTypeModesWhat it does
sequence_file
Sequence File
Sequence file Build MSA, Search Database, Cluster Sequences Paste a protein sequence or choose a FASTA/FASTQ file from an upload, dataset, or previous job output.
Required; Files: .fasta, .fa, .faa, .fas, .fna, .ffn, .fastq, .fq
reference_database
Reference Database
Text Build MSA, Search Database, Add MSAs to SubSeq Seqs Managed reference database used for MSA generation or sequence search.
Default: UniRef30; Options: UniRef30, UniRef50, UniRef90, Swiss-Prot, PDB, Environmental DB
search_goal
Search Goal
Text Search Database Use homology search for remote matches, or high-identity mapping for very similar sequences.
Default: Homology search; Options: Homology search, High-identity mapping
sensitivity
Sensitivity
Text Build MSA, Search Database, Add MSAs to SubSeq Seqs Higher sensitivity finds more distant homologs but costs more runtime.
Default: Balanced; Options: Fast, Balanced, Sensitive; Shown when search_goal is Homology search
output_detail
Output Detail
Text Search Database Choose a compact hit table or include aligned query and target residue strings.
Default: Summary table; Options: Summary table, Include aligned residues
clustering_scale
Clustering Scale
Text Cluster Sequences Standard clustering is more sensitive; huge-dataset clustering uses MMseqs2 linear-time clustering.
Default: Standard; Options: Standard, Huge dataset
minimum_identity
Minimum Identity
Number Cluster Sequences Minimum sequence identity for linking sequences into the same cluster.
Default: 0.5; Range: 0-1
minimum_coverage
Minimum Coverage
Number Cluster Sequences Minimum aligned coverage for clustering, using MMseqs2's bidirectional full-length overlap rule.
Default: 0.8; Range: 0-1
result_name
Result Name
Text All modes Optional output name. The job form writes the result with the appropriate extension or prefix.
entity_ids
Entities To Enrich
Text Add MSAs to SubSeq Seqs Comma-separated entity IDs to receive precomputed MSAs in each .seq.json file. Use all to enrich every protein entity.
Required
empty_other_msas
Empty Other MSAs
Yes/no Add MSAs to SubSeq Seqs Set non-selected protein entities to no-MSA mode, useful for target:binder screening where only the target should use an MSA.
Default: true
reuse_existing_msas
Reuse Existing MSAs
Yes/no Add MSAs to SubSeq Seqs Keep existing precomputed MSA references instead of recomputing them for selected entities.
Default: true
Advanced configuration fields

No additional fields in this group.

Outputs And Metrics

  • Search results, alignment files, cluster outputs, and converted FASTA/A3M-style files depending on mode.
  • Sequence-search outputs should be interpreted by e-value, identity, coverage, and alignment context.

Common Examples

  • Build an MSA for one protein FASTA, then use the A3M in Boltz-2 or AlphaFold-style workflows.
  • Cluster a FASTA library before selecting representatives.

Example API params

{
  "mode": "msa",
  "sequence_file": "query.fasta",
  "reference_database": "UniRef30",
  "sensitivity": "Balanced"
}

Caveats

  • Alignment quality depends on database choice, search sensitivity, and query composition.
  • Low-complexity and repeated regions can produce misleading hits.

Advanced Submit

Advanced submit is still available for direct program arguments through POST /api/v1/job/submit-advanced. Prefer canonical configuration unless you need exact low-level arguments or are reproducing a known command line.

  • Advanced submit can pass MMseqs2 subcommands and options directly for custom search/cluster pipelines.
  • Use canonical configuration for common MSA/search/cluster tasks.
curl -X POST https://subseq.bio/api/v1/job/submit \
  -H "Authorization: Bearer <api_key>" \
  -F program=mmseqs2 \
  -F 'params={"mode":"msa","query_fasta":"query.fasta","sensitivity":"Standard"}'

Further Reading