MMseqs2
Search, cluster, and build multiple-sequence alignments from FASTA inputs.
Overview
- Creating A3M alignments for structure predictors.
- Searching sequence collections for homologs.
- Clustering related protein sequences.
- Preparing sequence sets for downstream design or analysis.
Modes
| Mode | Input shape | When to use it |
|---|---|---|
msaBuild MSA Default |
Uses one selected file/source when file parameters are present. | Generate a predictor-ready A3M multiple sequence alignment from one FASTA/FASTQ file. |
searchSearch Database |
Uses one selected file/source when file parameters are present. | Search sequences against a managed reference database and write a TSV hit table. |
clusterCluster Sequences |
Uses one selected file/source when file parameters are present. | Cluster sequences from one FASTA/FASTQ file and write cluster outputs. |
enrich_subseq_seqsAdd MSAs to SubSeq Seqs |
Consumes a folder or output set; useful for batches and pipeline handoffs. | Read SubSeq seq JSON files from a folder, compute shared MSAs for selected protein entities, and write enriched SubSeq seq outputs. |
Canonical Job Configuration
These are the fields exposed by the default job configuration for mmseqs2. They are also returned by GET /api/v1/program/params?program=mmseqs2 and submitted as the params JSON object to POST /api/v1/job/submit.
| Parameter | Type | Modes | What it does |
|---|---|---|---|
sequence_fileSequence File |
Sequence file | Build MSA, Search Database, Cluster Sequences | Paste a protein sequence or choose a FASTA/FASTQ file from an upload, dataset, or previous job output. Required; Files: .fasta, .fa, .faa, .fas, .fna, .ffn, .fastq, .fq |
reference_databaseReference Database |
Text | Build MSA, Search Database, Add MSAs to SubSeq Seqs | Managed reference database used for MSA generation or sequence search. Default: UniRef30; Options: UniRef30, UniRef50, UniRef90, Swiss-Prot, PDB, Environmental DB |
search_goalSearch Goal |
Text | Search Database | Use homology search for remote matches, or high-identity mapping for very similar sequences. Default: Homology search; Options: Homology search, High-identity mapping |
sensitivitySensitivity |
Text | Build MSA, Search Database, Add MSAs to SubSeq Seqs | Higher sensitivity finds more distant homologs but costs more runtime. Default: Balanced; Options: Fast, Balanced, Sensitive; Shown when search_goal is Homology search |
output_detailOutput Detail |
Text | Search Database | Choose a compact hit table or include aligned query and target residue strings. Default: Summary table; Options: Summary table, Include aligned residues |
clustering_scaleClustering Scale |
Text | Cluster Sequences | Standard clustering is more sensitive; huge-dataset clustering uses MMseqs2 linear-time clustering. Default: Standard; Options: Standard, Huge dataset |
minimum_identityMinimum Identity |
Number | Cluster Sequences | Minimum sequence identity for linking sequences into the same cluster. Default: 0.5; Range: 0-1 |
minimum_coverageMinimum Coverage |
Number | Cluster Sequences | Minimum aligned coverage for clustering, using MMseqs2's bidirectional full-length overlap rule. Default: 0.8; Range: 0-1 |
result_nameResult Name |
Text | All modes | Optional output name. The job form writes the result with the appropriate extension or prefix. |
entity_idsEntities To Enrich |
Text | Add MSAs to SubSeq Seqs | Comma-separated entity IDs to receive precomputed MSAs in each .seq.json file. Use all to enrich every protein entity. Required |
empty_other_msasEmpty Other MSAs |
Yes/no | Add MSAs to SubSeq Seqs | Set non-selected protein entities to no-MSA mode, useful for target:binder screening where only the target should use an MSA. Default: true |
reuse_existing_msasReuse Existing MSAs |
Yes/no | Add MSAs to SubSeq Seqs | Keep existing precomputed MSA references instead of recomputing them for selected entities. Default: true |
Advanced configuration fields
No additional fields in this group.
Outputs And Metrics
- Search results, alignment files, cluster outputs, and converted FASTA/A3M-style files depending on mode.
- Sequence-search outputs should be interpreted by e-value, identity, coverage, and alignment context.
Common Examples
- Build an MSA for one protein FASTA, then use the A3M in Boltz-2 or AlphaFold-style workflows.
- Cluster a FASTA library before selecting representatives.
Example API params
{
"mode": "msa",
"sequence_file": "query.fasta",
"reference_database": "UniRef30",
"sensitivity": "Balanced"
}
Caveats
- Alignment quality depends on database choice, search sensitivity, and query composition.
- Low-complexity and repeated regions can produce misleading hits.
Advanced Submit
Advanced submit is still available for direct program arguments through POST /api/v1/job/submit-advanced. Prefer canonical configuration unless you need exact low-level arguments or are reproducing a known command line.
- Advanced submit can pass MMseqs2 subcommands and options directly for custom search/cluster pipelines.
- Use canonical configuration for common MSA/search/cluster tasks.
curl -X POST https://subseq.bio/api/v1/job/submit \
-H "Authorization: Bearer <api_key>" \
-F program=mmseqs2 \
-F 'params={"mode":"msa","query_fasta":"query.fasta","sensitivity":"Standard"}'